跳到正文
@barret_china· @barret_china · X·· 22 天前AI 评分43
AI 导读

目前市场上约有 2000 万张 H100 等效卡的算力,年 Token 消耗量已达几十万亿亿,同比增长接近一个数量级。过去三年 AI 芯片算力供给每年约增长 3 倍,但叠加卡量增加、单卡性能提升和推理效率优化,实际可提供的 Token 算力年增幅可能接近 10 倍。从 Chat 到 Coding 再到 Agent,单次任务 Token 消耗从几千升至千万甚至上亿,市场已长期处于紧平衡状态。

正文

研究了一下过去几年芯片和算力的供给情况。目前,市场上大约有 2000 万张 H100 等效卡的算力。按 Token 计算,年消耗量已经达到几十万亿亿 Token,相比去年增长了接近一个数量级。

过去三年,AI 芯片的算力供给每年大约增长 3 倍。但考虑到卡的数量增加、单卡性能提升,以及推理效率不断优化,实际能够对外提供的 Token 算力,年增长幅度可能接近 10 倍。

从 Chat 到 Coding,再到 Agent,每次产品形态升级,都会带来一轮新的需求增长。早期的 Chat,一次推理可能只需要几千 Token;到了 Coding,用户通过 Agent 完成一项任务,一次可能消耗几十万到几百万 Token;而 Agent 需要处理更长的上下文、调用工具,并进行多轮推理和验证,复杂任务的消耗可能达到千万甚至上亿 Token。

按照这个趋势,未来 Token 的需求大概率仍会保持指数级增长。那市场上会不会出现 Token 供不应求的情况?答案是会,而且现在其实已经长期处于紧平衡状态。需求突然上升时,市场通常会通过价格和延迟来调节:高价模型先涨价,低价模型则出现排队,同时也会有更多算力从训练逐步转向推理。

Token 的供给可以从四个层面来看:

1)电力和数据中心。这是最慢的一层。一个大型数据中心从电力指标、选址建设到最终投产,通常需要两三年。

2)芯片供给。Nvidia、Google、AMD 等厂商都在持续扩大产能,同时新一代芯片的性能也在不断提升。

3)模型和推理效率。同样一张卡,通过量化、缓存、推测解码等技术,可以生成更多 Token,单位算力的产出还会继续提高。

4)算力分配。目前仍有大量算力用于训练、RL 和各种实验。随着推理需求继续增长,部分存量算力会逐步从训练转向对外提供 Token。

从这个角度看,未来的 Token 可能会越来越像今天的电力和带宽。算力供给每增加一轮,很快就会有新的应用把这部分增量消耗掉。Chat 吃掉了第一波,Coding 吃掉了第二波,接下来 Agent 还会继续消耗新增的算力。

来源:@barret_china · x.com