Dekita

算力的单位从一张卡换成一个词元,换的是谁的钱?

中文长文存档 AI 提效

一、先摆两组数字,它们说的不是一回事

2026 年 9 月 30 日,谷歌发布 Gemini 4 Argon。按照 Google 官方博客的说法,这个模型把输出上限从 6.4 万词元抬到了 100 万词元,官方同时称它具备行业领先水平的长上下文能力,入门价定在每百万输入词元 2 美元、每百万输出词元 10 美元,缓存输入按输入价打 95% 折。谷歌同一天明确写了:促销期结束后,价格回到每百万输入 4 美元、输出 20 美元。

同一天,英伟达的硬件合作伙伴 CoreWeave 宣布 Vera Rubin NVL72 在其云上投入生产,Cognition 成为全球第一个在这套系统上跑生产负载的客户。Cognition 工程师自己跑的基准显示,SWE-2 推理负载的总词元吞吐相比上一代 GB200 NVL72 基线提升 4.8 倍,强化学习负载的输出词元吞吐提升 3.8 倍。

这两组数字谈的是同一个东西的两个面。谷歌卖的是一次任务能产出多少词元,CoreWeave 卖的是每秒能产出多少词元。前者是产品定价,后者是交付能力。

过去十年,算力行业的计量单位基本是一张卡,谈的是卡数、型号、机柜密度。这种计量的前提是:买卡的人知道每张卡每秒能吐多少算力。但这个前提正在失效,原因不复杂:模型的瓶颈已经从算得慢变成了想得久。

二、为什么词元成了新单位

这里要先分清三个被混用的词:算力(FLOPs)、吞吐(tokens per second)、价格(每百万词元多少钱)。

算力衡量的是硬件的理论能力;吞吐衡量的是实际跑到用户手里的速度;价格衡量的是你为此付的钱。行业习惯用第一项当卖点的外壳,用第二项做对比的基准,第三项则是采购时的一张报价单。

2026 年 9 月 30 日这两组数字把顺序颠倒了过来。谷歌在介绍 Argon 时,核心论证落在 100 万词元的输出上限:它让模型能在一趟推理里生成几十万词元,从而把深度推理的质量提上去。CoreWeave 公布的 4.8 倍同样来自实际负载:Cognition 拿 SWE-2 这个软件工程负载跑出来的词元吞吐。

这个转向有实际后果。Cognition 的研究负责人在 CoreWeave 的新闻稿里把话说得很直白:agentic 编程是每一步都要等上一步的负载,所以在这种负载上,每一阶段的提速会复利成整个任务里实打实多出来的工作量。反过来,如果某个负载不需要长上下文、不需要高频并发调用,纸面上的算力提升就未必转化成你拿到的结果。

这也解释了为什么峰值算力这个指标越来越不够用:它衡量的是芯片的能力,而用户真正买的是任务完成的速度。

三、真正的天花板不在芯片上

词元成了单位之后,问题就变成:词元的价格降下来了,能不能按需要买?

行业数据显示,2026 年全球九大云厂商的 AI 算力资本支出预计突破 8800 亿美元,同比增幅约 90%。这个数字本身已经说明供需有多紧。但比这个数字更能说明问题的是约束条件的位置:公开报道把当前 AI 规模化落地的瓶颈指向电力并网配额、电网容量与基建审批,而不是芯片供应。

两者的缓解周期差得很远。芯片供给不足,可以通过加产线、扩封装、找替代供应商在两三年内缓解;电网容量与并网配额受制于物理设施与审批流程,缓解周期以年计。这意味着接下来一段时间内,词元单价与能拿到多少词元会朝相反方向走:前者因为技术进步和价格战持续下降,后者因为物理约束增长乏力而受限。

上海青浦算力券的申报窗口正好印证这一点:该区 2026 年 10 月 1 日 9 点至 10 月 23 日 17 点受理 2026 年 9 月发生的算力租用费用,按实际研发使用算力费用的 30% 申领,年度封顶 1500 万元。补贴的存在本身,说明算力的获取成本对多数机构来说仍然是障碍。

看这一轮变化,顺序应该是:先看价格(词元单价降没降),再看规模(容量有没有扩),最后才看应用(有没有人真拿它干活)。只盯着价格,很容易得出过于乐观的结论。

四、我的判断

我觉得这件事真正被低估的部分在于计量单位的迁移,价格下降反而是次要的。

当卖方从按卡报价转向按词元报价,双方承担的风险就变了。按卡报价,芯片迭代带来的收益几乎全归买方,因为新一代卡性能更强但价格接近;按词元报价,效率提升会被价格重新吃掉一部分。谷歌自己就给了例子:Argon 的成本优势来自词元定价而非效率,每任务成本约为 Astra 的 60%,但同时每任务平均输出词元数也是 Astra 的两倍多。效率提升的收益,被你用得更多这个事实部分抵消。

对使用方来说,这意味着两件具体的事。第一,评估成本时不能只看单价,要看完成同一个任务花多少钱。单价降一半但每任务词元用量翻倍,总账可能是平的。第二,长上下文能力会显著改变任务结构:过去需要拆成多步、多次调用的流程,可能被一次长推理替代,这部分省下来的不只是钱,还有流程里最容易出错的环节。

对行业观察者来说,接下来半年最值得盯的单一指标,是促销期结束后的价格回落幅度,以及容量扩张能否跟上价格下降的速度。如果降价很快但容量没扩,价格只是账面数字;如果容量在扩但电价与并网成为硬约束,那这个词元单位会一直卡在算得出、跑不满的状态。

以上都是产业层面的机制分析,不针对任何具体标的,也不构成任何投资建议。文中提到的公司、模型与产品,都是作为行业现象的例证被提及。