词元经济崛起:当AI学会"吃"Token,世界还撑得住吗?

如果说2023年是"参数军备竞赛",2024年是"开源生态卡位战",那么2026年正在被一个全新的事实重新定义:AI不再只是"聊天",而是像数字员工一样持续工作、多步推理、反复调用工具——每一次动作都在吞噬海量的"词元"(Token)。

2026年9月下旬,两场大会的密集信号确认了这个判断。

一、词元经济:智能时代的"电量表"

2026年3月23日,国家数据局正式为Token确定中文译名"词元",并将其定性为"智能时代的价值锚点"以及连接技术供给与商业需求的"结算单位"。这不是文字游戏——截至3月,中国日均词元调用量已突破140万亿,较2024年初激增超千倍。中国AI大模型周调用量以4.69万亿的体量,连续两周反超美国。

词元贯穿语料处理、模型训练和推理服务。它就像水电煤——看不见摸不着,但缺了它,AI应用瞬间断电。

在2026年云栖大会上,阿里巴巴CEO吴泳铭给出了一个精妙的比喻:"芯片负责生产Token,云负责把Token送到每一个需要它的地方。"他把算力分层比作电力系统——芯片是"发电机组",智算中心是"电网",模型与应用是"用电户"。未来的竞争,不在于谁有最强的芯片,而在于谁能最高效地"生产、输送和按需交付"Token。

这种类比背后是一场价值链的大迁移:当算力供给持续紧缺、需求远超供给时,单纯的资源持有者赚的是周期红利,而"电网层"的运营者赚的是结构性红利。

二、AICC2026报告:算力悬崖已在眼前

9月21日,AICC2026人工智能计算大会上,IDC与浪潮信息联合发布《2026年中国人工智能计算力评估报告》。这是业内首份聚焦智能体基础设施的研究报告,它给出了一个令人震惊的数字矩阵:

指标 数据
全球活跃智能体数量(2026→2030) 7940万 → 22.16亿(CAGR 129.8%)
全球Token消耗CAGR(2026→2030) 4822.6%
Token消耗增速 vs 智能体数量增速 37倍
中国智能体部署渗透率(2026) 81.0%(全球78.1%)
全球AI算力需求满足率谷底(2027) 71%

Token消耗增速是智能体数量增速的37倍——这就是"智能体Tokens乘数效应"。

最初的问答式交互,单次任务消耗仅数万个Token;DeepSeek的深度思考模式将单任务消耗推至十万量级;而编程类智能体(Coding Agent)的涌现,直接将单任务Token消耗量拉升至百万级别。当一个Agent需要多步推理、工具调用、自我校验时,Token消耗呈指数级攀升。

报告预测,全球AI算力需求满足率将从2024年的79%下降至2027年71%的谷底(即近30%的需求无法被满足),直到2030年仅回升至77%。算力缺口绝对值从2024年的389亿美元扩大到2030年的3809亿美元——供需剪刀差正在持续扩大。

三、从"卖算力"到"卖词元":基础设施层的范式革命

面对这场Token饥荒,基础设施层正在发生三个深层变革:

3.1 Token工厂:从"炼钢"到"发电"

"Token工厂"的概念由黄仁勋带火,并在2026年WAIC后被中国创业公司大规模实践。商汤大装置是典型代表——其日均Token服务量从2026年2月的0.46万亿,增长至8月的4.5万亿,年底预计达到10万亿。PPIO的日均Token调用量超过1.2万亿,同比增长超8倍。

Token工厂的核心逻辑不是"拿芯片做推理"那么简单,而是实现"横向编排"与"纵向优化"的二维协同。商汤的"横向编排"让不同品牌、不同规格的算力进入同一个资源画像,动态调整Prefill与Decode的角色分工;"纵向优化"则覆盖算子、通信、访存、PD分离、投机推理和KV缓存的全链路效率提升。

结果令人印象深刻:依托异构混合推理技术,商汤将主流国产芯片的MFU(模型算力利用率)提升85%~152%,整体推理性价比达到NVIDIA H系列的1.25倍;同成本下Token产出规模扩大2.5倍。

3.2 超节点:超越单点硬件的系统工程

联想中国基础设施战略技术总监黄山在云栖大会上指出,对万亿级模型而言,超节点已成为训练和推理的重要架构选择。工信部定义超节点为32颗及以上AI算力芯片实现一级互联。

但第一代超节点受柜内铜缆等限制,扩展能力仅止步于一两柜范围。下一代超节点需要解决更大规模的柜间光互联、更高单柜密度,以及全液冷、800V高压直流和集群级软件管理等一系列问题。联想正在争取率先突破第二代超节点架构。

这意味着"AI算力竞争"正在从单卡性能走向系统能力——计算、通信、访存、存储、推理优化以及整个系统的调度能力,构成影响Token成本50%以上的因素。

3.3 Token成本结构的重新拆解

联想对Token成本结构的拆解尤为关键:基础建设约占四分之一(其中电费约10%),软硬件协同影响Token成本的50%以上。

这解释了为什么2026年全球AI基础设施的支出方向正在从"堆芯片"转向"系统工程"——芯片只是门票,真正的差异化在于是否具备高效"生产"Token的全栈能力。

四、从按Token计费到按Task计费:商业模式的范式跃迁

当企业真正将Agent嵌入生产流程时,一个核心矛盾暴露了:Token经济天然"不对结果负责"。

奥锐方智能科技CEO邵剑秋指出,目前约90%的企业已部署智能体工具,但同样约90%的企业发现这些智能体大多沦为"玩具"。根源在于,按Token计费模式下,供应商按流量收钱,但不对最终结果兜底。

这催生了"以Task计费"的新模式探索——客户只为业务落地成果买单,而非为算力资源消耗买单。阿里云CTO李飞飞的表述是:"类比SaaS行业付费逻辑,行业会走向智能体即服务(Agent-as-a-Service)模式。"

但这条路充满挑战。腾讯云副总裁吴运声明确表示腾讯云不会采用按Task计费,理由是业务任务边界难以精准界定。最终可能出现的混合模式是:模糊复杂工作由Agent处理(按Token),标准化固定流程用工作流承载(按次/按座席)。

无论如何,Token定价机制的演进标志着AI从"技术产品"向"基础设施服务"的跃迁——Token正在成为AI时代的"电量表",按表计费只是第一阶段。

五、全球算力竞赛:阿里20GW与中国速度

9月22日云栖大会上,阿里CEO吴泳铭发出迄今最强AI扩张信号:到2032年,阿里云运营的全球数据中心规模将扩展至超过20GW。

高盛等机构预测,阿里云目前算力约4-5GW。亚马逊AWS约14.1GW,微软约13.1GW(计划2032年达到38GW),Meta约15.8GW,谷歌约9.0GW。阿里要在六年里将算力翻四倍,每新增1GW仅IT设备资本开支就约需1000亿元人民币——这是万亿元级别的工程。

支撑这一扩张的是自研芯片"真武V900"(算力为上一代M890的3倍,单一集群可扩展至50万卡)和5万亿至10万亿参数的Qwen下一代模型。吴泳铭判断:"未来机器供给的思考总量将达到人类的1000倍以上,而当前行业中长期需求已远超供给能力。"

在这一背景下,中国智能算力规模2026年预计达2576.5 EFLOPS(同比增长87.9%),2030年将攀升至10524.3 EFLOPS。全球AI算力市场规模预计从2025年的约3130亿美元增长到2030年的1.25万亿美元。

六、展望:Token经济与"逆规模化"挑战

站在2026年9月的时间节点,词元经济正在经历三重张力:

第一重张力是Agent大规模化带来的Token需求指数级膨胀,与算力基础设施线性扩张之间的矛盾。到2030年,22亿活跃Agent的持续在线将每天消耗超过100,000万亿Token(高盛预测),但哪怕全球新增15GW算力也仅能将满足率从谷底略微提升。

第二重张力是Token生产成本需要持续下降(才能让Agent大规模应用普及),与高资本开支导致的投资回报压力之间的矛盾。当推理成本降到现在的1/100时,用量可能增长到1000倍。

第三重张力是最根本的:Token经济本质上是一个"逆规模化"的悖论——越是优化Token效率,总体Token消耗反而越大(因为Agent的使用场景随成本下降而爆发式扩张)。

这正是词元经济最深刻的启示:AI的终点不是模型,而是基础设施。谁在Token的"生产、输送、计量和定价"四个环节掌握主动权,谁就掌握了下一个时代的电力公司和电网运营者的话语权。

从"AICC2026报告"到"阿里20GW豪赌",从"商汤Token工厂"到"从按Token到按Task定价"——2026年9月密集释放的信号已经明确:词元经济不是概念,是一场正在发生的、关于算力操作系统的大迁移。

点赞(0) 打赏

评论列表 共有 0 条评论

暂无评论
立即
投稿

微信公众账号

微信扫一扫加关注

发表
评论
返回
顶部