一次Agent请求,输入8.8万个Token,输出只有413个——213:1的算力不对称
2026年9月21日下午,北京中关村国际创新中心,开源推理框架SGLang核心贡献者王书文在AICC 2026人工智能计算大会"AI软件栈"分论坛上给出了一组让在场近3000名产业人士震惊的数据:在真实生产环境的Agent流量中,一次请求的中位数输入是88,000个Token,输出却仅有413个Token——两者相差213倍。
"智能体时代,算力并不是花在输出上,而是花在反复携带的历史上下文上。"王书文的这句话,道出了当前AI计算产业正在经历的根本性变革。如果说传统大模型的算力消费是"问题→回答"的一次性模式,那么Agent时代的算力消费则是"持续携带→反复推理→偶尔输出"的长周期模式。这不仅仅是一个数量级的差异,更是整个负载范式的迁移。
从"造更强的模型到"重构整个计算栈"
AICC 2026由北京市发展改革委、中关村科学城管委会支持,北京开源芯片研究院、北京智源人工智能研究院、清华大学具身智能与机器人研究院等多家机构联合主办。大会设置AI芯片、Token工厂、开放超节点、大模型、AI软件栈、具身智能与智算发展、AI Work智能体七场专题论坛,近60场专题报告。
会议最核心的主题只有一个:智能体作为新型负载,正在重定义从芯片到应用的全栈基础设施。AICC大会发起人王恩东指出,当前中国AI算力产业面临供需缺口、成本能效、资源利用率三重挑战,其背后是三个结构性问题——基础能力短板、产业链纵向协同不足、横向生态彼此割裂。
浪潮信息首席AI战略官刘军的表述更加直接:"智能体的发展,让智能有望像计算和电力一样,成为可以规模化生产和供给的资源。这意味着人工智能计算既要支撑前沿智能突破能力边界,也要推动智能充分供给——沿着'能力型智算'与'容量型智算'两个方向共同发展。"
IDC的"三重乘数":Agent如何推高全社会算力消耗
IDC副总裁周震刚在大会现场发布的《2026中国人工智能计算力发展评估报告》中,将Agent带来的算力需求爆发拆解为三重乘数效应:任务执行频次 × 单任务Token消耗 × 多智能体协同效应。三者叠加,共同推高全社会的算力消耗。
区别于传统大模型单次问答式推理,生产环境下的智能体执行的是长周期任务——涉及海量知识库读取、多轮推理生成、外部工具调用、会话状态留存、出错回滚重试,同时需要支撑大规模实例并发运行。这种负载模式下,推理瓶颈从单一的计算单元进一步延伸至存储子系统、互联网络、任务调度器和整个软件栈。
这解释了为什么工信部电子信息司电子系统处处长金磊在大会上强调"算电协同"——当智能体对算力的需求呈指数级增长时,电力供给和物理基础设施的约束可能比芯片本身更早成为瓶颈。
忆阻器存算一体:打破"内存墙"的另一种可能
当业界还在讨论真武V900和英伟达B系列谁的算力更强时,清华大学教授吴华强从另一个维度提出了解决方案:不是把芯片做得更大,而是让计算和存储不再分离。
吴华强强调,面对大模型算力需求快速增长以及传统芯片在面积、带宽等方面的约束,AI算力芯片创新不能只依赖既有技术路径,还需要从新器件、新架构和新计算范式中寻找突破。忆阻器存算一体通过重构计算与存储的关系,减少数据搬移,实现器件、工艺、电路、架构与软件协同——这指向了一条与传统冯·诺依曼架构完全不同的技术路径。
在Agent负载下,"内存墙"问题被急剧放大:当一次请求需要携带8.8万个Token的历史上下文时,数据在计算单元和存储单元之间的频繁搬移本身就是巨大的能耗与延迟来源。存算一体技术恰好在这个精准痛点上提供了可能的出路。
Gemini 4 Pro"幽灵测试":AI研发的社区化转向
在AICC大会的同一天(9月20日前后),另一个意味深长的信号从海外传来:谷歌以"gemini-3.8-flash"为马甲,在AI Arena平台悄悄测试其下一代旗舰模型Gemini 4 Pro(代号Argon)。这个匿名模型在DeepSWE v1.1编码基准上拿下88.7%的得分,智能体/终端基准Terminal-bench 2.1达到95.3%,GUI智能体OSWorld-2.0达到86.8%——在多个维度全面压制GPT-6 Astra和Claude Fable 5.1。
谷歌没有任何官方公告、没有PPT、没有发布会。这种"故意不藏好的匿名"策略,让开发社区帮助完成了大规模压力测试,同时绕开了正式发布所需面对的预期管理压力。这是AI研发范式向开源社区化转向的一个缩影:在2026年,旗舰模型不再只是实验室的产品,而成为社区共建的产物。
从"单点竞赛"到"体系能力":AI计算竞争的升维
将AICC 2026的核心信号整合在一起:
第一,负载范式彻底迁移。Agent不是"更大的模型调用",而是一种全新的计算模式——长生命周期、多轮推理、强上下文依赖、持续状态维护。这要求基础设施从"优化单次推理"转向"优化全链路持续运转"。
第二,评价指标正在改变。传统AI芯片评价标准以TOPS(每秒万亿次运算)为核心,但在Agent负载下,更关键的是显存带宽、上下文窗口容量、多实例并发效率、调度系统的敏捷性。一套数据中心可能不缺总算力,但因上下文切换效率低下而浪费60%以上的计算周期。
第三,协同取代孤立。从芯片到系统、从软件到模型、从应用到服务,任何一个环节的单点优势都不再能决定全局竞争力。AICC大会汇聚芯片、系统、软件、模型与应用全产业链力量本身就说明:智能体时代,竞争不再是链条上某个环节的比拼,而是体系与体系的对抗。
结语:智能体不是应用层的进化,而是计算范式的新物种
SGLang团队揭示的213:1不对称比例、清华大学探索的忆阻器存算一体路径、IDC的三重乘数效应、工信部力推的全栈协同战略——这些发生在AICC 2026大会上的碎片化信息,拼合在一起指向一个清晰的结论:
智能体不仅仅是一种AI应用形态的创新,它更是一个全新的计算物种。这个物种有自己的负载特征、自己的评价体系、自己的基础设施需求和自己的协同法则。
当机器思考总量朝"人类的1000倍"方向演进时,最先需要回答的不是"谁有最强的模型",而是"谁能为这个全新的计算物种提供最高效、最可持续的基础设施"。
这可能是2026年AI产业最值得认真对待的一道新题目。

发表评论 取消回复