引言:AI正在集体"逃离"文本

2026年,人工智能产业正在经历一场比大模型竞赛更深刻的范式转变。从7月的世界人工智能大会,到8月的世界机器人大会,再到9月的外滩大会,几乎每一场行业盛会上,头部企业都在谈论同一个词——世界模型(Large World Model, LWM)。

这不是又一个技术热词的短暂狂欢。小鹏汽车在9月将预测式世界模型量产上车,字节跳动自研世界模型预计10月正式亮相,Gartner将世界模型列为2026年中国AI十大趋势之一。从"读懂文字"到"理解世界",AI正在完成一次惊险的跳跃。

小鹏第二代VLA:把"时间"塞进模型里

2026年9月,小鹏汽车向G9L Ultra和Ultra SE车型全量推送XOS 6.3.0版本,核心升级是将第二代VLA(视觉-语言-动作模型)正式推向上路。这次更新中最具革命性的变化,是小鹏开始把"时间"这个维度加入模型。

全新引入的Infini-VLA长时序架构,可以让模型记住前30秒的世界——这相当于让自动驾驶系统第一次拥有了"时间感"。传统智驾宛如"金鱼的记忆",只能根据眼前这一帧做判断;而在长时序建模能力加持下,系统可以结合此前的连续动态变化来理解当前场景。

更深层的突破来自X-Foresight预测世界模型。今年6月,X-Foresight在CVPR上向学术界公开,不到3个月就已实现量产落地。该模型能够推演未来6秒内的场景变化——预判行人是否会横穿马路、前车是否会急刹、旁道车辆是否会加塞。这种行动前的"内心彩排",正是当下人工智能最稀缺的能力。

配合Streaming Inference流式自回归推理,端到端响应速度提升300%,实现"边看、边想、边行动"。搭载第二代VLA的Robotaxi已获得广州市智能网联汽车远程测试资质,可在广州相关道路开展主驾无安全员道路测试。新版端侧模型参数量提升3.5倍,是主流VLA的15倍以上,官方称多维综合安全能力提升20倍。

字节跳动:700亿美元押注世界模型,预计10月发布

在自动驾驶赛道之外,字节跳动正在另一条战线全力冲刺。据彭博社9月8日独家报道,字节跳动自研的下一代"世界模型"极有可能在10月正式亮相。

这不是PPT概念——据接近项目核心的知情人士透露,模型已完成云端渲染链路全栈压测,延迟压进50毫秒红线,帧率稳守20FPS黄金阈值。更关键的是,它不在你的Pico头显里运行,而是在字节自建的万卡级智算云上实时生成。这意味着用户戴上的不再是"计算终端",而是一副"意识接口"——轻薄、便宜、无风扇、不发烫。

字节跳动将世界模型列为2026年AI四大攻坚目标之首,立下军令状:年底前必须交付SOTA级模型,对标Google在2025年8月发布的Genie3。值得注意的是,今年初的内部benchmark显示,字节版本尚落后约10%,但短短8个月,差距已被抹平甚至反超。若10月真能落地,那就是比原计划提前整整两个月的"中国速度"。

资金弹药方面,字节上周获得了300亿美元AI专项银团贷款,其华北智算中心二期已启用液冷超算集群,单日可调度算力超500 EFLOPS——足够同时渲染10万个开放世界。700亿美元AI总投入计划,不是口号,是正在浇灌的钢铁藤蔓。

对比之下,Meta在2026年夏天悄悄把RealityLabs年度预算砍掉28%,把AR眼镜Orion的量产节点推迟到2027年。一边是Meta砍预算砍硬件,一边是字节700亿All-in世界模型,两家公司给出了截然相反的选择。

Gartner 2026年中国AI十大趋势:世界模型为何被单独列出?

Gartner于2026年9月15日发布的"Top AI Trends From China, 2026"报告中,将十条趋势归入四个层次:全栈式自主可控人工智能、务实驱动的模型创新、可扩展的智能体劳动力、人工智能超级入口。世界模型被单独列为一个趋势条目。

报告给出的逻辑是:中国在大模型GLM-5.2、Kimi K3、DeepSeek V4等领域的进展正在重塑全球人工智能格局,但真正的范式跃迁发生在从"语言模型"到"世界模型"的转变。语言模型本质上是"文本的概率补全器",而世界模型需要理解物理世界的因果关系、时间演变和空间逻辑。

报告同时指出,到2027年,全球企业中采用中国AI模型的比例将从2025年的5%上升到50%。随着更多企业开始训练能够理解时间和空间关系的大模型,世界模型正在从学术概念变为产业落地。

基础设施就绪:工信部等五部门启动国家绿色算力设施推荐

世界模型的训练需要巨大的算力支撑。2026年9月21日,工业和信息化部等五部门联合印发通知,启动2026年度国家绿色算力设施推荐工作。

新版评价指标体系纳入了单位算力能效、碳利用效率、数字化碳管理、产品碳足迹等指标,强调绿色低碳、集约循环。这为AI算力的可持续发展提供了制度保障,也为世界模型等需要海量算力的前沿技术奠定了能源和基础设施基础。

中国AI调用量连续21周领跑:从"量变"到"质变"

根据OpenRouter最新数据,上周(9月14日至9月20日)全球AI大模型总调用量为129万亿Token。其中,中国AI大模型周调用量达67.46万亿Token,环比增长10.28%,连续二十一周超过美国。同期美国AI大模型周调用量为14.21万亿Token,环比下滑34.7%。

全球调用量排名前五中,有四款中国AI大模型。DeepSeek V4.1-Flash升至第一,周调用量达15.8万亿Token,环比增长219%。中国大模型在全球AI竞赛中,调用量占比超过52%。

这组数据的意义不仅是中国AI的"量变",更暗示着"质变"的到来——当大模型的调用量积累到足够量级,从语言理解向世界理解跨越的数据基础就已经具备。中国信通院9月23日发布的报告也指出,以大模型为代表的新一轮AI技术创新在数学推理、多模态理解、博士级科学问答等基准上已接近甚至超越人类基线。

结语:从"概率补全器"到"宇宙模拟器"

2026年之所以被称为"世界模型元年",不是因为某一项技术的突破,而是因为整个产业的重心正在发生根本性转移。

过去几年,AI的核心叙事是"更大的参数、更多的数据、更聪明的对话"。但2026年9月的种种信号表明,AI正在从"文本的概率补全器"进化为"物理世界的因果推理器"。小鹏的Infini-VLA让汽车拥有"时间感",字节的实时空间视频引擎让虚拟世界拥有"心跳",Gartner的报告确认了世界模型从概念变为产业趋势。

这场从"读懂文字"到"理解世界"的跳跃,或许正是AI从工具走向智能体的最后一道门槛。2026年之后的竞争,将不再是谁的模型能更好地写文章,而是谁的模型能更准确地"预演未来"。

点赞(0) 打赏

评论列表 共有 0 条评论

暂无评论
立即
投稿

微信公众账号

微信扫一扫加关注

发表
评论
返回
顶部