从人工调参到自主进化:AI研发的范式转移
2026年9月22日,杭州云栖大会以"智以致用"为主题拉开帷幕。但当阿里集团CEO吴泳铭在主旨演讲中公布Qwen团队在递归式自我改进(Recursive Self-Improvement,RSI)方向上的探索进展时,整个AI界为之震动——大模型开始制造自己的下一代了。
这不是科幻叙事,而是正在发生的现实:Qwen3.8-Max通过自主搭建训练流程、构造训练数据、设计实验并定位自身缺陷,在人类"零参与"的情况下连续迭代超过一个月,完成33轮有效迭代,在Artificial Analysis上的得分从40分跃升至45分,与Claude、GPT最强模型并列第一阵营。
一个根本性的问题正在浮现:当AI开始担任自己的研发工程师,人类在模型开发周期中的角色将如何重新定义?
一、RSI:通往ASI的三大技术路径
在AI通向通用智能(AGI/ASI)的道路上,业界逐渐收敛到三条核心技术路径:参数扩展(Scaling)、架构创新(Architecture Innovation)以及递归式自我改进(RSI)。过去十年的进展主要集中在前两者,但2026年云栖大会的信号表明,第三条路径正从实验室概念走向工程实践。
递归式自我改进的核心思想是:模型从真实反馈数据中发现自身能力短板,自主设计实验方案、构建训练数据集、评估训练结果,循环推动自身能力进化。与传统的人工调参循环相比,RSI的关键区别在于:改进目标的选择、改进实验的设计、改进效果的验证,均由模型自主完成。
吴泳铭在演讲中明确指出:"过去一年,通往ASI的技术路径逐渐清晰。这条路就是递归式自我改进。"
二、Qwen的RSI实践:三个维度的自主进化
第一维:模型自我训练——人类零参与的33轮迭代
Qwen3.8-Max在RSI框架下展现了惊人的自主性。系统自动从推理反馈中定位缺陷模式,自主构造合成训练数据,执行完整的训练-评测-修正循环。连续33轮迭代中,平均每轮迭代周期约2.3天,性能提升呈现稳定的线性增长趋势。
这一结果打破了"模型训练必须依赖人类研究员持续干预"的传统认知。核心难点在于防止模型自我改进过程中的奖励黑客(Reward Hacking)和方向偏移(Drift)——在无人监督的情况下确保自我改进始终朝向真实能力提升而非评测指标博弈。阿里团队通过引入多层级交叉验证和动态评估基线,有效规避了这一风险。
第二维:推理框架自主优化——在陌生芯片上实现96%吞吐提升
在Qwen3.8-Max的另一次实验中,模型在从未接触过的平头哥新款GPU架构上,自主适配并优化了Qwen3.8-Flash新模型的推理框架,最终实现单实例推理吞吐量提升96%。
这意味着RSI的能力不仅限于模型权重的优化,还延伸到了推理系统的自动适配。传统上,模型部署到新硬件架构需要工程师花费数周进行手动调优——分析算子瓶颈、调整内存布局、优化并行策略。现在,AI在几个小时内完成了这一流程。
第三维:芯片-模型协同设计——60小时自迭代完成物理实现
最引人注目的可能是RSI在芯片设计领域的应用。Qwen3.8-Max仅基于一份真实的总线模块规范文档,自主展开了前端设计、验证和后端物理实现的全链路迭代。在自主运行超过60小时、调用EDA工具超过1万次后,成功完成了芯片面积缩减42%的物理实现优化。
传统上,一个优秀的芯片物理设计工程师需要5-10年经验才能达到类似优化水平。AI设计Agent在三天内达成了这一成果,虽然仍需要人类工程师的最终审核和签核,但研发效率的跃迁已是不争的事实。
三、5-10万亿参数:Qwen下一代模型的进化目标
基于RSI前期探索的进展,阿里在大会上披露了下一代Qwen模型的发展路线图:
- Qwen4:基于新一代架构,已在训练中,深度集成RSI能力
- Qwen4.5/Qwen5:目标参数量级5-10万亿(5-10T),承担更复杂、更长程的任务
- 全模态扩展:视频生成、语音、图像、世界模型、音乐模型和全模态模型同步推进
- 开源体量:Qwen开源模型累计下载量已突破30亿次,衍生模型超30万个
吴泳铭表示:"未来AI模型将扩展至5-10T参数规模,目标是完成更复杂、更长程的任务,向ASI迈进。"
这个参数规模意味着什么?以目前最大的开源模型Kimi K3(2.8万亿参数)为参照,5-10T的体量将实现一个数量级的推理深度提升——模型不仅能"回答问题",还能在数小时或数天的时间跨度内持续追踪复杂任务的执行状态。这与华为全联接大会上提出的"AI Agent同一任务连续工作数小时"的能力互为印证。
四、真武V900:支撑自我进化的算力基座
大模型自我改进的循环并非在真空中进行——它需要极其庞大的试错算力。每一次RSI迭代本质上都包含完整的训练-评测循环,算力消耗是传统训练流程的数倍。
阿里旗下平头哥在云栖大会上发布的真武V900芯片正是这一需求的产物:
- 算力:达到上一代真武M890的3倍
- 集群扩展:基于真武V900搭建的算力集群最高可扩展至50万卡
- 芯模协同:支持RSI框架下模型自主适配和推理架构优化
- 能效优化:配合"智能是一种规模化商品"的战略定位,持续降低推理成本
这标志着中国AI芯片从"可用"到"好用"的关键跨越。支撑RSI所需的迭代式训练,不仅要求芯片具备更高的单卡算力,还要求集群组网能力支持频繁的模型checkpoint保存、回滚和分布式评测——这些细节对互联带宽和内存子系统提出了极高要求。
五、Agentic AI:从"被动回答"到"自主执行"
RSI引领的模型自我进化,正与云栖大会另一高频关键词"Agentic AI"形成深度共振。Agentic AI意味着AI不再只是被动回答问题,而是理解目标后自主拆解任务、规划步骤、调用工具去完成一个完整目标。
阿里副总裁、千问办公CEO陈宇森在大会上点出了当前AI落地的核心矛盾:"AI很聪明,但不懂业务。这是很多组织AI转型的现实困难。要让Agent在各行各业真正被用起来,数据是关键。"
RSI与Agentic AI的交汇将催生一个正反馈循环:模型通过RSI不断提升的推理和工具使用能力,使Agent在真实业务场景中表现更优;Agent在真实场景中产生的海量交互反馈,又为RSI提供了丰富的改进数据来源。
Gartner在9月15日发布的《2026年中国AI十大趋势》中指出,"智能体能力"位列十大趋势。报告预测企业采用Agent后,单任务Token消耗量将是标准聊天机器人的5到30倍。这一增长不是浪费,而是AI从"浅层应答"走向"深度执行"的必然代价。
六、RSI的边界:当AI自己打开改进的瓶盖之后
RSI的进展引发了关于AI安全性的深层思考。一个能够自主改进自身能力的模型,其改进方向和速度是否仍在人类可控范围内?
9月中旬硅谷爆发的一场"AI信任危机"恰好提供了参照:NVIDIA、Palantir和博思艾伦汉密尔顿集体要求OpenAI和Anthropic签署"零数据保留"协议后才恢复使用其GPT-5级模型。不是因为技术不行,而是"太聪明了"引发的信任焦虑。
对此,阿里在RSI实践中采取了一个务实取向:多层级交叉验证和动态评估基线确保自我改进方向可控,人类保留对改进目标和最终部署的审核权。正如业界评论中的精准界定:当模型开始寻找改进目标、设计训练流程、调用研发工具并验证改进效果时,它才真正从训练对象变成研发参与者——而非替代者。
大模型竞争正在从"谁的模型更强"走向"谁能让模型更快地继续变强"。模型自己生成一点数据再拿这些数据训练自己,还不是叙事终点。真正的变革发生在模型参与训练自己、优化运行自己的推理系统、设计承载自己的芯片这一刻——整个AI研发循环从人类独导转向人机协作。
结语:一个新的AI研发坐标系
2026年云栖大会落下帷幕,但它揭示的趋势将在未来数年持续发酵。RSI递归式自我改进正在重新定义AI研发的坐标系:模型不再是被人类"制造"的对象,而是逐渐具备参与自我改进的"研发合伙人"角色。
从Qwen3.8-Max连续33轮的人本零参与迭代,到推理框架的96%自主优化,再到芯片物理设计的42%面积缩减——这些数字串在一起描绘出的图景是:AI正在从工具变成同事。人类的职责从"编写每一次改进"转向"设定改进的坐标系和边界"。
这到底是人类智慧的延伸,还是智能对自身的回归?答案或许取决于我们如何设计RSI循环中的"参与接口"——那些人类保留审核权、设定方向、定义价值的环节。而当AI开始训练自己的下一代,唯一确定的是:下一轮进化的速度,将超出所有人的预期。

发表评论 取消回复