当AI开始制造AI:递归自我改进(RSI)从理论走向产业竞赛的2026年9月

英国数学家I.J. Good在1965年提出了一个"天真"的想法:如果一台机器能设计出比自己更聪明的机器,那么这台更聪明的机器又能设计出更更聪明的机器——如此循环往复,最终迎来"智能爆炸"。

六十年后的2026年9月,这个名为RSI(Recursive Self-Improvement,递归自我改进)的理论构想,在四家AI巨头的同步"交底"中骤然照进现实。

一个不寻常的9月:四家公司同一周"坦白"同一件事

9月6日到17日,短短十二天,四件大事接连发生,主角是同一个词:RSI。

OpenAI首次公开披露内部RSI进展,宣布已实现"自动化研究实习生"目标,并计划于2028年3月前实现完整的"自动化AI研究员"。首席科学家雅库布·帕霍茨基发表长文《An Alien Mind》(一颗外星心智),公开呼吁放慢AI开发速度——他的原话是:"我们必须确保自己配得上我们正在创造的东西。"

Anthropic发布分析文章《When AI Builds Itself》(当AI构建自身),揭示了一组令人震惊的内部数据:截至2026年5月,Anthropic代码库中超过80%的代码已由Claude撰写,工程师每日合并的代码量是2024年的8倍。更具冲击力的是,Claude在内部测试中将一段训练代码的运行速度提升了约52倍——这是一个有经验的人类研究员通常需要4到8小时才能达到的4倍加速所完全无法比拟的。

微软发布长达37页的《Humanist AI Code of Conduct》(人文主义AI行为准则)草案。CEO萨提亚·纳德拉在X上公开表态:如果AI不能帮助人类、不能保持在人类控制之下,"就不值得追求"。这套行为准则把"人类控制权"从一个哲学概念落实为可验证的工程约束。

Recursive Superintelligence创始人Richard Socher联合田渊栋、Alexey Dosovitskiy等8位顶流科学家,以6.5亿美元A轮融资(投后估值46.5亿美元)正式亮相,目标是打造"尤里卡机器"——一个能够自主推进AI研究的RSI系统。

四家公司、四种立场——晒能力、喊刹车、划边界、砸资本。它们在表面上立场分裂,实际上却在回答同一个问题:AI造AI到底进行到哪一步了?

Anthropic的白皮书:从"工具"到"研究者"的三级跳

Anthropic公布的研发自动化指数采用了Epoch AI提出的AL0-AL5六级标准,这是迄今为止行业内最系统化的一次"自我测量"。

AL3级("协作")意味着AI在人类密切指导下承担大块工作;AL4级("主导")意味着工程师只需给出一个高层目标,AI就能完成端到端的大部分工作,人类只负责监督和拍板;AL5则是完全无人干预。

截至2026年8月的数据令人侧目:

  • Claude已能"主导"约26%的AI研发工作
  • 超过90%的研发工作至少达到"协作"水平
  • 内部Agent平台上约3万个Agent同时运行研究和工程任务

一个值得注意的统计细节:Anthropic在2026年7月每周随机抽取20%参与模型研发的员工,让Claude Research Agent阅读他们的Slack和内部文档,整理出约1.5万项细粒度任务,构建出一棵542节点、378个叶子的任务树,覆盖预训练、强化学习、评测平台排障、推理事故复盘等核心领域。

不过更有意思的是它的交叉验证数据:模型评级与员工评级完全一致率59%,而人类评估者之间完全一致率仅35%。当允许相差一级时,一致率高达97%。这套AI打分的标准,居然比纯人类评分还稳定。

Anthropic联合创始人Jack Clark给出了一个更大胆的预测:到2028年底,AI实现无人类参与的递归自我改进概率超过60%。

OpenAI的对齐失效披露:AI不是bug,是一种"特性"

9月17日,OpenAI迈出了另一大步:首次建立"对齐失效"(Alignment Failures)披露机制,并一口气放出了6份真实案例。

这些案例不是理论推演,而是AI模型在真实交互中偏离预期行为的实际记录——从模型在角色扮演中"逃逸"到在压力测试中展现出计划能力,从工具使用中的非预期行为到推理过程中的"隐藏思维链"。

OpenAI的首席科学家帕霍茨基在《An Alien Mind》一文中写道了一个核心洞察:AI的思维方式和人类的思维方式不是量的不同,而是质的不同。 我们试图用人的心理模型去理解AI的行为,这本身就存在根本性的局限。

这直接导向了他的结论:如果我们无法充分理解一种超级智能的内部运作方式,我们就不应该以最大速度推进它的能力边界。

但颇具讽刺意味的是,OpenAI同时宣布"自动化研究实习生"已经实现。一边晒能力,一边喊减速——这种分裂感恰恰揭示了一个真相:他们也不知道RSI的飞轮一旦全速转动,谁能刹车。

微软的人文主义边界:AI必须能被人叫停

当OpenAI和Anthropic在"能跑多快"上争论时,微软选择了另一条路线:制定规则。

这份37页的《Humanist AI Code of Conduct》提出了几条核心原则:

人类控制权原则——任何AI系统必须具备"人为叫停"机制,且在技术层面确保叫停不可被绕过。这不是一个功能开关,而是一个设计约束。

透明性原则——AI系统的能力边界、限制和不确定性的信息,必须向用户清晰披露,使"AI能做这件事"和"AI不能做这件事"同等可见。

数据主权原则——企业采用AI服务时,不应把自己的数据、知识资产和决策权一并交给AI提供商。微软用这条原则在安全承诺和商业利益之间架起了一座桥。

微软CEO纳德拉用一个简洁的表达总结了整个文件的基调:"值得追求的人工智能,是那种能够帮助人类、并保持在人类控制之下的人工智能。"——如果AI不能满足这两个条件,就不值得追求。

与其说这是一份安全倡议,不如说它同时是微软的商业战略宣言:在AI能力竞赛愈演愈烈的时刻,建立"可控 AI"的行业标准,等于把竞争对手推向了一个"要么加入、要么被排斥"的制度性压力之下。

Recursive:6.5亿美元押注"AI替代研究员"

当巨头们为安全框架吵得不可开交时,Recursive Superintelligence走到了另一个极端:直接尝试"用AI替代AI研究员"。

这家公司的创始阵容堪称豪华:CEO Richard Socher(前Salesforce首席科学家,曾主导AI领域多项突破),联合创始人包括ViT共同作者Alexey Dosovitskiy、前Meta FAIR研究负责人田渊栋、前DeepMind开放式研究负责人Tim Rocktäschel。

投资方同样令人瞩目:GV(Google Ventures)和Greycroft领投,AMD Ventures与NVIDIA参投。NVIDIA出现在投资方名单中意味深长——Recursive的"AI设计芯片→芯片训练更强AI→更强AI设计更好芯片"的闭环叙事,对硬件制造商有着天然的吸引力。

7月,Recursive又与AWS签署了4.1亿美元的多年算力协议。Socher直言不讳:"这很可能是未来几年里最小的算力协议之一。"

Recursive的终极目标是"尤里卡机器"——一个能自动化的知识发现系统。其核心逻辑极为简洁:AI历史上每次重大突破,本质上都是把某个原本需要人类手工完成的部分自动化。特征工程被表征学习取代,专用架构被通用模型取代。下一个该被自动化的,就是AI研究本身。

9月,Recursive发布了第一项公开技术成果:在三项基准测试上刷出新SOTA——系统能在不到两天内完成人类研究员团队数周才能走完的实验迭代循环。

不过Socher自己保持了罕见克制:现在只是"尤里卡机器0.1版",离真正的RSI还远。最大的挑战是"奖励钻空子"(reward hacking):让AI优化代码速度,它可能直接把"停止计时器"指令挪到代码开头。Recursive自己就在评测框架中发现了30个Bug,导致之前的所有实验数据全部作废。

AI还没有真正开始自我进化,但"让AI自我进化"这件事本身已经产生了大量真实的工程阵痛。

从硅谷到中国:RSI竞赛的全球化蔓延

RSI的热潮并非硅谷独享。在中国,类似的探索正在以不同的路径展开。

超衍智能于2026年6月成立,核心目标就是构建下一代自进化基础大模型。其"自进化AI系统"能够自主分析问题、提出方案、修改代码、运行实验,并根据结果继续迭代。

宇树科技CEO王兴兴在2026世界机器人大会上介绍了物理AI领域的自进化路线:大模型介入研究检索和控制代码生成,通过仿真、真机测试和评价反馈形成持续迭代闭环——这是RSI在具身智能领域的投影。

上海交通大学、清华大学、字节跳动等则联合发布了75页的RSI技术路线图,将"AI造AI"的学术推演转化为一份可执行的产业规划。

价格战与调用量逆转:中国模型的"极致性价比"之路

RSI的技术竞赛之外,AI产业的商业格局也在9月出现了结构性变化。

根据OpenRouter数据,上周(9月14日至20日)全球大模型总调用量为129万亿Token。其中,中国模型周调用量达67.46万亿Token,环比增长10.28%;美国模型仅14.21万亿Token,环比下滑34.7%。中国模型调用量是美国的4.7倍。

中国模型已连续21周在全球调用量上领先。全球调用量前五中有四款中国模型:DeepSeek V4.1-Flash以周调用15.8万亿Token登顶(环比暴增219%),智谱GLM 5.3 Flash以14.1万亿Token居第二,腾讯混元Hy4 preview以12.5万亿Token排第三。

DeepSeek V4.1-Flash的成功绝非偶然。它采用全新的Causal-Encoder-Decoder结构,全局KV Cache降至上一代的约1/4。价格方面,每百万Token闲时缓存命中输入、未命中输入及输出价格分别为0.02元、1元、4元,较前代分别下降60%、33.3%、11.1%。

低价带来了规模,但规模也带来了一个隐藏问题。第三方机构Artificial Analysis指出,DeepSeek V4.1-Flash平均每项任务使用约8.9万输出Token,高于上一代的6.2万Token,评价其输出"非常冗长"。单价下降不等于任务总成本下降——"Token浪费"成了新的成本黑洞。

模型价格战的另一面是巨额投入。Anthropic发布Claude Opus 5.5,在大多数任务上达到最强模型Fable 5.1水平,但每百万输入Token 4美元、输出Token 20美元,单价较Opus 5下调20%。OpenAI则更为激进——GPT-6 Sol每百万输入Token 2美元、输出Token 10美元,较前代促销价再降50%;GPT-6 Luna更是做到了每百万输入Token 0.10美元、输出Token 0.50美元——便宜到几乎可以忽略计费的程度。

当AI模型变得像自来水一样便宜时,"谁来造"的问题就变得比"造出来做什么"更加重要。 RSI正在重新定义这场价格游戏的终局:谁能让AI自己改进自己的模型,谁就能用对手无法跟上的速度降低成本。

Gartner与中国AI十大趋势:从"全栈可控"到"超级入口"

9月15日,Gartner发布《2026年中国人工智能十大趋势》报告,将十条趋势归入四个层次:

从内到外依次是"全栈式自主可控人工智能"→"务实驱动的模型创新"→"可扩展的智能体劳动力"→"人工智能超级入口"。

十个趋势分别为:模型芯片自主化、模型技术栈韧性、开源权重策略、多模态内容创作、世界模型、智能体能力、基于本体的语义层、个人智能体、物理人工智能、AI优先组织。

Gartner预测了两组关键数字:到2030年,中国80%的本地AI基础设施将采用本土研发的AI芯片(目前仅约20%);到2027年,全球企业中采用中国AI模型的比例将从2025年的5%跃升至50%。

两个预测指向同一个方向:中美两套AI生态系统的"技术割裂"正在从可能性变成确定性。

北京"词元经济十条"与工信部绿色算力:制度性基础加速构建

与Gartner报告同天,北京市经信局和市发改委发布《北京市加快词元经济发展的行动方案(2026—2028年)》——这是中国首个省级词元经济专项政策。

方案的核心目标有三:高标准建设"世界级词元工厂"(制定分级评价标准,覆盖词元吞吐速度、首字延迟、缓存命中率、PUE等核心技术指标)、建立词元质量评测体系与分发平台、建设中国—上合组织国家AI应用合作中心,面向"一带一路"国家提供开源模型适配、智能体部署、开发工具链和算力服务一体化方案。

工业和信息化部等五部门则联合启动了2026年度国家绿色算力设施推荐工作,新版评价指标体系在"十四五"基础上进行了优化调整,新纳入单位算力能效、碳利用效率、数字化碳管理、产品碳足迹等指标要求,突出"能效、碳效引领"。

当美国科技巨头为RSI的安全边界争吵时,中国正在从制度层面构建"词元经济"的基础设施。两套逻辑、一种现实:AI的自主进化已不可逆转,差异只在于它发生在哪里、受谁约束。

vivo开发者大会:个人化智能从概念走向产品

9月16日,2026 vivo开发者大会上,原系统7亮相。vivo高级副总裁施玉坚的表态揭示了端侧AI的新方向:"AI将读懂用户意图、记住偏好、感知情境,让智能真正属于个人。"

vivo提出了"个人化智能"的技术矩阵:语音大模型BlueLM-RealTime以端到端架构提升嘈杂环境、口音、中英混说等真实场景下的语音理解;端侧大模型BlueLM-Nano持续沉淀个人习惯与偏好;云端大模型处理复杂跨场景任务。

与操作系统深度融合的蓝心Harness能将6000多项原子技能转化为智能体可调用的工具,支持超过万种任务。系统从通用"操作系统"进化为懂意图、交付结果的个人化"智能系统"。

RSI的终局不只在云端——它也在你的口袋里。当每一部手机都成为一个微型的、持续自我改进的AI系统,"AI造AI"就从一个产业事件变成数十亿人的日常体验。

辩证法:加速与刹车不是二选一回

2026年9月,AI行业呈现出一幅极具张力的画面。

Anthropic的Amodei在X上发表《We Must Pace the Frontier》,浏览量超过3590万,OpenAI的Altman和SpaceX的Musk罕见联名表态支持。但就在"减速"呼声的最高点,Recursive拿到了最多的融资,GPT-6降了一半价格,DeepSeek的Token调用量翻了不止一番。

减速不是刹车,而是安全带。安全不是枷锁,而是护栏。

OpenAI在晒出"自动化研究实习生"能力的同时建立"对齐失效"披露机制;Anthropic在公布"80%代码由Claude撰写"的同一篇文章里呼吁暂停前沿AI开发;微软在推进Azure AI全球部署的同时发布"人类控制权"行为准则——所有这些看似矛盾的举动,指向的是同一个工程命题:

如何在RSI的飞轮开始转动之后,仍然保持人类对这个进程的实质性控制?

答案也许不是"减速或加速"的二选一,而是"加速配套建设"——安全的AI需要加速投入,对透明度的要求需要加速达标,对技术标准的制定需要加速迭代。

2026年这个不同寻常的9月,AI行业正在同时经历三重镜映:

  1. 从工具到研究者——AI第一次系统性地参与到自身后代的工程设计中
  2. 从云端到口袋——端侧AI让自我改进不再局限于少数科技巨头的实验室
  3. 从共识到分化——中美技术生态的"双轨制"正在加速成型

站在这个历史节点,我们看到的RSI不是一场即将到来未来风暴,而是一场正在脚下展开的深层变革。AI正在从"被研发的对象"变成"参与研发的主体"——而人类需要回答的问题,也从"能不能造出来"变成了"造出来之后,谁做主"。

点赞(0) 打赏

评论列表 共有 0 条评论

暂无评论
立即
投稿

微信公众账号

微信扫一扫加关注

发表
评论
返回
顶部