引子:9月,27款大模型同台竞技
9月还没过完,全球已经有27款新模型发布,来自13家实验室,其中9款开放了权重。光是9月3日一天,就有7款模型同时上线。这个密度,放在两年前根本不敢想。此前占据行业话题中心的"减速运动"——Anthropic、OpenAI CEO呼吁放慢AI前沿研发速度、达成"48小时历史性和解"——在具体的产品更新面前显得格格不入。模型的能力从未停止扩张,而这一次,扩张的方向不再是"说",而是"做"。
过去我们说AI会写文案、会画图,那是"帮你干活";现在它自己打开软件、自己点鼠标、自己填表、自己跑测试,这叫"替你上班"。AI正在从"嘴"进化到"手"。这中间的差别,就像你请了个顾问和请了个员工。顾问给你建议,员工直接交活。企业掏钱买的,从来都是后者。
一、一次API调用,创建一个生产级Agent
9月10日,OpenAI宣布Agents API进入公开测试。这不仅是一套API,而是一次根本性的范式转变——开发者不再需要自己编排Agent的执行循环、管理会话上下文、处理故障恢复。只需指定任务描述、模型、工具和运行环境,一次调用就能创建一个可投入生产的Agent。
核心能力包括:Agent可以在云端运行代码、处理文件、保存中间结果,持续执行跨越数小时甚至数天的长任务;上下文接近上限时自动压缩;故障后自动恢复。计算环境的选择非常灵活:既可以用OpenAI托管沙箱,也可以部署于Cloudflare、DigitalOcean、Vercel等合作平台。框架具备最多3个并发子智能体协同能力,底层基于开源的Codex harness。
和传统API的本质区别在于:传统是"一问一答",每次调用独立、无状态、超时短;Agents API是"给一个目标,自己干完"。它把"写Agent编排代码"变成了"描述任务目标",开发者的角色从编排者变成了目标定义者。这是编程智能体从"开发者玩具"走向"基础设施"的标志性一步。
二、首宗"AI Agent作案":攻击者只动口
9月中旬,西班牙数据保护局(AEPD)公开确认,收到了一封特殊的通报——全球首宗"涉嫌由AI Agent实施"的个人数据泄露事件。这不是普通的黑客攻击:攻击者只负责下达指令,AI Agent自己完成登录、搜漏洞、改数据、查看账单的全过程。
根据报告,这套攻击链路几乎全部交给了自主AI Agent自动执行:Agent首先扫描系统通用文件查找漏洞,随后成功登录,在无人直接干预的情况下继续自主搜寻应用程序的缺陷,最终得以查看发票信息并篡改个人信息。整个过程无需人工持续值守。
西班牙监管方强调了几点关键事实:这不意味着底层模型或其提供商的基础设施遭到破坏,而是对商业工具的恶意滥用;目前所有信息源自受影响方的初步声明,最终结论尚待调查;单一事件不足以证明普遍趋势。但他们同时指出,AI已经可以提升既有攻击手段的速度、规模和适应性,压缩检测与处置时间。
三、黑客交出控制权:拿下每个目标仅需25美元
比西班牙事件规模更大、模式更清晰的案例已经浮出水面。有攻击者直接把整套入侵流程交给自主AI Agent完成,平均拿下一家线上零售企业的成本仅25美元,已经造成超60万条信用卡记录泄露。
这场攻击活动从2026年7月持续至今。仅9月10日到15日六天,就启动了105个攻击项目,至少27家企业遭到入侵——受害者包括财富500强酒店集团、美国大型航司、头部工业用品分销商、线上时尚零售平台。获取访问权限大多耗时不到一天,很多案例仅几个小时就完成突破。
整套攻击链路由三套开源AI harness分工配合:Strix负责漏洞检索、Cairn承担端到端自主渗透、Hermes负责整体活动编排。攻击者通过OpenRouter调用各类大模型支撑Agent运行。四周时间模型调用开销约7000美元,后续攻击规模进一步扩大,完整项目总开销预估在12000至18000美元区间——分摊到每个被扫描目标,平均成本25.46美元,最便宜的仅3.13美元。这是一个令人不寒而栗的数据:攻击者的边际成本已经低于一杯咖啡,而防御者的边际成本几乎没有变化。
四、9月密集发布:从GPT-6 Astra到Grok 4.7
仅记录9月前20天的主要发布事件,产业竞争的烈度一目了然:
9月1日,Anthropic发布Claude Fable 5.1和Mythos 5.1,主打编程和知识工作,缓存读取价格从每百万Token 1美元砍到0.25美元——这一刀直接砍向长任务成本。
9月2日,Google放出Gemini 3.8 Flash(输入0.75美元/百万Token);同日阿里发布Qwen3.8-Max-0902,2.4万亿参数、100万Token上下文,在Code Arena的WebDev榜冲到第一。
9月3日,OpenAI发布GPT-6 Astra。总裁Greg Brockman直言:"欢迎来到AGI时代"。OpenRouter数据显示,GPT-6 Astra上线两周,企业AI支出份额已达13%。
9月10日,OpenAI Agents API公测(详见上文);同日DeepSeek上线V4.1-Flash,5520亿参数MoE架构,输入仅0.3美元/百万Token——基本和行业地板价持平。
9月12日,xAI的Grok 4.7登场,参数规模2.1万亿,比上一代增长约40%。
加上同期发布的Kimi、字节豆包、智谱GLM等大模型更新,9月全球AI实验室的产品发布节奏之密,史无前例。
五、华为全联接2026:Agent工厂+昇腾,中国算力的全栈答案
9月17日,第十一届华为全联接大会在上海开幕。360集团与昇腾AI联合打造的智能体基础设施正式亮相。以360智能体工厂为核心的智能体平台与昇腾AI深度协同,面向AI Agent场景实现全面提速。
其首创的"蜂群多智能体协作技术"支持多智能体多层嵌套、灵活组队与共享协作记忆,使原本需要2小时的多角色协作任务缩短至20分钟,效率提升6倍。内测中已实现超过1000步复杂任务连续执行不中断,任务成功率达95%以上。针对智能体常见挑战,昇腾AI通过长序列和KV Cache优化,有效降低首Token时延、提升整体吞吐效率。
这一方向的核心意义在于:随着AI Agent从单轮问答迈向复杂任务执行,异步并行、长上下文推理、高频工具调用成为主流。Agent需要持续进行任务拆解、规划决策、工具调用和结果反馈,对底层算力的稳定性、吞吐能力和响应速度提出了高要求。算力基础设施和Agent框架的协同优化,正在成为中国AI产业的关键路径。
六、清华AI青年大会与全球治理:给Agent时代装护栏
9月19日,清华大学发布《2026年青年最关注的改变未来五大AI技术榜单》,由全球4000名青年票选出:多模态推理与生成大模型、可交互世界模型、长程任务智能体与多智能体协同技术、具身智能基础模型、递归自我改进技术。五项技术中至少三项与Agent直接相关。
同日,Anthropic威胁情报报告揭示了过去八个月内全球威胁行为体利用Claude模型进行恶意活动的真实案例:网络攻击、影响力操纵、监控行动、常规武器开发、生物滥用、诈骗欺诈以及非法蒸馏——AI显著降低了高级攻击的技术门槛,使个体或小型团体能执行以往仅限国家级别才能开展的复杂行动。
政策层面,中国工业和信息化部等五部门联合启动2026年度国家绿色算力设施推荐工作,新版评价体系突出能效、碳效引领,纳入单位算力能效、碳利用效率、数字化碳管理、产品碳足迹等指标。这一方向虽不直接关乎Agent安全,但在资源约束下如何平衡AI算力扩张与可持续发展,正在成为中国AI治理的关键课题。
据CNNIC数据,中国AI大模型周调用量连续二十一周领跑全球(67.46万亿Token),DeepSeek V4.1-Flash登顶全球第一(周调用量15.8万亿Token,环比增长219%)。中国在全球AI竞赛中的地位已从追赶走向部分领先。
七、Agent经济元年:从概念到财报
资本市场的反应同样值得关注。同花顺AI智能体指数从1月峰值1741.77点跌至9月1347.75点,较峰值跌去23%。但A股中报第一次出现了Agent商业化的规模化证据:金山办公收入同比+24.7%,蓝色光标AI驱动收入37.25亿元(同比+210%),焦点科技旗下AI麦可现金收入9083万元(同比+88.5%)。
IDC预测,全球活跃智能体数量将从2025年2860万个增长到2030年22.16亿个,中国市场复合增速151%。同花顺AI指数当前跌去23%的走势,并不是Agent被证伪,而是定价权从"叙事"切换到"报表"的阵痛——Gartner曲线上期望泡沫破裂后、实质生产爬坡前的那个深坑。
Gartner预测40%的Agent项目将在2027年前取消,国内67.3%的企业部署仍停留在L1级问答阶段——行业确实在挤泡沫。但Token成本两年下降千倍、按任务计费的收入占比从15%升至45%,Agent第一次有了可持续的单位经济模型。
结语
2026年9月将被行业史记录为AI Agent从"概念愿景"走向"生产实践"的分水岭月份。Agents API公测让"写Agent"变成了"说任务";西班牙的"AI Agent作案案"让安全界第一次面对"攻击者不亲自出手"的新型威胁;华为全联接大会展示了Agent基础设施的全栈方案;DeepSeek登顶全球调用量证明中国AI的规模化能力已经到来。
从嘴到手——这不只是技术能力的升级,更是AI与人类关系、AI与社会关系的一次重新定义。Agent不再只是屏幕上和你聊天的助手,而是能走进现实、服务社会的数字员工、数字攻击者、数字合作者。这个"手"伸向哪里,又该被怎样的规则约束——将是2026年下半年乃至更长远时间里,整个社会必须直面的核心命题。

发表评论 取消回复