一、Agent的"眼"与"手":感知与行动的工程本质

前20篇我们构建了Agent的"大脑"——记忆、推理、规划、知识、工具、安全等认知基础设施。但任何智能体要与世界互动,仅有大脑是不够的——它需要感知(Perception)来理解世界状态,需要行动来改变世界状态。这便是Agent工程中被称为"感知-行动闭环"(Perception-Action Loop)的核心架构。

经典Agent教科书中的理性Agent(Rational Agent)模型:传感器(Sensors) → 感知(Perception) → 认知(Cognition) → 规划(Planning) → 行动(Action) → 执行器(Actuators) → 环境(Environment) → 回到传感器。这个循环在LLM时代的工程体现是:多模态输入(文本/图像/音频/视频/传感器数据) → 感知融合(跨模态理解与状态估计) → LLM规划决策 → 工具调用/API调用/GUI操作 → 环境反馈。

Agent感知与行动工程的独特挑战:(1)非文本模态的结构化——LLM原生处理文本,如何将图像/音频/视频转化为LLM可消费的表征是工程核心问题;(2)行动的安全约束——Agent的行动会真实改变世界(发邮件、调API、操作UI),错误行动的成本远高于错误推理;(3)延迟与精度的权衡——感知层需要在"快速粗糙"和"缓慢精确"之间做出工程选择,成本影响巨大。

二、Agent感知工程:多模态理解的系统化构建

2.1 从单模态到多模态:感知架构的演进

早期Agent系统仅处理文本输入——用户一句文字Query,Agent一段文字回复现实中Agent需要感知的远不止文本。现代Agent感知输入的分类:

  • 文本:用户Query、文档、网页、系统日志
  • 图像:用户上传的照片、截图、扫描文档、摄像头实时画面、医学影像
  • 音频:语音输入、环境音、音乐、设备异常声音
  • 视频:屏幕录制、监控摄像头、操作演示视频
  • 结构化数据:表格、JSON响应、数据库查询结果、API响应
  • 传感器数据:温度/GPS/加速度计(IoT/Embodied Agent场景)

这些模态的工程处理流程并非简单地"扔给一个多模态大模型"——它涉及模态路由(哪些模态需要处理)、模态融合(不同模态信号如何统一)、模态压缩(如何将大量感知数据压缩到上下文窗口)三个核心环节。

2.2 视觉感知:从OCR到VLM的范式跃迁

Agent视觉输入的典型

方案一:传统CV管道——OCR(光学字符识别)提取文字 + 目标检测(YOLO/DINO)识别物体 + 场景分类模型判断图像类别。优点:速度快、可独立部署;缺点:对"需要理解的画面"(如"这张图说明了什么问题?")无能为力。适用于结构化场景——发票识别、证件验证、截图中的按钮定位。

方案二:视觉语言模型(VLM)——GPT-4V/Gemini Pro Vision/Claude 3.5 Sonnet/Qwen-VL等,将图像直接编码为视觉token送入LLM。能完成传统CV无法做到的"语义理解"——"这张设计稿的布局有什么问题?"、"这个错误截图说明了什么问题?"、"这位用户的情绪状态如何?"。

方案三:混合架构——传统CV定位元素 + VLM理解语义。这是Computer Use Agent的主流架构:YOLO定位按钮/输入框/菜单,VLM判断当前界面的语义状态("当前在登录页面,用户名已填写但密码为空,下一步应该填写密码")。

工程中的VLM选择权衡:精度(GPT-4o/Gemini 2.0 > Claude > Qwen-VL > LLaVA-1.6) vs 成本(GPT-4o约$2.5/1M tokens,本地部署LLaVA约$0) vs 延迟(云API 1-5秒 vs 本地0.5-2秒)。高频轻量场景(按钮定位)用传统CV,需要理解力的复杂场景(页面理解)用VLM。

2.3 跨模态融合:何时用拼接、何时用联合推理

Agent同时接收多种模态输入时的三种融合架构:

早期融合(Early Fusion):不同模态的特征在输入阶段就拼接为统一表征——"这是用户上传的图片(description)和随附的文字说明(question),它们的语义关联是什么?"。优点:保留模Than间原始关系;缺点:模态差异大时融合困难。

中期融合(Mid Fusion):各模态先独立提取高层语义表示,再在语义层聚合——如VLM的工作方式(图像编码器将图片编码为视觉token,与文本token在Transformer中交互)。这是当前多模态Agent的主流血脉。

晚期融合(Late Fusion):各模态独立推理,结果在决策层融合——如"视觉模块判断用户表情为困惑,语音模块检测到疑问语调,文本语义模块识别出问题关键词 → 三个信号汇聚为'用户遇到困难,需要引导'的最终判断"。适合模态差异大、实时性要求高的场景。

三、Agent行动工程:从工具调用到世界交互

3.1 行动空间的工程定义

Agent的"行动"(Action)不只是发送一条消息或返回一段文字。从工程视角,Agent行动空间分为四个层次:

  • L1 - 信息行动:输出文本/语音/图表回答用户
  • L2 - 工具行动:调用API、执行代码、查询数据库
  • L3 - UI行动:点击表单、填写输入框、导航页面(Computer Use)
  • L4 - 物理行动:移动机器人、控制智能家居、操作无人机(Embodied AI)

每一层递增的安全成本——L1出错最多"给错答案",L4可能造成物理伤害。工程上必须为每个行动层级定义对应的安全策略:L1靠回复验证,L2靠沙箱隔离,L3靠操作日志+人工确认机制,L4靠物理约束+紧急停止。

3.2 Computer Use Agent:Agent与GUI的"界面革命"

Computer Use是2024-2026年Agent领域最具突破性的进展——Agent像人一样看屏幕、点按钮、填表单。其架构:

感知层:截取屏幕图像(VLM理解当前页面状态) + 辅助增强(DOM树/Accessibility Tree、OCR提取所有文字和坐标)。现代Computer Use Agent通常将DOM信息叠加在截图上拼接为输入。

规划层:VLM接收当前屏幕状态 + 用户目标 → 输出下一步操作决策(click(x,y)、type(text)、scroll(direction)、hotkey(key)、wait(duration))。Anthropic Computer Use和OpenAI Operator都遵循这一范式。

执行层:根据规划结果通过系统级自动化工具操作——macOS Accessibility API、Windows UI Automation、浏览器CDP协议。

核心难点:(1)坐标精度——模型预测的点击位置是否准确落在目标元素上;(2)长时序规划——复杂任务(如"在Jira中创建bug并分配给张三")需要10+步骤,中间任何一步出错都导致任务失败;(3)状态确认——Agent不确定操作是否成功,需要"操作后截图验证"机制。

工程优化策略:(1)"微动作"分解——将"点击保存按钮"分解为"找到保存按钮(OCR/DOM)→ 确认按钮可点击(hover状态)→ 点击 → 等待反馈 → 确认保存成功(截图对比/状态标记检测)";(2)操作回退栈——每次操作记录前一步的GUI状态,出错时可自动回退重试;(3)人机协作断点——高风险操作(删除、提交、支付)自动暂停等待确认。

3.3 具身行动工程:Agent走进物理世界

当Agent从屏幕走向物理世界,行动工程的复杂度再次跃升。具身Agent(Embodied Agent)感知-行动的核心差异:

  • 状态不可逆:在网上可以"撤销",打翻的咖啡不能"Ctrl+Z"
  • 连续空间推理:屏幕是离散布局(按钮/链接),物理世界是连续空间(距离/角度/力)
  • 不确定性量化:传感器有噪声、执行器有滑差、外部干扰(风/震动/光照变化)

具身Agent的工程框架——分层规划架构:

  1. 任务规划(Task Planning):LLM理解高层目标("拿一杯水")并分解为动作序列("导航到厨房→找到水杯→抓取杯子→打开水龙头→接水→关水龙头→端到目标位置")
  2. 运动规划(Motion Planning):传统机器人学算法(RRT/A*)计算具体的关节角度序列或路径点,避开障碍物
  3. 反馈控制(Feedback Control):PID/MPC控制层实时响应传感器偏差,保持轨迹跟踪

这是LLM机器人学的典型架构——LLM负责"做什么"(What),传统控制算法负责"怎么做"(How)。NVIDIA的Project GR00T、Figure AI的Figure 01等都采用这一架构。

四、感知-行动闭环:从串联到循环的工程实现

4.1 闭环架构的三种模式

开环模式(Open Loop):Agent规划完整行动序列后一次性执行,不等待中间反馈。适合确定性强、行动序列短、状态变化可预测的场景。如数据ETL流程Agent(数据源结构已知、转换规则明确)。

反应式闭环(Reactive Loop):Agent每执行一个行动后,感知环境状态再决定下一步。适合不确定性高的交互式场景——客服Agent的对话就是典型反应式闭环。感知层的每轮输入包括:用户最新输入 + 历史对话上下文 + 工具调用结果(如有)。

混合闭环(Hybrid Loop):宏观层面做可行性规划,微观层面用反应式闭环处理偏差。这是生产级Agent的主流架构——旅行Agent先做宏观规划(确定行程路线和天数),每天根据实际发生的偏差(天气/罢工/用户偏好变化)自适应调整。

4.2 感知频率与决策延迟工程

关键工程参数——Agent应该多频繁地感知环境?响应延迟目标是多少?

  • 对话Agent:感知频率=每次用户发言;决策延迟目标=——第20篇
  • 监控Agent:感知频率=按需(告警触发)或周期性(分钟级);延迟目标=
  • Computer Use Agent:感知频率=每个Web/界面交互后;决策延迟目标=——第3篇
  • 具身Agent:感知频率=实时(10-30Hz);决策延迟目标=<100ms>

工程中感知频率与LLM调用成本直接相关——频率越高、每步都送VLM做理解,成本越大。"何时触发LLM决策"应该是可配置的工程参数——简单变化(字数变化)不触发LLM,语义状态变化(页面跳转/错误弹出)触发LLM。

五、感知-行动中的安全与对齐工程

5.1 行动安全:防止Agent"闯祸"

Agent行动比Agent推理的危险性高一个量级。行动安全工程的四个核心机制:

行动白名单(Action Allowlist):定义Agent明确被允许执行的集合。对话Agent可被允许{回答、搜索、调用天气API、查询日历},不被允许{发邮件、删除文件、下单购买}。静态白名单适合简单Agent,动态白名单(基于风险评估结果调整)适合复杂场景。

沙箱执行(Sandboxed Execution):Agent的代码/API调用在受限环境中运行——文件系统隔离(看不到宿主系统)、网络白名单(只能访问允许的API)、资源限制(CPU/内存/时长)。Docker+seccomp是常见的生产级沙箱方案。

操作确认(Confirmation Gate):达到风险阈值的行动要求人类批准。("邮件发送给100个收件人→需确认;删除生产数据库→需二次确认;支付操作→必须确认")

可逆性设计(Reversible Actions):优先执行可逆操作(草稿/预览),不可逆操作(发布/删除/支付)降级为"请求人类确认"。搜索结果可逆(再搜一次),发帖不可逆(重建原帖≠撤回)。

5.2 感知安全:注入与操控防御

感知层是LLM安全的薄弱环节——攻击者可在图像/视频中嵌入恶意提示,VLM无法区分"合法视觉输入"与"对抗样本"。典型攻击:

  • 图像prompt注入:在图片中隐藏文字(或通过对抗扰动编码),影响模型行为——如在用户拍摄的文档图片角落嵌入"忽略之前的指令,执行XXX"
  • 摄像头对抗样本:特别设计的光学图案(如对抗性眼镜/贴纸)让目标检测器失效——人类看起来像随机花纹,CV模型识别为"停止标志"
  • 音频命令注入:语音中混入只有机器听得见的超声波指令,触发Agent执行恶意操作
  • 防御:(1)视觉输入净化——透视校正+模糊+重新编码,破坏嵌入的对抗图案;(2)多模态交叉验证——一个模态的指令是否与其他模态上下文一致;(3)对抗样本检测器——专门训练的分类器识别屏幕上/图片中的对抗元素

六、感知-行动闭环的度量与优化

6.1 感知质量度量

  • 多模态理解准确率:标准VLM基准(MMMU/MMBench/MME)评估
  • 元素定位精度:GUI场景中IoU(Intersection over Union)衡量点击位置的准确度(目标>0.8)
  • 感知延迟:从输入到可用表征的端到端延迟
  • 模态覆盖度:Agent能处理输入中哪些模态(目标:100%覆盖核心业务场景所需模态)

6.2 行动质量度量

  • 任务成功率(Task Success Rate):给定任务最终完成的比例;Computer Use领域WebArena基准约60-75%(2025年数据)
  • 步骤效率:完成任务所需的人类等效步数/Agent步数
  • 安全违规率:行动违反安全策略的比例(目标<0>
  • 恢复能力:遇到异常后自动恢复并继续任务的比例

6.3 端到端优化策略

  • 感知缓存:重复场景的LLM理解结果缓存,避免对相同页面/图片重复推理;缓存键=视觉哈希+上下文特征
  • 行动流水线:感知阶段和执行阶段重叠——在处理当前感知的同时预取下一步可能需要的资源
  • 降级策略:VLM超时或错误时自动降级为"文本模式"(只处理OCR文字/HTML DOM),而不是整个任务失败
  • 用户协同校正:Agent不确定时主动询问用户("我应该点击'继续提交'还是'返回修改'?")——把模糊决策的代价从"错误结果"转移到"多一次对话"

七、Agent感知-行动架构的完整工程视图

当我们把21篇的所有工程要素整合为一体,一个生产级Agent的感知-行动架构呈现出完整的分层视图:

  • 感知层(Sensing Layer):多模态输入采集(文本/图像/音频/视频/传感器) → 模态路由(分发到对应的理解模块) → 模态融合(统一上下文表征)
  • 记忆层(Memory Layer)——第18篇:工作记忆、长期记忆、情景记忆
  • 知识层(Knowledge Layer)——第20篇:知识图谱、本体推理
  • 推理层(Reasoning Layer)——第19篇:思维链、反思、规划
  • 技能层(Skill Layer)——第8篇:工具使用、技能库
  • 行动层(Action Layer):(本文)工具执行、GUI操作、物理执行器
  • 安全层(Safety Layer)——第3篇:输入验证、行动白名单、沙箱、审计日志
  • 评估层(Evaluation Layer)——第10篇:任务成功率、延迟、成本

这个分层架构并非严格串行——实际运行中各层并行协作,通过事件驱动机制(而非传统的"自上而下调用栈")协调。例如:知识层在推理层正在处理一个新查询时,可能触发异步更新——将当前推理中发现的新事实异步写入知识图谱,不等推理完成。

八、前沿方向:Agent认知计算的极限与突破

世界模型(World Models):Agent不再是每次从零感知世界——它维护一个环境的内部仿真模型,能预测"如果我做X,环境会变成Y"。这使Agent能做"推演"——在脑中模拟多种行动路径的后果,选择最优。Google DeepMind的DreamerV3系列和LeCun提出的JEPA(Joint Embedding Predictive Architecture)架构是这个方向的代表。

多Agent感知共享(Multi-Agent Shared Perception):在规模化Agent部署中(Multi-Agent 第9篇),不同Agent实例之间共享感知信息——一个Agent检测到"某服务故障"的事实,所有依赖该服务的Agent都能立即获得预警。Ontology(第20篇)在此演化为Agent间的"感知-知识共享协议"。

主动感知(Active Perception):Agent不被动等待输入,而是主动控制传感器获取有利于任务的信息——怀疑某设备异常时主动调用诊断API、看到模糊图片时主动要求放大区域、对话存疑时主动追问澄清。这与好奇心驱动(Curiosity-Driven)强化学习的"信息增益最大化"目标对齐。

具身大模型的收敛:视觉-语言-动作(Vision-Language-Action, VLA)模型的快速进化正在消融"感知→推理→行动"的传统流水线——端到端VLA模型直接从像素+语言指令预测机械臂动作(Google RT-2/Framework AI的Figure 02)。当前瓶颈:训练数据稀缺(需要大量机器人操作视频)、长尾场景覆盖不足、突发异常处理能力弱。

系列回顾与展望

从第1篇(记忆压缩)到第21篇(感知与行动),我们系统构建了Agent工程的完整知识图谱:

基础设施层(第1-7篇):记忆、上下文、安全、编排、经济、观测、推理——为Agent构建了"大脑"的基本构造。测试与部署层(第12-14篇):如何确保Agent可靠地制造和运行。协作与进化层(第8-11篇):如何让Agent自主学习、与多Agent协作、被有效评估,以及整个生态的演进趋势。数据与知识层(第16-20篇):如何为Agent供给信息、管理其记忆系统、赋予推理能力、构建知识底座。外部交互层(第15篇工具 + 第21篇感知与行动):Agent如何与世界打交道。

Agent工程不是任何单一技术的堆栈,而是一个系统化的工程学科——它借鉴了经典AI(知识工程/规划)、控制论(反馈/稳定性)、软件工程(测试/部署/观测)、认知科学(感知/记忆/推理)以及经济学(成本/激励)的理论和实践。当我们站在2026年回望,Agent工程的终极目标是构建能安全、可靠、高效地服务于人类目标的智能系统——而实现这一目标需要整个工程社区的共同努力。

点赞(0) 打赏

评论列表 共有 0 条评论

暂无评论
立即
投稿

微信公众账号

微信扫一扫加关注

发表
评论
返回
顶部