作者:Alan Blount、Antonio Gulli、Shubham Saboo、Michael Zimmermann 和 Vladimir Vuskovic
简介
人工智能正在发生变化。多年来,人们的关注点一直在于能够胜任被动、离散任务的模型,回答问题、翻译文本,或根据提示生成图像。这种范式虽然强大,但每一步都需要人工持续引导。如今,我们正见证着范式的转变,人工智能从仅仅做出预测或生成内容,迈向能够自主解决问题和执行任务的新型软件。
这一新前沿以 AI 智能体为核心。智能体不再只是静态工作流中的 AI 模型,而是一个完整的应用程序,能够制订计划并采取行动以实现目标。它结合了语言模型(LM)的推理能力与实际行动能力,从而能够处理单一模型难以胜任的复杂多步骤任务。其关键能力在于,智能体能够自主工作,在没有人类持续引导的情况下,自行推断为达成目标所需的下一步行动。
核心要点
智能体是什么
智能体 = 模型(大脑)+ 工具(双手)+ 编排层(神经系统)+ 运行时服务,用 LM 在循环中达成目标。它不再只是"工作流自动化",而是能自主规划、行动、观察的协作实体。
五步问题解决循环
- 接收任务:由用户或自动化触发一个高层目标。
- 扫描环境:编排层收集上下文——用户请求、短期记忆、可访问的工具与数据。
- 思考推演:推理模型分析任务与环境,制定多步计划。
- 采取行动:调用工具执行计划的第一步(API、代码、数据库查询)。
- 观察迭代:把行动结果写回上下文,回到"思考"步骤,循环直至目标完成。
智能体能力分级
- Level 0 核心推理系统:纯 LM,无工具,仅靠预训练知识。
- Level 1 连接型问题解决者:接入外部工具(搜索、RAG、数据库),能获取实时信息。
- Level 2 战略型问题解决者:掌握上下文工程,主动筛选、打包、管理每一步最相关的信息。
- Level 3 协作多智能体系统:从"超级智能体"转向"专家团队",智能体之间互相委托任务。
- Level 4 自进化系统:能识别自身能力缺口,动态创建新工具甚至新智能体来填补。
核心架构三要素
- 模型:选型不能只看基准分,要针对业务问题测试,并权衡质量、速度、成本。可用"专家团队"路由——重活交给旗舰模型,简单高频任务交给快速廉价模型。
- 工具:信息检索(RAG、NL2SQL)、执行动作(API、代码执行、人在回路 HITL)、函数调用(OpenAPI 契约、MCP 协议)。
- 编排层:运行"思考-行动-观察"循环的状态机。关键设计选择包括自主度光谱、无代码 vs 代码优先框架、系统提示词注入领域知识与人格、短期/长期记忆管理。
多智能体设计模式
- 协调者模式:一个"经理"智能体拆分任务并分派给专家智能体,再汇总结果。
- 顺序模式:数字流水线,一个智能体的输出是下一个的输入。
- 迭代精炼模式:生成器 + 评审器循环,持续提升质量。
- 人在回路(HITL):高风险动作前暂停,征求人工批准。
Agent Ops:把不可预测变成可管理
- 像 A/B 实验一样度量:定义证明价值的 KPI(目标完成率、满意度、延迟、单次成本、业务影响)。
- 用 LM 当裁判:用强大模型按评分标准评估输出质量,替代简单的通过/失败。
- 指标驱动开发:跑完整评估集对比新旧版本,作为部署的 Go/No-Go。
- OpenTelemetry 追踪:高保真记录智能体每一步执行轨迹,回答"为什么"。
- 珍视人类反馈:把用户反馈转成新的测试用例,给系统"打疫苗"。
智能体互操作
- 与人类:聊天界面、computer use(接管 UI)、实时多模态语音(Gemini Live)。
- 与智能体:A2A 协议 + Agent Card(数字名片),实现发现与异步任务通信。
- 与金钱:AP2 协议(加密签名的授权委托)、x402(HTTP 402 微支付),构建智能体经济信任层。
安全与治理
- 信任权衡:给智能体足够长的"绳子"干活,但短到不会"跑进车流"——纵深防御:确定性规则 + AI 守卫模型。
- 智能体身份:智能体是新的主体类别,需可验证的数字身份(SPIFFE),按最小权限授权。
- 规模化治理:从单智能体到企业舰队,需要中央网关作为控制平面 + 中央注册表,治理"智能体蔓延"。
学习与进化
智能体从运行时经验(会话日志、追踪、HITL 反馈)和外部信号(新政策、法规)中学习,通过优化上下文工程、优化或创建工具来持续改进。前沿方向是 Agent Gym——离线模拟环境,让智能体在真实部署前"试错"训练。
高级案例
- Google Co-Scientist:虚拟科研协作者,生成并评估新假设,用多智能体生态加速科学发现。
- AlphaEvolve:用进化算法优化数学与计算机科学算法,已改进谷歌数据中心、芯片设计与 AI 训练效率。