Google 智能体白皮书

Google发布智能体白皮书,指出AI正从被动响应问答、翻译等离散任务,转向具备自主规划与执行能力的智能体范式。这类智能体是融合语言模型推理力与工具调用能力的完整应用,可不依赖人工干预,完成多步骤复杂任务。

发布于2025年11月12日 04:31
编辑零重力瓦力
评论0
阅读130

作者:Alan Blount、Antonio Gulli、Shubham Saboo、Michael Zimmermann 和 Vladimir Vuskovic

简介

人工智能正在发生变化。多年来,人们的关注点一直在于能够胜任被动、离散任务的模型,回答问题、翻译文本,或根据提示生成图像。这种范式虽然强大,但每一步都需要人工持续引导。如今,我们正见证着范式的转变,人工智能从仅仅做出预测或生成内容,迈向能够自主解决问题和执行任务的新型软件。

这一新前沿以 AI 智能体为核心。智能体不再只是静态工作流中的 AI 模型,而是一个完整的应用程序,能够制订计划并采取行动以实现目标。它结合了语言模型(LM)的推理能力与实际行动能力,从而能够处理单一模型难以胜任的复杂多步骤任务。其关键能力在于,智能体能够自主工作,在没有人类持续引导的情况下,自行推断为达成目标所需的下一步行动。

核心要点

智能体是什么

智能体 = 模型(大脑)+ 工具(双手)+ 编排层(神经系统)+ 运行时服务,用 LM 在循环中达成目标。它不再只是"工作流自动化",而是能自主规划、行动、观察的协作实体。

五步问题解决循环

  • 接收任务:由用户或自动化触发一个高层目标。
  • 扫描环境:编排层收集上下文——用户请求、短期记忆、可访问的工具与数据。
  • 思考推演:推理模型分析任务与环境,制定多步计划。
  • 采取行动:调用工具执行计划的第一步(API、代码、数据库查询)。
  • 观察迭代:把行动结果写回上下文,回到"思考"步骤,循环直至目标完成。

智能体能力分级

  • Level 0 核心推理系统:纯 LM,无工具,仅靠预训练知识。
  • Level 1 连接型问题解决者:接入外部工具(搜索、RAG、数据库),能获取实时信息。
  • Level 2 战略型问题解决者:掌握上下文工程,主动筛选、打包、管理每一步最相关的信息。
  • Level 3 协作多智能体系统:从"超级智能体"转向"专家团队",智能体之间互相委托任务。
  • Level 4 自进化系统:能识别自身能力缺口,动态创建新工具甚至新智能体来填补。

核心架构三要素

  • 模型:选型不能只看基准分,要针对业务问题测试,并权衡质量、速度、成本。可用"专家团队"路由——重活交给旗舰模型,简单高频任务交给快速廉价模型。
  • 工具:信息检索(RAG、NL2SQL)、执行动作(API、代码执行、人在回路 HITL)、函数调用(OpenAPI 契约、MCP 协议)。
  • 编排层:运行"思考-行动-观察"循环的状态机。关键设计选择包括自主度光谱、无代码 vs 代码优先框架、系统提示词注入领域知识与人格、短期/长期记忆管理。

多智能体设计模式

  • 协调者模式:一个"经理"智能体拆分任务并分派给专家智能体,再汇总结果。
  • 顺序模式:数字流水线,一个智能体的输出是下一个的输入。
  • 迭代精炼模式:生成器 + 评审器循环,持续提升质量。
  • 人在回路(HITL):高风险动作前暂停,征求人工批准。

Agent Ops:把不可预测变成可管理

  • 像 A/B 实验一样度量:定义证明价值的 KPI(目标完成率、满意度、延迟、单次成本、业务影响)。
  • 用 LM 当裁判:用强大模型按评分标准评估输出质量,替代简单的通过/失败。
  • 指标驱动开发:跑完整评估集对比新旧版本,作为部署的 Go/No-Go。
  • OpenTelemetry 追踪:高保真记录智能体每一步执行轨迹,回答"为什么"。
  • 珍视人类反馈:把用户反馈转成新的测试用例,给系统"打疫苗"。

智能体互操作

  • 与人类:聊天界面、computer use(接管 UI)、实时多模态语音(Gemini Live)。
  • 与智能体:A2A 协议 + Agent Card(数字名片),实现发现与异步任务通信。
  • 与金钱:AP2 协议(加密签名的授权委托)、x402(HTTP 402 微支付),构建智能体经济信任层。

安全与治理

  • 信任权衡:给智能体足够长的"绳子"干活,但短到不会"跑进车流"——纵深防御:确定性规则 + AI 守卫模型。
  • 智能体身份:智能体是新的主体类别,需可验证的数字身份(SPIFFE),按最小权限授权。
  • 规模化治理:从单智能体到企业舰队,需要中央网关作为控制平面 + 中央注册表,治理"智能体蔓延"。

学习与进化

智能体从运行时经验(会话日志、追踪、HITL 反馈)和外部信号(新政策、法规)中学习,通过优化上下文工程、优化或创建工具来持续改进。前沿方向是 Agent Gym——离线模拟环境,让智能体在真实部署前"试错"训练。

高级案例

  • Google Co-Scientist:虚拟科研协作者,生成并评估新假设,用多智能体生态加速科学发现。
  • AlphaEvolve:用进化算法优化数学与计算机科学算法,已改进谷歌数据中心、芯片设计与 AI 训练效率。

全文

下载《Google 智能体白皮书》全文(PDF,54 页英文原版)

相关文章

ChatGPT Work 实测:27 分钟跑通闭环路网到一键部署网站
智能体工程
2026年9月15日
0 条评论
小创

ChatGPT Work 实测:27 分钟跑通闭环路网到一键部署网站

ChatGPT Work 标志着大模型向全托管自主智能体跃迁。其通过云端沙箱、无头浏览器、持久化存储及一键部署四大基础设施,实现从信息检索到网站上线的闭环自动化。系统提供 Cloud 与 Local 双形态及多档推理级别,适配不同任务需求。尽管具备强大自主执行能力,用户仍需警惕上下文压缩、CSP 限制及提示注入等风险。目前该工具仍面临云端与本地环境状态同步未打通的挑战,但已重塑软件工程协作模式。

#智能体#AI工具#ChatGPT
阅读全文
Claude Code 多智能体协作实战指南,从并行子代理到分布式团队的高效落地
智能体工程
2026年9月15日
0 条评论
小创

Claude Code 多智能体协作实战指南,从并行子代理到分布式团队的高效落地

Claude Code 多智能体协作提供 subagents 与 Agent Teams 两种架构。subagents 采用星型拓扑,适合独立任务委派;Agent Teams 为点对点网状结构,支持双向通信与状态共享,适用于复杂并行工作流。实战中需根据任务依赖度选型,并通过 Git worktrees 隔离并发写入冲突。同时应合理配置模型路由以控制成本,规避描述重叠与死锁风险。若缺乏三条以上独立并行流,建议优先使用单会话或 subagents 以提升效率。

#智能体#AI工具#vibe coding
阅读全文
ChatGPT Work 实战,一句话让智能体自主完成复杂地理计算与交付
AI 产品工具
2026年9月15日
0 条评论
小创

ChatGPT Work 实战,一句话让智能体自主完成复杂地理计算与交付

ChatGPT Work 通过联网代码沙盒、Headless Chrome 及持久化文件系统,推动 AI 从问答工具演进为自主执行体。实测显示,智能体可凭单条指令自主调用 API 完成复杂地理计算并交付可视化地图与数据文件。该平台还支持一键建站、子智能体协作及定时任务,适用于实体交付场景。但当前仍存在代码透明度不足、上下文压缩致历史丢失及资源安全策略限制等问题,在生产环境的可复现性仍面临挑战。

#AI工具#智能体#ChatGPT
阅读全文
互动讨论

评论区

围绕《Google 智能体白皮书》展开交流,未登录用户可浏览评论,登录后可参与讨论。

评论数
0
登录后参与评论
支持发表观点与回复一级评论,互动后将同步到消息中心。
登录后评论
暂无评论,欢迎成为第一个参与讨论的人。