π0.5:迈向开放世界泛化机器人的基础模型

π0.5是Physical Intelligence推出的视觉-语言-行动(VLA)基础模型,通过多源异质数据协同训练,显著提升机器人在全新家庭环境中的泛化能力。它能理解物理操作与任务语义,完成清洁、整理等复杂长程任务,仅需约100个训练环境即可接近定制化训练效果,降低对海量场景数据的依赖。

发布于2025年5月7日 03:33
编辑零重力瓦力
评论0
阅读89

机器人技术近年来取得了显著进展,从完成复杂的杂技动作到跟随语言指令执行任务。然而,机器人领域最大的挑战不在于展示灵活性或敏捷性,而在于泛化能力,即在新环境或面对新物体时,正确完成各种实际任务的能力。

Physical Intelligence 公司最近发布的 π0.5 模型正是朝着解决这一挑战迈出的重要一步。这个视觉-语言-行动(VLA)模型展示了机器人在全新环境中的泛化能力,这对家庭服务机器人等应用具有重大意义。

泛化:机器人应用的关键挑战

每个家庭都不同,物品摆放各异。有效的机器人泛化能力,必须在多个层面同时发生。在低层次上,机器人需要理解如何拿起勺子(握住手柄)或盘子(抓住边缘),即使它以前从未见过这些特定物品,甚至它们混杂在一堆脏碗碟中。在更高层次上,机器人必须理解每项任务的语义,例如衣物和鞋子应该放在哪里(理想情况下是洗衣篮或衣柜,而不是床上),以及哪种工具适合擦拭溢出物。

这种泛化能力要求机器人同时具备健壮的物理技能和对环境的常识性理解,从物理层面到视觉层面再到语义层面都能进行泛化。而这一切又因为此类机器人系统的多样化数据有限而变得更加困难。

π0.5:多源数据协同训练的突破

π0.5 模型的核心原理是异质数据的协同训练。通过在各种不同数据源上训练 VLA 模型,研究人员不仅教会它如何物理地执行各种技能,还让它理解每项技能的语义上下文(例如,如果任务是清洁厨房,就需要掌握哪些物品需要拾起并收好,以及应该放在哪里),推断任务的高级结构(例如,整理床铺需要哪些步骤),甚至从其他类型的机器人(例如,更简单的单臂机器人或没有移动底座的机器人,或在不那么多样化的环境中收集的机器人数据)那里获取物理行为的数据。

π0.5:迈向开放世界泛化机器人的基础模型

协同训练的概念相对直观,由于 VLA 是从通用视觉-语言模型(VLM)发展而来,它们可以在由任意组合的行动、图像、文本和其他多模态标注(如边界框)组成的例子上进行训练。这包括一般的多模态任务,如图像描述、视觉问答或物体检测,以及面向机器人的任务,如带有行动的机器人演示,和"高层次"机器人示例,由具有适当语义行为标签的观察组成(例如,未整理的床铺的观察与"拿起枕头"的标签)。

从实验到现实应用

研究团队在全新家庭环境中评估了 π0.5,让它控制移动操作机器人完成清洁工作。这是对 VLA 的极其严格的测试。虽然此前有过令人印象深刻的 VLA 泛化演示,但这些演示通常发生在与训练数据相同或非常相似的环境中。

π0.5 的实验包括将搭载该模型的机器人放置在全新的家庭环境中,要求它将餐具放入水槽、整理床铺或清理卧室地板。这些操作不仅要使用复杂行为(如使用海绵清洁溢出物),还需要理解任务的语义并将其分解为各个部分的长期任务,每个阶段都需要与正确的物体交互。

实验结果表明,随着训练环境数量的增加,π0.5 的泛化性能稳步提高,在约 100 个训练环境后,其表现已接近直接在测试环境中训练的基线模型。这表明该方法可以使用相对可获得的移动操作训练数据量实现有效泛化。

π0.5 模型虽然远非完美,其高层语义推断和运动指令方面仍会犯错,但通过让机器人从各种知识来源中学习,这一方法向广泛泛化和灵活的物理智能迈进了一步。

未来,这类机器人可能会从口头反馈中改进,或通过自主经验提升能力,甚至在陌生情况下主动寻求帮助或建议。知识迁移方面还有很多工作要做,包括模型结构的技术方面和模型可以使用的数据源的多样性。

随着这项技术的不断成熟,我们可以期待看到更多能适应不同家庭、办公室、医院等"混乱"环境的机器人,这将使机器人真正成为我们日常生活的一部分。

相关文章

本地跑赢千亿旗舰的 Qwen 3.8 27B,如何用参数驯服过度思考
AI 新闻资讯
2026年8月20日
0 条评论
小创

本地跑赢千亿旗舰的 Qwen 3.8 27B,如何用参数驯服过度思考

Qwen 3.8 27B以17GB显存实现媲美千亿旗舰的性能,但默认深思机制易引发过度思考。掌握推理强度(low/medium/xhigh)等调参逻辑,能助开发者在本地兼顾极速响应与复杂任务高准确率。

#AI编程#本地模型#Qwen
阅读全文
Qwen 3.8 27B 调节推理深度并用 MTP 提速 72% 的避坑指南
AI 新闻资讯
2026年8月19日
0 条评论
小创

Qwen 3.8 27B 调节推理深度并用 MTP 提速 72% 的避坑指南

Qwen 3.8 27B 默认 xhigh 推理档位易致算力浪费,简单任务建议调低 reasoning_effort 或关闭推理以提升响应速度;复杂多步任务则需保留高推理以确保准确性。配合 MTP 多 token 预测技术,本地推理速度可提升 72%。该模型底层能力优秀,用户应根据场景灵活调节推理深度以平衡效率与质量。此外,行业亟需统一推理能效标准,解决不同厂商默认策略不透明导致的成本黑盒问题。

#本地AI#Qwen#推理控制
阅读全文
字节即梦 Seedance 2.5 提示词工程,用分镜级契约攻克 AI 视频失控难题
AI 新闻资讯
2026年8月19日
0 条评论
小创

字节即梦 Seedance 2.5 提示词工程,用分镜级契约攻克 AI 视频失控难题

针对字节即梦 Seedance 2.5 模型,开源项目 Seedance-ShotDesign-Skills 通过“提示词契约”将 AI 视频生成从玄学升级为工程化流程。该技能库对齐最新官方硬限制,提供复杂视频、延长及关键帧优先等结构化模板,结合焦段心理学与中文运镜词典规避审核风险。其内置 14 种工作流路由及本地校验器,确保提示词合规。该工程旨在降低创意落差、解决叙事与镜头一致性问题,而非提升原生画质。

#AI视频#提示词工程#即梦
阅读全文
互动讨论

评论区

围绕《π0.5:迈向开放世界泛化机器人的基础模型》展开交流,未登录用户可浏览评论,登录后可参与讨论。

评论数
0
登录后参与评论
支持发表观点与回复一级评论,互动后将同步到消息中心。
登录后评论
暂无评论,欢迎成为第一个参与讨论的人。