SPEAR引爆物理人工智能:高保真仿真训练评测闭环

引言
物理人工智能与具身智能正从“会看会说”的数字智能,迈向“会动会做”的真实世界智能。真正落地的拐点,并不在某个单一算法突破,而在底层基础设施的系统升级:去哪训练、拿什么学、怎么考。围绕这三道“出门三件事”,群核科技携手英伟达、英特尔、Adobe 与浙大、帝国理工、苏黎世联邦理工等伙伴,以三篇入选 ECCV 的工作,搭起了物理 AI 的训练—学习—评测闭环。更重要的是,它们指向了一个共识:高保真仿真、合成可验证数据与标准化评测,将组成下一代物理 AI 的“水、电、路”。
SPEAR:把“高保真、快、好用”放进同一个仿真器

高质量的具身训练,长期被“画质—速度—可编程性”的不可能三角拉扯。SPEAR 的设计核心,是从通信和调度两个最薄弱的底层环节重构栈。
- 运行时反射直连引擎:SPEAR 直接对接 Unreal Engine 的 C++ 反射系统,在 Python 端以字符串查找类与函数,开放 14485 个 UE 原生函数与 53537 个属性,无需手写厚重封装。对于研发者,意味着“在 C++ 加一行标记,Python 立刻可调”。
- 零拷贝的高吞吐通道:以进程间共享内存承载图像流,GPU 渲染结果直接落到 Python 侧的 NumPy 数组,实现真正 Zero-Copy,切断了最昂贵的搬运瓶颈。
- 事务式异步编程:用
/ 定义帧级工作图,任务在独立服务器线程排队执行,不阻塞 UE 主线程,从而在高保真画面下维持原生帧率。
在 1080P 下,SPEAR 的相机可达约 73 FPS,端到端渲染吞吐相较传统工具链显著提升。它同时输出深度、法线、语义、材质 ID 与 PBR 参数,为表观与物理一致性提供足量监督信号。能力面上,SPEAR 已展示多模态与复杂控制的结合:
- 多体型多 Agent 控制:行人、车辆、四足、飞行器等异构动作空间并行训练;
- 程序化地形与光照:实时操控岩石、植被与昼夜,支撑大规模域随机化;
- 与 MuJoCo 协同仿真:物理在 MuJoCo,图形在 UE,保证动力学可信与视觉写实兼得;
- 自然语言场景编辑:借助完整 Python 接口,代码助手可把语言指令转为场景重构。
值得注意的是,SPEAR 的改变不仅在“快”,更在“可编程”。当仿真器从黑盒渲染器,变为可组合的研究平台,环境生成、任务定义、干预注入与可复现性都被纳入统一接口。这恰是大规模具身研究走向工程化的前提。当然,向更大规模扩展时,跨 GPU/主机的同步开销、确定性回放与物理一致性仍是后续需要精修的环节。
Syn-GRPO:不背标准答案,大模型自己命题、自己批卷

有了可扩展的训练场,问题转向“拿什么学”。后训练阶段常见的做法是用人类偏好或静态题库做强化学习,但在具身场景中,代价高、覆盖窄、易过拟合。Syn-GRPO 的思路是把“题库”和“判卷”一起程序化,形成可验证的自举学习循环。
- 程序化任务生成器:以“场景—约束—目标”的三元模板,从仿真中自动采样任务(如“在光照变化与障碍扰动下,清理指定物体并归位”),天然覆盖长尾组合。
- 可计算的奖励与判据:每个任务伴随可执行的 checker(几何接触、轨迹、能量、安全边界等),避免主观偏好带来的漂移,便于跨任务对齐。
- 难度自适应的课程:根据成功率、时长与违规次数,自动上调或下调任务复杂度,维持在“既有挑战又可学到”的甜蜜区间。
- 模型在环的数据合成:使用当前策略生成反例与对抗场景,持续刷新训练分布,减少“背题”现象。
这种“自己出题、自己批改”的 GRPO 式优化,关键在于把昂贵的人类偏好替换为可验证的程序性反馈;把稀疏奖励拆解为多阶段、可分解的子目标;把静态题库升级为在线合成的多样分布。它更像工程系统,而不是单一算法招数:仿真、任务语言、奖励编译与调度器必须协同,才能真正提升样本效率与泛化力。
空间智能怎么考:从分数到能力画像
最后一道题是评测。具身智能的“好坏”不应只看单次任务成功率,更要读出它在感知、记忆、推理与动作之间的协同能力。新的评测基准着力解决三点痛处:指标统一、场景可复现、跨模态可比。
- 多维指标体系:除了 SR(成功率)、SPL(效率)与碰撞率,加入能耗、停滞时长、干预次数、违规类型分布,形成更立体的能力画像。
- 不同泛化级别:同构资产新布局、异构资产同语义、跨域外观随机化与传感器噪声注入,区分“熟练度”和“迁移力”。
- 任务谱系化:导航、抓取与装配、时序依赖任务、物理常识推断(遮挡、稳定性、可达性)统一在标准接口下,降低不同实验室之间的口径差。
- 可重放与比对:标准化日志、状态快照与随机种子管理,确保结果可复现实验,支持跨模型与跨版本回放对比。
与产业伙伴的联合,带来的并非“更多数据”,而是“更可比的数据”。当评测从“刷分”转向“诊断”,研发才能针对性优化:到底是视觉感知短板,还是策略规划不稳,抑或长时依赖记忆不足,一目了然。
影响与展望
把三篇工作放在一起看,指向的是一套闭环:SPEAR 负责“把世界生成得足够真且可编程”,Syn-GRPO 负责“把训练题目造得对路且可验证”,新基准负责“把能力评得全面且可比”。这不是一家公司的孤立创新,而是一条贯通“训练—学习—评测”的物理 AI 基建范式,天然需要软硬件协同、学术与产业共建。
短期影响体现在两点:
- 研发效率跃迁:统一接口与零拷贝流水,让数据与控制流更直,研究迭代从“周”被压到“日甚至小时”。
- 泛化与稳健性提升:程序化任务与难度自适应,系统性覆盖长尾与组合爆炸,为 sim2real 铺路。
中长期仍有硬骨头要啃:跨引擎/跨机器的确定性、现实偏差下的稳健感知、长时记忆与因果推理、安全与合规保障等。值得期待的是,当仿真器不再是瓶颈、数据不再稀缺、评测不再失真,物理 AI 的创新重心将回到“算法与系统协同”本身。那时,真正走出实验室的,不只是一个会抓取的手臂,而是一整套可解释、可控、可验证的智能体系。
标签: 物理AI 具身智能 仿真器 强化学习 评测基准