当前位置:首页 > AI资讯 > 正文内容

PhysBrain 1.5开源第一:物理智能新临界

admin36分钟前AI资讯3

PhysBrain 1.5开源第一:物理智能新临界

引言

当行业从“会说话、会思考、会工作”转向“能看懂世界并动手”时,AI 的下一扇门被真正推开。物理智能的关键不在于更大的参数,而在于能否闭合从感知—理解—规划—执行的整条链路,尤其在毫米级接触、复杂摩擦和不确定性环境中保持稳定表现。近期,中国团队深度机智发布的 PhysBrain 1.5,将这条最难的“物理闭环”推进了一大步:在28项公开基准中拿下综合 72.5 分,开源第一,与 GPT-6 Astra、Gemini 3.6 Flash 的差距缩小到 1 分以内。这不仅是一张漂亮的分数单,更是空间智能迈入可用临界点的信号。

为什么物理智能成了决定性赛道

语言模型的纵深突破,让机器“理解文本和图像”几乎成为标配,但一旦进入真实世界,挑战骤然变形:
- 从“看见”到“动手”:粗粒度任务(如抓取、放置)得益于通用理解能力明显提升,但精细插入、柔性材质操作、接触受力控制仍是巨大的能力鸿沟。
- 从单步到多步:真实任务不是一次决策,而是长时序、闭环反馈的持续校正,需要对未来状态的预测与不确定性管理。
- 从演示到泛化:跨物体、跨场景、跨设备迁移才是规模化落地的前提,避免“只会在A机台、A光照下成功”的脆弱性。

这意味着,支撑具身智能的“物理基座模型”必须具备系统性的空间与时序能力,而非只在单个指标上极限堆分。

PhysBrain 1.5 到底强在哪

多视角感知与精细插入的示意

PhysBrain 1.5 并没有追逐参数极限,而是沿着“更像人学习”的路线,强化感知—认知—规划—预测的一体化能力。在 28 项公开基准中,8B 版本综合 72.5 分,开源阵营第一;14 项开源第一、10 项开源第二,相较主流开源对手提升显著(对比 Hy-Embodied-VLM-1.0 的 66.0、RynnBrain 1.1 的 63.1)。更关键的是其整体水位已逼近头部闭源模型(GPT-6 Astra 73.3、Gemini 3.6 Flash 73.0)。

从能力维度看,PhysBrain 1.5 在“物理闭环”中补上了几块最难的拼图:
- 视觉空间感知:多尺度特征融合与遮挡鲁棒性提升,为后续定位与接触奠定稳定输入。
- 空间与多视角理解:跨视点一致性更强,支持从稀疏观测恢复物体姿态与场景拓扑。
- 具身认知与规划:从语言/任务目标到可执行动作序列的映射更稳健,减少依赖“硬编码技巧”。
- 空间指向与可供性:能更准确地理解“可抓取/可插入/可支撑”等可供性,缩短试错路径。
- 视觉轨迹推理与未来预测:不仅知道“现在在哪里”,还能预估“下一帧会怎样”,这对精细插入至关重要。

值得注意的是,PhysBrain 1.5 提供 2B 与 8B 两个量级,并配套技术报告与评测工具包全面开源。这种“轻量+可复现”的策略非常接地气:一方面便于开发者在真实机器人上低成本试水,另一方面也为社区形成统一评测语言,避免“各玩各的指标”的碎片化。

打通物理闭环的产业意义

分数的背后,是落地门槛的下降与生态的加速:
- 成本可控:较小模型即可达到高水位,意味着在边缘算力、轻量平台也能运行,硬件成本与延迟同时受益。
- 迁移更稳:多维度能力平衡优于“单项刷榜”,有利于从实验室跨向车间、仓库、实验室自动化等复杂环境。
- 数据飞轮:开源权重与评测包降低了复现实验与贡献数据的门槛,利于构建“实操数据—模型迭代—更强实操”的正反馈。

对国内生态而言,这一进展尤其关键:开源的“基座共识”能汇聚高校与产业的数据与工程能力,缩短从研究原型到工业级部署的路径,形成具身智能的“中国范式”。

影响与展望

视觉触觉语言融合驱动机器人控制

PhysBrain 1.5 把开源物理智能的整体水位推到闭源顶尖门槛边缘,释放出三个重要信号:
- 战略信号:决定物理智能上限的,不是参数炫技,而是以“人类学习”范式构建完整能力链条。
- 工程信号:可复现、可评测、可迁移的基座模型,才是产业规模化的抓手。
- 生态信号:当社区在同一基座上协作,数据与能力会积木化复用,进步速度将明显加快。

当然,通往“普适具身智能”的路仍有关隘:
- 接触与力控:毫米级插接、柔性材料、复杂摩擦的稳健性仍需在真实场景中淬火。
- 实时与安全:在低延迟控制环上保持稳定,并兼顾人机共融的安全约束。
- 跨机器人迁移:不同手爪、相机标定、动力学差异带来域间落差,需要更强的跨形态自适应。
- 多模态融合:视觉+触觉+力觉+语言的统一世界模型,是从“能做”走向“做得好、做得久”的关键。

接下来值得关注的方向包括:将语言与空间智能深度对齐,构建“目标—约束—动作—验收”的端到端闭环;引入力觉先验与触觉表征,补齐“看得见却摸不准”的盲区;以开源评测为锚,推动从仿真到实机的大规模自动数据采集与持续学习。若这些路径得以跑通,具身智能的可用性将出现质变,真正把“空间智能与通用大模型并驾齐驱”落到实处。

标签: 物理智能 具身AI 开源模型 机器人 空间理解

相关文章

行云芯片用LPDDR重构AI推理成本逻辑

从“天才少年”到芯片创业者:行云如何重构AI推理的成本逻辑 在AI大模型狂奔突进的今天,算力的军备竞赛正悄然从“性能至上”转向“成本优先”。当千亿参数模型成为标配,传统以HBM(高带宽内存)为核心的G...

机器人迎来GPT-3时刻:π0.7实现自主思考

机器人终于迎来了它的“GPT-3时刻” 当人们还在争论具身智能是否真的能走向通用时,Physical Intelligence(PI)用一款名为 π0.7 的VLA(视觉-语言-动作)模型,给出了一个...

谷歌开源Gemma 4重塑轻量级智能体生态

谷歌开源新里程碑:Gemma 4 如何重塑轻量级智能体生态 在开源大模型领域,谷歌再次迈出关键一步。最新发布的 Gemma 4 系列不仅延续了前代对轻量化与高性能的追求,更通过引入多模态能力、智能体原...

库克卸任CEO转任执行董事长,苹果平稳过渡

苹果权力交接平稳过渡,库克称将长期担任执行董事长 4 月 21 日,苹果公司召开全体员工大会,即将于今年 9 月卸任 CEO 的蒂姆·库克罕见现身并回应了外界对其健康状况的关切。据彭博社报道,库克在会...

AI智慧源于数据上下文

AI 的“智慧”取决于数据的“上下文” 人工智能在企业中的应用正以前所未有的速度从实验走向日常。如今,越来越多的组织开始在财务、供应链、人力资源和客户运营等关键业务中部署 AI 副驾驶(copilot...

火山引擎发布新一代AI汽车大脑

一个AI大脑,让汽车真正“活”起来 4月24日,北京车展开幕首日,火山引擎正式发布了基于Agentic AI架构的新一代汽车AI解决方案。这不仅是一次技术迭代,更标志着智能座舱从“被动响应”迈向“主动...

发表评论

访客

◎欢迎参与讨论,请在这里发表您的看法和观点。