深度机智|开源PhysBrain 1.5,8B版本在团队28项评测中居开源前列

PromptTree|阅读 2
2026/09/11 08:45
深度机智PhysBrain具身智能空间智能
近窗深度机智开源PhysBrain 1.5的约2B与约8B权重;8B在团队约28项具身空间智能与规划基准上综合约72.5,公开称接近部分头部闭源模型水位。

通用大模型在屏幕里越来越强,真正难的是:看懂物理世界之后,能不能给出可执行的动作。近窗,深度机智(DeepCybo)发布物理基座模型PhysBrain 1.5,并在Hugging Face开放约2B与约8B权重。技术叙事是把机器人动作与未来相机视图映射为离散词表token,使视觉语言模型能在同一套表征里完成空间理解、目标导向动作生成与环境演化预测。

深度机智聚焦物理智能与具身基座模型,公开路线强调以人类学习为起点、以动作为中心建模。PhysBrain 1.5以预训练Qwen3-VL为骨干,扩展动作与视觉状态token,宣称可复用Transformers、vLLM等常见推理与后训练工具链——等于尽量不强迫下游重写一整套私有栈。

评测与开放要点(团队公开口径):

  1. 规格:PhysBrain 1.5-2B与PhysBrain 1.5-8B
  2. 协议:自建约28项具身空间智能与规划基准
  3. 成绩:8B综合约72.5,位列参评开源前列;公开对照称接近GPT-6 Astra约73.3、Gemini 3.6 Flash约73.0
  4. 分差:较Hy-Embodied-VLM-1.0约66.0等开源对照有明显提升(团队口径)
  5. 获取:Hugging Face可下载权重;技术报告与完整评测细节仍需持续跟踪

所谓把动作做成词表,白话是让模型像「说下一句话」一样「说下一串动作」;所谓物理基座,白话是先过空间与规划关,再谈能不能接到真机控制器。对开源社区,这提供了可直接跑的对照点;对闭源厂,则意味着开源水位若持续贴身,演示溢价会被压缩。

放在物理智能鸿沟讨论里,行业刚经历一轮「数字侧智商暴涨」,下一棒竞争转向「视觉—规划—动作」是否同框。PhysBrain选择用统一token空间绑住看、想、动,而不是只做聊天式空间问答;竞品若榜单漂亮、真机接不上,采购方会更快回到交付指标。

产业影响上,若第三方复现与真机成功率同步披露,会抬开源物理基座的可信度;若许可与工程文档长期不齐,生产采用会犹豫。需要把边界读清楚:72.5等分数为团队评测协议下的公开数字,不等于第三方终裁。下一观察点是技术报告与评测协议是否完整公开,以及真机操作成功率能否与榜单同步披露。