通用大模型在屏幕里越来越强,真正难的是:看懂物理世界之后,能不能给出可执行的动作。近窗,深度机智(DeepCybo)发布物理基座模型PhysBrain 1.5,并在Hugging Face开放约2B与约8B权重。技术叙事是把机器人动作与未来相机视图映射为离散词表token,使视觉语言模型能在同一套表征里完成空间理解、目标导向动作生成与环境演化预测。
深度机智聚焦物理智能与具身基座模型,公开路线强调以人类学习为起点、以动作为中心建模。PhysBrain 1.5以预训练Qwen3-VL为骨干,扩展动作与视觉状态token,宣称可复用Transformers、vLLM等常见推理与后训练工具链——等于尽量不强迫下游重写一整套私有栈。
评测与开放要点(团队公开口径):
所谓把动作做成词表,白话是让模型像「说下一句话」一样「说下一串动作」;所谓物理基座,白话是先过空间与规划关,再谈能不能接到真机控制器。对开源社区,这提供了可直接跑的对照点;对闭源厂,则意味着开源水位若持续贴身,演示溢价会被压缩。
放在物理智能鸿沟讨论里,行业刚经历一轮「数字侧智商暴涨」,下一棒竞争转向「视觉—规划—动作」是否同框。PhysBrain选择用统一token空间绑住看、想、动,而不是只做聊天式空间问答;竞品若榜单漂亮、真机接不上,采购方会更快回到交付指标。
产业影响上,若第三方复现与真机成功率同步披露,会抬开源物理基座的可信度;若许可与工程文档长期不齐,生产采用会犹豫。需要把边界读清楚:72.5等分数为团队评测协议下的公开数字,不等于第三方终裁。下一观察点是技术报告与评测协议是否完整公开,以及真机操作成功率能否与榜单同步披露。