物理AI若每次感知都要「打电话问云端大脑」,延迟、带宽与隐私账单会一起爆炸——Om AI把答案写成端侧原生开源模型。
Om AI联汇定位物理AI与端侧多模态能力,产品线覆盖VLX模型系列、OmAgent智能体平台,以及具身与消费向终端。赛道落在机器人、无人机、工业巡检与可穿戴视觉等「必须在设备旁边做决定」的场景。公开信息显示,公司于8月6日披露完成数亿元融资,由前海母基金领投;同日宣布开源其端侧原生模型VLX-Seek 1.5。融资轮次、投后估值与完整股东名单未在通稿中完整展开,金额与条款以公司正式披露为准。
所谓「端侧原生」,白话不是先训一个云端大模型再强行压缩下发,而是在架构设计阶段就把端侧算力、延迟、功耗与部署成本当作硬约束。它和「端侧部署」差在哲学:后者问「如何把大模型塞进盒子」;前者问「如果模型生来就在盒子里,它该长成什么样」。对工厂机器人、弱网巡检无人机和家庭隐私敏感场景,这个差别往往比参数表更决定能不能规模化。
VLX-Seek 1.5提供约3B与约10B两个版本,强调流式多模态:持续接收视频流并在本地实时理解,而不是「拍一张图—上传云端—等待返回」的批处理链路。公开能力叙述拆成三层心智链路——Flow(持续注意力)、Seek(精细推理)、Go(执行控制)——试图把「看得清、看得准、动得了」串成闭环。
厂商自测中可对照的数字(仍待更广独立复现):
目标幻觉指标,白话就是惩罚「乱报警」。聊天机器人胡答一句,最多浪费阅读时间;机器人或安防系统误触发动作,代价可能直接打在物理世界。公司把「敢说不知道」写进评测叙事,等于承认物理AI的第一道门不是峰值智商,而是可控的拒绝与低误报。
商业化侧,公开材料提及OttoPlex御行落地、与联想及苹果合作的OttoBox AI Studio,以及面向视障用户的Homer AI(称已服务全国近约10万视障用户,平台月均AI调用达千万次量级)。对开发者,开源权重降低了试用门槛;对企业买家,真正要验收的是端侧延迟、误报率、跨硬件适配与长期功耗,而不是「碾压巨头」的标题句。
把融资与开源放在一起读:资本在给「端侧原生」路线定价,开源在抢开发者默认入口。云端世界模型、云端VLA与端侧原生并不互相取消,更像分工——云端做教师与仿真,端侧做实时闭环。下一观察点是社区复现能否把官方榜单翻译成可部署的功耗与失败率曲线,以及融资资金将优先投向模型迭代还是终端规模化——参数可以不大,但现场必须稳。