具身智能缺的往往不是模型论文,而是「把脏视频变成可训练标签」的流水线。
10月6日,TwelveLabs宣布发布Pegasus 1.6,明确把业务边界从通用视频智能扩展到物理AI——机器人、无人机、自动驾驶与工业设备等需要感知并作用于真实世界的系统。新模型首次针对egocentric(第一视角)视频优化:来源包括可穿戴相机与遥操作系统画面,典型场景如装配线操作、烹饪示范、远程操控机器人等。
能力升级: 相对1.5,1.6强化实体识别(手、物体、工具跨片段一致性)、元数据抽取、片段内时间戳事件列表,以及不受token上限截断的长视频分段。文档列出的新用例包括:第一视角动作稠密标注、对照预期行为做质检、遥操作轨迹与下一步动作预测、以及最多20张图像的对比分析。Time-Based Metadata能力允许用户自定义schema,自动得到带时间戳的结构化JSON,便于喂给语言条件机器人策略训练。
工程含义: 物理AI团队已积累海量真机与遥操作视频,瓶颈常在标注成本。Pegasus 1.6把「视频→自然语言空间关系与手物交互描述」产品化,降低从原始素材到策略训练数据的摩擦。迁移指南称将model_name设为pegasus1.6即可;批量分析场景暂仍建议使用1.5。
事实以TwelveLabs官方新闻稿与开发者文档为准。