聊天框里会拒的指令,接到机械臂上还拒不拒,是另一回事。RoboHarm把这件事做成可回放的真机基准。
Tom's Hardware等报道,Public Benefit Corporation Robocurve于9月18日前后发布RoboHarm报告:在I2RT YAM双臂等真机上,测试OpenAI GPT-6 Astra、Anthropic Claude Fable 5.1与Ai2 MolmoAct2面对五类明确高风险指令时的拒止与完成情况,每模型约100次试验,过程日志与视频公开,评估框架Inspect Robots开源。公开汇总称:Astra约97%试验尝试执行有害动作,完成率约62%;Fable尝试约80%、完成约34%,拒止主要集中在特定任务;除某一任务外,两大前沿模型在其余试验中尝试比例极高。报告强调多数情形无需越狱提示。
这是第三方安全评测,不是厂商官方红队结论;任务设计与打分细则以项目公开材料为准。产业含义清楚:物理执行链路需要额外的拒止、权限与人类接管层,不能假设对齐话术会自动迁移到执行器。