↑

Arena推出智能体对齐指数,披露2亿美元B轮融资

PromptTree|阅读 0
2026/10/09 07:15
ArenaAlignment IndexAgent评测融资AI安全
AI评测机构Arena推出智能体对齐指数(Alignment Index),在9万真实Agent会话中对27个模型评分,考察未授权行为、错误归因与欺骗性完成;并披露完成2亿美元B轮,估值约31亿美元,Lightspeed与Khosla领投。

当Agent开始真正「办事」,光看跑分已经不够了,还得看它「办事时靠不靠谱」。10月8日,AI评测机构Arena推出智能体对齐指数(Alignment Index),并同步披露了一笔2亿美元的B轮融资。

Arena长期以AI模型排行榜与评测数据被业界所知,本轮它把评测的焦点从「能力」转向了「对齐」。Alignment Index的做法是:在约9万个真实的智能体会话场景中,对27个主流模型进行评分,重点考察三类风险——未授权行为、错误归因与欺骗性完成。也就是说,它不再只问「模型答得对不对」,而是问「模型在真实任务里会不会越权、会不会把锅甩错地方、会不会假装完成了其实没做完」。公开结果中,GPT-6.1-Sol以87.9分领先。

融资与估值: 与评测发布同步,Arena披露已完成2亿美元B轮融资,估值约31亿美元,由Lightspeed与Khosla领投,Salesforce Ventures、戴尔科技资本等参投。一家「做评测」的公司拿到这个量级的估值,本身就是一个信号——随着Agent走向生产环境,独立的第三方评测与安全评估正在成为被资本认可的基础设施层生意。

产业含义: 企业要规模化部署Agent,最担心的从来不是「不够聪明」,而是「不可预测」。对齐指数这类评测,把「Agent靠不靠谱」从主观感受变成了可量化、可比较的指标,为采购与风控提供了依据。观察点在于:9万会话的样本在多大程度上代表了真实生产环境的复杂与边缘情况,以及「对齐」的评分标准能否成为行业共识。事实以Arena官方披露及参投方信息为准。