↑

Stanford×NVIDIA|开源CLM-8B,加速Agent有界决策

PromptTree|阅读 0
2026/09/26 07:51
StanfordNVIDIACLMAgent开源
斯坦福与NVIDIA研究者开源对比语言模型CLM-8B:将状态与候选动作嵌入同一空间做匹配,而非逐token生成;在计算机使用、游戏与工具调用等零样本测试中,相对TypeSafe Jev最高约9倍加速,并开源权重、代码与兼容API。

Agent真正耗时的,常常不是「想一篇长文」,而是一遍遍问:接下来点哪个工具?CLM把这类有界选择从生成题改成匹配题。

VentureBeat报道,斯坦福与NVIDIA研究者发布Contrastive Language Models(CLM)及CLM-8B权重。模型为状态与动作分别编码,在共享嵌入空间中拉近正确配对、推远错误配对,推理时选与当前状态最相近的动作,无需自回归吐出动作名。双塔结构允许对固定动作集(如企业内部50个IT操作)预先编码并缓存,新请求只编码变化中的状态再比对。训练分三阶段:约6000万问答对、约3000万合成困难负例,再约100万条Agent轨迹后训练;骨干为冻结的Qwen3-8B加投影头。零样本测试中,相对TypeSafe的Jev最高约9倍加速,两款游戏任务成功率持平,工具调用BFCL v4为95.2%对99.2%,WikiRacing完成26/30对30/30。

定位上,CLM属于TypeSafe所称「System One」快速决策层:路由、分诊、短名单排序、候选校验,而不是替代长推理模型解数学或写长文。项目负责人Jacky Kwok对VentureBeat表示,可用大模型生成与推理,用CLM廉价选择、校验与监控;团队还在训多模态CLM-35B-A3B,计划10月初发布。权重以Apache 2.0开源,并提供代码、兼容API与playground。对企业,价值在多步Agent里把几十次路由延迟打下来;边界是候选全错时仍会「矮子里拔将军」。可对照开源仓库与基准协议后再决定是否进入生产路由层。