Agent贵,常常贵在「每次只想要一个是/否或三选一,却让大模型写一整段」。Amazon用开源小模型,把这类窄决策拉回本地毫秒级检查点。
据VentureBeat报道,AWS在Strands Labs下发布Strands Decider 2B:以Qwen3.5-2B为基座,去掉下一词预测头,换成对候选答案打分的pointer组件(称Hobson架构),经rank-16 LoRA与约百万级新增参数适配;一次前向返回选项分布。模型与训练材料计划开源,Apache 2.0,可在Hugging Face下载自托管,暂无托管按次API。示例把Decider接在天气工具调用前:若用户未给地点而Agent擅自猜城市,Decider可判「是否过早调用」并触发追问。它利用Strands框架已有的干预机制(继续、拒绝、请求确认、回传反馈),模型只给判断,应用仍定义阈值。
公开材料给出本地RTX 3090等设备上数十到百毫秒量级延迟,以及JevBench公开集上约72%准确率等轨迹点,并称在同尺寸公开模型中居前、且完整训练配方可复现;但未直接公布对TypeSafe Jev的头对头总分。自Jev于9月中旬以「System One」分类模型定位引爆赛道后,Laya、Kev、Mapika、CLM-8B等方案迅速跟进。AWS的差异化更在开源可复现与可自托管,而非已证明全面超越Jev。亦需提醒:决策模型不能当作不可攻破的安全边界,对抗文本仍可能影响判决。对企业采购,开源零标价不等于零总成本:本机或云上推理、监控与微调都要算进去;Jev类托管API虽有按量费用,但运维更轻。哪条路线更划算,取决于调用频率、数据驻留要求与是否已有GPU余量。事实以AWS公告与VentureBeat报道为准。