大模型负责「想」,小模型负责「判」——这条分工在Jev点燃后,两周内变成全球赛道。国内团队几乎同时给出开源答案。
TypeSafe AI于9月15日推出Jev:不生成文字,只根据状态与预设问题返回带概率的结构化判断,自称「System One」模型。定价约每百万输入token 0.042美元、输出免费,定位Agent链路里的高频、廉价判断层。市场反应很快:公开材料称其上线首日即在部分网关占据显著调用份额。缺口同样清晰——闭源、仅云端API,不便本地与跨境敏感场景。
上海人工智能实验室随后开源Intern-Decision,提供0.8B、2B、4B三档,主打多模态:能看图像与界面再做决策。团队称推理速度较Jev快约2到3倍,4B在单卡消费级GPU上端到端时延可压到约45毫秒以下;并在校准后的概率可靠性指标上给出优于对照的自测结果。权重与样例已上线公开平台。
9月30日,成立未满五个月的上海公司StartLux(原点星辉)开源StartLux-Decision,覆盖0.8B至27B五档并配齐量化文件。CEO为盛大网络联合创始人陈大年,CTO为郭权玮。按公司基于公开工具、对照9月28日榜单快照的自测,27B在Decision Index 0.2.1的38项中有31项高于Jev 1.13,综合分约63.88对57.91;4B经Q4量化后约2.71GB,与原始权重决策一致率约98.3%。公司同时展示国际象棋对弈演示,但下棋并非决策模型主战场,更宜视为吸引注意力的demo。
为何押本地: 云端可以堆算力,个人设备显存与功耗有硬顶。若每个小判断都拉起27B通用模型,本地Agent跑不动。决策模型把「工单分流、工具门闩、完成与否」等高频判断拆出来,正好成为本地系统的关键零件。StartLux把自己的路线画成「通用模型+决策层+Agent/记忆+量化推理」整栈,而不是只下一个小权重。
赛道冷水: 同期海外已有OpenAI Decisions API、Cloudflare Clef、亚马逊Strands Decider入场;榜单「第一」保质期以天计。品类两周可被复制,壁垒更可能落在数据闭环、细调服务与把判断层嵌进真实产品的工程能力上。事实以各项目页、模型卡与可复现评测为准;自测分数不作跨机构权威排名。