刷榜之外,还有一张更硬的成绩单:真实世界里,一周到底烧掉了多少Token——Agnes这次把产品矩阵和调用量一并摊开。
Agnes AI是面向文本大模型与编程场景的AI产品团队,持续打造「模型+编程工具」组合:一边用Flash/Pro拉高通用与旗舰体验,一边用AgnesCode把能力接到开发者工作流。对用户而言,选型越来越不只看榜单分数,而看免费是否真能用、API是否好接入、编程链路是否够快。
Agnes官宣文本大模型与编程产品矩阵升级,动作分三块。
模型侧: Agnes 2.5 Flash正式上线,且不限期免费开放;旗舰体验版Agnes 2.5 Pro Alpha即将开放,支持百万Token上下文,API定价约每百万输入0.45美元、输出0.90美元。
工具侧: AgnesCode优化首字时延,并计划上线CLI(命令行工具),方便开发者把模型嵌进本地与自动化脚本。
榜单侧: Pro Alpha在Artificial Analysis Intelligence Index得分39、同类第9;Terminal-Bench v2.1得分67%。分数中游偏上,但不是这次叙事的唯一支柱。
更硬核的是调用数据:全模态单周Token处理量达8.16万亿,其中文本5.1万亿、多模态3.06万亿。对比OpenRouter周调用榜,小米MiMo-V2.5约10.2T、DeepSeek V4 Flash约6.01T,Agnes已跻身全球前列量级。Token(词元)是模型计费与吞吐的基本单位,周调用量越高,通常意味着真实请求越密集——这比实验室刷榜更接近「有没有人在用」。文本与多模态接近六四开,也说明其流量并不只靠聊天,还包含图像等更重的请求结构。
模型竞争正在换尺子:从「谁分高」转向「谁在真实流量里扛得住、交得出活」。Agnes用免费Flash做入口、用Pro Alpha与编程工具收价值,路径清晰。免费策略能拉新,但最终要看延迟、稳定性与编程工作流是否留得住开发者。
后续观察点有三:周Token量能否在更长时间窗口里稳住;Pro Alpha从体验版走向正式商业化时定价是否还站得住;AgnesCode的CLI上线后,能不能把「用过一次」变成「写进日常脚本」。