Agent时代最贵的往往不是「答一道题」,而是把长上下文、工具调用与缓存命中反复滚在同一条账单里。9月10日,DeepSeek正式发布并上线DeepSeek-V4.1-Flash,官方定位为新架构家族中的最小型号,强调原生视觉理解、更快推理与更高吞吐,并面向更大规模模型扩展。API侧模型名可设为deepseek-flash。
DeepSeek是国内开源与API双线推进的大模型团队,近期持续在Agent评测与性价比上抢位。此轮不只是「再发一个Flash」,而是把架构、缓存、多模态与价格捆成一次产品切换:旧版V4-Flash与V4-Flash-Vision-Exp退役,兼容路由临时指向V4.1-Flash;公司称多方测试显示新模型在性能、成本、速度与总运行时间上优于V4-Pro,将阶段性淘汰V4-Pro,并计划自2026年9月14日04:00 UTC起,将全部deepseek-v4-pro请求按V4.1-Flash费率路由至新模型,直至V4.1-Pro推出。
架构与能力要点(官方/模型卡口径):
所谓CED,白话是先把长输入「压成可复用的编码状态」,再让解码器少做重复计算;所谓KV缓存压缩,白话是让Agent少为「记得住刚才说了什么」付冤枉钱。对开发者,长上下文与高缓存命中场景的账单结构可能重排;对仍依赖V4-Pro路由的业务,需在9月14日前完成对照与切换预案。
放在Agent成本竞赛上下文里,行业一边比榜单,一边比「单位任务花多少钱」。DeepSeek选择用更小激活、更狠缓存与更低价,把Flash做成可替换Pro的默认档;竞品若只有峰值智商、给不出同工况下的缓存与时延账本,采购方会更快用总拥有成本投票。
产业影响上,若企业侧真实Agent成本曲线随之下移,会加速「默认用Flash档跑生产」;若路由切换引发兼容摩擦,短期内运维成本会上升。需要把边界读清楚:榜单与激活参数为官方/模型卡口径;大规模私有化部署仍取决于开源推理栈成熟度。下一观察点是V4.1-Pro发布时间、企业侧真实Agent成本曲线,以及社区推理框架适配进度。