DeepSeek|发布V4.1-Flash:CED架构压缩KV缓存,原生多模态上线并下调API价

PromptTree|阅读 1
2026/09/11 08:45
DeepSeekV4.1-FlashMoEKV缓存
9月10日DeepSeek上线V4.1-Flash:约552B MoE、原生多模态、最长约100万token上下文;CED架构预填约8B/解码约16B激活,KV缓存较上代大幅压缩,并下调API价、计划路由替代V4-Pro。

Agent时代最贵的往往不是「答一道题」,而是把长上下文、工具调用与缓存命中反复滚在同一条账单里。9月10日,DeepSeek正式发布并上线DeepSeek-V4.1-Flash,官方定位为新架构家族中的最小型号,强调原生视觉理解、更快推理与更高吞吐,并面向更大规模模型扩展。API侧模型名可设为deepseek-flash。

DeepSeek是国内开源与API双线推进的大模型团队,近期持续在Agent评测与性价比上抢位。此轮不只是「再发一个Flash」,而是把架构、缓存、多模态与价格捆成一次产品切换:旧版V4-Flash与V4-Flash-Vision-Exp退役,兼容路由临时指向V4.1-Flash;公司称多方测试显示新模型在性能、成本、速度与总运行时间上优于V4-Pro,将阶段性淘汰V4-Pro,并计划自2026年9月14日04:00 UTC起,将全部deepseek-v4-pro请求按V4.1-Flash费率路由至新模型,直至V4.1-Pro推出。

架构与能力要点(官方/模型卡口径):

  1. 规模:多模态混合专家(MoE)骨干约552B参数;上下文最长约100万token
  2. 结构:因果编码器—解码器(CED),约40层Transformer,编码器与解码器各约20层
  3. 激活:预填阶段每token约激活8B,解码阶段约16B,面向输入偏重的Agent负载
  4. 缓存:全局KV较V4-Flash约压至1/4 HBM;持久化KV约压至1/8 SSD;单token全局KV约890字节
  5. 训练:约45T多模态token预训练;后训练侧重Agent任务与环境的大规模自动合成
  6. 推理:支持1–100连续可调推理强度;最大强度下公开DeepSWE v1.1约74.2、Terminal-Bench 2.1约90.6等
  7. 价格:新定价自9月10日04:00 UTC生效;继续区分峰时与非峰时,非峰时约为峰时一半

所谓CED,白话是先把长输入「压成可复用的编码状态」,再让解码器少做重复计算;所谓KV缓存压缩,白话是让Agent少为「记得住刚才说了什么」付冤枉钱。对开发者,长上下文与高缓存命中场景的账单结构可能重排;对仍依赖V4-Pro路由的业务,需在9月14日前完成对照与切换预案。

放在Agent成本竞赛上下文里,行业一边比榜单,一边比「单位任务花多少钱」。DeepSeek选择用更小激活、更狠缓存与更低价,把Flash做成可替换Pro的默认档;竞品若只有峰值智商、给不出同工况下的缓存与时延账本,采购方会更快用总拥有成本投票。

产业影响上,若企业侧真实Agent成本曲线随之下移,会加速「默认用Flash档跑生产」;若路由切换引发兼容摩擦,短期内运维成本会上升。需要把边界读清楚:榜单与激活参数为官方/模型卡口径;大规模私有化部署仍取决于开源推理栈成熟度。下一观察点是V4.1-Pro发布时间、企业侧真实Agent成本曲线,以及社区推理框架适配进度。