用户口中「时好时坏」的DeepSeek,终于有了一个架构层面的解释。字节跳动Seed团队9月底在预印本平台arXiv提交论文,指出DeepSeek等开放权重模型在长上下文场景下的周期性性能波动,根源是分块KV缓存压缩引入的「相位敏感性」。这一结论对采用同类压缩设计的模型都有普适参考价值。
先解释这个现象为什么重要。不少用户有过这样的体验:同一个模型,有时对长文档里的信息对答如流,有时却「视而不见」。多数人把原因归给服务器负载或提示词写得不好,而Seed团队的研究说明,问题至少部分出在模型架构的设计选择上——这是结构性代价,不是玄学。
技术机制值得展开讲。为了降低长文本推理的内存和注意力开销,DeepSeek这类模型采用分块KV缓存压缩:以固定步幅把连续的词元窗口压缩成更少的缓存条目。这种设计省了算力,但也悄悄引入了一个新坐标——每个词元相对于压缩窗口边界的「相位」。团队发现,相同的信息处在不同相位时,检索难度存在系统性不对称:在压缩块的某些位置很容易被读到,在另一些位置则周期性地「失明」。
实验设计很干净:在约13万词元的长文本测试中,保持问题和目标信息完全不变,只移动信息在文档中的位置,观察模型的检索表现。结果呈周期性变化,与相位假设吻合。团队测试了基础版和后训练版的DeepSeek-V4-Flash、DeepSeek-V4-Pro,以及后训练后的DeepSeek-V4.1-Flash,波动现象普遍存在。
这项研究的意义在两个方向。对模型开发者,它指出了压缩设计的固有缺陷——下一步的修复方向已经明确,比如在压缩时引入位置去敏感机制,或混合保留关键位置的细粒度缓存;对部署方和用户,它提供了实操层面的启示:关键信息在长文档中的摆放位置,会真实影响检索效果,RAG应用的文档切分策略值得据此重新校准。
更宏观地看,这是中国工程团队给开源生态做的一次高质量「体检」:不是发布一个更强的模型,而是把一个所有人都在承受却没人讲清楚的问题拆解到机制层面。开源模型的可复现研究越多,生态的迭代就越扎实。