AB
AiBoss
News

字节Seed团队发现DeepSeek时强时弱与KV Cache压缩相位有关

字节Seed团队研究发现,DeepSeek-V4系列模型的表现会随输入信息位置以固定Token周期波动,最高准确率差距达40.2个百分点,原因指向分块KV Cache压缩带来的相位敏感性。

字节Seed团队发现DeepSeek输出波动与压缩相位相关

据量子位报道,字节Seed团队在一项研究中发现,DeepSeek-V4系列模型的表现会随输入信息所处位置出现周期性波动。研究人员在代码补全任务中观察到,仅在前方加入若干无实际意义的填充Token,模型的答案就会在正确与错误之间反复切换,且这种变化以4个Token为周期重复。在128K长上下文检索测试中,同一条信息仅改变位置,DeepSeek-V4-Flash-Base的检索准确率最大差距达到40.2个百分点,DeepSeek-V4-Pro-Base为34.8个百分点。

问题指向分块KV Cache压缩机制

研究将这一现象与DeepSeek-V4采用的分块KV Cache压缩技术联系起来。该技术把连续Token划分为窗口并压缩缓存条目,以降低长上下文推理的内存与计算开销。团队将信息相对于压缩窗口边界的位置称为Phase(相位),并把模型对不同相位信息检索能力的系统性差异命名为Phase Sensitivity(相位敏感性)。研究人员以Qwen3-0.6B架构为基础自行训练了多种压缩方案模型,结果显示所有接受测试的分块压缩模型都出现了与压缩步长对应的周期性变化,而全注意力基线模型没有同等程度的周期性。团队还发现不同注意力头对不同相位的贡献不同,称之为Phase Specialization(相位专门化)。

后训练可缩小差距,但周期性仍存在

据该报道,经过后训练后差距有所收窄:DeepSeek-V4-Flash-0731降至19.1个百分点,DeepSeek-V4-Pro-0813降至14.8个百分点,更新的DeepSeek-V4.1-Flash-0910进一步降至6.1个百分点,但周期性差异依然存在。研究团队建议评估采用分块KV Cache压缩的模型时,应将同一条信息放到不同压缩相位分别测试,而非只看整体平均准确率。上述内容来自量子位对相关论文的报道,论文地址为arXiv,具体结论与数据以原论文为准;相关模型的实际表现与可用性请以官方当前信息为准。