字节Seed团队于今年9月底在预印本平台arXiv提交研究论文,探讨分块KV缓存压缩带来的相位敏感性。该研究评估了DeepSeek-V4-Flash、DeepSeek-V4-Pro及后训练版DeepSeek-V4.1-Flash模型,发现压缩虽能减少长上下文推理的内存和注意力成本,但引入新的位置坐标(即相对压缩窗口边界的位置)。
团队观察到此类压缩模型中存在系统性不对称性,导致长上下文检索准确度在不同阶段间周期性波动,称为相位敏感性。该现象可能使平均基准分数掩盖模型在特定阶段的弱点,但不影响模型整体能力。
研究结果有助于理解长上下文模型性能漂移的潜在机制,并为优化压缩策略提供方向。据悉,相关论文链接已公开。


粤公网安备 44010602000162号
网友评论