2026.07.0111 MIN KV Cache 不是越省越好:长上下文为什么会“丢针”? 长上下文真正难的不是把内容塞进去,而是把关键证据留在正确的位置。KV Cache 压缩、淘汰和 Offload 省的是显存,弄不好丢的是模型的记忆。 LLMInferenceKV-Cache ↗