KV Cache 不是越省越好:长上下文为什么会“丢针”?
长上下文真正难的不是把内容塞进去,而是把关键证据留在正确的位置。KV Cache 压缩、淘汰和 Offload 省的是显存,弄不好丢的是模型的记忆。
LLMInferenceKV-Cache
Writing topic
围绕这个关键词继续探索。
长上下文真正难的不是把内容塞进去,而是把关键证据留在正确的位置。KV Cache 压缩、淘汰和 Offload 省的是显存,弄不好丢的是模型的记忆。
长上下文到底贵在哪里?KV Cache 压缩、淘汰和 Offload 全景拆解 这两年大模型最容易把人带偏的一件事,就是上下文窗口越报越大,大家就越容易产生一种错觉, 上下文好像是免费的。 128K。 200K。 1M。 这些数字看上去都很爽,像是模型终于学会记东西了。你把资料全塞进去,它就能一口气…