KV Cache 不是越省越好:长上下文为什么会“丢针”?
长上下文真正难的不是把内容塞进去,而是把关键证据留在正确的位置。KV Cache 压缩、淘汰和 Offload 省的是显存,弄不好丢的是模型的记忆。
Writing topic
围绕这个关键词继续探索。
长上下文真正难的不是把内容塞进去,而是把关键证据留在正确的位置。KV Cache 压缩、淘汰和 Offload 省的是显存,弄不好丢的是模型的记忆。
Prefill 算完不代表用户马上能看到第一个 token。KV Cache 跨节点迁移不是传文件,而是一条从 GPU、NIC、Leaf、Spine 到目的端 GPU 的端到端搬运链路。
大模型为什么第一个字最慢?从 TTFT 到 TPOT 拆解推理延迟 如果你经常用 ChatGPT、Claude、Gemini,或者自己写过一点 Agent,你一定遇到过一个很微妙的瞬间。 你按下回车。 屏幕安静了几秒。 然后第一个字终于蹦出来。 最奇怪的是,一旦第一个字出来,后面又好像顺了很多。模型…
大模型推理引擎到底在调度什么?从 vLLM 到 SGLang 看服务端黑箱 如果你只是在 API 层面用大模型,很容易把这件事想得特别简单。 发请求。 等结果。 结束。 但你只要开始真做线上服务,就会发现这套东西根本不是“发出去、回回来”这么朴素。你看到的只是一个接口,后面其实是一个不停调度请求、抢…
长上下文到底贵在哪里?KV Cache 压缩、淘汰和 Offload 全景拆解 这两年大模型最容易把人带偏的一件事,就是上下文窗口越报越大,大家就越容易产生一种错觉, 上下文好像是免费的。 128K。 200K。 1M。 这些数字看上去都很爽,像是模型终于学会记东西了。你把资料全塞进去,它就能一口气…
DeepSeek的推理为什么比别人便宜一个数量级?——MLA、MoE、MTP技术拆解 如果你最近调过各家大模型的API,你一定注意到一件事。 GPT-4o 的价格大概是输入 $2.5/1M token,输出 $10/1M token。Claude Opus 4 更贵一些。但 DeepSeek V3…
KV Cache 到底在缓存什么?从 Prefill 到 Decode 的推理加速全链路 很多人第一次听 KV Cache,会把它理解成”推理时缓存一下,所以更快”。 这个说法不能算错,但太粗了。 KV Cache 背后其实是一整套推理引擎的设计问题:Prefill 和 Decode 怎么拆,显存怎…
从你按下回车到大模型吐出第一个字:TTFT 全链路拆解 引言 你在 ChatGPT 输入框敲下「帮我写一段代码」,按下回车。光标停了 200~800 毫秒,第一个字「好」缓缓蹦出来。这段静默期工程上有个专门的名字,叫 TTFT (Time To First Token,首字延迟,从客户端发出请求到收…