KV Cache 不是越省越好:长上下文为什么会“丢针”?
长上下文真正难的不是把内容塞进去,而是把关键证据留在正确的位置。KV Cache 压缩、淘汰和 Offload 省的是显存,弄不好丢的是模型的记忆。
Writing topic
沿着这个关键词,继续往里看。
长上下文真正难的不是把内容塞进去,而是把关键证据留在正确的位置。KV Cache 压缩、淘汰和 Offload 省的是显存,弄不好丢的是模型的记忆。
Prefill 算完不代表用户马上能看到第一个 token。KV Cache 跨节点迁移不是传文件,而是一条从 GPU、NIC、Leaf、Spine 到目的端 GPU 的端到端搬运链路。
大模型为什么第一个字最慢?从 TTFT 到 TPOT 拆解推理延迟 如果你经常用 ChatGPT、Claude、Gemini,或者自己写过一点 Agent,你一定遇到过一个很微妙的瞬间。 你按下回车。 屏幕安静了几秒。 然后第一个字终于蹦出来。 最奇怪的是,一旦第一个字出来,后面又好像顺了很多。模型…
大模型推理引擎到底在调度什么?从 vLLM 到 SGLang 看服务端黑箱 如果你只是在 API 层面用大模型,很容易把这件事想得特别简单。 发请求。 等结果。 结束。 但你只要开始真做线上服务,就会发现这套东西根本不是“发出去、回回来”这么朴素。你看到的只是一个接口,后面其实是一个不停调度请求、抢…
长上下文到底贵在哪里?KV Cache 压缩、淘汰和 Offload 全景拆解 这两年大模型最容易把人带偏的一件事,就是上下文窗口越报越大,大家就越容易产生一种错觉, 上下文好像是免费的。 128K。 200K。 1M。 这些数字看上去都很爽,像是模型终于学会记东西了。你把资料全塞进去,它就能一口气…
DeepSeek的推理为什么比别人便宜一个数量级?——MLA、MoE、MTP技术拆解 如果你最近调过各家大模型的API,你一定注意到一件事。 GPT-4o 的价格大概是输入 $2.5/1M token,输出 $10/1M token。Claude Opus 4 更贵一些。但 DeepSeek V3…
AI Coding到底是怎么写出能用的代码的?——Spec Coding工程化全链路 如果你用过 Cursor 或 Claude Code 写代码,你一定体验过这种感觉: 给它一句”帮我加一个用户登录功能”,它刷刷刷生成几百行代码,看着像模像样。但你细看——密码没加密,session 没过期时间,S…
Agent评测:从Golden Set到业务指标 很多人觉得Agent评测就是”写几个测试用例,跑一下看结果对不对”。和单元测试有些相似,但本质不同。 但Agent的行为是 非确定性 的——同样的输入,今天能过明天可能就不过了。你改了一个Prompt的措辞,或者LLM provider悄悄更新了模型…
KV Cache 到底在缓存什么?从 Prefill 到 Decode 的推理加速全链路 很多人第一次听 KV Cache,会把它理解成”推理时缓存一下,所以更快”。 这个说法不能算错,但太粗了。 KV Cache 背后其实是一整套推理引擎的设计问题:Prefill 和 Decode 怎么拆,显存怎…
让大模型乖乖输出正确的 JSON:约束解码的底层原理 做 Agent 的同学大概都经历过这个时刻。 你的 Agent 系统上线了,跑得挺好的。模型在大部分情况下都能正确调用工具,返回格式工整的 JSON。你看着监控面板上 99.7% 的成功率,心情不错。 然后凌晨三点,告警响了。 一条线上日志显示,…