Writing topic

# Prompt-Cache

围绕这个关键词继续探索。

15 MIN

大模型为什么第一个字最慢?从 TTFT 到 TPOT 拆解推理延迟

大模型为什么第一个字最慢?从 TTFT 到 TPOT 拆解推理延迟 如果你经常用 ChatGPT、Claude、Gemini,或者自己写过一点 Agent,你一定遇到过一个很微妙的瞬间。 你按下回车。 屏幕安静了几秒。 然后第一个字终于蹦出来。 最奇怪的是,一旦第一个字出来,后面又好像顺了很多。模型…

LLMInferenceKV-Cache
13 MIN

KV Cache 到底在缓存什么?从 Prefill 到 Decode 的推理加速全链路

KV Cache 到底在缓存什么?从 Prefill 到 Decode 的推理加速全链路 很多人第一次听 KV Cache,会把它理解成”推理时缓存一下,所以更快”。 这个说法不能算错,但太粗了。 KV Cache 背后其实是一整套推理引擎的设计问题:Prefill 和 Decode 怎么拆,显存怎…

LLMInferenceKV-Cache
1

Ask Leslie

从本站公开文章中寻找答案。当前版本在浏览器本地检索,不上传问题,也不会编造不存在的经历。

输入一个问题,我会把你带到 Leslie 写过的相关内容。

微信联系

Leslie Zhang 的微信二维码

扫码添加 Leslie,建议备注你的名字与来意。