Writing topic

# Inference

围绕这个关键词继续探索。

15 MIN

大模型为什么第一个字最慢?从 TTFT 到 TPOT 拆解推理延迟

大模型为什么第一个字最慢?从 TTFT 到 TPOT 拆解推理延迟 如果你经常用 ChatGPT、Claude、Gemini,或者自己写过一点 Agent,你一定遇到过一个很微妙的瞬间。 你按下回车。 屏幕安静了几秒。 然后第一个字终于蹦出来。 最奇怪的是,一旦第一个字出来,后面又好像顺了很多。模型…

LLMInferenceKV-Cache
10 MIN

大模型推理引擎到底在调度什么?从 vLLM 到 SGLang 看服务端黑箱

大模型推理引擎到底在调度什么?从 vLLM 到 SGLang 看服务端黑箱 如果你只是在 API 层面用大模型,很容易把这件事想得特别简单。 发请求。 等结果。 结束。 但你只要开始真做线上服务,就会发现这套东西根本不是“发出去、回回来”这么朴素。你看到的只是一个接口,后面其实是一个不停调度请求、抢…

LLMInferencePagedAttention
11 MIN

长上下文到底贵在哪里?KV Cache 压缩、淘汰和 Offload 全景拆解

长上下文到底贵在哪里?KV Cache 压缩、淘汰和 Offload 全景拆解 这两年大模型最容易把人带偏的一件事,就是上下文窗口越报越大,大家就越容易产生一种错觉, 上下文好像是免费的。 128K。 200K。 1M。 这些数字看上去都很爽,像是模型终于学会记东西了。你把资料全塞进去,它就能一口气…

LLMInferenceKV-Cache
13 MIN

KV Cache 到底在缓存什么?从 Prefill 到 Decode 的推理加速全链路

KV Cache 到底在缓存什么?从 Prefill 到 Decode 的推理加速全链路 很多人第一次听 KV Cache,会把它理解成”推理时缓存一下,所以更快”。 这个说法不能算错,但太粗了。 KV Cache 背后其实是一整套推理引擎的设计问题:Prefill 和 Decode 怎么拆,显存怎…

LLMInferenceKV-Cache
14 MIN

从你按下回车到大模型吐出第一个字:TTFT 全链路拆解

从你按下回车到大模型吐出第一个字:TTFT 全链路拆解 引言 你在 ChatGPT 输入框敲下「帮我写一段代码」,按下回车。光标停了 200~800 毫秒,第一个字「好」缓缓蹦出来。这段静默期工程上有个专门的名字,叫 TTFT (Time To First Token,首字延迟,从客户端发出请求到收…

LLMInferenceKV-Cache
1

Ask Leslie

从本站公开文章中寻找答案。当前版本在浏览器本地检索,不上传问题,也不会编造不存在的经历。

输入一个问题,我会把你带到 Leslie 写过的相关内容。

微信联系

Leslie Zhang 的微信二维码

扫码添加 Leslie,建议备注你的名字与来意。