大模型推理引擎到底在调度什么?从 vLLM 到 SGLang 看服务端黑箱
大模型推理引擎到底在调度什么?从 vLLM 到 SGLang 看服务端黑箱 如果你只是在 API 层面用大模型,很容易把这件事想得特别简单。 发请求。 等结果。 结束。 但你只要开始真做线上服务,就会发现这套东西根本不是“发出去、回回来”这么朴素。你看到的只是一个接口,后面其实是一个不停调度请求、抢…
LLMInferencePagedAttention
Writing topic
围绕这个关键词继续探索。
大模型推理引擎到底在调度什么?从 vLLM 到 SGLang 看服务端黑箱 如果你只是在 API 层面用大模型,很容易把这件事想得特别简单。 发请求。 等结果。 结束。 但你只要开始真做线上服务,就会发现这套东西根本不是“发出去、回回来”这么朴素。你看到的只是一个接口,后面其实是一个不停调度请求、抢…
KV Cache 到底在缓存什么?从 Prefill 到 Decode 的推理加速全链路 很多人第一次听 KV Cache,会把它理解成”推理时缓存一下,所以更快”。 这个说法不能算错,但太粗了。 KV Cache 背后其实是一整套推理引擎的设计问题:Prefill 和 Decode 怎么拆,显存怎…
让大模型乖乖输出正确的 JSON:约束解码的底层原理 做 Agent 的同学大概都经历过这个时刻。 你的 Agent 系统上线了,跑得挺好的。模型在大部分情况下都能正确调用工具,返回格式工整的 JSON。你看着监控面板上 99.7% 的成功率,心情不错。 然后凌晨三点,告警响了。 一条线上日志显示,…