Writing topic

# LLM

沿着这个关键词,继续往里看。

15 MIN

大模型为什么第一个字最慢?从 TTFT 到 TPOT 拆解推理延迟

大模型为什么第一个字最慢?从 TTFT 到 TPOT 拆解推理延迟 如果你经常用 ChatGPT、Claude、Gemini,或者自己写过一点 Agent,你一定遇到过一个很微妙的瞬间。 你按下回车。 屏幕安静了几秒。 然后第一个字终于蹦出来。 最奇怪的是,一旦第一个字出来,后面又好像顺了很多。模型…

LLMInferenceKV-Cache
10 MIN

大模型推理引擎到底在调度什么?从 vLLM 到 SGLang 看服务端黑箱

大模型推理引擎到底在调度什么?从 vLLM 到 SGLang 看服务端黑箱 如果你只是在 API 层面用大模型,很容易把这件事想得特别简单。 发请求。 等结果。 结束。 但你只要开始真做线上服务,就会发现这套东西根本不是“发出去、回回来”这么朴素。你看到的只是一个接口,后面其实是一个不停调度请求、抢…

LLMInferencePagedAttention
11 MIN

长上下文到底贵在哪里?KV Cache 压缩、淘汰和 Offload 全景拆解

长上下文到底贵在哪里?KV Cache 压缩、淘汰和 Offload 全景拆解 这两年大模型最容易把人带偏的一件事,就是上下文窗口越报越大,大家就越容易产生一种错觉, 上下文好像是免费的。 128K。 200K。 1M。 这些数字看上去都很爽,像是模型终于学会记东西了。你把资料全塞进去,它就能一口气…

LLMInferenceKV-Cache
10 MIN

AI Coding到底是怎么写出能用的代码的?——Spec Coding工程化全链路

AI Coding到底是怎么写出能用的代码的?——Spec Coding工程化全链路 如果你用过 Cursor 或 Claude Code 写代码,你一定体验过这种感觉: 给它一句”帮我加一个用户登录功能”,它刷刷刷生成几百行代码,看着像模像样。但你细看——密码没加密,session 没过期时间,S…

AgentLLMAI-Coding
5 MIN

Agent评测:从Golden Set到业务指标

Agent评测:从Golden Set到业务指标 很多人觉得Agent评测就是”写几个测试用例,跑一下看结果对不对”。和单元测试有些相似,但本质不同。 但Agent的行为是 非确定性 的——同样的输入,今天能过明天可能就不过了。你改了一个Prompt的措辞,或者LLM provider悄悄更新了模型…

AgentLLM评测
13 MIN

KV Cache 到底在缓存什么?从 Prefill 到 Decode 的推理加速全链路

KV Cache 到底在缓存什么?从 Prefill 到 Decode 的推理加速全链路 很多人第一次听 KV Cache,会把它理解成”推理时缓存一下,所以更快”。 这个说法不能算错,但太粗了。 KV Cache 背后其实是一整套推理引擎的设计问题:Prefill 和 Decode 怎么拆,显存怎…

LLMInferenceKV-Cache
10 MIN

让大模型乖乖输出正确的 JSON:约束解码的底层原理

让大模型乖乖输出正确的 JSON:约束解码的底层原理 做 Agent 的同学大概都经历过这个时刻。 你的 Agent 系统上线了,跑得挺好的。模型在大部分情况下都能正确调用工具,返回格式工整的 JSON。你看着监控面板上 99.7% 的成功率,心情不错。 然后凌晨三点,告警响了。 一条线上日志显示,…

LLMvLLMConstrained-Decoding
12

Ask Leslie

从本站公开文章中寻找答案。当前版本在浏览器本地检索,不上传问题,也不会编造不存在的经历。

输入一个问题,我会把你带到 Leslie 写过的相关内容。

微信联系

Leslie Zhang 的微信二维码

扫码添加 Leslie,建议备注你的名字与来意。