Study note

LLM Inference Handbook

Properties

Type
Blogs
Status
待读
Domain
AI / ML
Category
LLM 推理与服务
Source
handbook.modular.com
Vault note
library/articles/ai_ml/LLM-Inference-Handbook-a2572bb87f981d16.md

Summary

从训练与推理的区别、请求生命周期、prefill/decode 和 TTFT/TPOT/goodput 等指标开始,系统覆盖模型准备与交互、KV Cache、continuous batching、prefix caching、chunked prefill、量化、GPU 架构、kernel 优化、P/D 解耦、容量规划、部署模式和生产运维。

Highlights

提供请求生命周期、逐 token decode、延迟指标、context window、GPU/模型选择、显存与 KV Cache 估算、batching 和 chunked-prefill scheduler 等交互式工具,适合先建立全景直觉,再按当前 AI inference 路线逐章查阅。所有页面还可通过在 URL 后追加 `.md` 获取 Markdown 版本。

Notes

Modular 团队维护的生产级 LLM 推理技术手册。

Comments

Loading comments...