Study note
LLM Inference Handbook
Properties
- Type
- Blogs
- Status
- 待读
- Domain
- AI / ML
- Category
- LLM 推理与服务
- Source
- handbook.modular.com
- Vault note
library/articles/ai_ml/LLM-Inference-Handbook-a2572bb87f981d16.md
Summary
从训练与推理的区别、请求生命周期、prefill/decode 和 TTFT/TPOT/goodput 等指标开始,系统覆盖模型准备与交互、KV Cache、continuous batching、prefix caching、chunked prefill、量化、GPU 架构、kernel 优化、P/D 解耦、容量规划、部署模式和生产运维。
Highlights
提供请求生命周期、逐 token decode、延迟指标、context window、GPU/模型选择、显存与 KV Cache 估算、batching 和 chunked-prefill scheduler 等交互式工具,适合先建立全景直觉,再按当前 AI inference 路线逐章查阅。所有页面还可通过在 URL 后追加 `.md` 获取 Markdown 版本。
Notes
Modular 团队维护的生产级 LLM 推理技术手册。
Comments
Loading comments...