Study note
Triton Notes
Properties
- Type
- Blogs
- Status
- 待读
- Domain
- AI / ML
- Category
- GPU、CUDA 与内核优化
- Source
- junupark.xyz
- Vault note
library/articles/ai_ml/Triton-Notes-84d54fba664cd3c0.md
Summary
从 host/device 分工和 kernel launch 开始,围绕 Triton 的 tile、program、program ID、launch grid、offset、pointer、mask、stride 与 `tl.constexpr` 等核心抽象,逐步实现向量加法和二维矩阵乘,并介绍配置选择、测试、性能 benchmark 与调试方法。
Highlights
通过交互图把 Triton program 与 CUDA thread block、tile 与数据区域、grid 与输出分块之间的映射讲得很直观,同时对比 non-persistent 和 persistent launch。适合先于高级 Triton/TMA 文章阅读,并用其中的 vector add 和 matmul 代码建立 kernel 手感。
Notes
从编程模型到矩阵乘的交互式 Triton kernel 笔记。
Comments
Loading comments...