Study note

Triton Notes

Properties

Type
Blogs
Status
待读
Domain
AI / ML
Category
GPU、CUDA 与内核优化
Source
junupark.xyz
Vault note
library/articles/ai_ml/Triton-Notes-84d54fba664cd3c0.md

Summary

从 host/device 分工和 kernel launch 开始,围绕 Triton 的 tile、program、program ID、launch grid、offset、pointer、mask、stride 与 `tl.constexpr` 等核心抽象,逐步实现向量加法和二维矩阵乘,并介绍配置选择、测试、性能 benchmark 与调试方法。

Highlights

通过交互图把 Triton program 与 CUDA thread block、tile 与数据区域、grid 与输出分块之间的映射讲得很直观,同时对比 non-persistent 和 persistent launch。适合先于高级 Triton/TMA 文章阅读,并用其中的 vector add 和 matmul 代码建立 kernel 手感。

Notes

从编程模型到矩阵乘的交互式 Triton kernel 笔记。

Comments

Loading comments...