Study note
xGeMM: GPU Accelerated Matrix Multiplication
Properties
- Type
- Blogs
- Status
- 待读
- Domain
- AI / ML
- Category
- GPU、CUDA 与内核优化
- Source
- tgautam03.github.io
- Vault note
library/articles/ai_ml/xGeMM-GPU-Accelerated-Matrix-Multiplication-439326b47e48927c.md
Summary
Tushar Gautam 的 CUDA 矩阵乘项目,从 CPU/Eigen/cuBLAS 对比和 naive GPU kernel 开始,逐步覆盖 global-memory coalescing、shared-memory tiling、1D/2D thread coarsening 与向量化访存,并提供可运行的 benchmark 和实现代码。
Highlights
这是已失效的《2678x Faster Matrix Multiplication with a GPU》的作者后续教程,内容更完整且托管在可访问的 GitHub Pages。适合沿着“naive -> coalesced -> tiled -> register tiling -> vectorized access”顺序复现每次优化。
Notes
从零实现并逐步优化 CUDA FP32 GEMM。
Comments
Loading comments...