Study note

xGeMM: GPU Accelerated Matrix Multiplication

Properties

Type
Blogs
Status
待读
Domain
AI / ML
Category
GPU、CUDA 与内核优化
Source
tgautam03.github.io
Vault note
library/articles/ai_ml/xGeMM-GPU-Accelerated-Matrix-Multiplication-439326b47e48927c.md

Summary

Tushar Gautam 的 CUDA 矩阵乘项目,从 CPU/Eigen/cuBLAS 对比和 naive GPU kernel 开始,逐步覆盖 global-memory coalescing、shared-memory tiling、1D/2D thread coarsening 与向量化访存,并提供可运行的 benchmark 和实现代码。

Highlights

这是已失效的《2678x Faster Matrix Multiplication with a GPU》的作者后续教程,内容更完整且托管在可访问的 GitHub Pages。适合沿着“naive -> coalesced -> tiled -> register tiling -> vectorized access”顺序复现每次优化。

Notes

从零实现并逐步优化 CUDA FP32 GEMM。

Comments

Loading comments...