从 CUDA 到 Triton:深入理解 Triton 的即时编译与自动调优
flex-gemm 是一个使用 triton 开发的系数卷积库,在运行的过程中因为要根据输入数据进行算子调优所以在计算时间上有很大的波动。在解决 flex-gemm triton 算子编译优化的过程中,系统性的学习了一下 triton 的编译流程。 这里写一篇文章做个记录。 一、CUDA 编程核心 1.1 线程架构 NVIDIA GPU 的设计哲学是“用海量线程隐藏内存延迟”。为了高效管理这些线程