内核优化
内核优化(Kernel optimization)旨在通过改善 GPU 内核(kernel)对计算资源、内存带宽和片上(on-chip)资源的使用,使其运行得更快、更高效。对于 LLM 推理,这通常意味着减少内存搬运、提高硬件利用率,并更精细地将工作负载映射到 GPU 上。
- LLM 推理的内核优化 — 什么是内核优化,以及为什么它仍然重要
- GPU 架构基础 — 理解 GPU 硬件与执行模型的基础
- 内核优化工具 — 如何在内核优化工具栈中做出选择
- FlashAttention — 一种快速且内存高效的注意力算法