从 PyTorch 到 CUDA Kernel:融合 RMSNorm 在 RTX 4090D 上加速 4.27 倍 2026-07-22 2026-07-22 技术 CUDA / AI Infra / GPU / PyTorch / LLM 推理 / Kernel 优化 从零实现 PyTorch CUDA 扩展,拆解 RMSNorm 的访存瓶颈、warp 归约、向量化加载、算子融合与冷热缓存 benchmark。 10 | 0