从 PyTorch 到 CUDA Kernel:融合 RMSNorm 在 RTX 4090D 上加速 4.27 倍 2026-07-22 2026-07-22 技术 CUDA / AI Infra / GPU / PyTorch / LLM 推理 / Kernel 优化 从零实现 PyTorch CUDA 扩展,拆解 RMSNorm 的访存瓶颈、warp 归约、向量化加载、算子融合与冷热缓存 benchmark。 16 | 0
Week 2:GPU 与推理加速——从 Kernel、算子融合到 LLM Serving 2026-05-05 2026-07-22 技术 深度学习 / GPU / 推理加速 / LLM / CMU 10-414 / vLLM / TensorRT 从 GPU 执行模型、Kernel 与算子融合出发,理解 KV Cache、batching 和 LLM Serving 的性能瓶颈。 5 | 0