MMInference 精读:为百万 Token 多模态预填充重排稀疏注意力 2026-08-05 2026-08-05 AI 多模态大模型 / 推理加速(推理侧) / 稀疏注意力 / 长上下文 / GPU Kernel / MMInference / ICML 拆解 ICML 2025 的 MMInference:以模态感知置换、Grid 稀疏模式与定制 GPU Kernel 加速长视频视觉语言模型的 prefill,属于推理加速(推理侧)方向。 8 | 0
FlashAttention-3 精读:用异步流水与 FP8 加速 Hopper Attention 2026-07-21 2026-07-22 AI AI Systems / FlashAttention / GPU Kernel / Hopper / FP8 / NeurIPS 从 Hopper 的 TMA、WGMMA 和 FP8 出发,拆解 FlashAttention-3 如何用 warp specialization、GEMM-Softmax 流水与低误差量化提升精确注意力吞吐。 9 | 0