MMInference 精读:为百万 Token 多模态预填充重排稀疏注意力 2026-08-05 2026-08-05 AI 多模态大模型 / 推理加速(推理侧) / 稀疏注意力 / 长上下文 / GPU Kernel / MMInference / ICML 拆解 ICML 2025 的 MMInference:以模态感知置换、Grid 稀疏模式与定制 GPU Kernel 加速长视频视觉语言模型的 prefill,属于推理加速(推理侧)方向。 8 | 0