MMInference 精读:为百万 Token 多模态预填充重排稀疏注意力 2026-08-05 2026-08-05 AI 多模态大模型 / 推理加速(推理侧) / 稀疏注意力 / 长上下文 / GPU Kernel / MMInference / ICML 拆解 ICML 2025 的 MMInference:以模态感知置换、Grid 稀疏模式与定制 GPU Kernel 加速长视频视觉语言模型的 prefill,属于推理加速(推理侧)方向。 8 | 0
EVE 精读:移除视觉编码器能加速多模态推理吗 2026-08-03 2026-08-03 AI 多模态大模型 / 推理加速(推理侧) / 视觉编码器 / 视觉语言模型 / Decoder-only / 推理延迟 / EVE / NeurIPS 拆解 NeurIPS 2024 Spotlight 论文 EVE:用无视觉编码器的 decoder-only 架构降低多模态视觉前处理开销,并核对其速度、精度、训练稳定性与端到端延迟边界,属于推理加速(推理侧)方向。 7 | 0
LLaVA-Mini 精读:一个视觉 Token 如何加速图像与视频推理 2026-07-29 2026-07-29 AI 多模态大模型 / 推理加速(推理侧) / 视觉 Token 压缩 / 多模态预融合 / 长视频理解 / LLaVA-Mini / ICLR 拆解 ICLR 2025 的 LLaVA-Mini 如何用模态预融合与查询压缩,把送入主语言模型的视觉 Token 从 576 个降到 1 个,属于推理加速(推理侧)方向。 10 | 0
Dynamic-LLaVA 精读:同时压缩视觉 Token 与生成上下文 2026-07-28 2026-07-28 AI 多模态大模型 / 推理加速(推理侧) / 视觉 Token 压缩 / KV Cache / 动态稀疏化 / Dynamic-LLaVA / ICLR 从视觉 Token 选择、生成上下文稀疏化与在线 KV cache 决策出发,拆解 ICLR 2025 的 Dynamic-LLaVA 如何贯穿预填充和解码阶段加速多模态大模型,属于推理加速(推理侧)方向。 15 | 0