MMInference 精读:为百万 Token 多模态预填充重排稀疏注意力 2026-08-05 2026-08-05 AI 多模态大模型 / 推理加速(推理侧) / 稀疏注意力 / 长上下文 / GPU Kernel / MMInference / ICML 拆解 ICML 2025 的 MMInference:以模态感知置换、Grid 稀疏模式与定制 GPU Kernel 加速长视频视觉语言模型的 prefill,属于推理加速(推理侧)方向。 8 | 0
SparseVLM 精读:让问题决定保留哪些视觉 Token 2026-07-23 2026-07-23 AI 多模态大模型 / 推理加速 / 视觉 Token 裁剪 / 稀疏推理 / SparseVLM / LLaVA / ICML 从文本 rater、逐层视觉 Token 稀疏化与被裁 Token 回收出发,拆解 ICML 2025 的 SparseVLM 如何在不训练新参数的前提下加速多模态大模型推理。 9 | 0
BLIP-2 精读:用 Q-Former 接通冻结视觉编码器与大语言模型 2026-07-20 2026-07-22 AI 多模态 / 视觉语言模型 / BLIP-2 / Q-Former / 参数高效训练 / ICML 从 Q-Former、三种表征学习目标与两阶段预训练出发,拆解 BLIP-2 如何用冻结视觉编码器和冻结 LLM 构建多模态模型。 9 | 0