SparseVLM 精读:让问题决定保留哪些视觉 Token 2026-07-23 2026-07-23 AI 多模态大模型 / 推理加速 / 视觉 Token 裁剪 / 稀疏推理 / SparseVLM / LLaVA / ICML 从文本 rater、逐层视觉 Token 稀疏化与被裁 Token 回收出发,拆解 ICML 2025 的 SparseVLM 如何在不训练新参数的前提下加速多模态大模型推理。 9 | 0
InstructBLIP 精读:让视觉特征听懂任务指令 2026-07-23 2026-07-23 AI 多模态大模型 / 个性化 / 训练侧适配 / 指令微调 / Q-Former / Zero-shot / NeurIPS 从指令感知 Q-Former、26 个数据集的指令微调与零样本评测出发,拆解 NeurIPS 2023 的 InstructBLIP 如何适配多种视觉语言任务。 12 | 0
DeeR-VLA 精读:用动态早退加速多模态机器人推理 2026-07-22 2026-07-22 AI 多模态大模型 / 推理加速 / 动态早退 / VLA / 机器人学习 / NeurIPS 从多出口 MLLM、动作一致性判据与预算约束出发,拆解 NeurIPS 2024 的 DeeR-VLA 如何动态跳过 LLM 层,实现多模态机器人推理加速。 17 | 0
Yo'LLaVA 精读:用 16 个软 Token 记住你的专属视觉概念 2026-07-21 2026-07-22 AI 多模态大模型 / 个性化 / 视觉概念 / 软提示 / YoLLaVA / NeurIPS 从可学习身份 Token、视觉属性软提示与难负样本出发,拆解 NeurIPS 2024 的 Yo'LLaVA 如何用 5 张图完成多模态大模型个性化。 13 | 0
M3 精读:可伸缩视觉 Token 如何加速多模态推理 2026-07-20 2026-07-22 AI 多模态大模型 / 推理加速 / 视觉 Token 压缩 / M3 / LLaVA / ICLR 从嵌套视觉 Token、多尺度训练目标与预填充成本出发,拆解 ICLR 2025 的 M3 如何在同一多模态大模型中按需切换推理粒度。 9 | 0