LLaVA-Mini 精读:一个视觉 Token 如何加速图像与视频推理 2026-07-29 2026-07-29 AI 多模态大模型 / 推理加速(推理侧) / 视觉 Token 压缩 / 多模态预融合 / 长视频理解 / LLaVA-Mini / ICLR 拆解 ICLR 2025 的 LLaVA-Mini 如何用模态预融合与查询压缩,把送入主语言模型的视觉 Token 从 576 个降到 1 个,属于推理加速(推理侧)方向。 1 | 0
MM-FSS 精读:免费多模态如何提升少样本 3D 分割 2026-07-29 2026-07-29 AI 多模态大模型 / 个性化(训练侧) / 少样本学习 / 3D 点云分割 / 视觉语言模型 / MM-FSS / ICLR 拆解 ICLR 2025 Spotlight 的 MM-FSS 如何用文本语义、隐式 2D 对齐和测试时校准适配少样本 3D 点云分割,属于个性化(训练侧)方向。 0 | 0
Dynamic-LLaVA 精读:同时压缩视觉 Token 与生成上下文 2026-07-28 2026-07-28 AI 多模态大模型 / 推理加速(推理侧) / 视觉 Token 压缩 / KV Cache / 动态稀疏化 / Dynamic-LLaVA / ICLR 从视觉 Token 选择、生成上下文稀疏化与在线 KV cache 决策出发,拆解 ICLR 2025 的 Dynamic-LLaVA 如何贯穿预填充和解码阶段加速多模态大模型,属于推理加速(推理侧)方向。 1 | 0
VideoLISA 精读:多模态模型的训练侧视频分割适配 2026-07-27 2026-07-27 AI 多模态大模型 / 个性化(训练侧) / 参数高效微调 / Reasoning Segmentation / 视频分割 / VideoLISA / NeurIPS 从 LoRA 适配、稀疏-稠密视频采样与 One-Token-Seg-All 训练出发,拆解 NeurIPS 2024 的 VideoLISA 如何把多模态大模型迁移到视频推理分割,属于个性化(训练侧)方向。 3 | 0
SparseVLM 精读:让问题决定保留哪些视觉 Token 2026-07-23 2026-07-23 AI 多模态大模型 / 推理加速 / 视觉 Token 裁剪 / 稀疏推理 / SparseVLM / LLaVA / ICML 从文本 rater、逐层视觉 Token 稀疏化与被裁 Token 回收出发,拆解 ICML 2025 的 SparseVLM 如何在不训练新参数的前提下加速多模态大模型推理。 4 | 0
InstructBLIP 精读:让视觉特征听懂任务指令 2026-07-23 2026-07-23 AI 多模态大模型 / 个性化 / 训练侧适配 / 指令微调 / Q-Former / Zero-shot / NeurIPS 从指令感知 Q-Former、26 个数据集的指令微调与零样本评测出发,拆解 NeurIPS 2023 的 InstructBLIP 如何适配多种视觉语言任务。 5 | 0
从 PyTorch 到 CUDA Kernel:融合 RMSNorm 在 RTX 4090D 上加速 4.27 倍 2026-07-22 2026-07-22 技术 CUDA / AI Infra / GPU / PyTorch / LLM 推理 / Kernel 优化 从零实现 PyTorch CUDA 扩展,拆解 RMSNorm 的访存瓶颈、warp 归约、向量化加载、算子融合与冷热缓存 benchmark。 10 | 0
DeeR-VLA 精读:用动态早退加速多模态机器人推理 2026-07-22 2026-07-22 AI 多模态大模型 / 推理加速 / 动态早退 / VLA / 机器人学习 / NeurIPS 从多出口 MLLM、动作一致性判据与预算约束出发,拆解 NeurIPS 2024 的 DeeR-VLA 如何动态跳过 LLM 层,实现多模态机器人推理加速。 10 | 0
TD-MPC2 精读:用隐式世界模型统一 104 个连续控制任务 2026-07-22 2026-07-22 AI 强化学习 / 世界模型 / 模型预测控制 / 连续控制 / 多任务学习 / ICLR 从隐式潜在动力学、SimNorm、离散回归、策略先验与 MPPI 规划出发,拆解 ICLR 2024 Spotlight 论文 TD-MPC2 如何用统一超参数稳定训练并扩展到 317M 参数、80 个任务。 4 | 0
Yo'LLaVA 精读:用 16 个软 Token 记住你的专属视觉概念 2026-07-21 2026-07-22 AI 多模态大模型 / 个性化 / 视觉概念 / 软提示 / YoLLaVA / NeurIPS 从可学习身份 Token、视觉属性软提示与难负样本出发,拆解 NeurIPS 2024 的 Yo'LLaVA 如何用 5 张图完成多模态大模型个性化。 5 | 0