DeeR-VLA 精读:用动态早退加速多模态机器人推理 2026-07-22 2026-07-22 AI 多模态大模型 / 推理加速 / 动态早退 / VLA / 机器人学习 / NeurIPS 从多出口 MLLM、动作一致性判据与预算约束出发,拆解 NeurIPS 2024 的 DeeR-VLA 如何动态跳过 LLM 层,实现多模态机器人推理加速。 7 | 0
M3 精读:可伸缩视觉 Token 如何加速多模态推理 2026-07-20 2026-07-22 AI 多模态大模型 / 推理加速 / 视觉 Token 压缩 / M3 / LLaVA / ICLR 从嵌套视觉 Token、多尺度训练目标与预填充成本出发,拆解 ICLR 2025 的 M3 如何在同一多模态大模型中按需切换推理粒度。 0 | 0
Week 2:GPU 与推理加速——从 Kernel、算子融合到 LLM Serving 2026-05-05 2026-07-22 技术 深度学习 / GPU / 推理加速 / LLM / CMU 10-414 / vLLM / TensorRT 从 GPU 执行模型、Kernel 与算子融合出发,理解 KV Cache、batching 和 LLM Serving 的性能瓶颈。 0 | 0