TD-MPC2 精读:用隐式世界模型统一 104 个连续控制任务 2026-07-22 2026-07-22 AI 强化学习 / 世界模型 / 模型预测控制 / 连续控制 / 多任务学习 / ICLR 从隐式潜在动力学、SimNorm、离散回归、策略先验与 MPPI 规划出发,拆解 ICLR 2024 Spotlight 论文 TD-MPC2 如何用统一超参数稳定训练并扩展到 317M 参数、80 个任务。 4 | 0
M3 精读:可伸缩视觉 Token 如何加速多模态推理 2026-07-20 2026-07-22 AI 多模态大模型 / 推理加速 / 视觉 Token 压缩 / M3 / LLaVA / ICLR 从嵌套视觉 Token、多尺度训练目标与预填充成本出发,拆解 ICLR 2025 的 M3 如何在同一多模态大模型中按需切换推理粒度。 0 | 0