从 DeepReviewer 2.0 到 CycleResearcher:科研 Agent 如何真正做 Post-training 2026-08-07 2026-08-07 AI LLM / Post-training / Agent / SimPO / Reward Model / ICLR 区分推理时 Agent 编排与模型后训练,并拆解 CycleResearcher 的领域 SFT、生成式 Reward Model、Iterative SimPO 和评测风险。 18 | 0
LLaVA-Mini 精读:一个视觉 Token 如何加速图像与视频推理 2026-07-29 2026-07-29 AI 多模态大模型 / 推理加速(推理侧) / 视觉 Token 压缩 / 多模态预融合 / 长视频理解 / LLaVA-Mini / ICLR 拆解 ICLR 2025 的 LLaVA-Mini 如何用模态预融合与查询压缩,把送入主语言模型的视觉 Token 从 576 个降到 1 个,属于推理加速(推理侧)方向。 10 | 0
MM-FSS 精读:免费多模态如何提升少样本 3D 分割 2026-07-29 2026-07-29 AI 多模态大模型 / 个性化(训练侧) / 少样本学习 / 3D 点云分割 / 视觉语言模型 / MM-FSS / ICLR 拆解 ICLR 2025 Spotlight 的 MM-FSS 如何用文本语义、隐式 2D 对齐和测试时校准适配少样本 3D 点云分割,属于个性化(训练侧)方向。 14 | 0
Dynamic-LLaVA 精读:同时压缩视觉 Token 与生成上下文 2026-07-28 2026-07-28 AI 多模态大模型 / 推理加速(推理侧) / 视觉 Token 压缩 / KV Cache / 动态稀疏化 / Dynamic-LLaVA / ICLR 从视觉 Token 选择、生成上下文稀疏化与在线 KV cache 决策出发,拆解 ICLR 2025 的 Dynamic-LLaVA 如何贯穿预填充和解码阶段加速多模态大模型,属于推理加速(推理侧)方向。 15 | 0
TD-MPC2 精读:用隐式世界模型统一 104 个连续控制任务 2026-07-22 2026-07-22 AI 强化学习 / 世界模型 / 模型预测控制 / 连续控制 / 多任务学习 / ICLR 从隐式潜在动力学、SimNorm、离散回归、策略先验与 MPPI 规划出发,拆解 ICLR 2024 Spotlight 论文 TD-MPC2 如何用统一超参数稳定训练并扩展到 317M 参数、80 个任务。 11 | 0
M3 精读:可伸缩视觉 Token 如何加速多模态推理 2026-07-20 2026-07-22 AI 多模态大模型 / 推理加速 / 视觉 Token 压缩 / M3 / LLaVA / ICLR 从嵌套视觉 Token、多尺度训练目标与预填充成本出发,拆解 ICLR 2025 的 M3 如何在同一多模态大模型中按需切换推理粒度。 9 | 0