RePIC 精读:用可验证奖励训练个性化多模态模型 2026-08-04 2026-08-04 AI 多模态大模型 / 个性化(训练侧) / 强化学习后训练 / GRPO / LoRA / 个性化图像描述 / RePIC / NeurIPS 拆解 NeurIPS 2025 的 RePIC:以 GRPO、对象一致性、视觉定位和身份一致性奖励,用 2K 样本后训练 Qwen2.5-VL,提升多主体个性化图像描述,属于个性化(训练侧)方向。 11 | 0