从 DeepReviewer 2.0 到 CycleResearcher:科研 Agent 如何真正做 Post-training 2026-08-07 2026-08-07 AI LLM / Post-training / Agent / SimPO / Reward Model / ICLR 区分推理时 Agent 编排与模型后训练,并拆解 CycleResearcher 的领域 SFT、生成式 Reward Model、Iterative SimPO 和评测风险。 18 | 0