BLIP-2 精读:用 Q-Former 接通冻结视觉编码器与大语言模型 2026-07-20 2026-07-22 AI 多模态 / 视觉语言模型 / BLIP-2 / Q-Former / 参数高效训练 / ICML 从 Q-Former、三种表征学习目标与两阶段预训练出发,拆解 BLIP-2 如何用冻结视觉编码器和冻结 LLM 构建多模态模型。 0 | 0