InstructBLIP 精读:让视觉特征听懂任务指令 2026-07-23 2026-07-23 AI 多模态大模型 / 个性化 / 训练侧适配 / 指令微调 / Q-Former / Zero-shot / NeurIPS 从指令感知 Q-Former、26 个数据集的指令微调与零样本评测出发,拆解 NeurIPS 2023 的 InstructBLIP 如何适配多种视觉语言任务。 12 | 0
BLIP-2 精读:用 Q-Former 接通冻结视觉编码器与大语言模型 2026-07-20 2026-07-22 AI 多模态 / 视觉语言模型 / BLIP-2 / Q-Former / 参数高效训练 / ICML 从 Q-Former、三种表征学习目标与两阶段预训练出发,拆解 BLIP-2 如何用冻结视觉编码器和冻结 LLM 构建多模态模型。 9 | 0