标签
多模态
BLIP-2 精读:用 Q-Former 接通冻结视觉编码器与大语言模型
从 Q-Former、三种表征学习目标与两阶段预训练出发,拆解 BLIP-2 如何用冻结视觉编码器和冻结 LLM 构建多模态模型。
0
|
0
Transformer、ViT 与 CLIP 基础:从三篇代表论文到高频面试题
以三篇代表论文为主线,串起 Transformer、Vision Transformer 与 CLIP 的结构、目标和面试高频题。
1
|
0
从零实现多模态 RAG:BM25、Dense 检索、RRF 融合、MMR 重排全部手写
用纯 NumPy 手写 BM25、Dense 检索、RRF 融合和 MMR 重排,构建可评测的多模态 RAG。
0
|
0