新芽专题介绍:多模态大模型的个性化与推理加速
随着人工智能从单模态迈向多模态时代,多模态大模型(Multimodal Large Models, MLMs)成为智能感知与理解的核心引擎:它们同时处理图像、文本、语音、视频等多源信息,在跨模态检索、智能问答、视觉理解、机器人感知等任务上展现出类人般的推理与生成能力。但要把这样的模型真正用起来,绕不开两个问题——如何让它适应特定任务或个性化需求,以及如何在有限算力下高效推理。

本专题就围绕这两个问题展开。本文是专题的导览篇:先讲清研究背景与两条主线的核心思想,再梳理当前的主要挑战,最后给出一份带链接的文献地图和分阶段学习路径,供新芽学子入门与汇报参考。
配套讲解 PPT:下载 21 页幻灯片(PPTX,约 5 MB),覆盖本文全部示意图、论文原图与文献地图概览,可直接用于专题汇报。
两条主线分别切在模型生命周期的两端:个性化是训练侧问题,关注“如何让通用模型适配具体场景”;推理加速是推理侧问题,关注“如何降低部署时的计算与存储开销”。
多模态大模型是怎么工作的
要理解两条主线切在哪里,先看一个典型的多模态大模型推理流水线:图像或视频经视觉编码器(通常是 ViT 或 SigLIP)变成一串视觉 Token,再由跨模态投影层(MLP 或 Q-Former)映射到语言模型的嵌入空间,与文本指令拼接后一起送入大语言模型生成回答。
这条流水线上有两个事实,决定了本专题的技术版图:
- 视觉 Token 的数量决定注意力开销。一张图常被切成数百甚至上千个 Token,视频更是成倍增长,而注意力计算随序列长度近似平方增长——这是推理加速的主要战场。
- 主干权重既是能力的来源,也是适配和压缩的对象。个性化方法在视觉编码器、投影层、语言模型上插入或附加少量可训练参数;量化方法则直接压缩权重本身的比特宽度。
这条流水线不是凭空出现的,它建立在几个里程碑工作之上。CLIP(ICML 2021)用 4 亿图文对的对比学习证明:自然语言监督可以训练出具备零样本迁移能力的视觉表征,是多模态对齐的基石。

图片来源:openai/CLIP 仓库根目录
CLIP.png,MIT License,用于说明对比图文预训练的基本流程。
LLaVA(NeurIPS 2023)则把这条路推进到指令跟随:用 GPT-4 生成的视觉指令数据微调,让模型获得对话式的视觉理解能力,成为后来大多数开源多模态大模型的范式。

图片来源:haotian-liu/LLaVA 仓库
images/llava_example_cmp.png,Apache-2.0,用于展示视觉指令微调模型的多模态对话能力。
主线一:个性化(训练侧)
个性化要回答的问题是:**在不动或少动预训练主干的前提下,如何让模型适配具体任务、具体领域、具体用户?**文献里有三条相互交织的技术线。

参数高效微调:只训练 1% 的参数
全量微调一个几十亿参数的多模态模型,显存和数据成本都很高。参数高效微调(PEFT)的思路是冻结预训练权重,把任务差异压缩进极少量可训练参数。方法大致分三派:
- 加性方法:往网络里插入小模块。Adapter 在层间插入瓶颈 MLP;Prompt Tuning / Visual Prompt Tuning(ECCV 2022)只学习输入侧的软提示向量;Yo'LLaVA 一类的个性化工作则用少量可学习 Token 记住用户指定的视觉主体。
- 重参数化方法:以 LoRA(ICLR 2022)为代表,用低秩乘积改写权重增量。后续工作沿两个方向改进:DoRA(ICML 2024)把权重分解为方向与幅度分别微调;PiSSA、SVFT(均为 NeurIPS 2024)用奇异值分解来初始化适配参数,加速收敛。
- 量化协同方法:QLoRA(NeurIPS 2023)先把主干量化到 4-bit NF4,再在上面挂 LoRA 微调,把 65B 模型的微调压进单张 48G 显卡;LoftQ、LQ-LoRA(均为 ICLR 2024)进一步在量化时同步初始化低秩分支。这一派正是个性化与推理加速的交汇点。

图源:Dettmers et al., QLoRA: Efficient Finetuning of Quantized LLMs,NeurIPS 2023,方法总览图;取自作者 CC BY 4.0 arXiv 源码,原图用于论文解读。
LoRA 值得单独看一张图,因为它是整条线的基石:
直觉很朴素:下游任务需要的权重变化往往是低秩的,所以与其微调整个矩阵,不如只学两个小矩阵的乘积。推理时 BA 还能合并回原权重,不增加任何延迟——这也是 LoRA 在工业界流行的原因之一。
知识迁移:把大模型能力搬到分割、检测与推理感知
第二条线利用大模型已有的知识来提升具体视觉任务。Segment Anything(ICCV 2023)用 11 亿掩码训练出可提示分割的通用模型,其“图像编码器 + 提示编码器 + 掩码解码器”的三段式设计,成为后来大量工作的基础设施。

图片来源:facebookresearch/segment-anything 仓库
assets/model_diagram.png,Apache-2.0,用于说明可提示分割模型的结构。
在此之上,LISA(CVPR 2024)让大语言模型输出特殊的 [SEG] Token 来驱动 SAM 解码器,实现需要常识推理的分割(“分割出最可能遮雨的物体”);VideoLISA(NeurIPS 2024)和 GLUS(CVPR 2025)把它扩展到视频;DenseCLIP、RegionCLIP、GLIP、Grounding DINO 等工作则把 CLIP 式对齐迁移到稠密预测与开放词汇检测。

图源:Lai et al., LISA: Reasoning Segmentation via Large Language Model,CVPR 2024,流程框架图;取自作者 CC BY-NC-SA 4.0 arXiv 源码,原图用于论文解读。
零样本与少样本学习
第三条线关注标注稀缺的场景:CLIP 的零样本分类、Flamingo(NeurIPS 2022)的图文交错少样本上下文学习,以及 ICLR/CVPR 2025 的两篇多模态少样本 3D 点云分割工作,都在探索“缺乏大规模标注时依旧保持竞争力”的边界。
主线二:推理加速(推理侧)
推理加速要回答的问题是:**模型已经训好了,如何让它在有限算力下跑得更快、更省?**三条经典路线之外,多模态场景还长出了第四条特有路线。

量化:用更少比特存同一个模型
量化把 FP16/FP32 权重压缩为 INT8、INT4 甚至 1-bit 表示,显存占用和能耗同步下降。从 BinaryConnect(NeurIPS 2015)、XNOR-Net(ECCV 2016)的 1-bit 探索,到 AdaRound(ICML 2020)逐层学习取整方向,再到 GPTQ(ICLR 2023)用近似二阶信息逐列补偿误差,训练后量化已经能把大模型压到 4-bit 而精度损失很小。
剪枝与视觉 Token 压缩:多模态特有的杠杆
剪枝去除冗余结构提高稀疏性。在多模态模型里,最肥沃的剪枝对象是视觉 Token 序列:图像 Patch 里大量是背景和冗余区域,并不需要全部进入语言模型。
这条线从纯视觉模型起步——DynamicViT(NeurIPS 2021)用预测模块逐层丢弃 Token,SPViT(ECCV 2022)做延迟感知的软剪枝,TokenLearner(ICLR 2022)学习 Token 重组——随后进入多模态大模型:FastV(ECCV 2024)发现第二层之后可以即插即用地丢掉一半视觉 Token,DivPrune(CVPR 2025)按多样性选 Token,LLaVA-PruMerge(ICCV 2025)把被剪 Token 合并进保留 Token,DyCoke(CVPR 2025)进一步处理视频 Token 的时序冗余。

图源:Tao et al., DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models,CVPR 2025,方法总览图;取自作者 CC BY 4.0 arXiv 源码,原图用于论文解读。
蒸馏:大模型指导小模型
蒸馏用冻结的教师大模型产生的软标签、中间特征或输出分布来训练轻量学生模型,让学生以小得多的体量逼近教师能力。它与剪枝、量化互补且可叠加——经典的 Deep Compression(ICLR 2016)就是“剪枝 + 量化 + 哈夫曼编码”的组合拳。
当前的主要挑战
这个领域远未收敛,至少有三个开放性挑战:
- 任务与场景多样性:不同领域对多模态交互的需求差异很大——医学影像要细粒度,视频理解要长时序,机器人要低延迟。如何设计通用且高效的个性化方案,仍是难题。
- 大模型计算开销巨大:数百亿参数的多模态模型在部署中常受限于算力和能耗,端侧和边缘场景尤其如此。
- 个性化与高效性的平衡:压缩可能损伤模型的细粒度感知能力,个性化模块也可能引入额外延迟。如何在保持性能的同时兼顾灵活性与推理效率,需要不断权衡和创新。
文献地图
以下 66 篇文献按“入门 → 进阶 → 领域相关”组织,链接均指向可公开访问的 arXiv 页面并逐一核验过。一句话定位只是阅读入口,不能代替读原文。
入门文献:骨干网络、多模态底座与基础方法
进阶文献:SAM 系、LoRA 变体、推理分割与 Token 压缩
领域相关文献:多模态底座、开放词汇视觉与压缩加速脉络
建议的学习路径
多模态大模型的个性化与推理加速,是推动 AI 从实验室走向产业落地的关键一环。对入门同学,建议按四个阶段推进,每个阶段都“读论文 + 跑代码”并行:
基础学习资料(均可免费使用):
- 《动手学深度学习》:适合中文初学者的深度学习教材,理论、代码、实践一体;
- 《Deep Learning》:深度学习入门经典教材;
- PyTorch 官方教程:掌握主流框架的最佳入口;
- Google Colab:免费云平台,不用安装软件就能跑 PyTorch 代码;
- Kaggle:海量数据集、竞赛与免费计算资源。
落到具体任务上,建议每位同学选一条线深入:个性化线可以从复现 LoRA 微调一个开源多模态模型开始,再读 DoRA、PiSSA 等变体,最后进入 LISA、VideoLISA 这类任务适配工作;加速线可以从 DynamicViT 的 Token 剪枝思想入手,再读 GPTQ 的量化补偿,最后跟进 DivPrune、DyCoke 等面向多模态大模型的最新压缩方法。期待大家在专题汇报中提出自己的见解,探索更多可能性。
说明
- 本文中标注“本文原创”的示意图均为笔者根据公开论文机制重绘,仅用于学习交流;三张概念插画(封面、个性化、推理加速)为本文原创的 AI 辅助生成图,仅用于栏目视觉呈现。
- CLIP、LLaVA、SAM 三张配图取自官方开源仓库,许可分别为 MIT 与 Apache-2.0;QLoRA、LISA、DyCoke 三张论文原图取自作者 arXiv 源码,许可分别为 CC BY 4.0 与 CC BY-NC-SA 4.0,出处均已在图注标明。
- 文献的一句话定位为笔者概述,具体方法与结论请以原文为准。