从GPT-4V到Gemini、Claude 3 Vision,多模态大模型(Multimodal Large Language Model, MLLM)正成为AI应用的核心基础设施。这类模型不仅能理解文本,还能"看懂"图像、"听懂"音频,甚至理解视频中的时空关系。本文将系统梳理MLLM的架构演进路径,深入解析视觉语言对齐、指令微调等关键技术,并探讨当前的研究前沿。

一、MLLM架构演进全景

MLLM经历了从早期late fusion到端到端架构的演进路线。早期方案如LLaMA-Adapter、LQVQ分别在LLM的层间插入适配器或修改输入层;中期方案如LLaVA系列通过简单的线性投影连接视觉编码器和LLM;当前最先进架构则追求更紧密、更高效的多模态融合机制。

主流MLLM架构通常包含三个核心组件:

  • 视觉编码器(Vision Encoder):通常使用CLIP ViT或SigLIP,将图像转换为序列化视觉token
  • 多模态投影器(Projector):将视觉token对齐到LLM的嵌入空间,可以是线性层、MLP、Q-Former或Pixel Shuffle等结构
  • 骨干LLM:负责最终的推理和文本生成,如LLaMA、Qwen、InternLM等

二、视觉语言对齐技术

视觉语言对齐是MLLM的核心挑战。CLIP通过对偶编码器学习视觉和文本的共享表征空间,目标是使图像的特征表示和其描述文本在嵌入空间中接近。常用的对齐损失包括对比损失(Contrastive Loss)、匹配损失(Matching Loss)和生成式损失(Captioning Loss)。

在MLLM中,对齐面临更细粒度的需求:

  • 空间对齐:需要精确定位图像中物体的位置关系(如grounding任务),通常通过目标检测预训练或区域特征提取增强
  • 语义对齐:同一视觉内容对应多种语义粒度描述(场景级、物体级、属性级)
  • 时序对齐(视频):需要将视觉帧序列与语言描述的时序对应,涉及关键帧采样和长上下文建模

三、关键技术突破

Killer Features:研究发现CLIP提取的图像特征具有压倒性优势,一旦模型在预训练阶段学到这些特征,就难以自主发现更细粒度的视觉结构。这一发现揭示了多模态模型中视觉信息被忽视的根本原因。

动态分辨率处理(Dynamic High Resolution):为了处理OCR、图表理解等高分辨率需求任务,动态切分策略将原图切分为多个子图,分别提取特征后再拼接。Qwen-VL、InternLM-XComposer等采用了此类方案,实现10x以上的分辨率处理范围而不破坏预训练视觉编码器的位置编码。

思维链与推理增强:将思维链(CoT)技术引入多模态场景,使模型逐步分析图像内容并推理结论。关键改进包括引用引用(CoR)——模型在推理过程中引用图像中的区域作为证据,以及程序辅助视觉推理——生成Python代码处理视觉任务中的数值计算。

四、训练策略与优化

MLLM的训练通常遵循两阶段策略:第一阶段预训练投影器,对齐视觉特征和文本空间;第二阶段端到端微调,使模型学会理解和生成多模态内容。预训练阶段的数据质量对齐至关重要——研究表明,平衡的图像标题数据(注重实体和关系的描述而非抽象场景)比海量但低质量的alt文本更有效。

指令微调数据需要精心设计:包括图像描述、视觉问答(VQA)、光学字符识别(OCR)、图表理解、文档问答、视觉推理等多个任务类别。Alpaca格式的多轮对话数据配合图像引用标记可以支持交互式多轮对话场景。

高效微调技术如QLoRA、Adapter允许在消费级GPU上微调7B级别的多模态模型。关键技巧包括:使用LoRA同时适配投影器和LLM的注意力层,解耦视觉和语言组件的参数更新以保持对齐稳定性。

五、应用前沿与挑战

多模态Agent是当前最热的研究方向。模型不仅理解单一图像,还能在桌面环境、移动设备、Web页面等多模态场景中自主操作。典型架构如ShowUI通过视觉定位和动作预测实现GUI操作,CogAgent通过高分辨率输入和操作历史记忆构建通用Agent。

视频理解正从秒级扩展到分钟级甚至小时级。关键技术包括:高效视频采样(只处理I帧和运动变化大的帧)、时空token压缩、长上下文窗口(通过RoPE外推或层级化注意力)。

当前的主要挑战包括:幻觉生成(视觉幻觉尤为严重)、上下文窗口对图像数量的限制、推理速度(图像编码是主要瓶颈)、以及缺少细粒度视觉grounding能力。解决方案的融合——结合目标检测器、OCR工具、视觉搜索增强的RAG——成为提高多模态可靠性的工程实践方向。

六、未来展望

原生多模态模型(Native Multimodal Models)——从统一嵌入空间和统一Transformer角度原生融合所有模态——是架构演进的下一个趋势。同时,多模态推理能力的提升将与数学推理、代码生成一起,成为大模型能力突破的下一个里程碑。

点赞(0) 打赏

评论列表 共有 0 条评论

暂无评论
立即
投稿

微信公众账号

微信扫一扫加关注

发表
评论
返回
顶部