视觉语言模型通常由图像编码器和文本编码器组成。以 CLIP 为代表的模型在少样本迁移中具备较强能力,但现有参数高效微调方法往往默认两个分支具有相近的重要性,并采用相对固定的更新方式。浙江大学与斯旺西大学研究团队在论文中将这一问题概括为视觉语言模型的“分支偏置”。

论文题为《A3B2:用于少样本视觉语言图像分类、缓解分支偏置的自适应非对称适配器》,作者包括浙江大学的 Yiyun Zhou、Zhonghua Jiang、Wenkang Han、Kunxi Li、Chang Yao、Jingyuan Chen,以及斯旺西大学的 Mingjing Xu。研究聚焦的是基于 CLIP 的少样本图像分类,而不是所有类型的视觉语言任务。
论文的核心发现是,图像分支的适配效果会明显受到测试分布影响。在分布内任务中,同时调整图像和文本分支可能有助于捕捉目标领域的细粒度视觉特征;但在跨数据集评估和域泛化等分布外场景中,直接增加图像编码器的适配可能损害原有的迁移能力。相比之下,文本分支的调整在多数实验设置中带来的收益更稳定。
基于这一观察,研究团队提出 A3B2,即 Adaptive Asymmetric Adapter。该方法并不对两个分支采用完全相同的适配策略:文本编码器始终使用适配器,图像编码器的适配则根据输入样本动态调节。论文将这一机制称为 Uncertainty-Aware Adapter Dampening,即不确定性感知的适配器抑制。
具体而言,当模型对输入的预测不确定性较高时,A3B2会抑制图像分支适配器产生的修改量,使图像特征更多保留预训练 CLIP 的表示;当模型对样本更有把握时,图像分支可以保留适配带来的变化。这个机制试图用数据驱动的方式替代人工判断,避免在遇到分布外样本时持续放大针对特定训练数据形成的偏移。
在结构设计上,A3B2采用了带有混合专家思路的轻量级非对称适配器。适配器使用共享的下投影层压缩输入特征,再通过多个上投影专家恢复特征,并由动态路由器为不同专家分配权重。训练过程中,论文还加入负载均衡正则化,以减少路由器长期偏向少数专家的问题。
论文在三个少样本图像分类任务、11个数据集上进行了实验,并与11种提示学习和适配器方法进行比较。根据论文摘要,A3B2在这些实验中持续优于所比较的方法。研究同时通过消融实验分析了不确定性抑制、动态路由和负载均衡等组件的作用。
这项工作的意义并不是证明图像编码器不应被微调,而是指出视觉和文本分支在不同迁移场景中的作用并不对称。对于标注数据有限、目标分布可能变化的任务,保留视觉预训练特征并对图像分支进行条件化调节,可能比固定强度的联合微调更稳妥。至于拥有大规模目标域标注数据的任务,论文结论并不能直接推出抑制图像分支一定优于全量微调,具体方案仍需结合数据规模和评估分布判断。