近日,多媒体技术领域国际顶级会议——中国计算机学会(CCF)推荐A类会议 ACM International Conference on Multimedia(ACM MM)2026公布论文录用结果。我校计算机与信息工程学院、福建省模式识别与图像理解重点实验室师生完成的两项研究成果成功入选,展现了我校在多媒体智能、协同学习及多视图数据分析等领域的科研进展。
入选论文信息如下:
论文一:PSL-RGHA
题目: PSL-RGHA: Parallel Split Learning with Reference Gradient Half-Space Alignment for Mitigating Gradient Divergence
该论文由我校研究生李晗担任第一作者,计算机与信息工程学院杨淼老师、朱顺痣老师担任通讯作者。
随着深度神经网络规模不断扩大,资源受限终端设备在部署人工智能模型时,面临计算能力不足和存储资源有限等问题。并行拆分学习通过将神经网络划分为客户端和服务器两部分进行协同训练,将主要计算任务卸载至服务器,为端侧图像分类、语音识别等多媒体智能应用提供了有效的模型训练方案。然而,由于并行拆分学习缺少客户端模型聚合机制,在数据分布异构的环境下,不同客户端的梯度方向容易发生冲突,进而造成训练不稳定、梯度发散,甚至影响模型收敛。针对上述问题,论文提出基于参考梯度半空间对齐的并行拆分学习框架 PSL-RGHA,并设计参考梯度渐进构建(RGPC)和梯度半空间对齐(GHA)两个关键模块。其中,RGPC通过评估不同客户端梯度方向的一致性,并利用Weiszfeld迭代算法逐步构建鲁棒参考梯度,以逼近全局最优下降方向;GHA则利用参考梯度建立半空间约束,对存在冲突的客户端梯度进行方向校正,使不同客户端保持相对一致的优化方向,从而缓解异构数据环境下的梯度冲突问题。在多个公开数据集和不同数据异构场景下的实验结果表明,PSL-RGHA在模型精度、训练稳定性和收敛性能等方面均优于现有主流并行拆分学习方法。该研究为资源受限终端设备上的多媒体智能协同学习提供了一种新的技术方案。

论文二:JLGCC
题目: Joint Local–Global Contrastive Calibration for Multi-View Semi-Supervised Classification
该论文由福建省模式识别与图像理解重点实验室肖顺鑫老师担任第一作者、王大寒老师担任通讯作者,2025级研究生谢彦欣等参与完成。厦门理工学院为论文第一单位和通讯单位。
多视图半监督分类旨在利用同一样本在不同视图中的互补信息,在标注样本有限的条件下提升分类性能。然而,现有方法通常只在网络最后一层对不同视图进行一致性约束,难以及时纠正特征在网络中间传播过程中产生的语义偏移。同时,在标注样本较少时,模型生成的伪标签可能存在噪声,若直接用于跨视图学习,错误信息容易在训练过程中传播和放大。针对上述问题,论文提出联合局部—全局对比校准方法JLGCC,从中间特征和最终分类结果两个层面对多视图语义一致性进行校准。在局部层面,该方法为每个视图构建近邻图,并通过多层图卷积网络提取不同层次的特征,在网络各层根据伪标签反映的样本语义关系,对不同视图之间的特征相似关系进行校准,从而及时缓解中间层的语义偏移。在全局层面,该方法融合各视图最终层的特征,形成相对稳定的全局共识预测,并利用该共识进一步校准各个视图的分类结果,降低错误伪标签对模型训练的干扰。此外,JLGCC采用渐进式三阶段训练策略,依次开展重构预训练、局部—全局对比校准和有监督微调,避免多个学习目标在训练初期同时介入而造成优化不稳定。实验结果表明,该方法在五个数据集上取得了最高的分类准确率,并在其余数据集上保持较强的竞争力,验证了其在缓解中间层语义偏移、抑制伪标签噪声以及提升少量标注条件下分类性能方面的有效性。

两项研究分别面向资源受限设备上的协同模型训练和少量标注条件下的多视图智能分析,从梯度优化与语义校准两个角度解决多媒体人工智能模型中的关键问题。此次两篇论文被ACM MM 2026录用,体现了我校相关科研团队在多媒体智能与机器学习领域持续开展创新研究所取得的阶段性成果。