DF-MoE:基于多模态稀疏混合专家的通用深度伪造检测
文章背景与核心概要
音视频深度伪造检测(Deepfake Detection)是当前人工智能领域备受关注的研究热点,其核心挑战之一在于如何开发出能够适应不同伪造生成方法的通用检测器。现有模型往往容易对特定的训练集产生过拟合,难以应对未知的新型伪造手段。
为了突破这一瓶颈,本文提出了 DF-MoE(Deepfake via Multimodal Sparse Mixture-of-Experts)框架。该研究核心在于利用多样化的预训练模型集合,从音频和视频模态中提取丰富的、高级的单模态与多模态线索——包括嘴唇运动、面部解析、面部表情、头部姿态、视线追踪、心率、音频情感以及语音活动等。
随后,DF-MoE 通过稀疏混合专家(Sparse MoE)骨干网络将这些互补的特征进行有机整合。在五个主流的音视频深度伪造基准数据集(MAVOS-DD、AVLips、PolyGlotFake、BioDeepAV、FakeAVCeleb)上进行的广泛实验表明,DF-MoE 在域内(In-domain)和跨域(Cross-domain)检测任务中均取得了最先进(SOTA)的性能,显著超越了现有的竞争方法。
摘要 (Abstract)
音视频深度伪造检测是一个备受关注的研究课题,其中主要的挑战之一是开发出能够在不同的深度伪造生成方法之间实现良好泛化的检测器。我们推测,通过利用预训练模型从可用的音频和视觉模态中提取多个高级线索,可以有效缓解过拟合现象。因此,我们组合了多种多样的预训练模型来提取编码嘴唇运动、面部解析、面部表情、头部姿态、视线追踪、心率、音频情感和语音活动等特征。
此外,我们通过一个混合专家(MoE)骨干网络整合单模态和多模态线索来检测深度伪造。我们在五个深度伪造检测基准数据集(MAVOS-DD、AVLips、PolyGlotFake、BioDeepAV、FakeAVCeleb)上进行了域内和跨域实验,以将我们的框架(DF-MoE)与最先进的方法进行比较。我们的实验结果表明,DF-MoE 获得了优异的深度伪造检测结果,超越了所有同类竞争方法。
Audio-visual deepfake detection is an actively studied topic, where one of the main challenges is to develop detectors able to generalize across deepfake generation methods. We conjecture that overfitting can be mitigated by extracting multiple high-level cues from the available audio and visual modalities via pre-trained models. We therefore assemble a wide variety of pre-trained models to extract features that encode mouth movements, face parsing, facial expressions, head pose, gaze tracking, heart rate, audio emotion and speech activity. We further integrate both unimodal and multimodal cues via a Mixture-of-Experts (MoE) backbone to detect deepfakes. We perform in-domain and cross-domain experiments on five benchmarks for deepfake detection (MAVOS-DD, AVLips, PolyGlotFake, BioDeepAV, FakeAVCeleb) to compare our framework (DF-MoE) with state-of-the-art methods. Our results indicate that DF-MoE obtains superior deepfake detection results, surpassing all competing methods.
论文元数据 (Paper Metadata)
- arXiv ID: arXiv:2608.23363 [cs.CV]
- 一级主题: 计算机视觉与模式识别 (
cs.CV) - 其他主题: 人工智能 (
cs.AI)、机器学习 (cs.LG) - 提交日期: 2026年8月24日
- 会议录用: 已被 BMVC 2026 接收
- 作者:
- Vlad Hondru
- Florinel Alin Croitoru
- Iuliana Georgescu
- A. Sophia Koepke
- Radu Tudor Ionescu
资源与链接 (Resources & Links)
- 官方代码仓库: GitHub - vladhondru25/DF-MoE
- 全文访问: 查看 PDF | 实验性 HTML
- 外部引用: 谷歌学术 | Semantic Scholar | NASA ADS