跳转至

面向条件式CMR合成的生成式基础模型元数据感知适应

文章背景与核心概要

医学影像领域长期面临数据稀缺以及关键临床表型代表性不足的问题。本文探讨了一种基于预训练潜在扩散模型的元数据条件式心脏磁共振(CMR)合成方法,旨在解决这一痛点。

通过将结构化的临床元数据和切片位置编码为文本提示词,该研究有效地引导了生成过程。为了增强元数据的一致性并克服临床属性的不平衡,该框架整合了三大核心策略:元数据无关的无分类器引导(CFG)、对比批次处理以及逆频率采样。

该方法在来自英国生物样本库(UK Biobank)的 59,058 个短轴 CMR 扫描数据上进行了训练与评估,取得了 37.47 的弗雷歇特初始距离(FID)。这一成绩相比于未使用这些策略进行微调的基线模型提升了 57.04%,并且相较于一个需要额外心脏几何输入(而此处仅依赖患者元数据)的先前文本条件式 CMR 扩散基线提升了 28.68%。子群分析表明,尽管人口统计学和采集元数据能够很好地对齐,但疾病特异性的条件化仍是未来元数据感知生成式框架面临的关键挑战。


arXiv: 2608.24342 [cs.CV]
Submitted: August 25, 2026
Primary Subject: Computer Vision and Pattern Recognition (cs.CV)
Authors: Marc Rodríguez, Grzegorz Skorupko, Nay Aung, Steffen E Petersen, Karim Lekadir, Polyxeni Gkontra
Links: View PDF | GitHub Repository


Summary

本论文研究了使用预训练潜在扩散模型进行元数据条件式心脏磁共振(CMR)合成,以解决医学影像中数据稀缺和关键临床表型代表性不足的问题。

This paper investigates metadata-conditioned cardiac magnetic resonance (CMR) synthesis using a pretrained latent diffusion model to address data scarcity and the underrepresentation of critical clinical phenotypes in medical imaging.

通过将结构化临床元数据和切片位置编码为文本提示,作者引导了生成过程。为了增强元数据的依从性并对抗临床属性失衡,该框架集成了三个主要策略: 1. 元数据无关的无分类器引导(CFG) 2. 对比批次处理 3. 逆频率采样

By encoding structured clinical metadata and slice position as textual prompts, the authors guide the generation process. To enhance metadata adherence and combat clinical attribute imbalance, the framework integrates three primary strategies: 1. Metadata-Free Classifier-Free Guidance (CFG) 2. Contrastive Batching 3. Inverse-Frequency Sampling

该方法在来自英国生物样本库(UK Biobank)的 59,058 个短轴 CMR 扫描上进行训练和评估,取得了 37.47 的弗雷歇特初始距离(FID)。这标志着比没有这些策略微调的基线模型提升了 57.04%,并且比之前需要额外心脏几何输入(此处仅依赖患者元数据)的文本条件式 CMR 扩散基线提升了 28.68%。子群分析表明,虽然人口统计学和采集元数据对齐良好,但疾病特异性条件化仍然是未来元数据感知生成框架的关键挑战。

Trained and evaluated on 59,058 short-axis CMR scans from the UK Biobank, the combined approach achieved a Fréchet Inception Distance (FID) of 37.47. This marks a 57.04% improvement over the baseline model fine-tuned without these strategies, and a 28.68% improvement over a previous text-conditioned CMR diffusion baseline that required extra cardiac geometry input (relying solely on patient metadata here). Subgroup analyses indicate that while demographic and acquisition metadata align well, disease-specific conditioning remains a key challenge for future metadata-aware generative frameworks.