迷失在发声中:将声音质量变异作为语音基础模型评估维度
文章背景与核心概要
语音基础模型(SFM)的最新进展使得模型能够直接处理原始音频,并对微妙的副语言变异做出反应。然而,这些模型如何解释诸如声音质量(Voice Quality)等非词汇线索,在很大程度上仍未得到充分探索。本文引入了 VQ-Bench,这是一个受控的评估套件,包含一个由合成的常态发声(modal)、气声(breathy)、压喉音(creaky)和句尾压喉音(end-creak)类型组成的平行数据集。
通过在四个具生态有效性的领域进行开放式生成评估以及语音情感识别测试,研究揭示了模型中存在的关键性能差距:领先的商业 API 未能通过基本的生物特征健全性检查,而其他模型则仅仅根据发声类型的不同,在感知到的自主性、同理心和领导力方面表现出系统性的偏移。此外,研究结果凸显了薪资和领导力认可方面的性别不对称现象,证明了 SFM 可能会镜像或放大人类的社会偏见。该工作建立了一个可重复的评估框架,以确保语音基 AI 系统能够进行负责任的副语言解释。
📌 执行摘要
Recent developments in Speech Foundation Models (SFMs) allow models to process raw audio directly and respond to subtle paralinguistic variations. However, how these models interpret non-lexical cues—such as voice quality—has remained largely unexplored.
这篇论文引入了 VQ-Bench,这是一个受控的评估套件,包含一个由合成的常态发声、气声、压喉音和句尾压喉音类型组成的平行数据集。通过在四个具生态有效性的领域以及语音情感识别任务中评估 SFM 的敏感度,研究揭示了关键的性能差距: * 生物特征健全性检查失败: 某领先的商业 API 未能通过基本的生物特征检查。 * 有偏见的行为转变: 其他模型仅仅根据发声类型,就在感知到的自主性、同理心和领导力方面表现出系统性的偏移。 * 社会偏见的放大: 该研究凸显了薪资和领导力认可方面的显著性别不对称,证明了 SFM 可以镜像或放大人类的社会偏见。
最终,这项工作建立了一个可重复的评估框架,以确保基于语音的 AI 系统能够进行负责任的副语言解释。
🔗 链接与资源
- Full-Text Access: View PDF | HTML (Experimental) | TeX Source
- Bibliographic Tools: NASA ADS | Google Scholar | Semantic Scholar
📋 摘要
Recent advances in Speech Foundation Models (SFMs) enable direct processing of raw audio, allowing models to respond to subtle paralinguistic variation. However, how these models interpret non-lexical cues remains largely unstudied. We introduce VQ-Bench, a controlled evaluation suite featuring a parallel dataset of synthesized modal, breathy, creaky, and end-creak phonation types. We evaluate SFM sensitivity through open-ended generation across four ecologically valid domains, alongside speech emotion recognition. Our results reveal performance gaps: while a leading commercial API failed basic biometric sanity checks, other models exhibited systematic shifts in agency, empathy, and leadership based on phonation. Our findings also highlight gender asymmetries in salary and leadership endorsements, demonstrating that SFMs may mirror or amplify human social biases. This work establishes a reproducible framework for ensuring responsible paralinguistic interpretation in speech-based AI.
语音基础模型(SFM)的最新进展实现了对原始音频的直接处理,使模型能够对微妙的副语言变异做出响应。然而,这些模型如何解释非词汇线索在很大程度上仍未得到研究。我们推出了 VQ-Bench,这是一个受控的评估套件,包含一个由合成的常态发声、气声、压喉音和句尾压喉音类型组成的平行数据集。我们通过在四个具生态有效性的领域进行开放式生成以及语音情感识别,来评估 SFM 的敏感度。我们的结果揭示了性能差距:虽然一个领先的商业 API 未能通过基本的生物特征健全性检查,但其他模型根据发声情况,在自主性、同理心和领导力方面表现出系统性的偏移。我们的研究结果还强调了薪资和领导力认可方面的性别不对称,证明了 SFM 可能会镜像或放大人类的社会偏见。这项工作建立了一个可重复的框架,以确保语音基 AI 中负责任的副语言解释。