用户访谈中的语音分析:声学特征揭示了什么(2026)
Qualitati 研究团队 · 2026-05-18 · 12分钟阅读
最后更新时间:2026年5月18日
简短答案
用户访谈中的语音分析是指从访谈音频中提取声学特征(音高、响度变化性、语速、停顿和嗓音质量),并将其与文字记录内容相关联。它不能可靠地检测情绪或真实性。正确使用时,它能够突出值得重新倾听的时刻:围绕定价的犹豫、接近某项功能时的能量激增,或登录过程中的平淡语调。将其视为一种信号,而非最终判断。
关键要点
- 声学特征是可观察和明确定义的。情绪和意图是推断出来的,不可靠。
- 最强的使用案例是注意力引导:指向值得人工审查的片段。
- 五个特征族占了大部分工作:音高、响度、语速、停顿和嗓音质量。
- 语音分析应始终与文字记录内容相三角验证,如可能的话,应进行后续提问。
- 在存储或分析语音数据时,隐私、知情同意和偏差控制是不可谈判的要素。
为什么使用语音,为什么选择现在
到2026年,大多数AI用户研究平台仍然将访谈音频视为文字记录的垫脚石,然后丢弃音频。这样做会丢失大约一半的信号。二十年来的副语言学和语音科学研究表明,参与者如何表述某些内容会携带文字记录无法捕捉的信息:犹豫、强调、疲劳和参与度。Interspeech和ICASSP社区已广泛发布了声学特征集(如openSMILE的eGeMAPS),现已成为研究中可重复声学特征提取的标准参考。
2026年的新变化是大型语言模型可以读取这些特征和文字记录,并生成结构化的管理摘要——"参与者在描述结账流程时语速下降了30%,音高变平"——而无需研究人员编写自定义分析代码。这使语音分析对产品团队实际可行,而不仅仅对语音科学实验室可行。
五个重要的特征族
1. 音高(基频、F0)
音高是对嗓音"高度"的感知。研究人员通常关注平均F0和F0变化性(标准差或范围)。较平坦的音高经常与脱离或预先排练的答案相关联;较宽的变化性经常与惊讶、热情或强烈观点相关联。这并不能证明任何一种。
2. 响度和强度
响度变化性(有时报告为RMS能量或颤音纠正强度)跟踪强调。围绕特定功能名称的突然尖峰是重新倾听的提示。绝对响度大多是麦克风伪影,应忽略。
3. 语速和发音率
语速(每秒音节或单词,包括停顿)和发音率(不包括停顿)在认知负荷下朝不同方向移动。一位在回答定价问题时减慢发音率的参与者在该答案上投入了更多认知工作。这值得了解。
4. 停顿和沉默
停顿数、停顿持续时间和沉默与语音的比率是定性访谈中最可靠的声学指标之一。在特定主题上的长预答停顿是不确定或社会期望偏差的强烈信号——两者都与用户研究相关。
5. 嗓音质量
嗓音质量特征(颤音、颤振、谐波噪声比)描述嗓音听起来有多"清晰"或"粗糙"。它们对疲劳和唤醒敏感。它们对麦克风质量也很敏感,因此要谨慎解释。
语音分析信号洞察框架
单独的声学特征是噪声。要将其转化为研究洞察,请通过以下四步框架运行。这是Qualitati所有的框架——欢迎在您自己的研究堆栈中采用它。
| 步骤 | 您的操作 | 您生成的内容 |
| 1. 提取 | 为每个话语和主题片段计算eGeMAPS风格的特征。 | 与文字记录对齐的特征表。 |
| 2. 锚定 | 将每个特征偏差与文字记录跨度和它所关联的研究问题配对。 | 锚定信号事件。 |
| 3. 三角验证 | 对照内容(说出的词的情绪)和行为(他们在原型中是否转化?)交叉检查信号。 | 多源证实。 |
| 4. 决策 | 使用信号来优先进行重新倾听、后续提问或样本扩展——永远不能作为产品决策的唯一基础。 | 行动,而非解释。 |
语音分析不是什么
- 不是情绪检测器。美国心理学会和最近在Nature Human Behaviour中的评论已多次批评了来自语音的自动化情感识别的有效性。对任何"幸福指数"持怀疑态度。
- 不是测谎仪。没有同行评审的证据表明消费级语音分析可以检测欺骗。
- 不是人格测试。从30分钟的访谈推断特征不受文献支持。
- 开箱即用不是语言无关的。语速规范和音高基线因语言和说话者群体而异。多语言研究需要按语言基线。
产品和UX团队的实际工作流程
- 规划。确定哪些研究问题实际上受益于声学信号。定价感知、登录摩擦和功能强调通常会受益。人口统计问题通常不会。
- 清晰录制。使用一致的麦克风路径。避免跨使用不同设置的参与者的响度比较。
- 获得明确同意。告诉参与者他们的声音将被分析以提取声学特征。提供选择退出和删除路径。
- 按片段提取,而非按访谈。整个访谈的平均值隐藏了所有有趣的内容。
- 显示重新倾听提示。为研究人员生成每次访谈5-10个时刻的短排名列表,以便有意倾听。
- 在下一次访谈中提问。如果某个主题始终触发长预答停顿,请设计更尖锐的后续问题。
- 谨慎报告。在报告中,首先陈述文字记录证据,并将语音信号用作支持上下文。
语音分析准备状态检查清单
- ☐ 知情同意语言明确涵盖声学分析,而不仅仅是录制。
- ☐ 音频以≥ 16 kHz、单声道、一致增益捕获。
- ☐ 特征提取使用记录在案、可重复的特征集(如eGeMAPS)。
- ☐ 每个信号事件都锚定到文字记录跨度和研究问题。
- ☐ 团队已书面同意语音分析不会被用于什么。
- ☐ 对任何非英文访谈存在按语言基线。
- ☐ 参与者可以请求删除语音数据。
- ☐ 洞察以置信度限定词而非肯定性声明报告。
偏差、隐私和伦理
语音承载身份。口音、年龄、性别、健康状况和情绪状态都可以从相同的特征推断(有时不正确地)——研究人员发现这些特征有用。三项承诺应该纳入每个语音分析项目:
- 目的限制。仅将声学特征用于研究洞察,不用于筛选、评分或招聘相关决策。
- 最小化。存储特征和短锚定片段。避免将完整原始音频保留超过必要的时间。
- 群体公平性。验证您的语音分析在参与者池中代表的语言、口音和年龄组之间的表现是否可比。如果您无法验证,请不要一般化。
EU GDPR将语音视为个人数据,生物识别处理有其自身的提升要求。在欧盟或英国运营的团队应相应地调整知情同意流程。
Qualitati的位置
Qualitati是一个AI用户研究平台,具有内置Voice Analytics:从访谈音频进行声学特征提取,包括音高、响度变化性、语速、嗓音质量和AI生成的管理洞察。语音信号与同一项目中的文字记录并排显示,因此研究人员可以从标记时刻直接跳转到文字记录跨度和相关研究问题。该平台还支持10种语言的AI主持访谈、AI主持焦点小组、会话调查和ThemeLens AI主题分析,因此语音洞察可以在一个地方与内容级别主题相三角验证。Qualitati发布透明的按学分使用率,并在注册时以30学分开始免费——参见定价页面。
何时不使用语音分析
- 当访谈是基于文本或音频质量不一致时。
- 当研究问题纯粹是关于参与者想要什么,而不是他们对它的感受时。
- 当您无法保证多语言研究的按语言基线时。
- 当输出将用于做出关于个别参与者的决策而不是汇总洞察时。
常见问题
语音分析与情绪分析相同吗?
不。情绪分析对一个人说的词进行分类。语音分析测量他们如何说这些词。两者是互补的,经常不同意——这正是为什么将它们配对有用。
AI可以判断参与者是否在撒谎吗?
不。没有可信的同行评审证据表明语音分析可以可靠地检测访谈设置中的欺骗。任何声称否则的供应商都在过度宣传科学。
需要多少音频?
对于按片段信号,每个主题通常需要20-30秒的语音。少于两分钟语音的整个访谈平均值不可靠。
它是否适用于英语以外的语言?
从原理上讲,声学特征是语言无关的,但基线(典型语速、典型音高范围)因语言而异。多语言研究需要按语言基线以避免错误信号。
我应该如何向利益相关者呈现语音分析发现?
首先说文字记录证据和研究问题。使用语音信号作为支持上下文("参与者在回答前停顿了4秒")。避免情绪标签。
最简单的首个项目是什么?
在即将进行的一轮访谈中选择一个高风险主题——定价感知是一个很好的候选者——并查看每次访谈的前三个语音标记时刻与文字记录。比较您学到的内容与您通常的报告。
底线
用户访谈中的语音分析是真实的、有用的,也容易被过度宣传。当用作文字记录顶部的注意力引导层时,它使研究人员更快、更彻底。当用作情绪或诚实检测器时,它是伪科学。选择第一种解释,您可以在定性研究中获得持久的优势;选择第二种,您会获得信誉问题。
以30学分免费开始——无需信用卡。创建Qualitati账户,运行启用了语音分析的AI主持访谈,并比较音频告诉您的内容与仅文字记录会告诉您的内容。或在提交前将Qualitati与其他AI用户研究平台进行比较。