定性访谈的语音分析:情绪、韵律与迟疑(2026)
撰稿:Fengming Liu (UCL) · 审校:Prof. Shubin Yu (HEC Paris) · May 2026 · 更新日期: 2026-05-30 · 14 min read
读一份访谈转录稿,你捕捉到了文字。但你失去了一个艰难回答之前的长时间停顿、在敏感话题出现时收紧的嗓音、涌起的热情、审慎的迟疑。在定性研究中,某事如何被说出往往与说了什么承载着同样多的意义——而这正是语音分析旨在找回的。
本指南为定性研究者讲解语音分析:它测量什么、它如何运作、它如何补充基于转录稿的分析,以及它的限度与伦理责任所在。关于周边的分析过程,请参阅我们的定性数据分析指南。
什么是语音分析?
语音分析是对言语的声音、非言语属性——语气、音高、语速、停顿和情绪线索——的计算分析,以提取超越文字本身的意义。应用于访谈录音时,它为定性研究结果增添一个副语言层,捕捉书面转录稿所抹平的情绪与互动质地。
它研究副语言学:关于言语的一切,除了字面上的文字。两个人可以用相反的含义说出"我没事",而语音分析正是让这一差异成为可分析数据之物。
为何声音在定性研究中重要
定性研究关心意义,而意义部分地存在于表达之中。一处迟疑可能意味着不适或审慎思考;音高的上扬可能标志着兴奋或压力;更快的语速可能传达热情或焦虑。这些线索帮助研究者定位情绪上重要的时刻、察觉文字本身所隐藏的矛盾心理,并解释参与者真正的感受——而不仅是他们所陈述的内容。
语音分析测量什么
情绪与情感
对言语的情绪基调进行分类——例如正面、负面,或诸如压力或热情这样的特定状态——以及它如何贯穿一场访谈而变化。
韵律
言语的音乐性属性:音高(高/低)、语调(一个短语的旋律)、音量和节奏。韵律是大量情绪和强调意义所编码之处。
迟疑与不流畅
停顿、填充词("嗯""呃")、错误开头和修正。迟疑的模式可以表明不确定、不适、认知负荷,或一个敏感话题的临近。
语速与声音动态
某人说话有多快,以及他们的表达如何随时间变化——一个放慢的嗓音、一次突然的加快——为贯穿对话的投入和情绪提供一份动态画像。
它如何运作
这条流水线把声音转为特征再转为解释:音频被处理以提取声学特征(音高轮廓、能量、时长、停顿),机器学习或深度学习模型把这些特征映射到诸如情绪或压力这样更高层级的标签。输出通常是一条时间线,显示声音和情绪信号如何贯穿访谈移动——一条与转录稿对齐的情绪时间线。
语音分析 vs. 转录稿分析
| 方面 | 转录稿分析 | 语音分析 |
| 捕捉 | 所说的文字 | 文字是如何被说出的 |
| 优势 | 内容、主题、语言的意义 | 情绪、强调、迟疑、动态 |
| 错过 | 语气、停顿、情感 | 语义内容 |
| 最佳角色 | 主要分析 | 互补层 |
二者是伙伴,而非对手。当语音分析的信号被叠加到基于转录稿的编码之上时,它最为强大,丰富解释而非取代解释。
研究中的用例
- 定位情绪高峰——在长访谈中快速找到情感骤升的时刻。
- 察觉矛盾心理——浮现自信的言辞与不确定的表达之间的落差。
- 敏感话题研究——识别以声音而非言辞表露的不适。
- 比较分析——比较参与者或群体之间的情绪动态。
- 焦点小组——追踪多名讲话者之间的投入和反应。
优势与局限
优势:找回转录中丢失的意义、可在长录音中规模化,并给出一份客观、带时间戳的声音动态记录。
局限:从声音识别情绪是概率性的,而非确定的;声音表达因文化、个体和语言而异,因此若照单全收,标签可能误导;音频质量强烈影响结果;而自动化"情绪检测"的效度正受到积极争论。把输出当作有待考察的信号,而非定论。
将语音与主题分析整合
实际的工作流是把情绪时间线与你编码后的转录稿对齐。当一个主题与一处声音骤升同时出现——参与者的嗓音恰好在他们讨论你已编码的某个话题时收紧——你便获得了比任一来源单独都更强的三角验证证据。用声音信号来引导细致聆听:在被标记的时刻回到音频,在情境中解释它们,而非径直信任标签。
伦理
- 同意——参与者应知道他们的声音将被分析以获取情绪和声音线索,而不仅是被转录。
- 避免过度断言——不要把概率性的情绪估计呈现为确定的心理事实。
- 文化敏感性——考虑情绪在不同群体间以声音表达的方式差异。
- 隐私——声音是生物特征数据;要安全地存储和处理它。
工具
专用平台替你处理声学处理。QualiTaTi 的语音分析从访谈音频提供情绪检测、言语模式与迟疑追踪,以及声音动态分析,为每场访谈生成一条你可与编码后的转录稿对齐的情绪时间线。
一个实例
- 录制并转录——为关于某敏感健康话题的 15 场访谈采集干净的音频并转录它们。
- 运行语音分析——为每场访谈生成一条情绪时间线和迟疑画像。
- 编码转录稿——照常发展主题。
- 对齐——把情绪时间线叠加到编码后的转录稿上,并标注声音骤升与特定主题相遇之处。
- 解释——在那些时刻回到音频、通过细致聆听加以确认,并把声音证据与引文一并报告。
要点回顾
- 语音分析分析某事是如何被说出的——语气、音高、语速、迟疑——找回转录稿所丢失的意义。
- 它测量情绪、韵律、迟疑/不流畅和言语动态,常以一条情绪时间线呈现。
- 它补充而非取代基于转录稿的主题分析。
- 输出是概率性且因文化而异的,因此把它们当作供细致聆听的信号,而非定论。
- 声音是生物特征数据——要谨慎处理同意、隐私和过度断言。
常见问题
什么是语音分析?
语音分析是对言语的非言语属性——语气、音高、语速、停顿和情绪线索——的计算分析,以提取超越文字的意义,为访谈分析增添一个副语言层。
语音分析能在访谈中检测什么?
它能估计情绪基调、映射韵律(音高、语调、音量、节奏)、追踪迟疑和不流畅,并测量贯穿对话的语速和声音动态,常以一条时间线呈现。
语音分析与转录有何不同?
转录捕捉所说的文字;语音分析捕捉它们是如何被说出的。转录稿分析处理内容和主题,而语音分析增添情绪、强调和迟疑——二者结合时效果最佳。
声音情绪检测准确吗?
它是概率性的,而非确定的。情绪表达因个体、文化和语言而异,且音频质量很重要,因此结果应被当作有待通过细致聆听考察的信号,而非确定的事实。
我如何把语音分析与主题分析结合?
把情绪时间线与你编码后的转录稿对齐。在一处声音骤升与一个已编码主题同时出现之处,你便获得三角验证证据;在那些时刻回到音频,在情境中解释它们。
分析声音有伦理上的顾虑吗?
有。声音是生物特征数据,因此要就声音分析取得知情同意、安全地存储录音、避免对所检测的情绪过度断言,并考虑声音表达上的文化差异。