AI 能识别访谈中的情绪吗?2026 年的现实
Qualitati 研究团队 · 2026-06-19 · 11分钟阅读
简短结论:AI 可以测量访谈中的声音与面部信号——音高、响度、语速、停顿、面部动作——但从这些信号推断出某种具体情绪(“这个人很生气”)在科学上并不可靠。一项具有里程碑意义的 2019 年综述和一项 2025 年的元分析都发现,面部与声音的组合形态无法跨人群、跨情境、跨文化地清晰对应到离散情绪。截至 2026 年 6 月,欧盟《AI 法案》还禁止了大多数职场情绪识别,并将面向客户的情绪 AI 重新归类为高风险。在研究中站得住脚的用法,是把声学与行为特征当作值得追问的线索,而不是可以写进报告的定论。
AI 能识别访谈中的情绪吗?至少不是厂商暗示的那种
2026 年,越来越多的定性研究平台把“情绪 AI”“情感智能”或微表情分析包装成在用户访谈和焦点小组中发现“突破性时刻”的手段。这套说辞很有诱惑力:让 AI 告诉你参与者何时兴奋、沮丧或犹豫,这样你就不会错过信号。若干厂商明确把这些功能锚定在 Paul Ekman 的“普遍情绪”框架和语调分析上(Listen Labs,2026)。
问题在于,支撑这套说辞的科学本身存在争议——而围绕它的监管已明显收紧。如果你从事用户研究、市场研究或 UX 研究,就需要清楚访谈中的情绪 AI 究竟能提供什么、不能提供什么,以及法律边界如今划在哪里。本文把可测量的部分与被营销的部分区分开来。
核心要点
- 信号是真实的;情绪标签并不可靠。AI 可以准确测量声学与面部特征。把这些特征映射到某个具名情绪,才是薄弱环节。
- 科学证据不支持简单推断。Barrett 等人(2019)回顾了约 1,000 项研究,未发现从面部动作读取情绪有强有力的支持;一项 2025 年关于表情与情绪共现的元分析得出了一致的结论。
- 监管已经变化。欧盟《AI 法案》禁止在职场使用情绪识别(2025 年 2 月 2 日生效),并自 2026 年 8 月 2 日起将面向客户的情绪 AI 视为高风险。
- 把特征当线索,而非结论。发声用力度的骤升是追问一个问题的理由,而不是在报告中给参与者贴上“沮丧”标签的证据。
- 要求透明度。询问任何厂商:它输出的是原始特征还是推断出的情绪,以及任何情绪结论背后有哪些验证依据。
AI 在访谈中真正能测量什么
测量与推断之间存在实质差别。现代语音与视觉模型可以从访谈音视频中提取客观、可复现的信号:
- 声学特征:基频(音高)、响度及其变异性、语速、停顿结构,以及抖动(jitter)和微颤(shimmer)等嗓音质量指标。
- 语言特征:用词选择、模糊限制语、文本情感倾向、迟疑标记(“嗯”“我猜”)。
- 面部动作特征:动作单元——构成某一面部形态的具体肌肉动作。
这些都是正当且可测量的量。让平台陷入麻烦的一跃是下一步:宣称某一特征模式就是某种特定情绪。Barrett 及其同事指出,连“情绪表达”这一术语本身——都夹带了一个未经证实的假设,而“面部形态”或“面部动作模式”才是更诚实的描述(Barrett 等,Psychological Science in the Public Interest,2019)。
为什么情绪推断不可靠:证据
反对简单情绪检测并非小众立场,而是大规模证据综合研究的结论:
- Barrett 等人(2019)回顾了约 1,000 篇论文,结论是:认为情绪可以可靠地从面部表情中读出的常见观点缺乏科学支持。同一种面部形态会出现在不同情绪中,而同一种情绪也会因人、情境和文化的差异产生不同的面部形态(APS 摘要,2019)。
- 一项发表于 Affective Science 的 2025 年元分析考察了情绪是否真的与其被预测的面部表情共同出现,结果发现共现程度很弱——进一步说明表情并非内在状态的诊断性“指纹”(Affective Science,2025)。
- 公民自由组织与专家评述也一再指出,商业情绪识别“缺乏科学基础”(ACLU,2019)。
声音通道存在同样的问题。语调确实携带信息,但同一种声学模式(比如音高升高、语速加快)可能反映兴奋、焦虑、强调,或者仅仅是一种生动的说话风格。脱离情境,这个标签只是被包装成测量结果的猜测。
这并不是主张忽略语音与行为,而是主张止步于证据:报告信号,让人类研究者在情境中去解释它。
监管已经改变:欧盟《AI 法案》与情绪识别
即便情绪 AI 在厂商演示中“足够好用”,截至 2026 年,法律基础也已发生变化:
- 职场禁令(2025 年 2 月 2 日生效):依据第 5 条,欧盟《AI 法案》禁止推断职场和教育场景中人员情绪的 AI 系统,仅对医疗或安全用途保留狭窄例外(Future of Privacy Forum,2025)。该禁令涵盖从包括语音和面部在内的生物特征数据推断情绪。
- 高风险重新归类(自 2026 年 8 月 2 日起):仍被允许的面向客户的情绪识别,在附件 III 下被视为高风险,触发繁重的合规义务(CX Today,2026)。
- 没有放松:欧盟委员会 2025 年 11 月的审议拒绝放宽禁止性做法清单,法案本身也把“可靠性有限”列为限制的核心理由(欧盟委员会,AI 法案)。
对研究团队而言,实际含义很具体:如果你访谈的是员工,或处于雇佣、教育情境中的参与者,那么推断情绪的工具在欧盟可能被彻底禁止——无论它声称多么准确。以上不构成法律意见;请就你所在司法辖区和具体用途咨询律师。但它应当改变你的采购问题清单。
原创工具:情绪 AI 宣称审核表(面向研究采购方)
用这份评分表评估任何主打情绪、情感或“情感智能”功能的平台。逐行打分:0 = 不合格,1 = 部分满足,2 = 明确满足。总分 10–14 表示做法站得住脚且透明;0–5 表示营销跑在了证据前面。
| 审核问题 | “达标”是什么样 | 得分(0–2) |
| 它输出的是特征还是情绪标签? | 呈现原始声学/行为特征;标签被明确标注为推断结果 | |
| 任何情绪结论是否经过验证? | 为任何情绪输出给出准确率、适用人群与适用条件 | |
| 它是否承认情境依赖性? | 明确说明同一信号可能含义不同 | |
| 是否保留人在回路中? | 特征用于提示研究者追问,而非自动下结论 | |
| 它是否具备监管意识? | 就职场/客户场景说明其欧盟《AI 法案》合规立场 | |
| 是否处理了跨文化效度? | 不假定表情与情绪存在普遍映射 | |
| 你能否导出底层数据? | 原始特征可导出以供独立审计 | |
这是一份规划辅助工具,而非最终裁决。请按你的情境给各行赋予权重——跨文化效度对多语种或全球研究更重要;监管对欧盟或职场研究更重要。
如何负责任地使用声音与行为信号
诚实而有用的工作流,把信号视为引导注意力的线索,而非结论:
- 先测量,再追问。当发声用力度骤升或参与者出现迟疑时,那是提示你去问“能再多讲讲吗”的信号——无论是在当场还是在分析阶段——而不是写下“参与者感到沮丧”的许可。
- 锚定到说了什么。把任何信号与逐字引语及其上下文配对。转录文本才是证据;声学特征只是指向它的指针。
- 让人来决定。对情感的解释是研究者的判断,需要模型并不具备的文化与情境背景。
- 报告不确定性。如果你要总结语调,请写“此处发声用力度更高”,而不是给内在情绪状态命名。
- 核查司法辖区。对于职场或欧盟场景的研究,先确认情绪推断是否被允许,再决定是否启用。
Qualitati 的定位
Qualitati 是面向产品、UX 和客户洞察团队的 AI 用户研究平台。其 Voice Analytics 正是围绕本文所强调的这一区分构建的:它从访谈音频中提取声学特征——音高、响度变异性、语速和嗓音质量指标——并把 AI 生成的管理洞察作为锚定于转录文本的线索呈现,而不是把参与者的离散情绪断言为事实。AI 主持的访谈、焦点小组和对话式问卷始终让研究者掌控解释权,ThemeLens 主题分析则把结论回溯到有参与者出处的引语。
这是与 Qualitati 方法论优先定位一致的刻意设计取舍:它是 NVivo、Qualtrics、ATLAS.ti 和 MAXQDA 的 AI 原生替代方案,也是 Outset.ai、Strella 和 Listen Labs 的透明定价替代方案——同时不会过度兜售自己无法验证的情绪识别能力。如果你需要一套声称能自动读取离散情绪的系统,Qualitati 有意不是那种工具。
局限与取舍
几点诚实的说明。第一,部分情感计算研究确实报告了高于随机水平的情绪分类结果,但那是在受控的、类实验室的条件下——本文的批评针对的是可靠性以及向真实、多语种、带情境的访谈的推广性,而不是主张信号毫无意义。第二,声学特征本身对某些任务仍可能有信息价值(例如标记出值得复看的片段),即使情绪标签并不可信。第三,监管因司法辖区而异且在不断演变;上文的欧盟《AI 法案》细节截至 2026 年 6 月是准确的,但仍应就你的具体情况与律师核实。我们建议对任何涉及方法论敏感性或情感判断的结论,先经人工复核再加以采信。
常见问题
AI 能从访谈语音中准确识别情绪吗?
AI 可以准确测量音高、响度和语速等声学特征。但把这些特征可靠地映射到某个具名情绪,缺乏充分的证据支持,因为同一种声音模式可能因人、因情境反映不同的状态。请把语调当作值得追问的线索,而不是定论。
在欧盟,情绪识别用于研究是否合法?
这取决于具体情境。截至 2026 年 6 月,欧盟《AI 法案》禁止在职场和教育场景中推断情绪(2025 年 2 月 2 日生效),并将获准的面向客户的情绪 AI 视为高风险(自 2026 年 8 月 2 日起)。请就你的具体用途咨询法律顾问;本文不构成法律意见。
Barrett 2019 年的研究发现了什么?
Barrett、Adolphs、Marsella、Martinez 和 Pollak 回顾了约 1,000 项研究,结论是:从面部动作读取情绪缺乏有力的科学支持,因为表情与情绪的映射会随情境、个体和文化而变化。
购买前我应该向情绪 AI 厂商问什么?
问它输出的是原始特征还是推断的情绪标签、任何情绪结论背后有哪些验证(准确率、适用人群、适用条件)、是否保留人在回路中,以及它如何符合欧盟《AI 法案》。可使用上文的情绪 AI 宣称审核表。
Qualitati 会识别情绪吗?
Qualitati 的 Voice Analytics 提取声学特征,并把锚定于转录文本的洞察作为线索呈现,供人类解释。按照设计,它并不兜售自动化的离散情绪判定。
结论
有价值的问题不是“AI 能识别访谈中的情绪吗”,而是“AI 能测量什么,又该由谁来解释”。可测量的信号——发声用力度、节奏、迟疑、面部动作——是真实的,也值得呈现。而跃向一个自信的情绪标签,正是科学与监管共同反弹之处。请这样设计你的工作流:让信号引导人的注意力,而不是取代人的判断。
免费开始,赠送 30 点额度,无需信用卡,即可开展带转录锚定 Voice Analytics 的 AI 主持访谈、焦点小组或对话式问卷。创建免费账户、查看透明定价,或阅读 Voice Analytics 如何呈现声学特征。