AI 访谈者为什么只会附和,却从不深挖?
Qualitati 研究团队 · 2026-09-07 · 9 分钟阅读
简短回答:因为"附和"是最安全的默认行为。在 2026 年 8 月一项针对实时多模态 LLM 访谈者的研究中,深入追问仅占全部对话轮次的 4.9%,而 28.7% 的提问轮次把多个问题塞进了同一轮。模型听起来很专注,收集到的却是浅层数据。追问深度必须靠设计实现,不能想当然。
核心要点
- 开箱即用的多模态 LLM 访谈者重附和、轻追问:它确认受访者所说内容的频率,远高于深挖内容的频率(Zhang 等,2026)。
- 问题堆叠是最常见的自伤行为。把三个问题打包进一轮,受访者只会回答最容易的那个,其余的被丢掉。
- 四类数据采集故障反复出现:信息丢失、过早结束、延迟和打断。其中三类属于传输与轮次管理问题,而非提示词问题。
- 社交压力降低是把双刃剑:受访者更愿意坦白,但回答更浅,因为没有人明显地在等他们继续说下去。
- 访谈中的信任更多取决于受访者感知到的机构分量,而非对话流畅度。谁在提问,比机器人说得多顺畅更重要。
- 正式投放研究之前,先用下文的"追问深度审计"检查一份试访记录。大约二十分钟,就能发现绝大部分问题。
研究发现:一个很专注却从不深挖的访谈者
2026 年 8 月 11 日,He Zhang、Kambinachi Chukwuma、ChanMin Kim 与 John M. Carroll 发布了 《When the Interviewer Is a Bot: Behavior, Breakdowns, and Trust in MLLM-Led Interviews》。这项研究的设计有一处很实用的特别之处:作者构建的语音系统 InterviewBot 并非作为新架构提出,用他们自己的话说,它是一台研究仪器,用于观察当你只是要求一个实时多模态 LLM 去做半结构化访谈时,它默认会做什么。
15 名受访者完成了由机器人主持的半结构化访谈,每场之后都有一次由人类主持的复盘。研究团队编码了 428 个对话轮次。
支撑整篇论文的是两个数字:
| 行为 | 报告占比 | 对你的数据意味着什么 |
| 深入追问 | 占全部轮次的 4.9% | 大约每二十轮才有一轮越过了第一层回答。访谈的大部分停留在表面。 |
| 多问题轮次 | 占提问轮次的 28.7% | 接近三分之一的问题是打包抛出的——尽管指令明确禁止这样做。 |
第二个数字才是研究团队真正该担心的,因为它是在明确指令禁止的前提下依然发生的。一句"每次只问一个问题"的提示词并不是控制手段,它只是一个模型十次里满足七次的偏好。
为什么堆叠提问会摧毁深度
当受访者听到"那让你感觉如何,和上次有什么不一样,你还会再用吗?"时,他们会回答最后一个或最容易的那个。访谈者用掉了自己的一轮,受访者也用掉了一轮,而你真正关心的那两个问题既没被问到,也没有留下任何标记。访谈记录里不会显示这次损失。你回头读时,会把它当作一次完整的交流。
这正是 AI 主持研究的隐性失效模式:它不会产出明显糟糕的访谈记录,而是产出看似合理、实则比表面更单薄的记录。
四类故障——以及提示词能修哪些
该研究识别出四类反复出现的数据采集故障。按它们真正的所在层级归类,才是可操作的做法:
| 故障 | 所在层级 | 提示词能修吗? | 真正的解法 |
| 信息丢失 | 对话策略 | 部分可以 | 覆盖度追踪——主持方持有一份未回答子问题的清单并主动回访 |
| 过早结束 | 对话策略 | 部分可以 | 为每一节设定明确的完成标准,而不是轮次预算 |
| 延迟 | 传输 / 模型 | 不能 | 流式语音管线、更低的首字延迟、填充语管理 |
| 打断 | 轮次管理 / VAD | 不能 | 针对思考停顿调优的端点检测;插话处理 |
一半的失效面属于基础设施。如果你在评估 AI 访谈平台,而演示只给你看一个提示词编辑器,那你只看到了系统的一半。请追问:当受访者在话说到一半时停顿四秒会发生什么——对于没有专门调优的语音活动检测器来说,一次真正的思考停顿和一句说完的话是无法区分的。
社会性发现:压力更小,深度更浅
受访者复盘环节浮现出三种动态,它们让"AI 能消除社会赞许性偏差"这一常见说法变得复杂。
1. 披露程度的自我调节
社交压力降低与更浅的回答相关。让敏感话题更容易说出口的那种"没有人在看着",同时也移除了继续说下去的对话义务。人类访谈者获得深度,部分正是靠那种让人忍不住去填补的沉默。
2. 机构的正当性
信任反映的是受访者感知到的组织分量,而非对话技巧。受访者在判断的是谁在做这项研究,而不是机器人听起来有多自然。这是多数团队闲置未用的设计杠杆:一个明确的发起方、一句清楚的研究目的、一个真实的知情同意页面,很可能比再调一轮人设带来更多坦诚。
3. 对话的落地
受访者更看重基于内容的复述,而不是泛泛的社交填充语。"听起来挺让人沮丧的"是填充语;"所以你已经重命名了文件之后导出才失败的——你有再试一次吗?"才是落地。它证明访谈者记住了细节,也因此换来了下一个回答。
Qualitati 追问深度审计
这是一份原创清单,正式投放研究前可用于一份试访记录。取一场完成的试访,统计轮次,逐项打分,大约需要二十分钟。
| # | 检查项 | 如何测量 | 通过阈值 |
| 1 | 追问率 | 深入追问数除以主持方全部轮次。深入追问指引用受访者刚说过的内容并要求展开。 | 不低于主持方轮次的 20% |
| 2 | 问题堆叠 | 包含一个以上问题的主持方轮次,除以提问轮次 | 10% 或更低 |
| 3 | 有据复述 | 引用或复述了具体细节(而非泛泛情绪)的附和占全部附和的比例 | 不低于附和的 50% |
| 4 | 覆盖度 | 实际获得回答的提纲子问题,除以提纲中的子问题总数 | 不低于 90% |
| 5 | 被遗弃的线索 | 受访者主动提出但主持方再未回访的话题数量 | 每一节为零 |
| 6 | 打断率 | 在受访者话语结束前就开始的主持方轮次 | 不超过轮次的 2% |
| 7 | 回答长度趋势 | 受访者字数中位数,访谈前三分之一与后三分之一对比 | 下降不超过 30% |
第 1 至 3 项中有两项不通过,说明是提示词与对话策略的问题。第 6 或第 7 项不通过,说明是传输或疲劳问题,再怎么改写提示词也无济于事。
一份可直接贴进提纲的追问阶梯
深度是一个序列,而不是一个问题。为每个重点话题给主持方一份明确的阶梯:
- 唤起:"带我回顾一下上次发生这种情况的时候。"
- 具体化:"你说它坏了——屏幕上当时显示了什么?"
- 对比:"这和它正常工作时有什么不同?"
- 后果:"你接下来做了什么?"
- 意义:"这件事让你对这个工具产生了什么看法?"
一轮爬一级。这个阶梯同时给了你一个可计数的审计指标:对于一个重点话题,主持方实际爬上了几级?
Qualitati 在其中的位置
Qualitati 是一个面向产品、UX 和客户洞察团队的 AI 用户研究平台。它支持文字与语音的 AI 主持访谈、AI 主持焦点小组,以及带有 AI 驱动追问和分支逻辑的对话式问卷,并通过 ThemeLens 主题分析和 QDA Workspace 完成结果分析。
平台中有三个部分直接针对追问深度问题:
- 访谈提纲结构。由于 AI 访谈者依据的是结构化提纲而非一段自由文本指令,覆盖度是对照已定义的章节来追踪的,而不是交给模型自行裁量。
- Active Listener 模式。当访谈由人类主持时,Qualitati 会向访谈者实时提供提示和章节进度追踪。这正是 AI 辅助访谈文献反复得出的人在回路配置——LLM 是人类判断的补充,而不是替代(Zhang 等,2025)。
- Voice Analytics。语速、音高、响度变异性、嗓音质量等声学特征,提供了单靠字数无法捕捉的参与度信号——而这恰恰在回答变短时最有用。
我们并不声称 Qualitati 对这项研究中的行为免疫。任何构建在通用 LLM 之上的 AI 主持方,都会继承同样的、偏向附和的默认倾向。关键在于:追问深度是你手中这台仪器的一项可测量属性,你应当在自己的试访记录上测量它,而不是相信任何厂商的说法——包括我们的。
局限,以及何时不该使用 AI 主持
请如实看待这项源研究。15 名受访者和 428 个轮次是一项实践性研究,不是基准测试;作者将其定位为对某一系统在某一时间点默认行为的观察。模型行为变化很快,换一套语音栈、换一套端点检测参数,打断相关的数字就会不同。
Zhang 及其同事在 CHIWORK '26 上的研究——一项由 17 位定性研究者(10 位新手、5 位中级、2 位资深)参与、转述 GPT-4o 生成追问的 Wizard-of-Oz 设计——补充了五项值得权衡的伦理张力:实时生成中的语言风险、对融洽关系的损害、对技术不熟悉者的参与不平等、AI 出错时的责任归属模糊,以及实时录音与转录带来的隐私暴露。
何时不该使用 AI 主持:
- 创伤、丧亲、临床或涉及保护义务的话题——一次失当的追问无法挽回。
- 全部价值集中在单个深度个案的研究——例如 6 场高管访谈,每一小时都不可替代。
- 界面本身构成障碍的人群,除非你已专门针对他们做过试访。
- 任何你无法公开说明"谁为主持方说的话负责"的场景。
多数团队最终采用的混合模式并不炫目,但很稳妥:用 AI 主持覆盖广度——结构化探索、概念检验、持续反馈;在深度、敏感性或判断力才是关键的地方,由人类主持。
结论
一个热情附和、极少追问的 AI 访谈者,会产出经得起快速浏览、却经不起综合分析的访谈记录。2026 年 8 月 InterviewBot 研究报告的 4.9% 追问率和 28.7% 问题堆叠率,并不是对 AI 主持研究的判决书;它们描述的是你若不加以设计对抗,就会默认继承的行为。先在一份试访上跑一遍追问深度审计:第 1 至 3 项去修对话策略,第 6 和第 7 项去修语音栈。然后再正式投放。
适合谁阅读
正在评估或已在运行 AI 主持访谈的 UX 研究者与研究运营负责人;在阅读 AI 生成的访谈记录、疑惑洞察为何单薄的产品经理;正在为 AI 研究技术栈制定质量标准的洞察负责人。
常见问题
访谈中的"深入追问"是什么?
深入追问指主持方的一个轮次,它引用受访者刚说过的内容并要求展开——要求更具体、举例、对比,或受访者赋予它的意义。它不同于附和(表示在听但不索取更多),也不同于新话题提问(转向别处)。
AI 访谈者应该多久追问一次?
目前没有公认标准。作为半结构化探索的工作目标,我们建议至少 20% 的主持方轮次应为深入追问;并建议把 Zhang 等(2026)报告的 4.9% 作为默认行为的地板值来对照自查,而不是当作可接受水平。
提示词工程能解决 AI 访谈过浅的问题吗?
只能部分解决。在该研究中,问题堆叠在明令禁止的情况下依然存在,所以仅靠提示词并不可靠。结构性控制更有效:由对话策略强制执行的"每轮一问"、每一节的完成标准,以及会回访未回答子问题的覆盖度追踪。延迟和打断则是提示词完全触及不到的基础设施问题。
AI 主持访谈能减少社会赞许性偏差吗?
证据是混合的,值得谨慎表述。在 2026 年这项研究中,社交压力的降低既伴随更容易的坦白,也伴随更浅的回答。移除观众,同时移除了顾虑和展开叙述的义务。
让 AI 听起来更像人,会提升信任吗?
主要不会。该研究中受访者的信任反映的是感知到的机构分量——谁在做这项研究、为什么做——而非对话技巧。明确的发起方、清楚的目的和真实的知情同意,杠杆很可能高于语音的拟真度。
我该如何审计一份 AI 访谈记录的质量?
用上文的七项追问深度审计检查一份试访记录:追问率、问题堆叠、有据复述、覆盖度、被遗弃的线索、打断率和回答长度趋势。第 1 至 3 项不通过指向对话策略;第 6 和第 7 项不通过指向语音栈。
下一步
在下一项研究开始前,先在你自己的试访上跑一遍这份审计。如果你想实际投放一场,可以免费开始,赠送 30 个 credits——无需信用卡——并查看透明定价了解按 credit 的使用费率。你也可以对比语音与文字 AI 访谈,阅读我们关于受访者为何中途退出 AI 访谈的分析,或回顾 AI 主持研究中的知情同意。
最后更新:2026 年 9 月 7 日。本文是对公开研究的独立编辑性摘要,与被引用作者无隶属关系,亦未获其背书。关于 AI 主持方行为的方法论主张,应结合你自己的试访数据加以验证。