AI 辅助访谈有哪些伦理风险?2026 年 17 名访谈者研究解读
Qualitati 研究团队 · 2026-07-16 · 8 分钟阅读
AI 辅助访谈是指在实时的半结构化访谈中,由 LLM 向人类访谈者建议追问问题。Zhang 及其同事在 2026 年的一项研究中让 17 名访谈者在这一情境下开展访谈,发现其风险主要不在于问题质量,而在于尊重、问责,以及当 AI 在“旁听”时究竟是谁在承担暴露风险。
这项研究测试了什么?
研究者并未部署真实的 AI 追问助手,而是采用“绿野仙踪”(Wizard-of-Oz)范式对其进行模拟。根据 Zhang、Liu、Guan、Cai 和 Carroll(2026)的描述,每场实验包含三个角色:研究受访者担任主访谈者;一名研究人员扮演被访者(“Oz”);另一名研究人员(“Wizard”)在被访者每次回答后向 GPT-4o 请求一到三个候选追问问题,再有选择地转述或修改。主访谈者听到这些建议时,会以为它们来自一位协同访谈者。
这一设计至关重要。它保留了大多数 AI 访谈试点悄然去掉的环节:由一个人当场判断,机器生成的问题是否应该被提出。论文将其称为“LLM-in-the-loop”——模型负责提议,人负责定夺。
样本为 17 名访谈者(10 名女性、7 名男性,年龄 21–35 岁),定性研究方法经验参差不齐:10 名新手,5 名中级(发表过 1–3 篇经同行评审的定性研究论文),2 名高级(3 篇及以上)。作者明确指出,样本偏向新手和中级研究者。
有一个方法论选择值得特别指出,因为它影响了后续所有结论。受访者首先在未被告知问题来自 LLM 的情况下评估这些追问,之后才被告知真相,并被要求反思伦理与责任问题。因此,这项研究同时捕捉到了“不知情”时的直觉反应和“知情”后的判断。
五类担忧是什么?
受访者提出了五类相互关联的担忧。它们值得作为一个整体来理解,因为每一类都从不同角度回答了同一个问题:“一旦出错,代价由谁承担?”
| 担忧 | 实践中的表现 | 谁承受伤害 |
| 有害或歧视性语言 | 模型生成“非常怪异的言论”、歧视性措辞,或越过访谈者本不会越过的边界的问题 | 被访者 |
| 尊重受损 | 访谈者的注意力在人与屏幕之间分散;非言语线索被忽略 | 被访者 |
| 参与不平等 | 技术门槛将部分人排除在外——论文将此描述为基于知识的歧视 | 潜在受访者 |
| 责任不清 | 当 AI 生成有害内容时,没有人明确负责——模型供应商、研究者还是机构 | 无人承担,而这恰恰是问题所在 |
| 隐私与合规 | 会聆听、录音或转写敏感内容的 AI 带来信息泄露与监管风险 | 被访者与机构 |
为什么“尊重”这一发现最值得关注?
因为这是一种再好的提示词也无法消除的代价。第一类担忧——模型产生不当语言——是可以通过工程手段解决的问题:可以过滤、约束和审核。第二类则是结构性的。一位正在阅读 AI 建议的访谈者,从定义上就无法全神贯注于面前的人。研究中的受访者将这种注意力分散体验为对被访者的不尊重,同时也意味着丢失了非言语信号——而正是这些信号告诉经验丰富的访谈者何时该追问、何时该停下。
对于任何开发或采购这项技术的人来说,这种权衡才是真正的设计问题。一个提升了追问深度却损害了融洽关系的追问助手,可能产出看似更丰富的访谈记录,而访谈体验本身却更糟。无论是自动化质量指标还是字数统计,都发现不了这一点。
问责缺口又如何?
第四类担忧最可能引起研究伦理委员会的关注。在传统访谈中,如果某个问题造成了伤害,问题由访谈者提出,也由访谈者负责。而在 LLM-in-the-loop 的设置中,这条责任链多出了一环——当转述的 AI 问题造成伤害时,研究中的受访者无法确定责任应落在何处。
这并非假设性问题。它决定了知情同意书写什么、伦理委员会批准什么,以及受访者投诉时如何处理。论文的回应是将每一类风险对应到具体的缓解策略:具有偏差意识的提示词、强制性的人工监督、无障碍的界面、明确的问责框架,以及贯彻“隐私始于设计”并定期审计。这些措施都不新奇,但每一项都要求有人事先确定由谁来承担责任。
这对研究者意味着什么
如果你正在考虑在实时访谈中引入 AI 辅助,以下三点值得注意。
- 在转述环节保留人工把关,并公开说明。这项研究的整体设计都以“有人可以修改或舍弃任何建议”为前提。直接向受访者抛出 AI 问题的工具,测试的是另一种风险更高的情境,而不是本文所评估的情境。
- 在开展访谈之前就确定信息披露政策,而不是事后补救。研究刻意区分了披露前与披露后的反思,说明作者预期“知情”会改变判断。你也应假定受访者的反应同样会改变。
- 将转写和录音视为合规的核心环节。第五类担忧才是大部分机构风险的真正所在——问题不在于提问有多巧妙,而在于系统听到并存储了什么。
如果你开展的是完全由 AI 主持的访谈,而非 AI 辅助访谈,这些担忧并不会消失,而是会发生转移。没有人类访谈者可被分心时,注意力分散的问题随之消失;但问责与隐私问题会更加尖锐,因为此时模型是唯一的提问者。正因如此,我们的 AI Interviewer 围绕明确的追问规则和可审阅的访谈记录构建,而 ThemeLens 则让分析环节保持可审计而非黑箱。但坦率地说,这篇论文告诉我们:工具选择是治理选择的下游结果,而不能替代治理选择。
常见问题
AI 辅助访谈能否提升追问深度?
本研究并未将追问深度作为结果变量加以测量。其研究动机是:访谈者的认知负荷和有限的领域熟悉度可能制约追问,但此处报告的发现关注的是伦理担忧,而非数据质量。追问深度能否提升,仍应视为一个悬而未决的问题。
“绿野仙踪”研究能公平地检验真实的 AI 工具吗?
对于有人工监督的版本,这是一种公平的检验。Wizard 可以修改和保留建议,这近似于研究者在使用前审核 AI 输出的部署方式。但它无法告诉你在完全自动化的系统中会发生什么。
这些发现的可推广性如何?
需谨慎看待。研究仅有 17 名受访者,大多为新手或中级定性研究者,年龄在 21 至 35 岁之间——作者本人也指出了这种偏向。这些担忧可以作为讨论议程,但不能当作总体估计。
应该向被访者披露 AI 辅助吗?
论文关于隐私和责任的发现强烈指向“应该”,而且大多数机构审查流程也会有此要求。研究本身的设计——测试披露前后的反应——表明信息披露的影响足够大,值得事先审慎规划。
来源
Zhang, H., Liu, Y., Guan, X., Cai, J., & Carroll, J. M. (2026). Ethics and Social Responsibility in AI-Assisted Interviewing: An LLM-in-the-Loop Study of AI-Generated Follow-Up Questions. arXiv:2606.30980. 已被 CHIWORK '26 接收。
最后更新:2026 年 7 月 16 日
本文是对第三方研究的独立编辑摘要。Qualitati 与论文作者无任何关联,超出论文本身主张的解读均为我们的观点。读者应查阅原论文,以了解其完整论证与局限。