AI 能做研究访谈吗?2026 年实地研究结果
Qualitati 研究团队 · 2026-07-31 · 8 分钟阅读
AI 能开展真正的研究访谈吗?Wuttke 等人 2026 年的一项研究围绕移民态度,对 571 名受访者开展了由 AI 主持的对话式访谈,发现 AI 访谈能够揭示标准化问卷遗漏的推理过程,而且受访者对 AI 访谈的评价不低于甚至高于问卷。AI 访谈是可行的,但访谈方式(语音或文字)影响很大。
这项研究检验了什么?
研究者检验了大语言模型能否以问卷的规模开展开放式、半结构化访谈。在论文 AI Conversational Interviewing: Scaling Up Semi-Structured and In-depth Interviews(Wuttke、Lang、Klamm、Würschinger & Kreuter,2026)中,来自 Prolific 和 Payback 样本库的受访者先由 AI 主持人就移民政策进行访谈,随后填写一份内容对应的标准化问卷,从而对两种数据收集方法进行直接比较。
关键在于,这项研究的设计针对的是研究领域长期存在的一个矛盾:深度与规模之间的权衡。由人工开展的深度访谈内容丰富,但耗时且成本高;问卷可以大规模发放,却会抹平细微差异。研究要回答的问题是:AI 访谈员能否在保留问卷覆盖面的同时,提供定性访谈的一部分深度?
AI 访谈员是如何搭建的?
据 Wuttke 等人(2026)介绍,文字访谈员基于 OpenAI 的 GPT-4o(模型 gpt-4o-2024-11-20,temperature 0.8),语音访谈员使用 OpenAI 的 GPT Realtime 模型(gpt-realtime-2025-08-28,temperature 0.7)。值得注意的是,研究团队报告称,将文字访谈员切换到 GPT-5 后出现了"访谈员表现的明显下降"——这提醒我们,更新的模型并不自动意味着更好的访谈员。
受访者被随机分配到三种条件:
- 语音——与 AI 进行口头对话。
- 文字/聊天——以打字方式对话。
- 自由选择——受访者自选偏好的方式。
最初分配的 1,039 名受访者在各条件间没有显著失衡(χ²(2)=3.67,p=0.159),最终分析样本为 N=571,均完成访谈且与问卷记录相匹配。
语音还是文字:哪种访谈内容更丰富?
语音访谈产生的内容明显更多。根据 Wuttke 等人(2026)的数据,具体如下:
| 指标 | 语音访谈 | 文字访谈 |
| 每位受访者平均字数 | 608.8 | 299.8 |
| 平均时长 | 8.3 分钟 | 11.5 分钟 |
| 说话/打字速度 | 52.5 词/分钟 | 21.1 词/分钟 |
简而言之,语音访谈产生的字数约为文字访谈的两倍,而且用时更短,因为说话比打字快。但也有代价:流失集中在纯语音条件中;当受访者可以自由选择时,他们"绝大多数选择了聊天方式"。作者将语音条件的流失归因于其实现中"可以改进的不足",而非语音访谈本身的根本局限——这说明瓶颈在于语音交互体验,而不在于这一方法本身。
受访者如何评价 AI 访谈?
评价是正面的。在完成访谈的受访者中,对 AI 访谈的评价在所有方式下都不低于甚至高于标准化问卷(Wuttke 等人,2026)。这一点很重要,因为对 AI 访谈的常见质疑是它会让人感觉冷漠或受挫;而在这里,完成访谈的人反而更喜欢它,而不是熟悉的问卷形式。研究留下的悬而未决的问题是完成率,而非满意度:如何让人们坚持完成访谈——尤其是语音访谈——仍是需要继续做设计工作的地方。
AI 访谈揭示了哪些问卷没能发现的内容?
最核心的方法论发现是:对话记录揭示了"全面的标准化量表组无法捕捉的考量和推理"。AI 访谈发现,在问卷上态度得分相近的受访者,对移民问题持有明显不同的心智模型。两个人可能出于完全不同的理由在 7 点量表上选了同一个分值——只有开放式对话才能让这种差异显现出来。这正是支持 AI 访谈的核心论据:它在不放弃规模的前提下,找回了数字背后的"为什么"。
这对研究者意味着什么
对学术、UX 和市场研究者来说,有三点实用启示尤为突出:
- AI 访谈如今已是一种真正的研究方法,而不只是演示。一项有 571 人参与、并与问卷数据相关联的研究,是对该方法用于观点和体验研究的有力验证。
- 访谈方式是一项设计决策。语音能带来更丰富、更长的回答,但流失率更高;在可以选择时,人们默认选择聊天。同时提供两种方式,并在语音交互体验上投入,是务实的做法。
- 用访谈来解释问卷,而不只是替代问卷。最大的收获是发现了相同问卷得分背后截然不同的推理。将简短问卷与 AI 访谈结合,就能同时获得分布和机制。
如果你想开展此类研究,QualiTaTi 的 AI Interviewer 可以大规模开展语音或文字访谈并自动转录,随后 ThemeLens 可以对访谈记录进行主题编码——把研究中所说的"为什么"转化为结构化分析。
常见问题
AI 能在定性研究中取代人工访谈员吗?
不能完全取代,但可以大幅扩展访谈规模。这项 2026 年的研究表明,AI 主持的访谈能捕捉问卷遗漏的推理,并获得受访者的好评,因此非常适合招募人工访谈员不现实的大样本观点和体验研究。
语音和文字 AI 访谈哪个更好?
二者服务于不同目标。语音产生的字数约为文字的两倍(608.8 对 299.8 词),回答也更快,但流失率更高;在可以自由选择时,大多数受访者选择了文字。若追求最大的内容丰富度,应采用语音并做好交互体验;若重视完成率和舒适度,则应提供聊天方式。
这项研究使用了哪个 AI 模型?
文字访谈员使用 OpenAI 的 GPT-4o,语音访谈员使用 OpenAI 的 GPT Realtime 模型。作者发现在访谈任务上 GPT-4o 的表现优于 GPT-5,说明模型选择应经过验证,而非想当然。
AI 访谈相比问卷真的有额外价值吗?
有——研究发现,问卷态度得分相同的受访者,其背后的心智模型存在实质差异,而这些差异只有对话数据才能揭示。AI 访谈能找回数字背后的推理。
原始文献:Wuttke, A., Lang, M. M., Klamm, C., Würschinger, Q., & Kreuter, F. (2026). AI Conversational Interviewing: Scaling Up Semi-Structured and In-depth Interviews. arXiv:2606.20064.
最后更新:2026 年 7 月 31 日。本文是对第三方研究的独立编辑摘要,与该研究作者无关联,亦未获其背书。