如何评估 AI 访谈员?一项 2026 年研究的启示
Qualitati 研究团队 · 2026-06-24 · 7 分钟阅读
如何评估一个 AI 访谈员? 2026 年发表在 Scientific Reports 上的一项研究指出,仅凭访谈记录无法判断其优劣。作者构建了一套受控评估方案,针对自适应提问——模型能否正确判断何时追问、追问是否真正带来新信息——对六个主流 LLM 进行打分。
这项研究测试了什么?
这篇论文题为 "The AI interviewer: multi-faceted evaluation of adaptive questioning by large language models"(Scientific Reports, 2026),评估了六个最先进的模型作为访谈员的表现:Claude Sonnet 4、Gemini 2.5 Pro、GPT-5 Chat、Grok 4、Qwen3-235B A22B 和 DeepSeek Chat V3.1。
每个模型都作为自适应访谈员,围绕横跨七个生活领域(个人经历、家庭、兴趣、挑战、价值观、工作和健康)的 54 个主问题进行访谈。对于每一条回答,模型都必须做出决定:是否需要追问?如果需要,应该问什么?这一决定正是自适应访谈的核心,也是固定问题脚本做不到的。
研究者如何保证比较的公平性?
为访谈员做基准测试最难的地方在于,一场好的访谈既取决于访谈员,也同样取决于受访者。作者通过三种方式对此加以控制:
- 标准化的语境。 访谈语境以十场基线人类访谈的访谈记录为锚点,确保每个模型都从同一份材料出发。
- 完全相同的编排。 六个模型全部在相同的提示词和相同的访谈引擎下运行,将模型行为与提示词工程的差异隔离开来。
- 单一的 LLM 受访者。 研究没有招募真人(其回答每次运行都会变化),而是使用了一个表现一致的 LLM "受访者",消除了人类回答的变异性,使差异可以追溯到访谈员本身。
这本身就是一个有用的设计模式:如果你想比较访谈员——无论是人还是机器——就必须让受访者保持恒定。
"好的"自适应提问究竟意味着什么?
这项研究将访谈员质量视为一个多维度的构念,而非单一分数。它采用的维度与经验丰富的定性研究者所关心的内容高度吻合:
| 维度 | 回答的问题 |
| 覆盖度 | 一场理想访谈应当挖掘出的材料中,模型实际触及了多少? |
| 引出比例 | 被挖掘出的内容中,有多大比例来自访谈员的提问,而非受访者本来就会主动说出的? |
| 追问决策 | 在应当追问时,模型是否追问了?在不该追问时,是否克制住了? |
| 回应质量 | 问题是否紧扣主题、保持受访者的投入,并引出具体细节? |
"引出比例"是其中最锋利的一个概念。一个什么都不问的访谈员,依然能"覆盖"健谈受访者自己提起的话题。只为访谈员的提问所引发的内容记功,才能把真正的追问与被动的记录区分开——无论你的主持人是人还是模型,这一区分都至关重要。
这对研究者为什么重要?
作者指出,尽管这些模型正越来越多地被部署为定性研究和人机交互中的自适应访谈员,但对 LLM 访谈行为的系统性评估仍然有限。说得直白一点:各团队推出 AI 主持人的速度,已经快过了学界就如何评判它们达成共识的速度。
从这项研究的设计中可以得出三条实用启示:
- 不要轻信一份演示用的访谈记录。 一场流畅的对话说明不了什么。质量体现在大量访谈之中,也体现在何时不追问的决策上。
- 追问才是核心技能,而非流畅度。 每个现代 LLM 都能写出语法正确的问题。真正的差异在于追问是否带来了新信息——这也是引出比例作为指标优于表面文采的原因。
- 模型选择是一项研究设计决策。 六个主流模型作为访谈员并不能互相替换,因此驱动你 AI 主持人的模型,值得与你的访谈提纲受到同等程度的审视。
在实践中如何应用
如果你在开展 AI 主持的研究,这项研究说明你应当像评估一位初级研究员那样评估你的主持人:看它对研究问题的覆盖度和追问的质量,而不是凭感觉。Qualitati 的 AI 访谈员在文字和语音访谈中都应用了自适应追问逻辑,其监督者架构旨在让追问始终紧扣主题——这正是 Scientific Reports 评估方案所打分的行为。对于需要大规模运行分支和追问的结构化研究,同样的自适应原则也驱动着对话式访谈与问卷。若想从另一个角度了解 AI 追问究竟是否有帮助,请参阅我们对相关证据的总结:AI 追问能否改善定性访谈?
需要注意的局限
这项研究的优势——单一且表现一致的 LLM 受访者——同时也是其主要的注意事项。真实的受访者会犹豫、自相矛盾、跑题、披露不均;一个在配合度高的合成受访者面前表现出色的访谈员,面对一个有所保留的真人时可能会有不同表现。七个生活领域宽泛且偏向个人,而非围绕任务或产品,因此结果对研究型访谈的参考价值高于对可用性测试等场景的参考价值。一如既往,请把基准测试视为关于某种设置的证据,而不是对某个模型的最终裁决。
常见问题
什么是自适应 AI 访谈员?
自适应 AI 访谈员是一种由 LLM 驱动的系统,它会实时判断每条回答是否值得追问,并随之生成量身定制的追问——而不是照着固定脚本读。2026 年这项 Scientific Reports 研究评估的正是这种行为。
哪些 LLM 被作为访谈员进行了测试?
六个模型:Claude Sonnet 4、Gemini 2.5 Pro、GPT-5 Chat、Grok 4、Qwen3-235B A22B 和 DeepSeek Chat V3.1,全部在相同的提示词和编排下运行。
我该如何为自己的研究评估 AI 主持人?
让受访者或情境保持恒定,运行大量访谈,然后对研究问题的覆盖度以及追问实际引出了多少新信息进行打分——而不只是看对话读起来是否流畅。
AI 访谈员能取代人类研究者吗?
这项研究评估的是访谈行为,而非替代问题。大多数团队使用 AI 主持人来扩大数据收集规模,而由人类负责研究设计、解读以及对敏感时刻的判断。
最后更新:2026 年 6 月 24 日。
本文是对第三方研究的独立编辑摘要,与该研究的作者或出版方无关,亦未获其背书。文中的论断和数据均来自所引用的来源;完整细节请查阅原始论文。