哪个 LLM 是最好的 AI 访谈员?2026 基准研究
Qualitati 研究团队 · 2026-09-01 · 7 分钟阅读
不同的大语言模型,做访谈主持人的表现有可测量的差异。在 Scientific Reports 2026 年发表的一项受控基准研究中,六个前沿模型执行了同一套 54 题的半结构化访谈流程。专业心理语言学家对 2,900 多个条目进行了标注,结果显示没有单一赢家——只有共情、彻底性、速度与稳定性之间的权衡。
这项研究测试了什么?
研究者构建了一个模块化的 LLM 访谈智能体,并在完全相同的条件下让六个模型运行。根据 Panfilova 等人(2026)的报告,该智能体依次走完固定的 54 个主问题,覆盖生平、家庭、兴趣、困难、价值观、工作与健康。每收到一个回答,它会判断是否需要追问,若需要则生成一个追问——每个主问题最多追问五次。
真正让这项基准研究与众不同的是它的受控设计。三个要素被固定下来,使得唯一变化的只有主持人模型:
- 访谈情境——54 个主问题的回答直接取自十份真实人类基线访谈的访谈记录。
- 编排逻辑——所有模型使用完全相同的提示词、护栏、重试逻辑、记忆窗口(2,000 字符)和温度参数(0.7),并通过同一个统一 API 访问。
- 受访者——每一个追问都由同一个基于 GPT-4o、带固定大五人格画像的模拟受访者回答,从而消除人类回答的变异性。
受测模型为 Claude Sonnet 4、Gemini 2.5 Pro、GPT-5 Chat、Grok 4、Qwen3-235B A22B 和 DeepSeek Chat V3.1,评测集中在 2025 年 9 月底至 10 月初的一个时间窗口内完成。
访谈质量是怎么衡量的?
质量由人来评分,而不是由另一个模型评分。三位受过定性方法训练的心理语言学专家独立标注了 1,658 个由 LLM 生成的追问,依据四条二元标准打分;另外还对 1,275 个智能体选择不追问的轮次按第五条标准打分:
- 善意(benevolence)——追问是否带有共情、给予认可的语气?
- 必要性(necessity)——考虑到原答案已有的完整度,这次追问是否真的有必要?
- 情境感知(context-awareness)——追问是否建立在受访者此前披露的信息之上?
- 开放性(openness)——是否避免了诱导性或封闭式的措辞?
- 合理跳过(justified skip)——当没有追问时,这个决定是否正确?
标注者对模型身份不知情。评分者间信度很高:Fleiss' κ 从必要性的 0.67 到善意的 0.93。这一点很重要——许多关于 AI 访谈员的说法都建立在用户满意度评分或下游任务准确率之上,而这两者都无法说明问题本身问得好不好。
哪个模型是最好的 AI 访谈员?
Gemini 2.5 Pro 拿到了最好的综合排名,但更有用的读法是按画像来看。对五条专家标准分别排名后取平均(数值越低越好),研究报告的结果如下:
| 模型 | 平均排名 | 每场访谈追问数 | 每次追问耗时 | 每场访谈成本 | 画像 |
| Gemini 2.5 Pro | 2.4 | 31.8 | — | $3.88 | 语气最具共情;开放性最高 |
| Grok 4 | 3.0 | 45.7 | 1 分 46 秒 | $5.03 | 覆盖最彻底;必要性最低 |
| Claude Sonnet 4 | 3.2 | 39.2 | 27 秒 | — | 均衡;对话式、现在时风格 |
| GPT-5 Chat | 3.6 | 19.4 | 9.8 秒 | $0.75 | 最快最便宜;追问最有必要 |
| Qwen3-235B A22B | 3.6 | 26.8 | 2 分 41 秒 | — | 情境运用强、语体正式,但极慢 |
| DeepSeek Chat V3.1 | 4.2* | 18.7* | — | — | 被排除:格式不稳定 |
*DeepSeek 只完成了十场访谈中的三场;其数据仅为透明起见列出,不具可比性。
共情与彻底性方向相反
Gemini 2.5 Pro 在善意一项上显著优于其他所有模型,标注者指出它的措辞会主动肯定受访者披露信息所付出的努力。Grok 4 则处在另一个极端:它提出的追问最多(每场访谈 45.7 次,每个主问题 0.85 次),而在必要性上得分最低——因为标注者判定,面对本已足够详细的回答,它的许多追问是冗余的。它的问题平均长度为 43 个词、平均句法深度超过 8 层,而全语料均值为 26 个词、深度 5.9。
Grok 还过度使用情境信息。在一场访谈中,它 24 次提及受访者较高的神经质得分——标注者认为其中不少显得生硬。更多情境并不自动等于更好的关系建立。
"跳过"的判断已经相当可靠
对实务工作者最令人安心的发现,恰恰是最不戏剧化的一个。当模型决定不追问时,这一判断在各模型中有 85–93% 的比例被认定为恰当,而开放性得分在所有模型上都高于 0.80。当代 LLM 在提示得当的情况下,既不会习惯性地提诱导性问题,也不会在无可深挖时硬追。差异主要在于它们对剩余空间的追问有多激进。
结构化输出合规性是一类首要研究风险
DeepSeek Chat V3.1 仅在三场访谈中就累积了 45 次 schema 校验错误,最终不得不被剔除。这是一类被讨论不足的失效模式:一个无法稳定输出结构化决策的访谈智能体,会悄悄丢掉追问,产出彼此之间不可比较的访谈。评估 AI 访谈平台时,要问的是输出 schema 的失败率,而不只是它用了哪个模型。
这对研究者意味着什么
实务上的要点是:"哪个模型最好?"本身就是错的问题——"对哪一类访谈最好?"才是对的。论文自己给出的建议可以直接对应到研究设计上:大规模筛选这类效率优先的工作,适合快速、选择性强的模型;疾病、创伤或身份认同等敏感的自传式话题,适合语气更温暖、更懂得给予认可的模型;追求详尽的探索式访谈可以用高强度提问的模型,前提是能管理受访者的疲劳。
这个框架带来一个设计层面的后果。如果模型行为在共情与追问频率上差异如此之大,那么模型就是一项方法学选择,而非基础设施细节——它应当与你的抽样方案和访谈提纲一并报告。在 AI Interviewer 上开展研究的团队,应在正式投放前用少量真实访谈记录试跑一遍追问行为,并把追问强度当作需要按方案调校的参数,而不是照单全收的默认值。
这也强化了把五条标准的评分表当作可移植审核工具的理由。你不需要三位心理语言学家才能用它:从自己的试跑中读 30 个追问,对必要性、情境感知和开放性逐条打是/否,一小时之内就能发现一个过度追问的智能体。
需要知道的局限
三点限制界定了这些结果能推广多远。访谈以俄语进行,语言学画像使用的是俄语词典——风格层面的发现未必迁移到其他语言。受访者是模拟的而非真人,因此该研究衡量的是主持人行为,而不是真实参与者会产出的数据质量。此外,模型是在 2025 年末的单一时间窗口内受测的;前沿模型的行为会漂移,这也正是作者把自己的评分表定位为可重复运行的审核工具,而非一份固定排行榜的原因。
常见问题
综合排名第一的模型就是我这项研究最合适的 AI 访谈员吗?
未必。Gemini 2.5 Pro 在各标准上的平均排名最好,主要得益于共情语气。如果你的方案是高通量的筛选式访谈而非敏感的人生故事访谈,该研究自己的建议指向的是更快、更具选择性的模型。
AI 访谈员会提诱导性问题吗?
在这项基准研究中很少。在给出明确的非诱导性指令后,所有模型在开放性(即避免诱导性或封闭式措辞的标准)上得分都高于 0.80。提示词设计似乎承担了其中很大一部分作用。
追问越多越好吗?
不是。追问次数最多的模型(每场访谈 45.7 次)在"追问是否有必要"上得分最低。追问的数量与质量朝相反方向移动。
跑一场 AI 主持的访谈成本是多少?
在这项研究中,一场 54 题访谈的端到端模型成本因模型而异,介于 $0.75 到 $5.03 之间——最便宜的一端约合每次追问 $0.04。这只是推理成本,不含平台、招募或受访者报酬成本。
来源
Panfilova, A., Bolshev, V., Mozikov, M., Latynov, V., Vanin, A., Nestik, T., Nourkova, V., Vlasova, A., Kozin, M., Serohvostov, A., Tarasova, E., & Nikolenko, S. (2026). The AI interviewer: multi-faceted evaluation of adaptive questioning by large language models. Scientific Reports, 16, 20257. 开放获取。
最后更新:2026 年 9 月 1 日
本文是对第三方研究的独立编辑性综述。Qualitati 与该研究作者无隶属关系,文中所有数据均取自已发表的论文。