AI 访谈员能按受访者专业水平调整提问吗?2026 年研究发现
Qualitati 研究团队 · 2026-10-09 · 7 分钟阅读
简短回答:专业水平自适应 AI 访谈员会根据受访者的回答判断其对话题的了解程度,并据此调整下一个问题的难度。在 2026 年一项涵盖 246 场访谈的研究中,一个本地运行的小型 LLM 对专业水平的判断与受访者自评结果的一致率达到 78.9%,问题复杂度也随之相应变化。
大多数 AI 访谈员对所有人提出同样深度的问题。新手面对为专家设计的问题,只能给出单薄的回答;专家面对基础问题,则很快失去兴趣。Aisvarya Adeseye、Jouni Isoaho、Adeyemi Adeseye、Seppo Virtanen 和 Mohammad Tahir 的一篇新预印本测试了另一种设计:访谈员在每次回答后评估受访者的专业水平,并据此调整下一个问题的深浅。本文概述他们构建的系统、数据结果,以及这对开展 AI 主持访谈的研究者意味着什么。
这项研究测试了什么?
研究检验的是:一个运行在本地小模型上、由提示词驱动的访谈员,能否在不打断对话脉络的前提下,按每位受访者调整问题深度。根据 Adeseye 等人(2026),该系统运行在 Llama 3.2 3B 上,全程本地部署,受访者的回答不会发送到任何外部 LLM 服务。
访谈主题是员工如何在工作中使用 LLM。每场访谈包含 16 个面向受访者的问题,分布在五个研究领域:对 LLM 的认知与了解、组织内的应用、技能与培训、数据隐私与安全,以及组织规范。每个领域设有优先级(高、中、低)和问题配额。受访者为具有职场经验的成年人,通过大学和专业人脉招募,以英语在线完成访谈。
专业水平自适应 AI 访谈员如何工作?
它由五个提示词驱动的模块组成流水线,共享一份持续更新的访谈记录。所有角色都由同一个模型承担:
- 生成系统提示词。把研究者的访谈配置转化为一份可复用的系统提示词,涵盖访谈员的角色、目的、伦理准则、知识处理规则、行为一致性和输出格式。
- 生成开场问题。从高优先级领域提出一个易于回答、开放式、低复杂度的开场问题。它用于校准,但不直接决定受访者的水平。
- 评估专业水平。每次回答后,将受访者归为新手、基础了解、进阶了解或专家,依据四个因素:术语与具体程度、概念准确性、推理深度,以及应用与评价能力。
- 生成下一轮对话。写出对回答的回应、通往下一话题的过渡语,以及复杂度与当前专业水平匹配的下一个问题。
- 校验问题唯一性。将每个候选问题与已问过的全部问题比较,决定接受或退回重新生成。
所谓“证据可追溯”,指的就是这份共享的访谈状态记录。它保存此前的问题、回答、各研究领域的覆盖情况、专业水平估计,以及唯一性校验的决定及其理由,研究者事后可以看到每个问题为何被提出。
专业水平评估有多准确?
相当准确。Adeseye 等人将模型给出的水平标签与受访者独立填写的自评水平进行比较。246 场访谈中有 194 场完全一致(78.9%),相差不超过一个相邻等级的比例为 98.4%。线性加权 Cohen's kappa 为 0.80,仅有四名受访者被误判超过一个等级。
自评分布较为均衡:新手 52 人(21.1%)、基础了解 73 人(29.7%)、进阶了解 76 人(30.9%)、专家 45 人(18.3%),因此结果并非由某一主导群体驱动。
问题难度真的随专业水平变化吗?
是的。编码员按 1–4 分对全部 3,690 个追问的复杂度进行评分(编码员间完全一致率 89.1%,加权 kappa 0.86)。平均复杂度随评估水平稳步上升,Spearman 相关系数为 .79(p < .001):
| 评估的专业水平 | 平均问题复杂度(1–4) | 标准差 |
| 新手 | 1.42 | 0.55 |
| 基础了解 | 2.08 | 0.60 |
| 进阶了解 | 2.91 | 0.63 |
| 专家 | 3.56 | 0.51 |
来源:Adeseye 等人(2026),arXiv:2610.11651。
唯一性校验能阻止重复提问吗?
它拦下了一小部分但确实存在的重复。校验模块首轮接受了 3,690 个候选问题中的 3,469 个(94.0%),将 221 个(6.0%)因与已问问题过于相似而退回。其中 207 个在重新生成一次后通过,14 个需要两次或更多。重复提问是对 AI 访谈员最常见的抱怨之一,这种成本低、规则明确的校验值得借鉴。
受访者如何评价这些访谈?
评价很高。在 5 分量表上,受访者对问题相关性与连贯性的评分为 4.41,投入度为 4.32,总体满意度为 4.38。这些均为自评数据,且没有固定顺序提问的对照组,因此只能说明自适应访谈员受到好评,不能证明它优于非自适应的版本。
研究有哪些局限?
作者指出了两点。一是只测试了一个模型,其他本地模型是否表现相同尚不清楚。二是自评专业水平只是参照,而非真实标准:人们会高估或低估自己的知识,因此 78.9% 衡量的是与受访者自我认知的一致程度。此外,研究只涉及一个主题和一种语言,没有报告响应延迟,也没有对过渡语质量做定量评估。研究者还应考虑自适应对可比性的影响:如果新手和专家收到的问题不同,跨群体比较在分析阶段需要格外谨慎。
对研究者意味着什么
- 本地小模型已可胜任访谈员。一个 3B 参数的模型完成了水平评估、问题生成和重复校验,这对数据不能离开机构的研究尤为重要。
- 把访谈员拆分为不同角色。将评估、生成和校验分开,使每一步都可检查。一句“当一个好的访谈员”的提示词,没有任何可审计之处。
- 记录推理过程,而不只是访谈记录。保留每个问题被提出的原因,有助于建立审稿人越来越期待的 AI 辅助定性研究审计轨迹。
- 用已知背景的受访者做预测试。正式开展前,先找几位你已了解其专业水平的人试访,检查访谈员的提问深度是否匹配。
如果你想在自己的访谈提纲上尝试自适应追问,QualiTaTi AI 访谈员支持文字和语音访谈,话题和追问由研究者设定;之后可用 ThemeLens 对访谈记录进行主题分析。
常见问题
什么是专业水平自适应 AI 访谈员?
它是一种 AI 访谈员,会从受访者的回答中推断其了解程度,并调整后续问题的复杂度,让新手不至于无所适从,也让专家被进一步追问。
研究使用了哪个模型?
五个模块全部使用本地运行的 Llama 3.2 3B。作者将测试其他本地模型列为后续工作。
自评专业水平是可靠的基准吗?
只是部分可靠。作者承认自我评估可能高估或低估知识水平,因此 78.9% 这一数字反映的是与受访者自我认知的一致程度。
在哪里可以阅读论文?
预印本《Evidence-Traceable Dynamic Interviewer Architecture for Expertise-Adaptive Qualitative Interviews Using Local LLMs》发布在 arXiv(2610.11651)。作者注明该文已被 Springer Nature 出版的图书 AI in Education: Pedagogy, Ethics, and Society 接收。
最后更新:2026 年 10 月 9 日。本文是对第三方研究的独立编辑摘要,QualiTaTi 与论文作者无任何关联。