自定义 GPT 能做研究访谈吗?一份 2026 年实地报告
Qualitati 研究团队 · 2026-10-02 · 7 分钟阅读
简短回答:自定义 GPT 可以完成简短的、由受访者自助参与的研究访谈,而且受访者普遍能够接受。在一份 2026 年针对 66 名软件从业者的经验报告中,90.9% 的人对体验给出正面评价,89.4% 的人愿意再次参与。但只有 19.7% 的人认为追问帮助他们说得更多,而且该研究并不能证明这些数据可与人工访谈相当。
很多研究者都想过:能不能不搭建访谈平台,直接配置一个 ChatGPT 的“GPT”来访谈受访者?一篇新的预印本在两项真实研究中检验了这种自己动手的方案。根据 Gheyi、Albuquerque、Ribeiro 和 Perkusich(2026)的研究,这一流程对于 10–15 分钟的访谈切实可行,也受到受访者欢迎,但它在追问深度、隐私和数据保真度上留下了缺口,任何研究团队在照搬之前都应提前规划。
这项研究测试了什么?
该研究考察了一个定制的 ChatGPT 智能体(“MyGPT”)能否在没有研究者在场的情况下进行半结构化访谈。论文题为 AI-Conducted Interviews in Empirical Software Engineering: An Experience Report(arXiv,2026 年 7 月 16 日),作者来自巴西坎皮纳格兰德联邦大学和阿拉戈斯联邦大学。
研究团队为两项研究各搭建了一个 GPT。第一个询问软件从业者的重构实践;第二个询问从业者和学生如何在 Scrum 活动中使用生成式 AI,例如待办事项梳理和用户故事编写。具体流程如下:
- 提示词设计。每个 GPT 都有一个共享核心(角色、语气、一次只问一个问题、请求具体例子、避免评判性语言、避免收集机密信息),外加一份针对主题的问题清单。指令字段上限约为 8,000 个字符,这迫使提示词必须精简。
- 预测试。研究者测试了通过共享链接访问(包括免费账户)、语音模式、对访谈方案的遵循情况,以及在三种语言之间切换。
- 实地执行。受访者用自己的 ChatGPT 账户打开链接,选择语言,通过语音与访谈者对话,全程没有研究者在场。
- 产出。访谈结束时,受访者让 GPT 生成一份结构化综述(个人概况、实践、风险、“可能的编码”),并把它连同一份简短的体验问卷一起粘贴到 Google 表单中。
研究团队在三天内分析了 66 份提交,每项研究各 33 份。所有受访者都居住在巴西,66 份材料中有 65 份主要以葡萄牙语写成。
受访者如何评价被 AI 访谈的体验?
受访者在便利性和清晰度上给出很高评价,而对自然度以及取代人工访谈则更为谨慎。根据 Gheyi 等人(2026)的数据:
| 问卷题项 | 正面回答(n = 66) |
| 节奏合适 | 97.0%(64/66) |
| 问题清晰 | 95.5%(63/66) |
| 整体体验正面 | 90.9%(60/66) |
| 回答时感到自在 | 90.9%(60/66) |
| 愿意再次参与 | 89.4%(59/66) |
| 能够充分表达经历和观点 | 87.9%(58/66) |
| 访谈感觉自然 | 81.8%(54/66) |
| 没有研究者在场是正面的 | 43.9%(29/66) |
这个规律很能说明问题。得分最高的是后勤层面:65.2% 的人看重能按自己的节奏作答,47.0% 的人表示压力比面对人类研究者时更小。但只有不到一半的人对没有真人在场给出正面评价,45.5% 持中立态度。在一道比较题上,42.4% 选择了中点,37.9% 倾向人类访谈者,19.7% 倾向 AI。作者提醒,这道题的措辞存在歧义,因此它只反映大致倾向,而非明确偏好。
AI 访谈者在哪些方面表现不足?
短板在于自适应追问。虽然 65.2% 的人认为 AI 让访谈保持聚焦,但只有 19.7% 的人表示它的追问帮助他们给出了更详细的回答。被选择最多的不足包括:
- 问题过于笼统:28.8%
- 对回答不够敏感:28.8%
- 深度不足:27.3%
- 隐私顾虑:22.7%
- 缺少人际互动:22.7%
- 问题重复:19.7%
作者自己的结论是:共享提示词带来的是一致性,而一致性不应被等同于好的追问。语音也带来了干扰:有一次咳嗽被当成了回答,一些受访者需要重复提出切换语言的请求。
AI 生成的访谈摘要可信吗?
单靠摘要并不可信。这是论文中最重要的方法论要点。研究者从未收集完整的访谈记录,他们拿到的只是每位受访者自行粘贴的综述。审查发现,92.4%(61/66)的提交具备预期结构,但有三份提交的是对话片段,一份是未经整理的回答,一份没有可用内容,还有两份包含重构相关内容,而受访者报告的却是参加了 Scrum 访谈。
部分原因在于措辞:表单要求提交“访谈记录”,而 GPT 生成的是摘要。更根本的是,摘要可能压缩、重排或遗漏受访者所说的内容,而该研究无法核查丢失了什么。作者明确把这些材料视为 AI 中介的摘要,而非等同于访谈记录的数据,并指出 GPT 给出的“可能的编码”并不是经过验证的研究者编码。
这对研究者意味着什么
这项研究支持一个范围有限但有用的结论:对于简短、聚焦、低风险的主题,自助式 AI 访谈能被受访者接受,并能快速收集完整的回答。如果你打算尝试,论文的经验可以转化为一份实用清单:
- 保留完整访谈记录。由受访者粘贴的摘要不是可以审计的数据。应采用由研究者而非受访者持有完整记录的方案。
- 像写提示词一样认真撰写受访者说明。准确说明你期望收到的材料,并在收到时逐份检查,以便请对方重新提交。
- 掌控平台。当受访者使用自己的账户时,你无法固定模型、界面或数据保留策略。要明确告诉受访者平台可能存储哪些内容。
- 记录每次访谈的语言和模型,以便报告其中的差异。
- 不要只依赖 AI 访谈来处理敏感或情绪性的话题,或涉及屏幕、代码、文档的讨论。
- 询问受访者的感受。一份简短的访谈后问卷能展示这种方法给人的体验,而不仅仅是它是否产出了数据。
专门构建的工具可以同时弥补其中几个缺口。Qualitati 的 AI Interviewer 为研究者保存完整的文字或语音访谈记录,按项目负责人的配置运行而非依赖每位受访者的账户,并允许你在访谈提纲中设置追问深度级别和条件追问。其访谈记录可以直接导入 ThemeLens 进行主题分析,每个主题都能追溯到原话引文,而不是追溯到一份 AI 摘要。
这项研究的局限
- 它是一篇预印本,属于探索性经验报告而非实验,也没有与人类访谈者进行对照。
- 只分析了完成者;没有追踪邀请和中途退出情况,因此无法报告完成率。
- 样本为来自同一国家的 66 人,涉及两个技术主题,访谈时长约 10–15 分钟。
- 材料审查由一名研究者完成,且结果与研究期间 OpenAI 的 GPT 平台绑定。
常见问题
我可以用自定义 GPT 作为研究中的 AI 访谈者吗?
对于简短、低风险的访谈是可行的:在这项 2026 年的研究中,66 名受访者中有 89.4% 愿意再次参与。但要预先考虑到笼统的追问、你无法控制的受访者端隐私设置,以及缺少由研究者持有的访谈记录。
受访者更喜欢 AI 访谈者还是人类访谈者?
并不明确。大多数人感到自在,47.0% 的人感觉压力更小,但在比较题上,倾向人类访谈者的人(37.9%)多于倾向 AI 的人(19.7%),另有 42.4% 持中立。
AI 生成的访谈摘要足以用于定性分析吗?
不够。摘要可能遗漏或重组受访者所说的内容;在这项研究中,66 份提交里有 5 份根本没有包含预期的摘要。应分析完整访谈记录,把摘要当作导航辅助。
哪类研究适合自助式 AI 访谈?
适合主题敏感度低、以排期为主要瓶颈的简短聚焦研究。作者不建议将其作为敏感、情绪性或大量涉及材料讨论的研究的唯一方法。
最后更新:2026 年 10 月 2 日
本文是 Qualitati 研究团队对第三方研究的独立编辑摘要,与该研究作者无关联,也未获其背书。完整方法与结果请参阅原论文。