LLM 编造访谈引语的频率有多高?2026 年研究
Qualitati 研究团队 · 2026-08-21 · 7 分钟阅读
当 LLM 从访谈记录中抽取一段支持性引语时,它通常在引用——但并非总是。在一项 2026 年发表于 JAMIA 的研究中,研究者审查了 122 份心衰患者的访谈记录,结果显示 LLM 给出的引语中 68% 为逐字原文,20% 为改写,9% 为部分或完全编造。主题是可靠的;挂在主题下面的证据则不然。
这项研究测试了什么?
Bang 等人(2026)让同一份语料走完两套完整的定性分析流程,然后加以比较。语料包含 122 份访谈记录——61 次临床问诊与 61 次反思性访谈,全部来自心力衰竭患者。两套流程都采用演绎—归纳混合设计:先从a priori(先验)框架出发,再允许新编码从数据中涌现。
- 人工主导组。受过训练的定性研究者在 Dedoose 中按常规主题分析对访谈记录进行编码。
- LLM 辅助组。同一份语料在符合机构合规要求的环境中使用 ChatGPT Edu(GPT-5.2)分析,由一套固定的十一步提示词协议驱动,而非随意对话。
- 比较组。研究团队比较了 63 组人工—LLM 主题配对,逐一判断每个 LLM 主题的效度,然后人工核验模型给出的每一条引语。
第三步是这篇论文的特别之处。多数关于 AI 定性分析的评估止步于"主题看上去对不对"。这项研究回到了访谈记录本身,核查模型归到受访者名下的句子是否真的被说过。
AI 主题与人工主题的吻合程度如何?
足够可用,但又没有高到多余。据 Bang 等人(2026)报告,人工主导的分析产出 7 个主题,LLM 辅助的分析产出 9 个。两组主题的重叠度为中等到较高,Jaccard 系数介于 0.44 至 0.51 之间,命中率为 1.00——也就是说,每一个人工主题都能在模型输出中找到对应项。
关键在于,复核的研究者判定全部 9 个 LLM 主题均为有效主题。将两组主题整合后,最终形成三个领域下的 14 个主题。模型并没有凭空捏造不属于数据的主题;它只是在同一批材料上切分的位置略有不同,而其中几刀是人工团队没有切下去的。
模型编造引语的频率有多高?
大约每十一条摘录中就有一条不是真实引语。Bang 等人(2026)的引语保真度审计结果如下。
| 摘录类别 | 占引语比例 | 实际含义 |
| 逐字原文 | 68% | 抽查后可直接引用 |
| 改写 | 20% | 语义保留但措辞改动——不可加引号发表 |
| 部分编造 | 6% | 真实话语中被拼接进了虚构词句 |
| 完全编造 | 3% | 访谈记录中不存在对应话语 |
| 截断 | 3% | 截取方式可能扭曲原意 |
部分编造才是最危险的一类。完全虚构的引语往往语感略有不对,容易被抓出来。而一句真实的受访者话语被嫁接上三四个词后,读起来完全自然,挂在一个确实成立的主题下面,任何不重新打开访谈记录的审阅流程都拦不住它。
为什么主题站得住,引语却站不住?
因为这是两类失效方式不同的任务。构建主题是压缩任务:模型读入大量文本,返回一个抽象概括,而抽象是宽容的——措辞略有差异的主题仍然可辨认为同一个主题。引用则是以精确匹配为成功标准的检索任务,而生成式模型并不是检索索引。当它产出一条引语时,它是在以访谈记录为条件生成文本,而不是从中复制一段原文。流畅的重构是默认行为,而不是故障。
由此得出的实践结论:一份 AI 定性分析的可信度不是一个单一数字。主题层与证据层需要分别验证,而只有后者要求回到原始材料去核对。
这对研究者意味着什么
作者自己的结论是:LLM 更适合定位为分析伙伴,而非自主编码者;在情境化诠释与核验环节,人的监督仍然不可或缺。由此可推出四条操作层面的含义。
- 凡打算发表的引语,逐条核验。不是抽样——是每一条。按 9% 的编造率计算,一篇含 20 条例证引语的论文很可能带着一到两处虚构。
- 优先选择能把引语锚定到访谈记录位置的工具。能返回带时间戳或行号的原文片段的系统可以机器校验,返回自由文本的系统则不能。这是工具选择问题,而非提示词问题——没有任何提示词能可靠消除这一行为。这也正是 ThemeLens 将每条支持性摘录回溯到其在源访谈记录中位置的原因。
- 用固定协议,而不是聊天。该研究的十一步提示词结构正是其结果可复现的原因。随意提示产出的分析别人无法重复。
- 把 AI 主题当作第二编码者,而不是替代者。1.00 的命中率说明模型能找到你团队找到的东西;多出的两个主题说明它也可能浮现出你漏掉的内容——这是同时跑两套流程的理由,而不是砍掉其中一套的理由。
访谈记录的质量决定了这一切的上限。如果转录本身就把话语记错了,模型也无法还原出逐字引语——因此在访谈阶段的准确采集会沿着后续每一步不断累积其影响。
这项证据的局限
这是一份语料、一个临床领域、一个模型。心衰问诊是结构化、术语密集的对话;在散漫、情绪复杂或多语言的访谈数据上,编造率可能高也可能低。该研究使用的是 GPT-5.2 的合规机构部署版本——其结果并不能说明消费级聊天机器人处理可识别健康数据的情况,那涉及另一整套治理问题。此外,由于两组分析的是同一份语料,这一比较展示的是趋同性,而不是相对外部金标准的准确性。
常见问题
能信任 LLM 做主题分析吗?
就生成和组织主题而言,这里的证据令人鼓舞:全部 9 个 LLM 主题被判定为有效,且每一个人工主题都被找回。就提供逐字证据而言则不能——32% 的引语并非逐字原文。
什么是演绎—归纳混合流程?
指先以理论或既有研究得出的预设编码框架为起点,再允许额外编码从数据中归纳涌现的分析方式。这项研究的两组都采用了这一设计。
如何高效核查 AI 生成的引语?
在访谈记录文件中做精确字符串检索。精确匹配失败就是信号——若该字符串没有逐字出现,这条摘录就是改写、截断或编造,不能放进引号发表。
这是否意味着 AI 辅助的定性研究不可发表?
不是。这意味着核验环节不是可选项,并且应当与所用的提示词协议一并写进方法部分。
原始文献:Bang, S.H., Han, S., Reading Turchioe, M., Ellison, M., Dai, S., Happ, M.B., Russell, D., & Masterson Creber, R. (2026). Developing and evaluating human-led and large language model–assisted hybrid deductive–inductive workflows for qualitative analysis. Journal of the American Medical Informatics Association. https://doi.org/10.1093/jamia/ocag123
最后更新:2026-08-21
本文是对第三方研究的独立编辑性摘要。Qualitati 与该研究的作者及其所属机构无隶属关系。