LLM 能否扩展定性分析?一项涵盖 167 份访谈的研究
Qualitati 研究团队 · 2026-07-24 · 7 分钟阅读
大语言模型(LLM)可以在不牺牲严谨性的前提下,让大规模定性分析成为可能——但前提是研究者要有意识地设计人机分工。Ronaghi 等人于 2026 年 1 月发表的一项研究,将人机协作(human-LLM)框架应用于 12 家健康中心的 167 份访谈记录,他们估计这项工作若全靠人工编码,大约需要 93 个工作周。
这项研究测试了什么?
该研究检验的是:一套结构化的人机协作流程,能否在人工编码无法按时完成的规模上,仍然提供严谨的定性分析。Ronaghi、Aveling、Levis、Ross、Alsentzer 和 Singer(2026)在 arXiv 预印本 Large Language Models for Large-Scale, Rigorous Qualitative Analysis in Applied Health Services Research 中报告,他们是在一项正在进行的、针对联邦认证健康中心(FQHC)糖尿病护理的多站点研究中开展这项工作的。
该框架被用于两项分析任务:
- 定性综合 — 将跨 22 个领域、约 31,200 字的研究者摘要,整理为面向每个站点的比较性反馈报告。
- 演绎编码 — 依据一套包含 19 个编码领域、并扩展为 177 个子问题(平均每个编码约九个)的框架,对 167 份访谈记录(约 1,327,000 字,访谈时长约 8,600 分钟)进行编码。
对于健康数据场景,技术配置至关重要:主题整理使用 ChatGPT-4o,跨站点综合使用 OpenAI o1,编码使用结合检索增强生成(RAG)的 ChatGPT-4o,全部运行在符合 HIPAA 要求的机构部署环境中,并使用 Qdrant 向量库和 OpenAI 的 text-embedding-3-large。
四步人机协作框架是什么?
该框架与具体模型和任务无关,其核心做法是:在引入任何模型之前,先判断工作的哪些部分包含研究者的隐性判断。根据 Ronaghi 等人(2026),这四个步骤是:
- 界定任务。先在小样本上手工完成任务——明确目标、固定输出格式、记录工作流程,并标出哪些环节必须有研究者参与。
- 设计人机协作方法。把任务拆分为若干独立部分,说明每部分的目的,识别人类所做的隐性贡献,并为每个部分选择模型的配置方式。
- 小规模评估。使用针对具体任务的质量标准,而非单一的量化分数,比较有无 LLM 协助时产出的结果。
- 全面应用与评估。记录真实使用情况,并评估其对研究目标和效率的影响,而不仅仅是速度。
第 1 步是大多数团队跳过的一步。先手工做一遍任务,才能得到后续用来约束模型的输出规范。
他们如何验证 LLM 的输出?
他们没有使用 kappa。值得注意的是,团队依据定性研究的严谨性标准而非评分者间信度统计量来评判输出——具体包括:以数据为依据、理论与数据的整合、与研究问题的契合、对领域的意义,以及对实践者的有用性。
小规模评估刻意保持审慎:在综合任务中,两位研究者针对两个可比较的领域各自独立产出结果;在编码任务中,则针对两个站点的六份访谈、四个编码进行评估。进入大规模应用的门槛是:纯人工与人机协作两种产出之间的差异,应类似于两位人类研究者之间可预期的差异。
这一基准值得停下来思考。它把验证问题从“模型是否符合金标准?”重新表述为“模型的分歧是否处于正常的人类分歧范围内?”——这更接近定性方法学者实际看待编码差异的方式。如果人类之间的差异本身就很大,这个门槛也就偏低,因此作者同时配合使用上述实质性的严谨标准。
究竟节省了多少时间?
不同任务的报告收益差异很大,而这种差异正是该研究最具实践价值的发现。
| 任务 | 规模 | 报告的效果 |
| 摘要的定性综合 | 约 31,200 字,22 个领域 | 每位研究者节省 30–55% 的时间 |
| 访谈记录的演绎编码 | 167 份访谈记录,约 1.33M 字 | 人工估计跨 12 个站点约需 93 个工作周;借助 LLM 使数据收集后九个月的截止期限变得可行 |
综合任务的数字体现的是效率提升,编码任务的数字体现的是可行性提升——没有辅助的话,这项分析在那样的时间线上根本无法完成。这是两种不同的论证,评估 AI 辅助分析的团队在向利益相关方说明时应当分清自己主张的是哪一种。
LLM 在哪些地方失败了?
作者报告了一组具体且常见的失败模式。检索增强生成让 1.33 百万字的语料变得可处理,但也带来了碎片化、脱离语境的理解——模型看到的是检索到的段落,而不是整场访谈的脉络。相关问题还包括:从单一数据点过度概括、忽略周边语境、滑向泛泛的描述性概述,以及在回答中表现出示例偏差和积极性偏差。
有一个局限是方法层面而非技术层面的:当模型阅读访谈记录时,研究者并没有读。对原始数据熟悉度的下降,在解释性工作中是真实的代价,而且不会体现在任何准确率指标里。作者明确指出,最终的解释、语境理解和方法透明度仍然离不开人类。
这对研究者意味着什么
从这项研究可以得出三点实用启示:
- 先手工试做,再自动化。框架的第一步之所以存在,是因为你无法规定一个自己从未做出过的输出。
- 让验证方式与主张相匹配。如果你的分析是演绎式、基于框架的,人与人之间的差异是可辩护的基准;如果是归纳式、解释性的,则需要准备更多的论证。
- 为阅读预留预算。有意识地保留一部分访谈记录,由人工从头读到尾,使团队保有检索流程所剥离的语境基础。
如果你要在这样的规模上进行基于框架的编码,像 ThemeLens 这样的工具可以处理 AI 辅助的主题分析,并保持编码轨迹可见;当访谈记录的数量成为瓶颈时,Qualitati 的 AI Interviewer 则负责数据收集环节。
常见问题
LLM 能可靠地进行演绎编码吗?
这项研究依据一个包含 19 个领域的框架对 167 份访谈记录进行了编码,并通过在六份访谈的子集上比较人机协作与纯人工的输出来验证,当差异类似于研究者之间的常规差异时即予接受。这证明的是在人工监督下的可行性,而不是无人监督编码的可靠性。
检索增强生成对定性分析是有利还是有害?
两者兼有。RAG 使 1.33 百万字的语料变得可处理,但 Ronaghi 等人(2026)也报告,由于模型依据的是检索到的段落而非完整访谈,它同时带来了碎片化、脱离语境的解读。
AI 辅助编码需要评分者间信度统计量吗?
不一定。这个团队使用的是定性严谨性标准——数据依据、理论整合、问题契合、相关性、对实践者的有用性——而不是信度系数。哪种合适,取决于你的方法和审稿人。
节省 30–55% 的时间是典型情况吗?
这个数字仅适用于本研究中的综合任务,即研究者重新整理自己的摘要。编码任务被表述为可行性提升,而不是百分比形式的节省。
主要来源:Ronaghi, S., Aveling, E.-L., Levis, M., Ross, R. L., Alsentzer, E., & Singer, S. (2026). Large Language Models for Large-Scale, Rigorous Qualitative Analysis in Applied Health Services Research. arXiv preprint. https://arxiv.org/abs/2601.14478
最后更新:2026 年 7 月 24 日
本文是对第三方研究的独立编辑性摘要。Qualitati 与原作者没有任何关联,读者如需完整的方法细节,请查阅原始预印本。