AI 编码数量是人工的两倍:2026 年研究
Qualitati 研究团队 · 2026-08-07 · 7 分钟阅读
一条四阶段的 LLM 流水线在约 45 分钟内完成了 28 份访谈记录的编码,生成 12 个高层概念和 73 个低层概念——大约是五位人类研究者在同一批数据上人工得出的 8 个和 31 个的两倍。专家在每一个质量维度上都给出了 5 分制的 4 分中位数,但同时指出:多出来的这份颗粒度,正是最需要人工返工的地方。
这项研究测试了什么?
研究检验的是:定性内容分析能否被拆解为一系列离散、可审计的机器步骤,而不是把整件事塞进一个提示词丢给聊天机器人。Forster 等人(2026)在 Studies in Health Technology and Informatics(dHealth 2026)上发表的这项工作,围绕 GPT-4.1 搭建了一条流水线,跑完了 28 份关于健康数据捐赠态度的半结构化访谈——这批数据此前已由五位研究者人工分析过,人工结果即为对照基准。
比模型更值得注意的是设计本身。每个阶段只做一件事,而且四个阶段中只有三个真正用到了 LLM:
- 意义单元切分。 访谈记录被切分为连贯的思维单元,并记录位置,使得把所有单元拼接起来即可精确还原原文。
- 基于渐进式编码手册的初始编码。 每个单元获得一到三个编码。第一份访谈记录生成初始编码手册;此后每一份都必须先尝试匹配已有编码,才允许新建。
- 层级化概念构建。 两轮聚类先把编码归入低层概念,再综合为高层概念,并设有复查步骤回收未被归组的编码。
- 确定性引语抽取。 不使用 LLM。由一段 Python 程序按编码精确匹配,把概念回溯到源单元,因此引语无法被凭空编造。
第一到第三阶段采用单样本(one-shot)提示——方法学说明加一个示例——提示词存放在可编辑的模板中,而非硬写进代码。
AI 分析的准确度如何?
足以使用,而且稳定到可以托付一本编码手册。据 Forster 等人(2026)报告,92.6% 的编码复用了已有标签而非新建,从第三份访谈起复用率就超过 90%。这个数字最值得关注:它说明编码手册很早就稳定下来,没有滑向一长串近义编码——而后者正是 LLM 逐份孤立编码时的典型失败模式。
与人工分析的一致性,在编码层面低于概念层面。三位参与过原始编码的评估者估计,编码层面的主题重叠度为 41–60%,概念层面为 61–100%。换句话说,机器与人类切分文本的方式不同,但大体抵达了相同的主题。一位评估者的概括是:差异在于颗粒度和侧重,而非编码上的相互矛盾。
专家评分
五位研究者使用 QUEST 对产出打分——这是一套改编自医疗领域 LLM 评估的框架,采用 5 分量表,1 分代表存在根本性问题,5 分代表可直接发表。
| QUEST 维度 | 中位数 | 取值范围 |
| 信息质量 | 4 | 无差异 |
| 理解与推理 | 4 | 3–4 |
| 表达风格 | 4 | 2–4 |
| 安全与危害 | 4 | 4–5 |
| 信任与信心 | 4 | 3–4 |
五位评估者中有四位建议做小幅修订,一位建议大幅修订。五位全部接受该产出可用于科研,前提是研究者进行细化与情境化处理。
为什么 AI 生成的概念数量翻倍?
因为流水线没有任何理由去做合并,而研究团队有。人类分析者通过讨论把重叠的想法收拢——有人主张两个编码其实是一个,编码手册随之收缩。本研究的流水线是单编码者架构,没有共识环节,于是团队本会合并掉的细微区分全都保留了下来。评估者直接点出了症状:彼此"过于相似"的概念,以及宽泛到需要拆分的伞状术语。
这一点值得细想,因为概念更多并不自动等于更差。更细的颗粒度可能浮现出疲惫的团队本会抹平的区分。但它转移了工作,而不是消除了工作:研究者不再负责生成主题,转而负责审核与合并主题。任何诚实的省时估算,都必须把这一轮合并计入成本——45 分钟的算力时间并不是全部代价。
这对研究者意味着什么
可迁移的经验在架构,而不在 GPT-4.1 这个具体模型。无论你用哪个模型,这条流水线的三项设计选择都值得照搬:
- 让编码手册向前传递。 强制每份新访谈先匹配已有编码再新建,正是 92.6% 复用率的来源。各份独立编码、事后再合并,做不到这一点。
- 让引语检索确定化。 用代码而非模型抽取引语,把"编造证据"从一类需要抽查的风险变成了不可能发生的事。每一条主张都可沿概念到编码、到意义单元、再到访谈记录位置逐级回溯。
- 预留合并的工序。 为合并近义概念、拆分伞状术语安排一轮人工处理。把机器产出当作第一版编码手册,而不是成品框架。
如果你想把这套做法接进自己的工作流,一个自带持久化编码手册和可追溯引语的工具已经替你做掉大半——ThemeLens 在整批访谈记录上采用同样的编码前传与引语溯源逻辑,而 AI Interviewer 让访谈、编码与原始片段保持关联,使审计轨迹一路延续到成文阶段。
这个结论应该被信任到什么程度?
把它当作一次仪表完备的概念验证,而不是效度验证。作者对局限直言不讳:只测试了单样本提示,只用了一家模型供应商,也没有用配对标注做正式的评分者间信度检验——那些重叠度数字是评估者的回溯性估计,而非计算出来的一致性统计量。数据集是单一健康领域的 28 份访谈。而且由于流水线跑在商用 API 上,作者指出健康数据要满足 GDPR 合规,需要数据处理协议或本地部署模型。
这项研究真正确立的是:一条分阶段、透明、有专家监督的流水线,能够产出连做过人工分析的人都愿意接受的结果——这个门槛,明显高于一个基准测试分数。
常见问题
LLM 能取代人工定性内容分析吗?
就本研究的证据而言不能。研究中每一位评估者的接受都以研究者的细化为前提,其中一位还建议大幅修订。流水线产出的是一份站得住脚的初版结构,不是完成的分析。
什么是渐进式编码手册?
指跨访谈不断累积的编码手册:第一份访谈生成初始内容,此后每一份都必须先尝试匹配已有编码,再考虑新建。它是控制整个语料库中编码泛滥的关键机制。
为什么 AI 编码比人工产生更多编码?
因为合并是一个社会性过程。人类团队通过讨论把重叠编码归并;单轮流水线没有对应环节,于是团队本会收拢的细微区分被保留了下来。
这条流水线会编造引语吗?
在这套设计中不会。引语抽取由确定性算法而非模型完成,按编码精确匹配把概念对应到源片段,因此每一条引语都可追溯到访谈记录中的具体位置。
原始文献: Forster, E., Kartschmit, N., Klager, E., Mosor, E., Schuster, B., Mosor, E., Stamm, T., & Donsa, K. (2026). Multi-Stage LLM Pipeline to Support Qualitative Content Analysis — A Proof of Concept Experiment with Expert Validation. Studies in Health Technology and Informatics (dHealth 2026). 阅读原文。
最后更新:2026 年 8 月 7 日。本文是对第三方研究的独立编辑性摘要,与原作者无隶属关系,也未获其背书。