AI 定性编码中的编码者间信度(2026)
Qualitati 研究团队 · 2026-07-13 · 10分钟阅读
简短回答:编码者间信度衡量两位编码者对同一批数据施加相同编码的一致程度,通常使用 Cohen's κ。在 AI 定性编码中,LLM 被当作一位编码者,并与人工黄金标准进行比对。截至 2026 年,提示词设计良好的前沿模型在具体的、领域特定的编码上可达到相当程度的人机一致性(κ ≈ 0.60–0.70),但在抽象构念上会下降。人工监督仍是必需的。
编码者间信度对 AI 定性编码意味着什么
编码者间信度(ICR)— 也称评分者间信度 — 指独立编码者对定性数据的同一片段赋予相同编码的程度。它是证明编码本清晰、编码并非某位研究者一己之见的经典证据。当你把 AI 引入定性数据分析时,编码者间信度自然成为回答一个简单问题的标尺:模型的编码方式是否与受过训练的人类一致?把 LLM 当作第二位编码者,让它与人工编码的黄金标准比对,然后计算一致性统计量。
最后更新:2026 年 7 月 13 日。以下所有统计数据均标注了具名、注明日期的 2025–2026 年来源;证据存在分歧之处,我们会明确说明。
核心要点
- ICR 是检验 AI 编码的恰当方式。它把“这个 AI 看起来挺准”转化为审稿人可以推敲的、站得住脚的数字。
- 模型与构念比工具更重要。2026 年一项 arXiv 研究报告称,在具体领域编码上人机 Cohen's κ 为 0.60–0.70,但在抽象的“元认知”编码上仅为 0.55(arXiv, Aug 2025)。
- 提示词与参数调优确有效果。同一项研究在采用少样本提示以及温度/top-p 调优后,平均把 κ 提升了约 0.14–0.15。
- 一致性更高并不等于准确性更高。通过角色设定与温度参数让多个 LLM 智能体彼此达成一致,相对于真实标准只带来“微乎其微的准确性提升”(arXiv, Jul 2025)。
- 人工监督没有商量余地。2025–2026 年每一项严肃研究的结论都是人在回路的验证,而非替代。
如何测量人机之间的编码者间信度
整个流程与经典的双编码者信度一致,只是由模型充当第二位人类编码者。
- 建立黄金标准。让一到两位受过训练的人依据既定编码本,对一个有代表性的子集(通常是 10–20% 的片段)进行编码。
- 固定编码单元。确定编码单元是句子、发言轮次还是段落 — 如果 AI 与人类以不同方式切分文本,一致性就毫无意义。
- 让 AI 对相同的单元进行编码,使用相同的编码本与清晰的定义。
- 计算经机遇校正的统计量 — 两位编码者用 Cohen's κ,编码者更多或存在缺失数据时用 Krippendorff's α。原始百分比一致率会高估信度,因为它忽略了偶然造成的一致。
- 检查分歧之处。某个编码上 κ 偏低,通常说明定义模糊,而不是模型不好。请修订编码本并重新运行。
如何解读 kappa 数值
| Cohen's κ | 常见解释 | 在 AI 编码中该怎么做 |
| < 0.20 | 极弱 | 编码本或单元有问题;不要自动化 |
| 0.21–0.40 | 一般 | 仅用人工;修订定义 |
| 0.41–0.60 | 中等 | AI 出初稿,人工全面复核 |
| 0.61–0.80 | 较强 | AI 辅助编码,配以人工验证 |
| 0.81–1.00 | 近乎完美 | 抽查;审核边界案例 |
这些阈值是惯例(Landis & Koch, 1977),而非定律。许多方法学者认为 κ ≥ 0.60–0.70 对探索性工作是可接受的,而对高风险编码则要求更高。
2025–2026 年的证据究竟说明了什么
研究图景令人鼓舞,但有边界。在 2025 年 8 月一项关于工程设计讨论的研究中(14 个小组、42 名学生、204 个文本片段),ChatGPT-4o 与 4.5-preview 经调优后达到了相当程度的人机一致性:物理概念的 κ = 0.70,工程设计编码为 0.60,但元认知思维仅为 0.55 — 也就是最抽象的那个构念(arXiv 2508.14764)。更早的研究发现了明显的模型代际差距:在相同提示词下,GPT-4 达到了与人类相当的诠释水平,而 GPT-3.5 的 κ 平均仅为 ≈ 0.34。
2025 年的第二项发现是一记有益的警告。2025 年 7 月的一篇论文表明,通过调节温度与角色设定让多个 LLM 智能体彼此达成一致,相对于人工真实标准只产生了“微乎其微的准确性提升”(arXiv 2507.11198)。教训是:模型之间的共识不等于正确。只有与人工黄金标准的一致,才算得上信度证据。
人在回路的 ICR 核查清单
在你把任何 AI 辅助编码报告为可信之前,请使用这份 Qualitati 原创清单。
- □ 在编码之前已存在一份书面编码本,包含定义、纳入/排除规则与示例。
- □ 编码单元(句子、发言轮次、段落)已固定,且人类与 AI 完全一致。
- □ 人工编码的黄金标准覆盖了数据中有代表性的子集。
- □ 信度以经机遇校正的统计量报告(κ 或 α),而非原始百分比一致率。
- □ 记录了确切的模型、版本、日期与温度参数,以便复现。
- □ 逐编码检查了 κ;一致性低的编码经过修订,而不是被悄悄删掉。
- □ 进入最终分析的每一个 AI 编码,都有人复核并可推翻。
- □ 抽象或诠释性的编码比具体编码接受更严格的人工审视。
- □ 方法部分披露了 AI 的使用情况、提示词与验证步骤。
演绎式与归纳式编码:AI 信度的差异所在
编码者间信度对演绎式编码最有意义,因为固定的编码本界定了“一致”究竟指什么。AI 在这里表现良好:类别是预先设定的,模型有明确的目标。而对于归纳式编码,编码从数据中涌现,ICR 就是一件较为粗钝的工具 — 两位编码者(无论人还是 AI)可能生成不同却同样有效的编码标签。对于归纳式工作,信度的重心从“标签完全相同”转向透明度、审计轨迹与反身性。有编码本时报告 ICR;没有时则报告你的过程。
Qualitati 的位置
Qualitati 是一个面向产品、UX 与洞察团队的 AI 用户研究平台,其定性数据分析围绕人在回路的编码来构建。QDA 工作台支持 AI 辅助的归纳式与演绎式编码、编码本生成与主题可视化,研究者可以对每一个编码进行确认、合并、重命名或否决 — 这正是编码者间信度所预设的那套推翻机制。在更高层次的综合上,ThemeLens 以 map-reduce 式主题流程一次处理至多 100 份转录稿,把编码映射到研究问题,并将主题锚定在受访者原话上。Qualitati 会记录每个分析工具所使用的模型与温度参数,便于你留存本清单所要求的可复现性细节。它支持 10 种语言,定价透明:注册即享含 30 点额度的免费层级,无需信用卡,并公开每点单价 — 在 AI 原生分析方面,它明确定位为 NVivo、ATLAS.ti 与 MAXQDA 的替代方案。参见透明定价。
局限与取舍
编码者间信度是必要条件,但不是充分条件。高 κ 证明的是一致性,而非效度:两位编码者完全可以稳定地施用一套有缺陷的编码本,并在错误的结论上取得一致。Kappa 还对基础发生率敏感 — 罕见编码即便原始一致率很高,κ 也可能很低(即“kappa 悖论”),所以要与百分比一致率和基线比例一并解读。已发表的 AI 数值来自特定领域(STEM 教育、小样本),未必能迁移到你的访谈数据、敏感主题或非英语语料。此外,把信度强加于真正诠释性、反身性的分析可能扭曲方法本身 — 并非每一种定性传统都把 κ 当作目标。人工复核提示:在发表之前,请针对你自己的数据与部署环境核实任何关于模型表现或信度的主张;不要从品类基准数据中推断。
常见问题
AI 编码的编码者间信度达到多少算好?
对于 AI 辅助编码,Cohen's κ 在 0.61–0.80(“较强”)区间是常见的接受门槛,并需配以人工验证。高风险编码应达到 κ ≥ 0.80。低于 0.60 时,只应把 AI 当作初稿工具,并修订编码本。
AI 能达到人类水平的编码者间信度吗?
在具体、定义明确的编码上,前沿模型在 2026 年的一项研究中相对于人工编码者达到了 0.60–0.70 的 κ — 属于较强一致。在抽象或诠释性构念上,一致性会下降,人工监督仍不可或缺。
我该用 Cohen's kappa 还是 Krippendorff's alpha?
两位编码者(例如一位人类对一个 AI)且编码为名义变量时,用 Cohen's κ。编码者超过两位、存在缺失数据,或编码为有序/等距变量时,用 Krippendorff's α。两者都对偶然一致做了校正;原始百分比一致率则没有。
两个 AI 模型之间达成一致,能证明信度吗?
不能。2025 年 7 月的一项研究发现,让多个 LLM 智能体彼此达成一致,相对于真实标准只带来微乎其微的准确性提升。信度证据要求与人工黄金标准一致,而不是模型与模型之间的共识。
编码者间信度适用于归纳式编码吗?
不那么直接。ICR 预设了一套固定的编码本,这与演绎式编码相契合。对于编码逐步涌现的归纳式编码,应优先看重透明度、审计轨迹与反身性,而不是单一的 κ 数值。
结论
编码者间信度把“这个 AI 看起来挺准”变成一个你能为之辩护的数字。2025–2026 年的证据很清楚:提示词设计良好的前沿模型在具体编码上可达到相当程度的人机一致,在抽象编码上一致性较弱,而模型之间的共识本身什么也证明不了。请把 LLM 当作第二位编码者,对照人工黄金标准做验证,并保持人在回路。免费开始,赠送 30 点额度 — 在QDA 工作台中运行内置人工验证的 AI 辅助编码,或对比透明定价与 NVivo、ATLAS.ti 和 MAXQDA。