AI 质性编码的评分者间信度(2026)
Qualitati 研究团队 · 2026-06-25 · 12分钟阅读
简短回答:评分者间信度衡量的是两位编码者——在 2026 年,往往一位是 AI、一位是人类——是否对同一份数据赋予相同的编码。标准指标是 Cohen's kappa,其中 κ ≥ 0.61 为高度一致,κ ≥ 0.81 为近乎完全一致。近期研究表明,能力较强的 LLM 在定义清晰的演绎式编码上可以与人类达到高度一致,但在归纳式与解释性工作上一致性会下降。在信任 AI 编码之前,务必用人工编码的样本对其进行验证。
最后更新:2026 年 6 月 25 日。
为什么 AI 编码的评分者间信度在当下至关重要
AI 质性编码的评分者间信度是区分“AI 编码了我的转录稿”与“我能为这些发现辩护”的最关键一道检验。随着 LLM 从起草编码手册走向在数百份转录稿上实际施加编码,过去纯人工的信度仪式——两位研究者独立编码,然后比对——如今必须容纳一位非人类编码者。问题不再只是“我的两位编码者是否一致?”,而是“AI 与人类的一致程度,是否足以让我信任它去编码其余部分?”
这是一个可测量的问题,而 2024–2026 年的研究已开始用真实数字给出答案。本指南解释相关指标,梳理近期研究的实际发现,并提供一套可复用的验证流程与评分量表,供你应用于任何 AI 辅助编码项目。
核心要点
什么是评分者间信度?
评分者间信度(IRR,也称编码者间信度)指的是独立编码者对相同数据单元赋予相同编码的程度。它是本领域用以证明一套编码方案可复现、而非某位研究者私人解读的证据。在 CSCW 与 HCI 领域,报告 IRR 一直是演绎式与内容分析类研究严谨性的既定规范(McDonald, Schoenebeck & Forte, CSCW 2019)。
当其中一位编码者是 AI 时,IRR 承担双重职责:它既验证编码手册,也验证 AI 作为编码者的资格。样本上较高的人类–AI kappa 是你放手让模型编码其余部分的许可证;而较低的 kappa 则提示你,在扩大规模之前先修正编码手册、提示词,或两者兼修。
各项指标简述
- 一致率百分比——编码完全相同的单元所占比例。直观,但会被机遇抬高,类别越少越明显。不要单独报告它。
- Cohen's kappa(κ)——适用于两位编码者,经机遇校正。是 AI 与人类比较的默认选择。
- Krippendorff's alpha(α)——可处理两位以上编码者、缺失数据与不同测量层级;在编码者较多时更受青睐(参见 arXiv 2008.00977 的指南)。
- 语义相似度——适用于归纳式编码,此时标签措辞不同但含义相同;它是对 kappa 的补充而非替代。
Cohen's kappa 阈值
广泛使用的解释区间(Landis 与 Koch,由 McHugh 2012 归纳)为 kappa 值的含义提供了一套共同语言。
| Cohen's kappa | 解释 | 可用于 AI 编码吗? |
| < 0.00 | 差(不如随机猜测) | 停下——编码手册或提示词出了问题 |
| 0.01–0.20 | 轻微 | 不可用 |
| 0.21–0.40 | 尚可 | 不可用于决策 |
| 0.41–0.60 | 中等 | 每条编码都需人工复核 |
| 0.61–0.80 | 高度一致 | 配合抽查后可接受 |
| 0.81–1.00 | 近乎完全一致 | 很强;仍需审核分歧案例 |
常见的发表门槛是 κ ≥ 0.70–0.75。请注意 McHugh 的提醒:在高风险场景下,即便是“高度一致”也可能残留实质性误差,因此应把阈值当作下限,而非终点线(McHugh, 2012)。
近期研究的实际发现
诚实的概括是:AI 与人类的一致性确实存在且在改善,但它取决于任务本身。
有清晰编码手册的演绎式编码
Dunivin(2024)检验了用于质性编码的思维链提示,发现 GPT-4 在 9 个编码中的 8 个上达到高度信度(κ ≥ 0.61),其中 3 个达到近乎完全的信度(κ ≥ 0.79)——在部分诠释性任务上与人类表现相当。关键在于,当模型在赋予编码前先给出理由时,一致性会上升(有理由时平均 κ ≈ 0.68,无理由时为 0.59)(arXiv 2401.15170)。
归纳式与解释性编码
当编码是开放式或解释性的,一致性就会下降。已报告的数据显示,GPT-4 在归纳式编码上的 κ 接近 0.57,而人类基线约为 κ = 0.73——可作初轮编码,但不能作最终编码者。模型代际同样重要:在相同比较中,能力较弱的模型(如 GPT-3.5)在各编码上的平均 κ 仅约 0.34。
2025–2026 年的研究
2025 年一项让 ChatGPT-4o 与 4.5-preview 对音频转录稿评分的研究显示,只有在调优提示词与超参数之后,才在三个主题上达到高度一致(κ > 0.6),在另一个主题上为中等(Borse, Subramaniam & Rebello, arXiv 2508.14764, 2025)。另有一项 2025 年的多 LLM 方法将 Cohen's kappa 与语义相似度配对使用,正是因为单一的一致性数字会掩盖模型在语义上产生分歧之处(arXiv 2512.20352)。
注意:这些都是基于特定数据集与编码手册的个别研究。应把这些数字视为“可达到什么水平”的方向性证据,而非对你自己数据的保证。
原创工具:AI–人类编码信度工作流
一套可重复的七步流程,用于在把 AI 编码者推广到整个语料库之前对其进行验证。
- 敲定编码手册。每条编码都需要名称、一句话定义、纳入规则、排除规则和一个示例。定义含糊是 kappa 偏低的首要原因。
- 抽取验证样本。随机选取 10–20% 的单元(或足以让每条编码出现若干实例的数量)。在某条编码毫无实例的样本上算信度毫无意义。
- 独立编码。让人类在不看 AI 输出的情况下对样本编码,同时在提示词中放入同一份编码手册运行 AI。不要让任何一方看到另一方的编码。
- 逐条编码计算 kappa。为每条编码分别计算 Cohen's kappa,而不只是给出一个总体数值——一条失效的编码可能被表现良好的编码掩盖。
- 审核分歧。逐一阅读人类与 AI 判断不同的每个单元。分歧通常暴露的是定义模糊,而不是模型愚蠢。
- 修订并复测。收紧定义、加入“先给理由”的指令,或拆分负荷过重的编码;然后在新样本上重跑。反复迭代,直到每条编码都跨过你的阈值。
- 抽查式扩大规模。一旦各编码跨过 κ ≥ 0.61–0.75,就让 AI 编码其余部分,并由人工滚动审核随机样本,以捕捉漂移。
原创工具:AI 编码信度记分卡
为编码手册中的每条编码打分。只有当一条编码既跨过 kappa 阈值,又通过质性检验时,才算“可扩大规模”。
| 检查项 | 通过条件 |
| 逐条编码的 Cohen's kappa | ≥ 0.61(高度一致);发表需 ≥ 0.75 |
| 编码有足够实例 | 验证样本中 ≥ 5 个阳性实例 |
| 分歧已审核 | 100% 的人类–AI 不一致均已阅读并解释 |
| 定义稳定性 | 最近一次运行后无需再修改编码定义 |
| 附有理由 | AI 为每次编码赋值输出一段简短说明 |
| 无系统性偏差 | AI 未在某一方向上过度或不足地施加该编码 |
未通过的编码回到流程第 6 步。通过的编码可在滚动抽查下扩大规模。
Qualitati 在其中的位置
Qualitati 是一个 AI 用户研究平台,其 QDA Workspace 支持 AI 辅助的归纳式与演绎式编码、编码手册生成与主题可视化,而 ThemeLens 可一次性对至多 100 份转录稿进行主题分析。具体到信度工作,这意味着你可以生成或导入编码手册、用 AI 施加编码,然后在同一工作流内用人工编码的样本加以验证——而不必导出到另一个统计工具。Qualitati 的方法有文档记录,并持续对照学术质性研究文献进行核查,定价透明且按额度计费,因此你可以免费开始、获得 30 个额度且无需信用卡,先跑一个信度试点再扩大研究规模。
局限与方法学提醒
- kappa 对流行率敏感。当某一条编码在数据中占主导时,即使原始一致率很高,kappa 也可能偏低(即“kappa 悖论”)。请在报告 kappa 的同时报告流行率。
- 各研究的数字不可迁移。此处引用的 κ 值来自特定数据集与编码手册;你能达到的一致性取决于你的编码、数据、模型与提示词。
- AI 与人类一致并不等于 AI 正确。模型与人类可能一致地犯同一个错。IRR 衡量的是一致性,而非事实基准。
- 反身性与解释性传统各不相同。某些质性范式(如反身性主题分析)根本不把 IRR 当作目标;请让指标与你的认识论相匹配。
人工复核说明:本文的 kappa 数值与阈值反映的是所引用的 2012–2026 年文献,在用于高风险或可发表用途之前,应在你自己的数据上重新验证。
常见问题
AI 质性编码的 Cohen's kappa 达到多少算好?
κ ≥ 0.61 属于“高度一致”,是合理的工作下限;许多刊物要求 ≥ 0.70–0.75。高于 0.81 即近乎完全一致。低于 0.41 时,AI 还不足以可靠到可以扩大规模(McHugh, 2012)。
AI 能在编码上达到人类水平的一致性吗?
在清晰的演绎式编码上可以——GPT-4 在多项任务上与人类表现相当,在部分编码上达到 κ ≥ 0.79(Dunivin, 2024)。在归纳式与解释性编码上,它通常落后于人类的一致性,需要人工复核。
AI 编码该用 Cohen's kappa 还是 Krippendorff's alpha?
单次 AI 与人类的比较用 Cohen's kappa。当你有两位以上编码者、存在缺失数据或使用有序编码时,用 Krippendorff's alpha——它在这些情形下的推广性更好。
我的验证样本应该多大?
大到足以让每条编码都有若干真实实例——通常是 10–20% 的单元,或每条编码至少约五个阳性案例。对于在样本中毫无实例的编码,信度不具信息量。
要求 AI 解释其编码能提升信度吗?
能。在一项研究中,先给理由(思维链)的编码方式使平均 kappa 从约 0.59 提升到 0.68,因为模型在贴标签之前先确立了一种解读(Dunivin, 2024)。
AI 与人类高度一致就足以发表了吗?
这是必要条件,而非充分条件。请报告逐条编码的 kappa、编码流行率、你的样本,以及你如何解决分歧——并且记住,某些质性传统更看重反身性解读而非 IRR。
结论
过硬的 AI 质性编码评分者间信度,是把 AI 编码者从“图方便的工具”变为“经得起辩护的证据”的关键。请对照人工编码的样本逐条编码计算 Cohen's kappa,跨过高度一致的阈值(κ ≥ 0.61,最好 0.75+),审核每一处分歧,然后才扩大规模——并配合滚动抽查。免费开始,获得 30 个额度,在 Qualitati 的 QDA Workspace 中跑一个编码信度试点,或先查看透明定价。另请参阅如何构建质性编码手册、如何审计 AI 质性编码,以及LLM 分析可复现吗?。