如何用AI构建质性编码簿(2026年)
Qualitati 研究团队 · 2026-07-02 · 12分钟阅读
最后更新:2026年7月2日
简短答案
定性编码本是一份结构化参考文件,定义了分析中的每个代码——其名称、描述、纳入和排除规则,以及示例引文。要用AI构建编码本,需要从样本文稿中草拟候选代码、编写精确定义、在新鲜数据上测试、测量编码者间信度,并由人类研究者作为最终仲裁者。AI加速草稿编写和初步应用;它不能替代解释。
关键要点
- 编码本是可重现的定性编码的支柱:它允许两个人(或一个人和AI)以相同方式应用相同代码。
- AI在演绎编码——应用现有编码本——方面最有力,在从零开始发明类别方面较弱。GPT-4在将人类编码本应用于医学教育文稿时达到了约96%的一致性和Cohen's kappa 0.71(Xiao et al., ACM IUI, 2023)。
- 人类仲裁对罕见但理论上重要的代码最重要,基准研究表明这些代码的信度增益最大(人道主义数据基准,arXiv, 2026)。
- 良好的代码定义有四个部分:名称、描述、何时应用(纳入)、何时不应用(排除)和1–2个示例引文。
- 编码本主题分析介于自反TA和纯内容分析之间——它保留了研究者判断,同时增加了共享代码和信度检查(Delve, 编码本TA指南)。
- 在信任编码本进行全数据集编码之前,使用下面的AI编码本质量评分卡。
什么是定性编码本?
定性编码本是一套文档化的代码集合,用于标记文本片段(访谈文稿、开放式调查答卷、田野笔记),以便对模式进行计数、比较和审计。每个条目都指定了代码的含义、何时应用、何时不应用,以及有效示例的样子。编码本将编码从私密、直觉的行为转变为透明、可重复的程序。
在编码本主题分析——Braun和Clarke描述的三个流派之一——中,编码本保留了自反TA的解释精神,同时增加了实用、可重现的编码。这个中间位置正是AI最有用的地方:编码本约束模型,而研究者拥有意义的所有权。
归纳式与演绎式编码本
- 归纳式(自下而上):代码从数据中出现。你阅读、观察模式,然后命名它们。对AI来说较困难,因为没有固定的目标。
- 演绎式(自上而下):代码来自理论、先前研究或你的研究问题,然后应用于数据。这是LLM表现最好的地方。
大多数实际项目都是混合的:你从访谈指南中种植几个演绎代码,然后让归纳代码从早期文稿中浮现。如果你仔细安排顺序,AI可以支持两个阶段。
如何用AI构建编码本:7步工作流
1. 将编码本锚定在你的研究问题上
在接触任何文稿之前,列出你的研究问题和你承诺遵循的任何框架。每个候选代码都应该映射到一个问题。这可以防止AI常见的失败模式,即生成数十个看似合理但没有重点的代码,这些代码描述了文本但没有回答任何问题。
2. 从样本中草拟候选代码
选择3–6个信息丰富的文稿。要求AI提出代码及简短定义和示例引文,或手动编码它们并使用AI聚类你的亮点。最近的工作表明开源模型可以归纳地生成与人工构建的编码本相似的编码本——GATOS工作流(Nature Humanities & Social Sciences Communications, 2026)在小规模上演示了这一点——但将输出视为初稿,而不是定论。
3. 编写严谨的定义
这是将可用编码本与模糊编码本区分开的步骤。对于每个代码,指定:
- 名称——简短、独特、与同级代码不重叠。
- 描述——关于概念的一两句话。
- 纳入标准——应用此代码时……
- 排除标准——不应用此代码时……(命名可能混淆的相邻代码)。
- 示例引文——1–2条逐字引文,明确符合条件。
排除标准是最经常被跳过和最有价值的部分。LLM和初级编码者都会在没有它们的情况下漂移。
4. 在新鲜数据上测试编码本
将草稿编码本应用于AI在草拟期间没有看到的2–3份文稿。查找从不激活的代码(过于狭窄)、捕捉所有内容的代码(过于宽泛)和没有任何东西适配的段落(缺失代码)。修订,然后重复一次。
5. 测量编码者间信度
让第二个编码者——人类或AI——编码重叠子集,然后计算一致性(百分比一致性加Cohen's或Fleiss' kappa)。已发表的人类–AI数据差异很大:当编码本干净且演绎时一致性很强(kappa 0.71),当类别富有解释性时中等水平(Fleiss' kappa ~0.46)。信度是编码本的属性,而不仅仅是编码者的属性——低kappa通常意味着定义模糊,而不是模型差。
6. 仲裁分歧——尤其是罕见代码
编码者意见不一致时,人类决策并定义得到改进。2026年针对专家仲裁的基准发现最大的信度增益出现在罕见的、理论上重要的代码上,AI单独编码在那里停滞。将人类注意力预算分配给最重要的代码,而不是频繁的简单代码。
7. 冻结,然后大规模应用并附加审计跟踪
一旦信度可接受,冻结编码本版本并将其应用于完整数据集。保留审计跟踪:哪个版本编码了哪个文档,以及每个定义变更及其原因。期刊和资助者越来越期望这种透明度,工具可以存储决策但不能决定哪些重要——这仍然是研究者的工作。
AI编码本质量评分卡
对每项评分0(缺失)、1(部分)或2(良好)。在全数据集编码前争取16+/20。
| 标准 | "良好"是什么样的 |
| 研究问题映射 | 每个代码都追溯到所述问题或框架 |
| 定义清晰度 | 每个代码都有1–2句描述 |
| 纳入标准 | 明确的"应用于……"规则 |
| 排除标准 | 明确的"不应用于……"加可能混淆的相邻代码 |
| 示例引文 | 每个代码1–2条逐字引文 |
| 非重叠 | 同级代码互不重叠 |
| 覆盖范围 | 测试文稿的"不适用"段落少 |
| 信度已测试 | 在重叠子集上计算了Kappa |
| 罕见代码仲裁 | 人类解决了关键代码的分歧 |
| 版本化审计跟踪 | 定义变更已记录日期和原因 |
可重用的AI代码定义提示模板
复制、填空、对每个代码重用:
"你正在帮助为一项关于[主题]的研究构建编码本,研究问题:[RQ]。对于代码[代码名称],编写:(1)一份两句的描述;(2)纳入标准("应用于……");(3)排除标准("不应用于……",命名它可能混淆的相邻代码[列表]);(4)来自下面提供的文稿的两条简短逐字示例段落,明确符合条件。不要编造引文;仅使用我提供的文本。对任何你不确定的段落进行标记。文稿:[粘贴]。"
Qualitati的角色
Qualitati是一个AI用户研究平台,具有为这个工作流量身定制的专门QDA工作区。你导入文稿、逐行手动编码或接受AI建议代码,并构建和管理编码本——创建、重命名、合并代码并将其组织成具有定义的类别。多个编码者(人类或AI辅助)可以处理相同的数据,工作区计算编码者间信度和编码分析,让你看到何时代码开始漂移。编码数据和代码注释文稿导出为Word和CSV,用于附录和审计跟踪。
对于更大量、问题导向的跨多个文稿的综合分析,Qualitati的ThemeLens运行一个map-reduce主题分析管道来处理多达100份文稿,将代码映射到带有参与者锚定引文的研究问题。QDA工作区是构建和验证编码本的地方;ThemeLens是扩展它的地方。
局限性和权衡
- AI在解释上漂移。LLM在语义一致性和理论负荷代码上有困难;随着你的方案变得更具解释性,一致性下降。
- 模式化偏差。模型可以系统地过度或不足应用某些代码,如果不与人类编码检查,会威胁有效性。
- 罕见代码受损最严重。理论上重要的低频代码恰恰是AI单独编码最不可靠的地方——也是你的贡献通常所在的地方。
- 可重现性对版本很敏感。模型更新可以改变输出;冻结你的编码本版本并记录使用的模型。
- 不是阅读数据的替代品。没有人类阅读文稿而构建的编码本看起来整洁但会遗漏重点。
人类审查说明:这里引用的信度数字来自特定的研究和数据集;你自己的kappa将取决于你的编码本、领域和模型。将已发表数字视为有方向性的,而不是保证。
谁适用——何时不使用它
谁适用:需要可重现、可审计分析的UX研究者、市场和学术定性研究者以及对访谈或开放式回复进行编码的洞察团队。
何时不使用固定编码本:在早期探索或自反工作中,强制预定义代码会削平新兴含义。在那里,从归纳开始,仅在模式稳定后才将编码本正式化。
常见问题
代码和编码本之间的区别是什么?
代码是应用于文本片段的单一标签。编码本是具有定义、纳入/排除规则和示例的完整、文档化代码集合——保持跨人员和时间编码一致的参考。
AI可以自己构建编码本吗?
它可以草拟一个,开源工作流已生成类似人工构建的编码本。但AI在应用现有编码本(演绎编码)上最可靠,在发明设定界限的类别上最弱。研究者应该验证定义、仲裁分歧并拥有解释。
构建编码本需要多少份文稿?
通常3–6份信息丰富的文稿来草拟,加上2–3份新鲜文稿来测试。如果新代码不断出现,添加更多——这表明你还没有达到稳定性。
什么编码者间信度是"足够好的"?
没有通用阈值,但许多应用研究将Cohen's/Fleiss' kappa大约0.6–0.8视为实质性一致性。比达到数字更重要的是理解为什么会出现分歧并修复定义。
使用AI进行编码会损害可重现性吗?
如果你对编码本进行版本控制、记录模型和日期,并保留定义变更的审计跟踪,则不会。可重现性问题通常来自模糊定义和文档不全的决策,而不是AI本身。
归纳或演绎编码——我应该与AI一起使用哪一个?
当你有理论或框架并想要规模和一致性时,使用演绎编码和AI。当你在探索且含义仍在出现时,使用归纳编码(人类领导)。许多项目按顺序同时进行两者。
结论
定性编码本是使AI辅助编码值得信赖的原因:它约束模型、记录你的决策,并给审查者一些东西来审计。有意识地构建它——将代码锚定在你的问题上、编写纳入和排除规则、在新鲜数据上测试、测量信度,并仲裁重要的罕见代码。这样做,AI就变成了一个快速、一致的第二编码者,而不是一个无法解释的黑箱。
准备好构建你的了吗?在Qualitati的QDA工作区中免费开始使用30个积分——编码文稿、管理编码本、并在一个地方计算编码者间信度。或查看透明定价和阅读AI–人类编码者间信度如何工作。