AI 定性编码中的编码手册漂移(2026)
Qualitati 研究团队 · 2026-09-03 · 9 分钟阅读
简短回答。编码手册漂移(codebook drift)是指随着编码工作推进,某个 code 的实际应用边界在无人宣告的情况下悄然移动——纸面上的定义没变,实践中的边界却变了。在 AI 辅助的定性编码中,漂移的主体有两个而非一个:研究者的解释,以及底层模型。要发现二者,都需要一个固定的锚定样本集在多个时间点被重新编码。
什么是编码手册漂移?
编码手册漂移,就是第 60 份访谈记录在同一个 code 名称下被编码成了与第 6 份不同的样子。没有人做出过改变的决定。定义仍然写在编码手册里,一字未改。但研究者在这之间读了五十份访谈记录,这个 code 已经悄悄从它被应用过的案例中沾染了新的含义,边界因此发生了位移。
定性方法论者长期把这个问题归入编码者内部信度(intra-coder reliability)——即同一位编码者在不同时间与自己的一致性——它与受到远多关注的评分者间信度是两回事。这个问题的 AI 版本在一个具体维度上更糟:它更难被察觉,因为在第 6 份和第 60 份访谈记录上,输出看起来同样自信、同样格式工整。
核心要点
- 漂移是一个时间维度的信度问题。在项目开始时测量一次的编码者间一致性对它毫无说明力。
- AI 辅助工作流引入了第二个漂移来源:模型版本、prompt 和累积的上下文,都可能在你不知情时发生变化。
- 2026 年的一篇 arXiv 系统论文 Co-Refine(2026 年 4 月 21 日)明确将时间性漂移命名为一种可信度威胁,并指出现有 CAQDAS 工具无法实时检测它。
- 《PLoS One》上一项预注册的纵向研究(2026 年 2 月 2 日)在十个连续周次中追踪了三个 LLM 家族,发现其中一个在研究中期出现了性能退化——这说明"同一个模型、同一个 prompt"并不等于"同样的行为"。
- 实用的防御手段成本很低:冻结一组锚定访谈记录,在固定检查点重新编码,并保留一份书面的决策日志。
AI 辅助工作流中会漂移的两样东西
把它当成一个问题来处理,正是让它变得隐形的错误。要把来源分开。
1. 解释性漂移(人的一侧)
研究者的实际操作定义在迁移。一个叫"上手摩擦"的 code,最初指"用户无法完成的步骤",两周后扩张为"用户在早期抱怨过的任何事"。这是经典形态,也有经典的应对方式:写备忘录(memoing)、为 code 定义同时写出纳入与排除标准,并把典型示例钉在定义旁边。
2. 系统性漂移(AI 一侧)
这种情况下研究者的判断是稳定的,机器的判断不是。有四种不同机制:
- 模型版本变更。供应商在同一个模型名称背后更新了 checkpoint。《PLoS One》的纵向研究是这一现象最干净的公开证据:在十个周次、一套固定的 240 条 prompt 上,三个模型家族中的一个在第 6 周出现显著的负向偏移,第 7 周效应量最大(Hedges' g = −0.85)。另外两个则保持稳定或持续改进。同样的 prompt,不同的周次,不同的行为。
- Prompt 修改。项目中途对编码指令做的一个小小措辞调整,就是一次编码手册变更,无论它是否被记录为变更。
- 上下文累积。如果流水线把先前已分配的 code 回灌到后续处理中,那么编码手册就有一部分是由更早的输出写成的。这往往是好事——一致性正是这样维持的——但它使第 20 份访谈记录的编码取决于前 19 份。
- 顺序效应。哪些访谈记录排在前面,会从根本上塑造涌现出的编码手册的样貌。换一种顺序重跑是一项正当的稳健性检验,却很少有人做。
CHI 2026 上一项针对开源 LLM 编码工具的用户研究(西班牙巴塞罗那,2026 年 4 月 13–17 日;预印本)从研究者一侧得出了相同的诉求。其关于信任的建议包括:设置护栏以防止新的 code 在不同阶段之间凭空出现,以及"可复现的运行(保存 prompt 与设置)和可锁定的编码手册"。请注意样本量:4 位参与者。这是一个设计信号,而不是一个测量出的效应,应当如此看待。
编码手册漂移审计
这是我们自己在用、也推荐给他人的原创流程。它被刻意设计得足够轻,以至于团队真的会去执行。总成本:在典型项目上,每个检查点大约三十分钟。
第一步——冻结一组锚定样本
在编码开始之前,抽取 5–8 份访谈记录(或 40–60 个片段),覆盖你预期中的变异范围:不同的人群细分、不同的情绪倾向,其中至少有一份是你确实觉得含混难判的。把它们单独放好。这就是你的锚定样本集。在整个项目周期内它永不更改。
第二步——在固定检查点上编码锚定样本
在项目开始、大致中点和结束时,各重新编码同一组锚定样本。如果项目分波次进行,则每一波编码一次。要在不看先前结果的前提下盲编——不要先去翻自己此前打的标签。
第三步——比较轮次之间,而不是编码者之间
计算你自己在检查点 1 与检查点 2 之间的一致性。任何标准统计量都可以;数值本身不如变化方向重要。你要找的不是一个阈值,而是一种模式:具体是哪些 code 失去了与自身的一致性。
第四步——对发现的问题分类
轮次之间的每一处分歧都落入四种类型之一。类型决定了修复方式。
| 漂移类型 | 表现形式 | 算是问题吗? | 修复方式 |
| 边界蔓延 | 同一个 code,应用范围悄悄变宽或变窄 | 是——且无声无息 | 重写定义并加入排除标准;把检查点往回的全部材料重新编码 |
| 拆分 | 一个 code 实际上在承担两项职能 | 否,只要有记录 | 拆开它,为两个子 code 命名,重新编码受影响的子集 |
| 合并 | 两个 code 在实践中已无法区分 | 否,只要有记录 | 合并,并在审计轨迹中保留旧名称作为别名 |
| 模型偏移 | 你的标签稳定,AI 的标签变了 | 是——一律是 | 核查版本/prompt 变更日志;锁定模型版本;重跑受影响区间 |
第二类和第三类是分析在正常运作——编码手册本就应当归纳式地演化。失败之处不在于它变了,而在于变了却没有把此前的材料重新编码。第一类和第四类则直截了当地构成效度威胁。
第五步——记录决策,而不只是记录变更
每次变更写一行:日期、受影响的 code、变了什么、为什么、以及重新编码了哪个区间。这是审稿人、客户或伦理委员会将会索要的材料。它也正是"编码手册演化了"与"我们无法复原自己做过什么"之间的分野。
漂移检查点清单
- 锚定样本集在编码开始前已冻结,此后未被改动
- 本检查点已对锚定样本集完成盲编
- 轮次间一致性按每个 code 分别计算,而非只算总体
- 每一处分歧都归入了上述四种类型之一
- 每一次 AI 辅助处理都记录了模型名称与版本
- 每一次处理的 prompt 文本都做了哈希或逐字保存
- 任何定义变更都附有明确的重新编码区间
- 决策日志当天写就,而不是事后追记
谁需要这么做——以及何时不必
建议执行审计,如果:项目跨度超过约三周;分波次进行;编码者不止一人;编码手册是归纳式的、预期会不断生长;或者研究结论将面临外部审视(发表、监管方、客户交付物)。
可以跳过,如果:整个语料由一个人、在一次性的时间段内、依据一套固定的演绎式编码手册、用锁定版本的模型完成编码。此时不存在可供漂移发生的时间轴,审计只会沦为仪式。
Qualitati 在其中的位置
Qualitati 是面向产品、UX 与客户洞察团队的 AI 用户研究平台,覆盖 AI 主持的访谈与焦点小组、对话式问卷,以及 AI 辅助的定性分析。其中两个部分与漂移直接相关。
QDA Workspace 支持归纳式与演绎式编码以及编码手册生成,因此编码手册是一个可以做版本管理的显式对象,而不是隐含在某段聊天记录里。这是能够审计漂移的前提——如果从来没有一份书面的编码手册,你就无法把它与它此前的样子作比较。
ThemeLens 以 map-reduce 流水线的方式一次性对至多 100 份访谈记录做主题分析,将 code 映射到研究问题,并综合出带有受访者原话锚定的主题。在一次流水线运行中分析一整批材料,消除了顺序式人工编码所制造的部分时间轴——同一套程序被应用于整批材料,而不是在处理过程中演化。这是一项真实的缓解措施,但它不是解药:跨批次比较,或者比较相隔数周运行的不同项目,时间轴又回来了。锚定样本集仍然是那道检验。
两者都不能替代人来决定一个 code 到底意味着什么。上文的审计流程刻意做到与工具无关——它在 NVivo、ATLAS.ti、MAXQDA、一张电子表格或 Qualitati 中同样适用。
局限与坦率的说明
这个框架并未解决、也不应被读作已经解决的一些问题:
- 漂移并不总是错误。在解释主义框架下,理解的深化重塑了某个 code,恰恰说明分析在奏效。审计的目的不是冻结解释——而是让变化可见、可被重新编码,而不是悄无声息。
- 小样本上的一致性统计量噪声很大。五份访谈记录给不出稳定的系数。要读每个 code 的模式,而不是小数点后第三位。
- 证据基础既薄又新。那项 CHI 研究只有四位参与者。《PLoS One》的纵向研究测量的是通用 prompt 上的表现,而非定性编码本身;我们是在做外推推理——一个输出会跨周变化的模型,作为编码者时也会变化。这是合理推测,不是已被证明的结论。
- 我们没有对漂移率做基准测试。我们不会给出一个"编码手册漂移了多少"的数字,因为我们手上没有一个经得起推敲的数字。
人工复核提示:上文的漂移分类法是一个从既有编码者内部信度实践中综合出来的实务框架,而非经过验证的量表。请结合你自己的方法论加以调整,并在写入预注册之前请方法论专家审阅。
结论
AI 定性编码中的编码手册漂移是一个具有两个来源的时间维度信度问题——你的解释与系统的判断——而只在开始时测量一次的编码者间统计量,两者都抓不住。冻结一组锚定样本,在检查点上重新编码,对变动之处分类,记录决策。这是 AI 辅助工作流中成本最低的严谨性,也是最常被跳过的那一项。
常见问题
定性研究中的编码手册漂移是什么?
编码手册漂移是指在编码过程中,某个 code 的应用方式发生了渐进的、通常不被察觉的变化,而其书面定义保持原样。它是编码者内部不可靠性的一种形式:同一位编码者在不同时间点对同样的材料给出了不同的编码。
编码手册漂移与评分者间信度有何不同?
评分者间信度比较的是同一时间点上的两个人。漂移比较的是同一位编码者(或同一套系统)跨越时间的自身。一个项目完全可能在第一周拥有极佳的编码者间一致性,而到第六周已经出现实质性漂移,标准的信度报告两者都不会显示。
AI 会造成编码手册漂移吗?
会,途径有若干:供应商悄悄更新模型版本、项目中途修改 prompt、或者流水线把更早的输出喂进后续处理。《PLoS One》的纵向研究(2026 年 2 月 2 日)发现,在一套固定 prompt 下,三个模型家族中的一个在第 6 周发生了显著偏移,这直接证明"模型名称相同"并不保证行为稳定。
应该多久检查一次漂移?
最低限度是在编码的开始、中间和结束各一次。如果项目分波次收集数据,则每波检查一次。如果你更换了模型、prompt 或某个 code 的定义,这一变更本身就是一个检查点——先重新编码锚定样本集,再继续。
编码手册在演化,是否意味着我的分析无效?
不是。归纳式分析本就应当让编码手册演化。真正威胁效度的,是演化之后没有按新定义重新编码此前的材料,也没有记录变更发生过。变更+重新编码区间+一条日志是严谨的;只有变更则是漂移。
这套审计最小可用的版本是什么?
冻结五份访谈记录作为锚定样本集,在中点重新编码一次,把分歧归入那四种类型。在多数项目上这不到一小时,却能抓住最要紧的边界蔓延与模型偏移。
在你自己的数据上试一试
Qualitati 提供 AI 主持访谈、AI 主持焦点小组、对话式问卷以及 AI 辅助主题分析,并公开按 credit 计费的使用费率。免费开始,赠送 30 credits——无需信用卡——或查看透明定价。如果你正在评估从传统 QDA 软件迁移,可参阅我们的 NVivo 替代方案指南与 MAXQDA、ATLAS.ti 与 NVivo 对比。
延伸阅读:AI 定性编码中的评分者间信度、为 AI 定性分析建立审计轨迹,以及如何用 AI 构建编码手册。
最后更新:2026 年 9 月 3 日。本文为独立编辑性综述。竞品与工具相关表述均基于该日期时公开可得的信息;凡未公开的细节,我们会直接说明,而不做估计。