如何审计AI定性编码(2026年检查清单)
Qualitati 研究团队 · 2026-06-04 · 9分钟阅读
最后更新:2026年6月4日
简要答案
要审计AI定性编码,需要将每一个机器生成的代码视为必须可追溯、可复现且经人工验证的主张。2026年CHI研究(Ngo等人)发现LLM在摘录提取方面表现尚可,但在解释性标注上不可靠,对微小提示变化敏感,且不同运行结果不一致。解决办法不是更好的模型,而是流程优化:要求每个代码都有行级证据、冻结提示和种子、在信任任何输出前用人工判断审查分层样本。
为什么AI定性编码需要审计
AI定性编码是指使用大型语言模型为访谈记录、开放式调查答案或焦点小组讨论的片段分配代码——即简短的解释性标签。这种方法速度快、可扩展性强,但它是一个生成过程:模型生成可信的文本,而非经验证的测量。这意味着AI编码器可能会创造出文本中不存在的摘录、附加数据不支持的代码,或在第二次运行时对同一片段进行不同的标注。
这不是假设。根据Ngo等人(2026)对CHI'26设备端编码工具的用户研究,参与者仅给予"有条件的信任"——他们接受该系统用于基础数据提取,但怀疑其解释可靠性和会话间一致性。该研究指出幻觉、对提示措辞的敏感性和不可复现性是核心风险,并建议输出证据-基础结果,包括明确的行级引用、防止虚构摘录和代码的防护,以及可复现的运行。
关键要点
- 幻觉是主要风险。AI可能为从未出现过的摘录生成代码。每个代码都必须指向源文本中的可验证跨度。
- 提示漂移是真实的。编码提示中的小措辞变化可能改变代码——因此提示必须为给定的一次运行进行版本控制和冻结。
- 可复现性不是自动的。重新运行相同数据可能会产生不同的代码,除非该运行被固定。
- 审计是工作流程,而非设置。最具防御性的设置将AI速度与结构化人工审查相结合。
- 演绎法的审计性优于归纳法。针对固定代码簿的编码比开放式主题生成更易审计。
您要审计的四种失败模式
| 失败模式 | 表现形式 | 如何发现 |
| 虚构证据 | 引用的摘录在文本中逐字出现 | 将每个摘录字符串匹配回源文本;拒绝不匹配项 |
| 无依据代码 | 摘录真实但代码勉强或错误 | 人工审查分层样本;检查代码定义 |
| 提示漂移 | 当提示措辞略有改变时代码改变 | 冻结和版本化提示;与数据集一起记录 |
| 运行间不一致 | 同一片段在重新运行时获得不同代码 | 固定模型和解码设置;对子集进行重新运行以测量稳定性 |
Qualitati AI编码审计清单
将此用作任何使用AI编码定性数据的项目的发布前把关。它围绕2026年研究汇聚的三个原则组织——可追溯性、可复现性和人工监督。
1. 可追溯性——您能证明代码来自数据吗?
- 每个代码都附加到具有行或时间戳引用的特定摘录。
- 每个摘录字符串与源文本完全匹配(没有意译"引用")。
- 没有代码在没有支持文本的情况下应用——空代码或推断代码被标记。
- 每个代码的代码簿定义在其应用程序旁边可见。
2. 可复现性——您会再次获得相同结果吗?
- 用于编码的确切提示与项目一起保存和版本化。
- 模型名称和版本被记录(例如提供商和模型ID)。
- 解码设置(温度/可用的种子)被固定和记录。
- 子集文本被重新运行以确认代码在运行间稳定。
3. 人工监督——研究人员是否真的检查过?
- 跨越每个代码的分层样本(例如15–20%的片段)由人工审查。
- 该样本上AI和人工之间的一致性被记录为数字,而非印象。
- 分歧被解决,代码簿或提示相应更新。
- 一名具名研究人员在报告发现前签署批准。
如果任何一项未选中,安全的做法是将输出视为人工修订的草稿,而非结果。这反映了Ngo等人(2026)的设计建议:使输出证据-基础和可追溯,建立防止虚构摘录和代码的防护,并确保运行可重复。
演绎法vs归纳法:哪个更易审计?
两者都可以审计,但它们带来不同的负担。演绎编码——应用预定义代码簿——是更易处理的情况:您可以根据固定定义检查每个应用程序,"对错"相对明确。2025年对LLM演绎编码的比较研究(Wang等人,arXiv)针对这种固定代码簿标准检查了ChatGPT干预,强调当目标明确时可靠性是可测量的。
归纳编码——让模型从头开始生成代码和主题——更难审计,因为没有检查的基准真理,解释步骤正是LLM最薄弱的地方。2026年SAGE研究(Misra等人,国际定性方法期刊)比较传统和研究人员解释的LLM方法得出相同结论:AI可以加速机械层,但人工解释仍是归纳工作的承重部分。有关此划分的更多信息,请参阅我们的归纳vs演绎编码指南。
实际审计工作流程
- 冻结您的输入。在运行任何内容之前锁定代码簿、编码提示和模型版本。与项目一起保存它们。
- 编码需要证据。配置AI为每个代码返回确切的摘录及其位置——绝不会有没有跨度的代码。
- 自动验证证据。以编程方式确认每个返回的摘录在源中逐字出现。拒绝并重新编码不匹配的。
- 抽样和审查。在所有代码中抽取分层样本,让研究人员接受、拒绝或重新标记每一个。
- 测量一致性。在样本上报告AI–人工一致性。如果较低,修复代码簿或提示并重新运行——不要发送。
- 重新运行子集。确认相同片段在第二次运行时获得相同代码以检查可复现性。
- 签署。一名具名研究人员在报告任何主题或发现前批准最终编码数据集。
Qualitati的角色
Qualitati是一个AI用户研究平台,服务于产品、UX和客户洞察团队。其QDA工作区围绕这种审计逻辑构建:AI辅助的归纳和演绎编码,其中代码与源片段相连,代码簿明确,人工研究人员在主题确定前审查和修订。ThemeLens主题分析管道将代码映射到研究问题并使用参与者锚定的引用综合主题——即可追溯到真实文本跨度的引用,而非浮动文本。设计意图是默认人工在循环中:AI完成第一次通过的繁重工作,研究人员进行判断。Qualitati的主持人行为和分析管道根据学术定性研究文献进行记录和改进,包括此处引用的可靠性发现。
限制和权衡
审计降低风险;它不能消除风险。以下是一些诚实的注意事项:
- 抽样可能遗漏罕见错误。15–20%的审查不会捕获大语料库中的每个坏代码——它估计质量,不保证它。
- 一致性指标不完美。简单代码上高AI–人工一致性可能掩盖微妙、高风险代码上的分歧。
- 可复现性是部分的。即使固定模型也可能在提供商更新中改变行为;记录版本并在升级后重新验证。
- 解释仍是人工的。审计保护编码层,但您从主题中提取的意义仍是研究人员的责任。
人工审查说明:此处讨论的可靠性和幻觉数字来自特定模型和任务的第三方研究;不应将其理解为任何特定产品(包括Qualitati)的性能声明。
这是为了谁——何时不使用AI编码
这是为了谁:想要AI编码速度而不牺牲可防御性的UX研究人员、洞察团队、市场研究人员和研究运营领导。
何时不使用AI编码:对于手动编码快速的小数据集;对于在法律或临床上敏感的材料,其中单个误标注会造成真实伤害,完全手动编码有保证;或当您因任何原因无法强制可追溯性和人工审查时。在这些情况下,AI仍可以协助(例如建议候选代码),但不应是记录系统。
常见问题
AI能幻觉定性代码吗?
可以。AI可能为从未说过的摘录附加代码,或引用文本中不存在的文本。这就是为什么在信任之前每个代码都应该追溯到逐字跨度。
AI编码数据集中有多少应该由人工审查?
没有通用数字,但跨越每个代码的分层样本(通常是片段的15–20%)让您估计AI–人工一致性。低一致性意味着修复提示或代码簿并重新运行。
演绎或归纳AI编码哪个更可靠?
演绎编码到固定代码簿更易审计且往往更可靠,因为每个应用程序都可以根据明确的定义检查。归纳主题生成是模型最薄弱的地方。
为什么AI代码在运行间改变?
LLM输出是概率性的,所以除非固定模型和解码设置,否则相同片段可能获得不同代码。重新运行子集是您测量稳定性的方式。
本地或设备端模型是否能解决问题?
它可以帮助隐私,但2026年CHI研究发现设备端模型仍然引发解释可靠性和一致性问题——用户仍然想要可见的防护。本地部署不是审计的替代品。
底线
审计AI定性编码的方法是停止将AI输出视为答案,开始将其视为必须赢得信任的草稿:可追溯到数据、在运行间可复现且经人工检查。在报告单一主题前运行上述清单。使用30学分免费开始——无需信用卡——在QDA工作区尝试可审计的编码通过,或查看透明定价。比较工具?查看Qualitati如何作为NVivo、ATLAS.ti和MAXQDA的AI原生替代品进行对比。
资源
Ngo, T. T., Nguyen Van, D., Nguyen, A.-M., Do, P.-A., & Nguyen-Quoc, A. (2026). Qualitative Coding Analysis through Open-Source Large Language Models: A User Study and Design Recommendations. Extended Abstracts, CHI '26. https://arxiv.org/abs/2602.18352
Misra, R., Dahal, R., Kirk, B., Khan, R., Dogan, G., Chataut, R., & Gyawali, P. (2026). Large Language Models in Qualitative Analysis: Comparing Traditional and Researcher-Interpreted Approaches. International Journal of Qualitative Methods. https://journals.sagepub.com/doi/10.1177/16094069261426100
Wang et al. (2025). Assessing the Reliability of Large Language Models for Deductive Qualitative Coding: A Comparative Study of ChatGPT Interventions. arXiv. https://arxiv.org/abs/2507.14384
本文是第三方研究的独立编辑总结,为教育目的而撰写。它不隶属于或经被引用研究的作者认可。