{"slug":"is-ai-qualitative-coding-biased-2025","title":"AI 定性编码有偏差吗？2025 年一项研究的发现","description":"2025 年发表于 Sociological Methods & Research 的研究发现，ChatGPT 和 Llama 2 的编码错误与受访者特征相关；而小型监督模型更准确、偏差更小。","keywords":"AI 定性编码偏差,LLM 编码偏差,ChatGPT 定性分析,Llama 2,监督模型,iQual,2025 研究,定性研究","date":"2026-07-28","author":"Qualitati 研究团队","category":"指南","readTime":"8 分钟阅读","content":"\n<p><strong>是的——2025 年的一项研究发现，使用大语言模型（LLM）对定性访谈进行编码，可能引入<em>系统性</em>偏差，而不只是随机误差。</strong>ChatGPT 和 Llama 2 在标注访谈记录时，其错误与受访者的特征（如难民身份和孩子的性别）相关，从而扭曲了后续结论。一个基于人工编码训练的小型监督模型，不仅更准确，偏差也小得多。</p>\n\n<h2>这项研究测试了什么？</h2>\n<p>该研究探讨的是：LLM 能否可靠地标注来自开放式访谈的大样本定性数据。根据 Ashwin、Chhabra 和 Rao（2025）发表于 <em>Sociological Methods &amp; Research</em> 的研究，作者分析了孟加拉国考克斯巴扎尔地区罗兴亚难民及其孟加拉国东道主的 <strong>2,407 份开放式访谈</strong>记录。这些访谈围绕父母对长子女的期望展开——这正是定性方法最能发挥价值的那类细腻、需要解释的概念。</p>\n<p>受过训练的社会学家使用包含 19 个编码的灵活编码方案，人工标注了其中 <strong>789</strong> 份访谈记录。随后，研究者在 200 份访谈组成的留出测试集上比较了三种方法：直接由 LLM 标注、定制的监督模型，以及作为金标准的人类专家编码。</p>\n\n<h2>他们比较了哪些模型？</h2>\n<p>研究团队将闭源和开源 LLM 与一个专门构建的分类器进行了基准对比。比较对象包括：</p>\n<ul>\n  <li><strong>ChatGPT（GPT-3.5）</strong>——闭源模型，通过提示词让其对每份访谈记录编码并解释理由。</li>\n  <li><strong>Llama 2 13B（chat 版和 base 版）</strong>——Meta 的开源模型，使用相同方式提示。</li>\n  <li><strong>iQual</strong>——在人工标注上微调的定制监督分类器（轻量级 BERT 系列模型）。</li>\n</ul>\n\n<h2>AI 编码的准确度和偏差如何？</h2>\n<p>在准确度和偏差两方面，定制的监督模型都胜过 LLM。根据 Ashwin、Chhabra 和 Rao（2025），对所有编码的样本外 F1 分数取平均，<strong>iQual 表现最佳</strong>——在复现人工编码方面优于 ChatGPT 和两个 Llama 2 变体。更引人注目的是偏差检验：作者将每个编码的出现率对受访者特征进行回归，以检验标注错误是否是随机的。</p>\n<p><strong>iQual 仅在 19 个编码中的 1 个上显示出偏差迹象。LLM 未能通过偏差检验的情况则多得多，在许多编码上都有明显的偏差证据。</strong>由于这些错误与受访者是谁相关，它们不是可以相互抵消的噪声，而是系统性的扭曲。</p>\n\n<table>\n  <thead>\n    <tr><th>方法</th><th>相对准确度（平均 F1）</th><th>被标记存在偏差的编码数（共 19 个）</th></tr>\n  </thead>\n  <tbody>\n    <tr><td>iQual（监督模型，基于人工编码训练）</td><td>所有方法中最佳</td><td>1</td></tr>\n    <tr><td>ChatGPT（GPT-3.5）</td><td>低于 iQual</td><td>较多</td></tr>\n    <tr><td>Llama 2 13B（chat / base）</td><td>低于 iQual</td><td>较多</td></tr>\n  </tbody>\n</table>\n<p><em>来源：Ashwin、Chhabra &amp; Rao（2025），Sociological Methods &amp; Research。“较多”反映的是论文在众多编码上发现了明显的偏差证据；具体数量因模型而异。</em></p>\n\n<h2>为什么有偏差的编码会影响你的研究发现？</h2>\n<p>有偏差的编码可能颠覆一项研究的结论。作者表明，基于 LLM 标注得出的估计有时与基于人工编码得出的估计不一致——在若干情况下，专家标注下为正且显著的关系，在 ChatGPT 标注下变成了负向或不显著。仅依赖 LLM 输出的研究者，可能会报告与数据真实情况相反的结论，把算法造成的假象误认为现实世界中的规律。</p>\n<p>这不同于人们熟悉的“AI 只是不够准确”的担忧。随机误差主要是增加噪声。而与受访者人口特征相关的系统性偏差，则可能悄悄制造——或抹去——定性研究和混合方法研究者最关心的群体差异。</p>\n\n<h2>作者提出了哪些建议？</h2>\n<p>作者建议基于人工编码训练一个定制模型，而不是直接用 LLM 进行标注。他们的理由很务实：仅仅为了<em>检验</em> LLM 是否存在偏差，你就已经需要一批高质量的人工标注，因此不如把这些标注用来训练一个更小、偏差更低的监督分类器。他们将 LLM 和自然语言处理（NLP）定位为<strong>辅助和扩展</strong>传统定性分析的工具，而不是取代对访谈记录的细读——正是这种细读才能产出站得住脚的编码树。</p>\n<p>对于今天正在进行 AI 辅助分析的团队，可以得出以下具体启示：</p>\n<ol>\n  <li><strong>保留一份人工编码的金标准集。</strong>没有它，你根本无法检测偏差。</li>\n  <li><strong>不仅检查准确度，还要做偏差检验。</strong>检验编码错误是否与受访者特征相关，而不只是看整体一致性是否很高。</li>\n  <li><strong>优先采用人在回路的核验</strong>，而不是未经审核的批量自动编码，尤其是在需要解释或与身份相关的构念上。</li>\n</ol>\n<p>这正是 AI 定性工具应当围绕可审计、可由人工复核的编码手册来构建的原因。在 <a href=\"https://qualitati.com/themelens\">ThemeLens</a> 中，AI 建议的主题和编码始终可编辑，并可追溯到访谈记录，研究者因此可以验证并纠正机器的解读，而不是盲目接受。在 <a href=\"https://qualitati.com/qda-workspace\">QDA 工作区</a>中扩大开放式编码时，同样的原则适用：AI 提出建议，研究者做出决定。</p>\n\n<h2>常见问题</h2>\n<h3>AI 总是会给定性编码带来偏差吗？</h3>\n<p>不一定，但风险真实存在且不易察觉。2025 年的这项研究发现，LLM 的标注错误在许多编码上与受访者特征存在系统性关联，而基于人工编码训练的监督模型仅在 19 个编码中的 1 个上存在偏差。最稳妥的假设是：在你检验之前，偏差就是可能存在的。</p>\n\n<h3>我如何检查自己的 AI 编码是否有偏差？</h3>\n<p>将 AI 编码与人工编码的样本进行比较，然后检验分歧是否与受访者属性（年龄、性别、群体归属）相关，而不是随机分布。如果错误按子群体聚集，你的后续估计可能已经被扭曲。</p>\n\n<h3>定制模型真的比前沿 LLM 更好吗？</h3>\n<p>在这项研究中，是的。一个在专家标注上微调的轻量级监督分类器取得了最佳的平均 F1 和最低的偏差，在这项编码任务上，两方面都优于 ChatGPT 和 Llama 2。</p>\n\n<h3>我应该停止在定性分析中使用 LLM 吗？</h3>\n<p>不必——作者将 LLM 定位为助手而非替代者。用它们加快编码、提出候选编码，但要在流程中保留人工阅读、金标准样本和明确的偏差检验。</p>\n\n<p><a href=\"https://arxiv.org/abs/2309.17147\">阅读原论文：“Using Large Language Models for Qualitative Analysis can Introduce Serious Bias”（Ashwin, Chhabra &amp; Rao，Sociological Methods &amp; Research，2025）</a>。</p>\n\n<p><em>最后更新：2026-07-28。</em></p>\n<p><em>本文是对第三方研究的独立编辑性摘要，与该研究作者无关联，亦未获其认可。</em></p>\n","related":[{"slug":"ai-conversational-interviewing-2026-study","title":"AI 能做研究访谈吗？2026 年实地研究结果","description":"AI 能做研究访谈吗？2026 年一项 571 人实地研究比较了 AI 语音访谈、文字访谈与标准化问卷的效果。","category":"指南","date":"2026-07-31","readTime":"8 分钟阅读","author":"Qualitati 研究团队"},{"slug":"digital-twins-survey-respondents-2026-study","title":"数字孪生能取代问卷受访者吗？2026年研究结论","description":"哥伦比亚商学院 2026 年研究发现，在 164 项结果指标上，LLM 数字孪生与真实问卷回答的相关系数仅为 r = 0.20：它们是哈哈镜，而非替代品。","category":"指南","date":"2026-07-29","readTime":"8 分钟阅读","author":"Qualitati 研究团队"},{"slug":"best-llm-thematic-analysis-reliability-study","title":"哪个 LLM 最擅长主题分析？2026 年信度研究解读","description":"2025 年 12 月的一项研究让 Gemini 2.5 Pro、GPT-4o 与 Claude 3.5 Sonnet 各运行六次做主题分析，用 Cohen’s kappa 与余弦相似度测量评分者间信度，三者均超过 0.80 的优秀阈值，Gemini 以 0.907 领先。本文解读研究设计、结果与对定性研究者的启示。","category":"指南","date":"2026-07-27","readTime":"8 分钟阅读","author":"Qualitati 研究团队"}]}