Human-in-the-loop AI 标注真的有效吗?2025 年研究解读
Qualitati 研究团队 · 2026-06-28 · 7 分钟阅读
最后更新:2026 年 6 月 28 日
简要回答
让人类“参与其中”(human-in-the-loop)并不会自动解决 AI 标注的问题。在一项 2025 年预注册的实验中,MIT 的 Schroeder、Roy 和 Kabbara 招募了 410 名标注者,收集了超过 7,000 条标注。他们发现,向标注者展示 LLM 建议的标签会锚定他们的判断,改变整体标签分布,并让人更加自信——却没有让他们更快。更关键的是,当这些 AI 辅助标签随后被用于评估同一个 AI 时,模型的测量表现被夸大了。人工审核是必要的,但并不能保证效度。
核心要点
- 根据 Schroeder 等人(2025)的研究,LLM 的标签建议产生了强烈的锚定效应:标注者的标签分布“显著”地向模型建议偏移。
- LLM 辅助提高了标注者的自信,但并未加快标注速度。
- 用 AI 辅助标签作为评估 AI 的“金标准”,会夸大模型的报告表现——这是一个循环论证陷阱。
- 对于主观任务(情感、立场、框架、主题判断),风险最高,因为这类任务没有唯一正确答案——而这恰恰是定性研究者最关心的任务。
- “Human-in-the-loop”是一种工作流程,而非效度声明。AI 判断与人工判断的先后顺序会改变结果。
这项研究测试了什么?
研究者针对主观文本标注任务开展了一项预注册的在线实验——这类任务中,合理的编码者之间也会存在分歧。他们招募了 410 名众包标注者,在不同实验条件下产生了超过 7,000 条标注,各条件的区别在于是否以及如何在每个条目旁展示 LLM 建议。由于任务是主观的,不存在唯一的“真实”标签,因此研究团队测量的是:与无建议的基线相比,出现 AI 建议时人类标签的分布如何变化。
AI 建议对人类编码者的影响有多大?
影响很大。根据 Schroeder、Roy 和 Kabbara(2025)的研究,标注者“大量采纳了 LLM 的建议,使标签分布相较基线发生了显著变化”。换言之,同一个人在看到 AI 提出的标签后,往往会直接认可它,而不是独立地重新判断该条目。这与关于自动化偏差和锚定效应的更广泛文献一致:当屏幕上出现一个看似笃定的默认选项时,人们会不自觉地向它靠拢。
另有两个次要效应对研究运营同样重要。第一,获得 LLM 建议时,标注者报告的自信程度更高——即便独立性在下降,他们却感觉更有把握。第二,建议并未加快标注速度,因此常见的理由(“人工扫一眼又快又便宜”)也失去了一个主要卖点。
为什么这会夸大 AI 的准确率?
这正是论文所强调的循环问题。假设你用“人类 + LLM”的工作流程生成标签,再把这些标签作为基准来衡量 LLM 的好坏。由于人类标签已经被拉向 LLM 的输出,模型实际上是在用一份它参与编写的答案来给自己打分。研究发现,在这种设置下“报告的模型表现显著提升”。任何建立在这些标签之上的下游分析——效应量、流行率估计、主题频次——都会继承同样的失真。
AI 优先与人工优先标注:对比
| 维度 | AI 先建议(审核模式) | 人工优先(盲评后再协调) |
| 锚定风险 | 高——标签分布向模型偏移 | 低——在看到 AI 之前先记录人工判断 |
| 速度 | 无可测的提升(Schroeder 等人,2025) | 前期较慢,但可审计 |
| 自信校准 | 自信被高估 | 更真实地反映实际分歧 |
| 能否安全地评估 AI? | 否——循环论证,夸大指标 | 能——独立的参照标签 |
| 最佳用途 | 大批量、低风险的初筛 | 信度检验、对效度要求高的编码 |
这对定性研究者意味着什么
定性编码本质上就是一种主观标注任务。如果你的编码手册涉及解释性判断——情感、动机、立场或主题归属——那么当 AI 提出编码、由人类“批准”时,同样的锚定机制也会起作用。三点实践启示:
- 不要用 AI 辅助标签来衡量 AI 的一致性。若要估计 AI 编码者与人类的匹配程度,应先收集至少一部分盲评的人工编码,再进行比较。这样才能让你的评分者间信度估计保持可信。
- 将生成与验证分开。对照 AI 进行协调的编码者,不应成为信度统计的数据来源。应保留一个独立的、未接触 AI 的样本作为参照。
- 把“human-in-the-loop”视为一种设计选择,而不是质量认证。记录操作顺序:人类是在做出判断之前还是之后看到 AI 标签的?
这也是为什么支持定性分析的工具应当让工作流程透明可见。在 Qualitati 的 QDA Workspace 和 ThemeLens 主题分析流程中,AI 辅助编码的设计会保留审计轨迹,并让研究者将 AI 建议与自己的判断进行比对协调,而不是不加审视地照单全收——从而使信度可以被检验,而不是被默认。
局限与待解问题
该研究使用的是完成简短主观任务的众包工作者,而非运用复杂编码手册的受过训练的定性研究者,因此专家群体中锚定效应的大小仍是未知数——专家可能更能抵抗,也可能在时间压力下同样容易被锚定。这项工作是 2025 年的 arXiv 预印本,引用时请确认其发表状态。此外,“盲评优先”的标注需要花费时间和资金,因此速度与独立性之间如何权衡,取决于标签对效度的要求有多高。
常见问题
Human-in-the-loop 的 AI 标注能让标注更快吗?
在本研究中不能。根据 Schroeder 等人(2025)的研究,LLM 建议并没有让标注者更快,尽管他们感觉更有信心。
什么是 AI 标注中的锚定效应?
它指的是人类标注者仅仅因为看到了 AI 建议的标签,就倾向于把自己的标签向其靠拢。这项 2025 年的研究发现,与无建议的基线相比,这一效应显著改变了整体标签分布。
可以用 AI 辅助标签来评估我的 AI 编码者吗?
不应该。由于这些标签被拉向模型自身的输出,它们会夸大模型的测量表现。评估时应使用独立的、未接触 AI 的参照标签。
如何确保 AI 辅助的定性编码保持效度?
在展示 AI 建议之前先收集一部分盲评的人工编码,保留审计轨迹,并将生成标签的人员与用于衡量信度的参照集分开。
结论
“让人参与其中就行”本身并不是一种效度策略。2025 年的证据表明,AI 建议会锚定人类判断、助长虚假的自信,而且——如果不加小心——还会悄然夸大你用来信任 AI 的那些指标。对于定性研究而言,解决之道在于流程:先盲评,再协调,永远不要用 AI 参与生成的标签来给 AI 打分。
主要来源:Schroeder, H., Roy, D., & Kabbara, J. (2025). Just Put a Human in the Loop? Investigating LLM-Assisted Annotation for Subjective Tasks. arXiv:2507.15821.
本文是对第三方研究的独立编辑摘要。数据与发现均归属于所引用的作者;Qualitati 与其无任何关联。最后更新:2026 年 6 月 28 日。