LLM 编码手册怎么改?专家时间该花在哪里(2026 研究)
Qualitati 研究团队 · 2026-09-24 · 7 分钟阅读
简短回答:宾夕法尼亚州立大学与康奈尔大学 2026 年 9 月的一项研究发现,改进 LLM 编码手册最快的办法是:让来自不同厂商的多个 LLM 先对数据进行标注,找出它们分歧最大的案例,再只请专家对这些案例进行标注并说明理由。该方法相对专家标签的准确率达到 64.9%,超过了专家花六个月打磨的编码手册(57.8%)。
用 LLM 编码过定性数据的人都知道,瓶颈不在模型,而在编码手册。团队会议上看似清晰的定义,一到边界案例就站不住脚,修订往往意味着数月的每周校准会议。一篇新的预印本论文——Zeyu He、Zhuqian Zhou、Kirk Vanacore、Rene F. Kizilcec 与 Ting-Hao 'Kenneth' Huang 的 《Experts Rise Where LLMs Disagree》(arXiv,2026)——检验了一条捷径:用 LLM 之间的分歧来决定稀缺的专家时间该花在哪里,再以 LLM 最能利用的形式收集专家意见。
核心要点
- 跨模型分歧是实用的难度信号。三个 LLM 标签一致时,多数投票准确率为 66.2%;三者各不相同时,准确率跌至 12.8%。
- 专家反馈的方式比数量更重要。对疑难案例进行标注并附上简短理由,效果优于回答澄清问题,也优于修改 AI 起草的编码手册修订稿。
- 采用"理由标注"时,每位专家约投入 2.8 小时,得到的 LLM 编码手册就优于专家打磨出的最终版本——而每位专家估计后者的开发耗时约 300 小时。
- 单靠 LLM 自行修订编码手册没有帮助:纯 AI 修订版准确率为 53.1%,未修改的初始编码手册为 53.4%。
- 多样性必须来自不同的模型厂商。模仿单个专家的人设提示(persona prompt)几乎没有带来标签差异。
这项研究检验了什么?
研究比较了三种收集专家反馈的方式,用于修订由 LLM 大规模应用的编码手册。研究场景是一个真实的长期标注项目:两位教育专家针对来自三家辅导机构的数学辅导访谈记录,构建了包含 29 种辅导行为的分类体系(加上"None"共 30 个标签),并在六个月里每周开会完善。
研究者取该编码手册的最早版本,让来自六家厂商的六个 LLM(GPT 5.1、Gemini 2.5 Pro、Claude Sonnet 4.5、Qwen3 Coder、DeepSeek V3.2 和 Mistral Large 3)标注 6,595 条专家从未见过的辅导教师话语。他们用归一化投票熵(衡量六个模型标签分散程度的指标)为每条话语打分,并按平均分歧程度对标签排序。随后,每种工作流针对 12 个标签展开,覆盖高、中、低三档分歧。
所有修订后的编码手册都在一个留出集上评估,该集包含来自 110 次辅导的 4,032 个专家共识标签;评估时由同样的六个模型进行标注,并用八种不同方法汇总投票。
哪种专家反馈方式效果最好?
"理由标注"效果最好,结构化问答次之,而核验 AI 起草的修改几乎没有作用。三种工作流分别是:
- 编码手册核验(CV):LLM 根据分歧案例起草编码手册修订,专家审阅并修改。
- 问答(QA):LLM 将分歧归纳为若干歧义模式,生成澄清问题(每个标签六个),再根据专家的回答改写编码手册。
- 理由标注(RL):专家针对每个目标标签,对 10 条精选的分歧话语进行标注并解释理由,且看不到任何模型预测;随后由 LLM 改写相关的编码手册条目。
| 编码手册 | 准确率 | 加权 F1 | 专家耗时(每人) |
| 初始编码手册(未修订) | 53.4% | 0.536 | 无 |
| 纯 AI 修订 | 53.1% | 0.547 | 无 |
| 编码手册核验(最佳变体) | 53.7% | 0.557 | 0.9 小时 |
| 问答(最佳变体) | 60.5% | 0.613 | 3.0 小时 |
| 理由标注 | 64.9% | 0.658 | 2.8 小时 |
| 专家最终编码手册(六个月) | 57.8% | 0.583 | 约 300 小时(事后估计) |
根据 He 等人(2026)的配对检验,理由标注和最佳问答设置在全部八种汇总方法下都优于专家最终编码手册。作者指出,300 小时这一数字涵盖整个标注项目,而不仅是编码手册的修改,因此只是背景参考,并非同口径的成本比较。
为什么 LLM 之间的分歧能指向疑难案例?
模型之间的分歧往往恰好出现在编码手册含糊、缺少规则或需要精细划界的地方。在对 825 条专家已标注话语的预实验中,作者发现:GPT 5.1、Claude Sonnet 4.5 和 Gemini 2.5 Pro 三者一致时准确率为 66.2%(408 条),两者一致时为 36.0%(308 条),三者各不相同时为 12.8%(109 条)。
提升集中在最需要的地方。在分歧最高的十个标签上,加权 F1 从初始编码手册的 0.295 提高到理由标注的 0.568,而六个月的专家编码手册为 0.429。在所有条件下,低分歧标签得分最高,高分歧标签得分最低。
有一个设计细节值得借鉴。作者起初尝试让模型依据每位专家的写作和博士论文来模仿专家,但这些人设几乎没有改变标签。不同厂商之间的预测差异远大于同一厂商内部,因此最终的模型组合采用了六家不同厂商。
为什么修改 AI 起草的修订稿没有帮助?
请专家核验 LLM 提出的编码手册修改是耗时最少的工作流,但几乎没有带来提升,其中一个变体甚至低于初始编码手册(52.0%)。作者认为,在边界案例上,缺少专家指导的 LLM 只能猜测,因此它起草的修订给专家提供了错误的回应对象。自动提示优化方法也好不到哪去:在没有金标准标签的情况下,APO 和 SPO 都低于未修订的编码手册。
专家自己的评分提供了更多细节。QA 被评为脑力负担最重(7 分中的 7 分),但也最能揭示此前未考虑到的区分;理由标注的负担最轻(7 分中的 3.5 分)。因此,QA 可能适合项目早期,那时团队仍需要发现自身的歧义所在。
这对定性研究者意味着什么
实际启示是:把专家时间花在附带理由的标注样例上,而不是校对 AI 文本。如果你用 LLM 大规模进行演绎式编码,基于这项研究的一套可行流程如下:
- 起草编码手册,为每个编码写明解释、示例和近似反例。
- 让来自不同厂商的多个模型用它标注尚未编码的数据。
- 按模型分歧程度对片段和编码排序。
- 请团队在盲态下对一小批争议最大的片段编码,每条附一句理由。
- 让 LLM 把这些标签和理由整合进编码手册,再在留出的人工编码样本上重新测试。
能够查看并修正 AI 所施加编码的工具,会让这个循环更容易运转。例如在 ThemeLens 中,你可以在 AI 编码进入主题之前先审阅它们。如需更全面地了解编码手册结构,请参阅我们的指南:如何为 AI 定性编码构建编码手册。
也要看清局限。这只是一个项目,只有两位专家,且标签集基本固定,因此结果未必适用于编码仍在涌现的归纳式编码。作者还指出了一个真实的权衡:缓慢的编码手册工作正是专家熟悉数据的过程,把它压缩到几个小时,可能会牺牲部分理解。
常见问题
LLM 编码中的跨模型分歧是什么?
指多个不同的 LLM 在同一编码手册下,对同一文本片段给出的标签的分散程度。该研究用归一化投票熵来衡量:0 表示所有模型一致,1 表示每个模型选择了不同的标签。
理由标注需要多少专家时间?
在这项研究中,每位专家对 60 条争议话语进行了标注并附上理由,平均耗时约 2.8 小时。
没有人工输入,LLM 能改进编码手册吗?
在这项研究中不能。纯 AI 修订改写了全部 30 个标签,准确率却只有 53.1%,略低于原始编码手册的 53.4%。
这能取代评分者间信度检验吗?
不能。该工作流决定的是专家精力的投放方向,你仍然需要一份人工编码的留出样本,来确认修订后的编码手册确实提高了与专家判断的一致性。
最后更新:2026 年 9 月 24 日。
本文是 Qualitati 对第三方研究的独立编辑摘要,与论文作者无隶属或背书关系。完整方法与结果请阅读原始预印本:arXiv:2609.26926。