LLM 能可靠标注民族志文本吗?2026 年 7 模型基准研究
Qualitati 研究团队 · 2026-09-15 · 7 分钟阅读
简短回答
LLM 能可靠地标注民族志文本吗?目前还不能。2026 年 1 月,一项由牛津大学牵头的研究在 567 段民族志文本上测试了 7 个大语言模型。在 115 个仪式特征上,表现最好的配置平均 F1 仅为 0.41。模型在具体、明确描述的特征上表现尚可,但在长文本、分级判断和含义模糊的概念上明显吃力。
许多研究者希望 LLM 能把"厚描述"式的定性材料大规模转化为结构化变量。这项研究是迄今针对长篇、高难度材料检验这一设想最严谨的测试之一。下文介绍它测试了什么、发现了什么,以及如果你用 AI 编码访谈、田野笔记或其他长篇定性文本,这意味着什么。
核心要点
- 在主数据集上,所有模型和提示条件下的平均 F1 介于 0.12 到 0.41 之间(Goodall 等,2026)。
- 开源权重的 DeepSeek V3.1 与 GPT-OSS 120B 并列第一(F1 = 0.41),Claude Sonnet 4.5(0.39)和 GPT-5 Nano(0.37)紧随其后。
- 有明确文本线索的特征(葬礼、舞蹈、歌唱)在最佳模型上 F1 > 0.60;而"心理不适"等需要解读的特征 F1 < 0.30。
- 人类编码者难以达成一致的特征,LLM 同样难以处理;即便在人类高度一致的特征上,模型也不及人类。
- 不同 LLM 之间的一致性远低于两名人类编码者之间的一致性(κ = 0.23 对 κ = 0.57)。
这项研究测试了什么?
研究检验的是:现成的 LLM 能否从真实的民族志文本中提取结构化的仪式特征。论文题为 "Large language models struggle with ethnographic text annotation",作者为 Leonardo S. Goodall、Dor Shilton、Daniel A. Mullins 和 Harvey Whitehouse,于 2026 年 1 月 17 日发布在 arXiv 上,作者来自牛津大学、特拉维夫大学和伦敦大学伯贝克学院。
语料来自电子版人类关系区域档案(eHRAF):567 篇描述 73 种文化中仪式的文本。文本中位长度为 653 词,范围从 43 词到 8,924 词。这远长于此前多数"LLM 媲美人类编码者"研究所用的推文和简短问卷回答。
作者基于该语料构建了两个数据集:
- 形态空间数据集:115 个仪式特征(功能、持续时间、行为、情绪状态),主要由一名专家编码。
- 同步性数据集:6 个描述同步行为的特征(歌唱、吟诵、祈祷、行进、舞蹈、一般性动作),每个特征由两名人类独立编码,因此可以与人类评分者间信度直接比较。
研究比较了三种提示策略:一次标注一个特征(零样本)、一次标注同一类别下的全部特征(多任务提示),以及将多任务提示重复 10 次并取最常见答案(集成采样)。
LLM 的准确度如何?
准确度远低于无人监督标注所需的水平。下表列出了 115 个特征数据集上报告的平均 F1。
| 模型 | 类型 | 平均 F1(报告的最佳条件) |
| DeepSeek V3.1(671B MoE) | 开源 | 0.41 |
| GPT-OSS 120B | 开源 | 0.41 |
| Claude Sonnet 4.5 | 闭源 | 0.39 |
| GPT-5 Nano | 闭源 | 0.37 |
| Perplexity Sonar(可联网) | 闭源 | 0.23 |
| Llama 3.2 Instruct(3B)、Qwen 3 Instruct(4B) | 开源 | 低于 0.25 |
多数类基线的平均 F1 仅为 0.02,说明模型确实捕捉到了真实信号。但据 Goodall 等(2026)所述,绝对表现仍"远低于"可靠水平。联网也没有帮助:Perplexity Sonar 相比离线模型并无优势。
提示策略的作用有限。多任务提示使多数模型的 F1 提高 0.02 到 0.07;集成采样再增加 0.01 到 0.02。在较简单的同步性数据集上,最佳结果为 F1 = 0.54(GPT-5 Nano,多任务提示)。
为什么 LLM 难以处理民族志文本?
作者指出了三个原因:文本长度、需要解读的特征,以及真实存在的模糊性。
文本越长,误报越多
文本越长,F1 越低、误报越多。作者认为这是虚假的模式匹配:在长篇文本中,模型会抓住并不代表该特征真实存在的表层线索。小模型尤为极端:Llama 3.2 Instruct 几乎在所有情况下都预测"存在"(误报率 > 98%)。
分级与解读性特征最难
多分类特征(需要在有序或类别选项中作选择)被正确识别的几率比二分类特征低 90%(OR = 0.10)。"唤醒水平""仪式形式"这类特征无法从明确字词中直接读出,需要语境和文化知识。
人类分歧设定了上限
在同步性特征上,两名人类编码者的平均 Cohen's kappa 为 0.57,原始一致率为 89%。一致性从同步歌唱的 κ = 0.92 到一般性动作的 κ = 0.25 不等,而 LLM 的准确度排序与之一致。在人类一致性较差的特征上(κ < 0.40),LLM 的表现接近随机。
LLM 犯的错误和人类一样吗?
不一样,二者的错误方向相反。人类编码者偏保守:平均误报率为 4%,但漏报率为 51%。多数 LLM 则倾向于过度报告特征。而且模型之间的分歧远大于人类之间的分歧,这限制了简单汇总多个模型所能带来的改进。
研究也发现了一个实用信号。在 214,529 次预测中,集成采样时反复一致给出的答案更可能正确:确定度为 91–100% 时准确率为 81%,确定度为 10–50% 时为 68%。这一效应在 GPT-OSS 120B 上最强(r = 0.36),在 Llama 3.2 上则不存在(r = -0.01)。
这对定性研究者意味着什么
这一结论不止适用于人类学。深度访谈、田野笔记、日记等任何长篇、需要解读的定性数据,都具备让这些模型失手的特点。
- 先检验人类一致性。如果两名受过训练的编码者都无法就某个编码达成一致,就不要指望 LLM 能可靠地应用它。
- 自动化优先用于具体的二分类编码。分级判断和潜在含义的判断留给人类,或把 AI 输出当作初稿。
- 把长文档切分成段。文本长度会导致误报,因此应编码较短的片段,并保留每个编码所依据的原文引语。
- 把多次运行的一致性作为预警信号。不一致的标注交由人工复核。
- 在编码手册上多下功夫。作者没有测试带示例的详细编码手册或微调,并将二者列为有待研究的问题。
这正是 ThemeLens 等人机协同工具的设计逻辑:AI 提出与原文引语绑定的编码,由研究者审阅和修改,而不是直接接受一次性的自动化结果。
常见问题
ChatGPT 或 Claude 能编码民族志田野笔记吗?
能提供帮助,但不能无人监督。在这项 2026 年的研究中,Claude Sonnet 4.5 的平均 F1 为 0.39,在 115 个仪式特征上没有任何模型超过 0.41。应把输出视为需要专家审阅的初稿。
开源 LLM 做定性标注更差吗?
不一定。大型开源权重模型(DeepSeek V3.1、GPT-OSS 120B)与所测闭源模型持平甚至更好;参数量很小的模型(3B–4B)表现最差。
更好的提示能解决问题吗?
只能部分解决。多任务提示与集成采样合计带来的提升不到 0.1 个 F1 点。作者建议将带示例的编码手册和微调作为尚未测试的下一步。
为什么早期研究发现 LLM 能媲美人类编码者?
据作者分析,那些研究大多使用短文本、窄编码方案和模糊性较低的类别。而长篇、文化内涵密集的民族志文本是更严苛的测试。
最后更新:2026 年 9 月 15 日
本文是对 Goodall、Shilton、Mullins 和 Whitehouse(2026)第三方研究的独立编辑摘要。Qualitati 与作者无关联。完整方法与结果请参阅原论文。