LLM 能捕捉专家的不确定性吗?2026 年研究
Qualitati 研究团队 · 2026-08-06 · 7 分钟阅读
大语言模型在识别一段长访谈所表达的价值观时,准确度已经接近人类专家——但它们对这些价值观的排序方式不同,不确定之处也不同。2026 年 3 月的一项研究发现,LLM 在找到了什么上逼近人类天花板,而在什么最重要上明显落后。
这项研究测试了什么?
研究要问的是:面对解释性的模糊地带,LLM 能否像资深定性研究者那样处理。Kostina、Dikaiakos、Porcel 与 Stassopoulos(2026)在 "Can LLMs Capture Expert Uncertainty? A Comparative Analysis of Value Alignment in Ethnographic Qualitative Research"(arXiv:2603.04897)中,选取了 12 场时长两小时的开放式民族志访谈(受访者为中国本地居民),让人类专家和四个 LLM 分别以 Schwartz 基本价值观理论为编码手册,识别每场访谈最突出的三项人类价值观。
有两个设计选择让它比一般的准确率基准更有价值。第一,任务本身确实存在歧义——没有唯一正确答案,这正是绝大多数真实解释性编码的状态。第二,作者比较的不只是准确率,还有不确定性结构:模型在哪里犹豫,专家又在哪里犹豫。
参与测试的四个模型
- DeepSeek-R1-Distill-Llama-8B
- Qwen3-30B
- Llama-3.3-70B
- Mistral-Small-3.2-24B
四个都是开放权重模型,这对受数据合规约束的研究者尤其重要:这意味着证据来自你可以本地运行、无需把访谈记录发送到商业 API 的模型。
AI 与人类专家的差距有多大?
在集合重合度上接近,在排序上不接近。根据 Kostina 等人(2026)的数据,表现最好的模型 Qwen3 在 F1 上与专家基线相差约 1.6 分,但在 RBO(排序重合度,奖励把前三项价值观的顺序排对)上低了约 15 分。
| 指标(前三项价值观) | 人类专家 | Qwen3(最佳模型) |
| F1@3 | 58.19 | 56.60 |
| Jaccard@3 | 44.54 | 43.96 |
| RBO@3(排序重合度) | 51.97 | 37.09 |
数据来源:Kostina et al.(2026),arXiv:2603.04897。数值越高越好,均为均值。
请注意人类这一列的数字有多低。专家之间在该任务上的一致性为 Krippendorff's alpha 0.389——这提醒我们:两位受过训练的研究者读同一场两小时访谈,对"哪些价值观占主导"经常意见不一。任何"AI 编码不可靠"的判断都必须放在这个参照系里,因为这里的人类天花板不是 90%,而是 F1 约 58。
为什么识别做得到、排序却做不到?
因为判断某项价值观是否出现是一个识别任务,而把它排在第一位,需要把整场访谈放在一起相互权衡。模型找到的价值观集合大体正确——它与专家集合的重合程度,几乎与专家彼此之间的重合程度相当——但它对这个集合的排序逻辑,不同于一位完整读完访谈记录的研究者。
这有一个现实后果。如果你的分析产出是"数据中出现了哪些主题"的清单,那么 LLM 辅助的基础相当稳固。但如果你的产出是关于受访者最看重什么的论断——这是多数定性论文和研究汇报的核心结论——那么模型的排序恰恰是其输出中最薄弱的部分,也是应当由人来负责的部分。
什么是"Security"偏差?
四个模型都比人类专家明显更频繁地赋予 Schwartz 价值观中的 Security(安全)。作者认为这更可能是模型引入的价值观偏差,而非访谈本身的属性。
某一个编码被系统性过度赋值,是一种具体且可检查的失效模式,而且很容易被忽略,因为在单份访谈记录的层面它看起来并不像错误——每一次 Security 的赋值单看都说得通。它只有在你把模型在整个语料上的编码分布与人工编码子集作对比时才会显现。这项对比值得纳入任何 AI 辅助编码流程。
模型集成有用吗?
有用,而且效果稳定。论文显示,用 Majority Vote 或 Borda Count 把多个模型的输出合并后,F1 与 RBO 提升 8–10 分,Jaccard 提升 6–8 分——足以弥合排序差距中相当一部分。
这一发现呼应了定性方法学者对人类编码者的既有做法:多轮独立编码再按既定程序调和,优于任何单一编码者。对实务而言更有意思的版本不是四个模型投票,而是把一个模型和一位研究者当作两位独立编码者,让分歧被显性呈现,而不是被平均掉。
这对研究者意味着什么
把 LLM 给出的价值观或主题赋值当作待裁决的候选集,而不是可直接汇报的排序结论。由这项研究可以推出三个具体动作:
- 人工编码一个校准子集。没有它,你无法发现类似 Security 的分布偏差,也没有本地的人类天花板估计来评判 AI。
- 排序由你来定。让模型提出"出现了什么",由你判断"什么是核心",并把推理过程留在审计轨迹里。
- 不要只跑一遍。多轮独立编码——不同模型,或模型加人——经显性调和后,优于单次自信的输出。
ThemeLens 正是围绕这一流程设计的:AI 在整个语料上提出编码与主题,研究者负责裁决与记录。同样的分工也适用于上游的数据收集环节——AI Interviewer 可以规模化地完成访谈对话,而对结论的解释权仍然属于研究者。
这项研究可信到什么程度?
语料规模小且带有特定文化背景:12 场中国本地居民访谈,仅依据一套价值观框架编码。因此不应把结论当作 AI 定性编码的通用准确率。更具外推性的是结果的形态——识别接近人类天花板、排序明显落后、存在系统性的单编码偏差、集成带来稳定收益。这些是值得在你自己的数据上验证的模式,而不是可以直接引用的基准数字。
常见问题
LLM 能取代定性研究中的人类编码者吗?
就本研究的证据看还不能。它们在识别"出现了哪些编码"上接近专家水平,但在重要性排序上明显不足,并且带有系统性的编码层面偏差——而这类偏差只有通过人工编码对照才能发现。
为什么这项研究中人类一致性这么低?
因为任务本身——在两小时开放式访谈中指出最突出的三项人类价值观——存在固有歧义。专家之间的 Krippendorff's alpha 为 0.389,作者将其视为任务属性,而非标注质量的缺陷。
哪个开源模型表现最好?
在四个受测模型中,Qwen3-30B 最接近专家水平的一致性,与专家的价值观分布也最吻合。模型之间差距不大,因此成本、隐私与稳定性都是合理的取舍依据。
把多个模型组合起来能提升 AI 编码质量吗?
能。Majority Vote 与 Borda Count 集成带来稳定提升——F1 与 RBO 提升 8–10 分,Jaccard 提升 6–8 分——是目前性价比最高的质量改进手段之一。
最后更新:2026 年 8 月 6 日。本文为对第三方研究的独立编辑性摘要,与原研究作者无隶属关系,也未获其背书。原始文献:Kostina, Dikaiakos, Porcel & Stassopoulos, "Can LLMs Capture Expert Uncertainty? A Comparative Analysis of Value Alignment in Ethnographic Qualitative Research," arXiv:2603.04897 (2026)。