社会科学家如何检验 LLM 测量的效度?
Qualitati 研究团队 · 2026-09-04 · 6 分钟阅读
当社会科学研究者用大语言模型给数据打标签、或让模型代替真人回答问卷时,模型本身就成了一件测量工具——而工具是需要做效度检验的。一项 2026 年针对八本顶级期刊的研究发现,已发表的 LLM 测量大多只对着一把尺子校验,还有一部分根本没做任何检验。
这项研究考察了什么?
Desai、Card 与 Jacobs(2026)筛查了八本社会科学旗舰期刊在 2022 年至 2025 年底之间发表的 2,143 篇论文,寻找那些用 LLM 提示词来对社会概念做定量测量的研究——情感、意识形态、政策立场、态度,以及模拟的问卷作答。最终有 27 篇论文符合条件,其中包含 50 项各自独立的测量任务。随后,研究者逐项编码这些任务报告了哪一类效度证据、或是否根本没有报告。
这个框定方式很关键:论文把「提示词 + 模型 + 解码配置」当作一件测量工具来看待,就像看待一套问卷量表一样。正是这一重新框定,让当前效度检验的单薄之处显形。
已发表的 LLM 测量究竟报告了多少效度检验?
比其风险所要求的要少。根据 Desai 等人(2026):
- 6 篇论文中的 8 项任务完全没有报告任何效度检验——LLM 的输出被直接当作数据使用,未与任何其他来源比对。
- 22 篇论文(39 项任务)报告了聚合效度:把 LLM 输出与同一构念的黄金标准(通常是人工标注)作比较。
- 在做了检验的任务中,42 项里有 28 项只评估了单一类型的效度,而且几乎都是那同一种「与人工一致性」的比较。
换句话说,主流做法是:在一个样本上与人类编码者达成一致,报告相关系数或 kappa,然后继续往下走。而心理测量学者会追问的其他问题——换个说法重写提示词后结论还成立吗?在不同子群体上表现是否合理?它测到的构念是否就是假设里那个构念?——大多无人过问。
哪些效度检验被跳过了?
| 效度视角 | 它回答的问题 | 在语料中的状况 |
| 聚合效度 | LLM 与黄金标准一致吗? | 占绝对主导——50 项中的 39 项 |
| 假设效度 | 该测量的表现是否符合理论预期? | 第二常见,但差距很大 |
| 内容效度 / 构念界定 | 测量之前,概念是否被精确界定? | 经常界定不足 |
| 对配置的稳健性 | 换提示词或换设置后数字还站得住吗? | 很少被报告 |
| 未做任何检验 | — | 8 项任务,6 篇论文 |
有哪些认识论层面的威胁?
作者点名了四种单一一致性分数无法察觉的威胁。提示词敏感性:论文指出 LLM 对「提示词或配置的微小改动」高度敏感,这意味着一个回归系数的变动可能只源自一句指令的改写,而非现实世界中的任何变化。幻觉:模型可以自信地给出一个在原文中毫无依据的标签。跨情境脆弱性:在某一语料上建立的一致性,未必能迁移到另一个领域、语言或人群。构念漂移:当概念界定松散时,研究者会「失去对自己所测概念的控制」——模型悄悄测量的是提示词所暗示的东西,而那未必是假设中的构念。
值得注意的是这些威胁会彼此叠加。在一个便利样本上取得高人机一致性,与上述四点全部同时成立并不矛盾。一致性是必要检验,而非充分检验——这一点与关于 AI 定性编码中一致性不等于质量 的研究发现相互呼应。
研究者应该怎么做?
论文给出的处方分三步,而这三步的成本相对于撤稿一篇研究发现来说都极其低廉。
- 写提示词之前先精确界定构念。把定义、边界案例,以及什么算作假阳性都写下来——这正是一本编码手册所要求的纪律。
- 用多重构念效度视角来检验。在人机一致性之外至少再加一项检查:用改写过的提示词重跑一遍、在留出的另一领域上测试,或验证该测量能复现一个已知关系。
- 透明报告工具的每一个组成部分。模型名称与版本、完整提示词、temperature 与解码设置、运行日期。一项无法被重新指定的测量,任何人都无法复制。
这对应用型研究者意味着什么
这一发现的适用范围远超学术发表。任何团队只要在用 LLM 编码开放题、给访谈记录打标签,或模拟一个受访者面板,做的就是测量,无论幻灯片里有没有出现「测量」这个词。落到实处很简单:保留人机一致性检查,然后补上一次稳健性验证和一份书面构念定义,并在结果旁记录模型版本。
工具设计可以分担一部分负担。ThemeLens 中透明的编码手册与逐码溯源,让构念显性化、编码可审计,而不是隐含在一句提示词里;用 数字孪生面板 处理合成受访者的团队,则应把面板输出视为测量结果,在它们进入决策之前完成同样的效度检验。
常见问题
把 LLM 和人类编码者作比较,这样的效度检验够吗?
不够。Desai 等人(2026)发现多数已发表任务止步于此,但聚合一致性无法察觉提示词敏感性、在新领域上的脆弱性,也无法察觉所测构念与理论构念之间的错配。
究竟有多少社会科学论文真的检验了自己的 LLM 测量?
在该研究 27 篇论文、50 项测量任务的语料中,6 篇论文的 8 项任务没有报告任何效度检验,而做了检验的 42 项任务中有 28 项只评估了一种效度类型。
一项 LLM 测量的最低报告标准是什么?
模型及其版本、完整提示词、解码配置、运行日期——外加一份对所测构念的精确定义。
这也适用于 UX 与市场研究吗?
适用。任何由 LLM 产出、并支撑某个结论的计数、评分或标签都是一项测量,无论它最终出现在期刊上还是利益相关方的汇报里,需要追问的效度问题都一样。
来源
Desai, M., Card, D., & Jacobs, A. Z. (2026). Validating LLMs in social science: Epistemic threats and emerging norms. arXiv:2607.07915. https://arxiv.org/abs/2607.07915
最后更新:2026 年 9 月 4 日。
本文是对第三方研究的独立编辑性摘要。Qualitati 与该论文作者无隶属关系,以上解读为我们自己的观点。