LLM 合成受访者的心理测量效度:2026 年审计
Qualitati 研究团队 · 2026-09-07 · 7 分钟阅读
简短答案:不能——至少在心理测量意义上不能。Lukauskas 与 Šarkauskaitė 在 2026 年对 37 个大语言模型做的审计发现,合成受访者能复现人类问卷关系的方向,却在结构上失守:一个普通的高斯 copula 统计基线击败了所有 LLM,而用合成数据训练出的模型在真实人群上丧失了预测效度。
这项研究究竟测了什么
这项研究提出的问题,比多数合成受访者评测更难。它不问单个作答看起来是否可信,而是问合成样本是否保留了让问卷数据可用的那些联合性质:相关结构、潜变量结构、量表信度、中介路径与人口统计效应。
根据 Lukauskas 与 Šarkauskaitė(2026),研究设计如下:
- 一份立陶宛组织心理学数据集,263 名员工,作答 12 个分量表共 68 个题目(Dunham 变革态度量表、UWES-17,以及 Koopmans 个体工作绩效问卷)。
- 一个包含 37 个模型的阵容,涵盖 OpenAI、Anthropic、Google 以及十二个开源权重模型家族。
- 每个模型都以真实受访者画像为条件,置于五级人格披露阶梯之下,并附加呈现方式与推理强度的消融实验。
- 反事实人口属性替换(性别、职位、教育程度)、跨语言检验,以及一项逐字回忆探测,用以检验结果是否由训练数据记忆驱动。
- 心理测量相似度分数(PSS)以五个非 LLM 统计基线和一个留出的"人对人"上限为锚,配合受访者自助抽样置信区间以及针对 Tucker's phi 的题目置换零分布。
最后这一点值得借鉴,无论你对 LLM 持何种看法。多数合成数据的主张既没有上限也没有下限:没有人对人的基准,你无法判断 0.7 的相似度算不算好;没有统计基线,你也无法判断模型是否提供了 copula 给不了的东西。
合成受访者到底逼近到什么程度?
近到看起来没问题,远到足以误导。报告中的失效大致可归为几类。
| 失效模式 | 研究报告的发现 |
| 被统计基线击败 | 在 PSS 的样本驱动成分上,高斯 copula 基线优于所有 LLM |
| 合成单一化 | 模型间平均 PSS 为 0.73——模型彼此之间比与人类更相似 |
| 默许偏差 | 每个模型都出现 +0.84 SD 的赞同倾向偏移 |
| 预测效度丧失 | 用合成数据训练的回归模型在留出人类样本上平均 R² 为 −0.18,而对照为 0.28 |
| 凭空生成机制 | 模型在 10 条安慰剂中介路径中的 3 条上产生了间接效应 |
| 因子结构坍塌 | 37 个模型中有 8 个在 UWES 上的 Tucker's phi 落入题目置换零分布之内 |
其中两点值得强调。R² 为负意味着合成数据训练出的模型预测真实人群比直接猜均值还差——这不是信号变弱,而是主动有害。而安慰剂中介的结果,应当让任何用合成样本做理论检验的人警惕:作者放入了本应毫无效应的中介路径,模型却在其中三条上产生了效应。
为什么记忆化这一结果很关键
对合成受访者基准的一个常见质疑是:好分数来自模型记住了量表。这项研究用逐字回忆测试做了探测,报告回忆能力与 PSS 的秩相关为 0.00——回忆能力并不能预测排行榜位置。
这一点是双向的。它排除了记忆化作为成功解释的可能,从而强化了"模型确实抓住了人类关系的定性方向"这一发现;同时它也拿掉了为失败开脱的借口:模型失败并非因为没见过这些量表,而是因为生成一个连贯的总体,与生成一个连贯的个体,本就是两件不同的任务。
没人会在提示里指定的教育程度效应
反事实替换给出了一个研究者很少预料到的排序。改变所描述受访者的教育程度,使作答产生了平均绝对效应量 0.56 的移动,远超职位(0.18)与性别(0.12)。
如果你在构建人物画像,你很可能仔细指定了性别与职位,却把教育程度当成背景细节。而在这次审计中,它才是主导杠杆。这是一条具体且可检验的提示设计启示:要么固定教育程度,要么有意识地操纵它,否则你的合成样本的变异将由一个你并未打算操纵的变量所驱动。
这对你的研究实践意味着什么
论文的结论范围明确且直白:LLM 样本不能直接替代人类问卷数据。它并未说合成受访者毫无用处。结合 2026 年其余文献来看,一个站得住脚的立场大致是:
- 用于测试问卷工具是可行的。发现表述含糊的题目、天花板效应或断裂的跳转逻辑,并不要求联合分布是对的。
- 用于效应量、中介检验或任何你会作为发现发表的结论则不可行。安慰剂路径的结果对这类用途是致命的。
- 绝不要把它当作应用于真人的模型的训练集。负的 R² 是论文中最清楚的一个数字。
- 始终对照一个统计基线。如果在小规模真实样本上拟合的 copula 就能胜过你的 LLM 流程,那么 LLM 增加的是成本,而非信息。
务实的替代方案,不是"要么收集完整的传统样本,要么放弃",而是把少量真实人类数据花在刀刃上。一轮简短的 AI 主持访谈能带来合成生成本身产生不了的深度与锚定分布;而建立在真实受访者数据之上的 Digital Twin Panel,与凭一串人格描述凭空造出来的东西,是完全不同的两件事。这次审计是在论证要把合成工作锚定在人类数据上,而不是放弃合成。
常见问题
那我到底还能不能用 LLM 当问卷受访者?
用于问卷工具预测试和流程试跑,可以。用于估计效应、检验中介或训练预测模型,这次审计提供了强有力的反对证据。
换更好或更大的模型能解决吗?
在这项研究中不能。默许偏移、单一化、凭空生成中介这些失效,在全部 37 个模型上都出现了,涵盖四个商业模型家族与十二个开源权重家族。
什么是高斯 copula 基线,它在这里为什么重要?
它是一种标准统计方法,用于生成保留真实样本相关结构的合成数据。它之所以重要,是因为它在 PSS 的样本驱动成分上击败了所有 LLM——更简单的工具把结构这件事做得更好。
这个结论只适用于立陶宛数据吗?
数据集来自立陶宛组织心理学领域,作者也做了跨语言检验,但单一国家、单一领域、263 人的样本确实是推广性上的现实限制。可以把发现的方向视为稳健的,而把具体数值视为这一情境所特有的。
最后更新:2026-09-07。本文是对第三方研究的独立编辑性摘要,与该研究作者无隶属关系,也未经其背书。