更丰富的人设能让 LLM 成为人类替身吗?2026 年研究检验
Qualitati 研究团队 · 2026-10-01 · 7 分钟阅读
简短回答:不能。Ahn、Mao 与 Lee 在 2026 年发表的一篇工作论文,用覆盖逾 400,000 名参与者的四个数据集检验了 LLM 人类替身,发现模型能很好地复现每道题的平均答案,却只能解释个体受访者偏离该平均值部分的 3.05%。更丰富的人设和微调都没有弥合这一差距。
合成受访者的卖点通常建立在一个前提上:只要给模型足够多关于某个人的信息——人口统计特征、人格得分或一段长访谈——它就能像那个人一样作答。新的工作论文 Item-Mean Surrogates: Why Richer Persona Data Fail to Improve LLMs as Human Surrogates(Daehwan Ahn,佐治亚大学;Chengfeng Mao,MIT Sloan;Dokyun Lee,波士顿大学;arXiv,2026 年 8 月)直接检验了这一前提。结论是:LLM 替身表面上的准确率,大部分来自"知道哪些题目大家倾向于打高分或低分",而不是来自对个体的任何了解。
这项研究检验了什么?
研究检验的是:在去掉"容易的部分"——即每道题的人类平均答案——之后,LLM 替身还能否预测个体作答。据 Ahn、Mao 与 Lee(2026),分析使用了四个数据集,以免结论取决于某一份问卷:
| 数据集 | 受访者 | 题目 / 结果变量 | 在研究中的作用 |
| Megastudy(Peng 等人的数字孪生数据,18 项研究) | 1,784 | 160 | 主检验 |
| SocSci210(210 项研究) | >400K | 5,998 | 稳健性检验 |
| Twin-2K-500 Survey | 2,058 | 126 | 稳健性检验 + 重测信度基准 |
| ANES(美国全国选举研究) | 4,270 | 11 | 稳健性检验(最初"硅样本"研究的场景) |
关键做法很简单。对每道题,作者从人类答案和 LLM 答案中都减去人类平均值。剩下的就是每位受访者的个人偏离:此人在这道具体题目上高于还是低于人群平均。真正的个体替身应当能预测这种偏离;只知道题目均值的模型则做不到。
LLM 问卷替身在个体层面有多准确?
去掉题目均值后,几乎谈不上准确。在 Megastudy 主分析中,LLM 的题目均值与人类题目均值高度相关(133 道题,Pearson r = 0.78)。但合并去均值 R²——即 LLM 能解释的受访者特异性变异所占比例——只有 3.05%。由人类重测信度(同一批人两次回答同一题目的一致程度)设定的上限为 53.6%。LLM 只达到了可达水平的 5.7%。
作者还把 LLM 与一个刻意简单的基准做了比较:用其他所有人对该题的平均答案来预测某人的答案。这个基准不使用任何关于此人的信息。在 1,631 名受访者中,LLM 的人均相关系数均值为 0.34;留一法人类平均值则为 0.45。换言之,带人设提示的模型还不如直接报告"其他人怎么答"。
更丰富的人设或微调有帮助吗?
所有测试的变体都没有弥合差距。论文报告的去均值 R² 如下(Ahn、Mao 与 Lee,2026,表 2):
- 完整人设提示(Megastudy):3.05%
- 最强的非微调提示(Megastudy):4.44%
- 微调后的 GPT-4.1(Megastudy):2.31%,低于最佳普通提示
- 在 SocSci210 上微调的 Socrates-Qwen2.5-14B:见过的研究上 7.57%,留出研究上 0.73%
- Twin-2K-500 Survey:不同设定下为 3.87% 至 6.21%
- ANES 四题组:10.77%,为最高结果,主要集中在党派认同和意识形态题目上
人设并非毫无用处。作者将人设在受访者之间随机打乱 10,000 次,打乱后的结果从未超过 0.028%,说明正确匹配确实携带了一些真实信号。只是这点信号太少,远不足以把输出当作那个人的替身。
为什么人设解决不了这个问题?
因为缺失的信息不是"这个人总体上是什么样",而是"他对某道具体题目如何反应"。作者用概化理论(generalizability theory)分解预测误差。稳定的个人效应——也就是人设摘要所描述的那类信息——只占误差方差的 4.9%。人×题交互效应,即特定受访者在特定题目上偏离平均值的方式,占 44.0%,约为前者的 8.9 倍。人设对所有题目都是固定的,因此它能编码前一种信号,却编码不了后一种。
合成回答的分布像真实回答分布吗?
不太像。LLM 的回答始终比人类回答更窄。题目层面标准差的中位数,在 Megastudy 中为人类的 65%,SocSci210 中为 50%,Survey 中为 57%。模型使用的回答类别也更少,中位比率在人类数值的 43% 至 73% 之间。分布形状同样不同:形状因素占人类与 LLM 分布间距离的 31% 至 40%,因此不匹配不只是均值偏移或离散度被压缩。作者把这种整体模式称为 item-mean surrogacy(题目均值替身)。
研究者应如何验证合成受访者的说法?
让检验与主张相匹配。论文提出了四项检验,替身必须通过这些检验,才能被称为可替代个体:
- 还原偏离,而不是均值。报告去均值后的准确率,而不仅是与题目均值的相关。
- 能泛化到新题目和新任务。在见过的研究上准确不算数;Socrates 的结果表明,在留出研究上准确率下降得有多快。
- 优于打乱的人设。如果在受访者之间互换人设并不损害预测,说明模型给出的是通用答案,而不是在模拟某个人。
- 复现分布。检查离散度、使用的类别数量和形状,而不只是均值。
作者还做了一项文献梳理,说明这为何重要。在 2023 年 1 月以来提出、部署或检验 LLM 人类替身的 63 篇论文中,53 篇持支持立场。在提供了实证验证的 44 篇支持性论文中,33 篇只在总体层面做了验证,仅有 4 篇报告了个体层面的指标。
这对研究者意味着什么
合成受访者在总体层面、早期阶段的工作中依然有用:发现可能出现天花板效应的题目、发现问卷中明显的设计问题、在实地调研前形成大致预期。但这篇论文不支持用它们替代个体受访者、基于个体模拟得出细分群体结论,或进行任何依赖离散度和分歧的分析。
在实践中,这意味着一种工作流程:用数字孪生样本库或合成焦点小组对讨论提纲或问卷草稿做压力测试,然后与真人开展正式研究并进行对比。如果报告合成结果,请说明你检验到了哪个保真层级,并至少完成上述的打乱检验和分布检验。我们此前对人设提示研究的解读,从另一数据集得出了一致的结论。
研究的局限
作者明确界定了适用范围。分析覆盖的是有序、有界的问卷回答,开放式回答和行为任务可能表现不同。研究没有测试在预测时检索受访者完整作答历史的系统,也没有测试专门为个体预测训练的模型。所用指标是线性的,可能遗漏非线性的个体结构。此外,这是一篇 arXiv 工作论文,尚未经过同行评审;预注册材料将在正式发表时公开。
常见问题
什么是 item-mean surrogacy(题目均值替身)?
指 LLM 替身能复现每道题的人类平均答案,却无法预测个体受访者如何偏离这个平均值,同时生成的回答分布更窄、形状也不同的模式。
LLM 数字孪生准确吗?
在总体层面看起来可以很准确,本研究中题目均值相关约为 0.78。在个体层面,去掉题目均值后,它们只解释了 3.05% 的受访者特异性变异,而人类信度上限为 53.6%。
微调能让合成受访者更真实吗?
本研究中不能。微调后的 GPT-4.1 得分低于最佳普通提示;在 SocSci210 上微调的模型,从见过研究上的 7.57% 跌至留出研究上的 0.73%。
我还能使用合成受访者吗?
可以,用于预测试和形成总体预期。把它们当作"普通受访者可能会怎么说"的草稿,在得出个体或细分群体层面的结论之前,先用真实受访者加以验证。
最后更新:2026 年 10 月 1 日
本文是 Qualitati 研究团队对第三方研究的独立编辑摘要。Qualitati 与论文作者无隶属关系。完整方法与结果请阅读原论文。