硅基抽样能跨国使用吗?2026 年 ESS 30 国检验
Qualitati 研究团队 · 2026-09-22 · 7 分钟阅读
简短回答:硅基抽样(silicon sampling,即用 LLM 模拟问卷受访者)能在部分态度题上大致排出国家的先后顺序,却无法还原具体的个人。2026 年一项以欧洲社会调查为基准的检验发现,提示词中的国家名称几乎承担了全部作用,而个体层面的准确度在所有条件下都接近于零。
硅基抽样承诺带来又便宜又快的问卷数据:给大语言模型一份人口学画像,让它以此人的身份作答。迄今多数验证研究集中在美国。伦敦政治经济学院(LSE)Chuyao Wang 的一篇新工作论文在 30 个欧洲国家检验了这一方法,并提出一个更尖锐的问题:信号究竟从哪里来?
这项研究检验了什么?
研究将 LLM 模拟的回答与欧洲社会调查(ESS)第 11 轮的真实回答进行比较,覆盖 30 个国家、42 道题目、12 个领域,包括制度信任、主观幸福感、移民态度、宗教、安全感和收入。据 Wang(2026)介绍,研究使用了两个开源权重模型 Qwen 2.5-7B-Instruct 和 Llama 3.1-8B-Instruct,分别采用第一人称(“以此人身份作答”)和第三人称(“预测此人会如何作答”)提示。
每个模拟受访者都获得一段由 20 个 ESS 人口学变量生成的背景故事。随后研究进行了一系列对照实验:
- 背景条件实验:逐块添加或移除画像信息(国家、地区、政治身份、社会经济地位、家庭、移民背景等),观察哪一部分影响准确度。
- 标签互换安慰剂实验:给每位受访者换上错误的国家名称,其余画像保持不变。
- 作答格式 2×2 实验:将国家标签(有/无)与作答量表(仅数字 vs. 数字加文字标注的两端含义)交叉。
- 非 LLM 对照基准:用邻近国家的平均值,以及地区加人均 GDP 对数来预测每个国家。
论文共报告了 43 个实验组、3460 万次(34.6 million)生成尝试。
硅基抽样在跨国比较中有多准确?
总体层面的准确度中等,且不同题目差异很大。在表现最好的设置(Qwen、第一人称)下,模拟与实际国家均值之间的逐题相关中位数为 0.443。42 道题中只有 20 道超过 0.5,9 道超过 0.7。对警察、议会和司法系统的信任还原得最好,约为 0.80。
一个好看的汇总数字会掩盖这一点。所有题目合并计算的相关为 0.822,但论文指出这一数字被夸大了,因为合并时混入了量表长度不同的题目。只报告合并相关的研究者,可能让一次糟糕的模拟看起来很出色。
模型还在 11 道题上把国家顺序排反了。最严重的是“男同性恋和女同性恋是否应能自由按自己的意愿生活”(−0.82)和“同性伴侣是否应有权收养子女”(−0.73)。每个国家的模拟均值都向上偏移,从芬兰的 0.36 个量表点到保加利亚的 1.40。
信号从哪里来?国家名称
几乎全部的总体准确度都来自国家标签。在只有性别、年龄、出生年份三个变量的最简画像中加入国家名称,逐题相关中位数就从 −0.03 升至 0.52。完全不含人口学信息、只写国家名称,同样达到 0.52。更丰富的画像没有带来稳定提升,政治与社会经济信息反而降低了总体准确度。
安慰剂实验证实模型确实在读取标签。给受访者换上错误国家后,其真实国家的还原度甚至低于不写国家的基线(正向编码题上为 0.34 对 0.40)。Wang 将其解释为一种国家层面的假设:模型给国家名称附上一个固定预期,受访者的个人细节无法修正它。作者也指出,这些数据无法区分真正的调查知识与国家刻板印象或网络上关于该国的言论。
模型为什么会把国家排反?
排反主要是作答格式的问题,而不是知识问题。11 道排反题中有 10 道是反向编码题,即数字量表的方向与题意相反;仅题目方向一项就解释了逐题准确度方差的 66%。当量表两端用文字标明含义、而不是只给一个数字范围时,国家标签对所有正向编码题以及 10 道反向编码题中的 8 道都产生了正面作用。这一效应在 Llama 上同样复现。
实践启示:提示词的作答格式本身就是测量工具的一部分。真人 ESS 受访者看到的是带文字标注的示卡;模型拿到的只是 “Scale: 0-10”,只能去猜哪一端代表什么。
硅基样本能预测个体受访者吗?
不能。在所有模型与提示条件下,国内个体相关中位数都未超过 0.028,即共享方差不到 0.1%。作为对照,用五个人口学变量做简单回归,在同一批真人数据上可达 0.210。第一人称与第三人称提示没有可检测的差异(Qwen 为 0.027 对 0.029)。在一次重复运行中,模型产生的国内差异有 95% 只是不同运行之间的随机波动。模拟回答的分布也被压缩,模型与真人的标准差之比仅为 0.57 至 0.61。
总体准确度和个体准确度甚至并不同步。在 30 个国家之间,两者的相关为 −0.21;435 对国家组合中有 232 对在两种指标下排序相反。一个在总体层面看起来模拟得很好的国家,用于个体层面的分析并不更可靠。
LLM 能胜过简单基准吗?
最令人警醒的结果是:一个完全不用 LLM 的基准在水平准确度上表现更好。用每个国家邻近国家的平均值来预测,逐题相关中位数为 0.55,高于模型的 0.44;标准化误差也小得多(0.056 对 0.180),在 42 道题中的 41 道上水平准确度胜出。
| 方法 | 逐题国家相关中位数 | 标准化误差中位数 |
| LLM,完整 20 变量画像(Qwen,第一人称) | 0.44 | 0.180 |
| LLM,仅国家名称 | 0.52 | 未报告 |
| 邻近国家平均值(不用 LLM) | 0.55 | 0.056 |
| 地区 + 人均 GDP 对数(不用 LLM) | 0.62 | 0.052 |
来源:Wang(2026),第 4.1–4.2 节。标准化误差为将每道题重新缩放到 0–1 后的平均绝对误差。
这对研究者意味着什么
论文本身的结论很克制:在经过外部基准验证的题目上、并报告所用作答格式的前提下,硅基抽样或可用于探索性的国家排序比较;它不支持个体预测、国内异质性估计或分布层面的推断。由此可以得出四条做法:
- 逐题验证。本研究中合并相关和国家画像相关看起来都很高,却掩盖了被排反的题目。
- 用文字标注量表两端,并报告你使用的确切格式。
- 始终跑一个简单基准。如果邻近国家平均值就能胜过你的模型,那么模型增加的是成本,而不是信息。
- 不要把更丰富的人设当作解药。更多人口学细节没有帮助,有时反而有害。
要回答某个市场的人为什么这样想,真实受访者仍然是证据所在。Qualitati 的 AI Interviewer 让跨国家、跨语言接触真实受访者的成本更低。Digital Twins 这类模拟样本组最适合在正式调研前试测问题、压力测试访谈提纲,而不是取代实地调研。
常见问题
什么是硅基抽样?
硅基抽样是指用受访者的人口学画像来设定 LLM,让它生成近似同类真人的问卷回答。这一术语来自 Argyle 等人(2023)。
给 LLM 受访者加入更多人口学细节会更准确吗?
在这项研究中不会。仅有国家名称就达到了与完整画像相同的总体准确度,加入政治或社会经济信息反而使其下降。
我能用 LLM 模拟受访者来比较国家吗?
只能谨慎地、探索性地使用:限于已用真实数据验证过的题目,并使用文字标注的量表。在信任模型之前,先确认它能胜过简单的邻近国家平均值。
研究测试了大型商用模型吗?
没有。研究使用的是在大学计算集群上本地运行的两个 7–8B 开源权重模型,因此更大的商用模型表现如何仍是未解问题。
原始来源:Wang, C. (2026). Silicon sampling answers with country-level assumptions, not individual attitudes: Cross-national evidence from the European Social Survey. arXiv:2609.16395.
最后更新:2026 年 9 月 22 日。本文是对第三方研究的独立编辑摘要;Qualitati 与论文作者无隶属关系。