LLM 能预测没见过的问卷题目答案吗?(2026 研究)
Qualitati 研究团队 · 2026-09-11 · 7 分钟阅读
简短回答:部分可以。一项 2026 年基于台湾全国选举问卷的研究发现,零样本 LLM 预测个体受访者对从未见过题目的回答,完全匹配准确率约为 52%;而在约 960 名真实受访者数据上训练的随机森林为 58%。党派相关态度预测效果好,个人判断类题目则很差。
最后更新:2026 年 9 月 11 日
硅基抽样(silicon sampling)是指让大语言模型以特定人物身份作答问卷。过去对它的评估大多停留在总体层面:合成样本能否复现真实样本的分布?一篇新预印本认为这个标准太宽松,并提出了更严格的检验。本文介绍作者做了什么、发现了什么,以及如果你打算在研究中使用合成受访者,这意味着什么。
要点速览
- 个体层面准确率有限。最佳零样本 LLM 在未见题目上的完全匹配率为 52.1%,多数投票基线为 46.6%,有监督随机森林为 58.3%。
- 仅靠人口统计信息几乎没有预测力。仅使用五个人口统计变量的逻辑回归得分 47.0%,勉强高于多数基线。预测信息来自受访者对其他题目的回答。
- 可预测性随党派性变化。党派相关构念约达 67%,统独立场仅 23%。
- 方差坍缩并非 LLM 独有。所有方法都会压缩回答分布,而 LLM 保留的离散程度反而比随机森林更高。
- 安全对齐的影响因模型而异。移除对齐后,一个模型损失 6.1 个百分点,另一个几乎不变。
什么是跨问卷迁移?
跨问卷迁移是一种评估设计:LLM 先看到某位受访者对一组题目的真实回答,再预测此人对另一组从未展示过的题目的回答。据 Ku、Hsu、Huang、Liu、Cheng 和 Kang(2026)所述,以往大多数硅基抽样研究以人口统计画像为条件、比较总体分布,这可能奖励的是模式匹配,而不是对单个人的连贯预测。
作者在任何实验之前就把题目分成两个互不重叠的组:作为人物设定展示给模型的情境集(Set A),以及完全保留的预测集(Set B)。每个构念约三分之二的题目进入 Set A、三分之一进入 Set B,因此每道被预测的题目在情境中都有相关的锚定题。
研究检验了什么?
研究使用台湾选举与民主化调查(TEDS)2024,这是一项在 2024 年 1 月选举后开展、样本为 1,206 人的全国代表性电话调查。设计如下:
- 输入:每位受访者的 5 个人口统计变量和 28 道 Set A 题目,写成自然语言提示,并附上总体层面的回答分布用于基率校准。
- 目标:14 道 Set B 题目,覆盖 13 个构念,从制度信任到统独量表。每道题保留 593 至 610 名有效受访者。
- 模型:三个本地运行的开源权重 LLM:Qwen3.5(27B)、gpt-oss(120B)和 Gemma3(27B),每个模型还测试了移除安全对齐的“abliterated”版本。
- 基线:多数投票、基于人口统计的逻辑回归,以及基于人口统计加 Set A 的随机森林,后两者均采用 5 折交叉验证训练。
选择一份来自非西方民主国家的中文问卷是有意为之:现有硅基抽样证据大多来自英语、WEIRD 人群。
LLM 的准确率如何?
零样本 LLM 的表现介于朴素基线与训练模型之间。下表列出论文的主要结果。
| 方法 | 训练数据 | 完全匹配 | 误差 ±1 以内 | 方差比 |
| 多数投票 | — | 46.6% | — | — |
| 逻辑回归(仅人口统计) | 有监督 | 47.0% | 83.1% | 0.38 |
| 随机森林(人口统计 + Set A) | 有监督 | 58.3% | 88.2% | 0.72 |
| Qwen3.5 27B | 零样本 | 52.1% | 85.7% | 0.84 |
| gpt-oss 120B | 零样本 | 51.3% | 85.2% | 0.85 |
| Gemma3 27B | 零样本 | 47.6% | 86.2% | 0.67 |
有两点值得注意。第一,模型规模不能预测准确率:27B 的 Qwen3.5 略胜 120B 的 gpt-oss,作者将此归因于 Qwen 更强的中文训练数据。第二,作者将与随机森林之间 6 个百分点的差距解释为约 960 个目标人群标注样本的价值,而 LLM 从未获得这些样本。
LLM 能预测哪些态度?
以党派认同为锚的态度最可预测,基于个人判断的态度最难预测。在各 LLM 平均下,政党能力达 67.2%,政府表现 62.7%,制度信任 60.4%;经济评价降至 44.4%,候选人评价 24.7%,统独立场 23.3%。
作者借助 Converse 的态度约束理论解释这一层级:当党派认同塑造某种信念时,其他题目的回答就能揭示它。这一排序在三个 LLM 和随机森林之间都很稳定,说明它反映的是真实的态度结构,而非某个模型的特性。统独题是异常值,LLM(23.3%)与随机森林(56.1%)相差 33 个百分点。
方差坍缩真的是 LLM 的问题吗?
不只是。方差坍缩指合成回答过度集中于平均值的倾向,它出现在所有方法中。LLM 的方差比介于 0.67 至 0.85,随机森林为 0.72,仅用人口统计的回归为 0.38。作者认为,基于有限情境预测个体,会把所有方法都拉向总体均值。
这带来研究者应注意的权衡:LLM 对单个人的预测不够准确,却在整体分布上保留了更真实的多样性。如果你的目标是总体层面的异质性而非个体预测,这一点很重要。
安全对齐会扭曲合成受访者吗?
取决于模型。移除对齐后,gpt-oss 准确率下降 6.1 个百分点,Gemma3 下降 2.3,Qwen3.5 基本不变(−0.1)。方差的变化方向也相反:gpt-oss 从 0.85 升至 0.90,Gemma3 则从 0.67 降至 0.45。作者建议逐个模型检验对齐效应,而不是假设存在普遍规律。
对研究者意味着什么
作者的结论是,目前的准确率不足以替代真实受访者,但可用于问卷预测试和提出假设。由此可得出几点实践启示:
- 检验个体层面预测,而不仅是分布。保留部分题目是一种低成本方法,可以判断合成样本究竟了解你的受访者,还是只了解总体平均。
- 为模型提供真实的态度情境。在本研究中,人口统计画像几乎没有贡献,起作用的是先前的回答。这正是基于真实回答数据构建数字孪生样本的逻辑。
- 预期不同主题表现不均。党派或身份相关题目可能模拟得很好,而敏感或个人化题目可能失败。
- 考虑混合设计。论文指出,将 LLM 生成的先验与较小规模的人类样本结合,是近期最有前景的用法。
局限也值得注意:研究只使用了一份问卷和固定的题目划分,仅测试开源权重模型,且没有人类重测信度作为上限。作者还指出,相对多数基线的提升虽然在 8,000 多次预测中具有统计显著性,但实际意义有限。
常见问题
什么是硅基抽样?
硅基抽样是指提示 LLM 以指定人物或画像身份回答问卷,生成用于近似真实人类样本的合成回答。
2026 年 LLM 能替代问卷受访者吗?
根据这项研究,不能。零样本模型在未见题目上的完全匹配率为 52%,低于有监督模型的 58%,在敏感和个人判断类题目上表现大幅下滑。
更大的模型是更好的合成受访者吗?
本研究中并非如此。一个中文训练较强的 27B 模型在中文问卷上胜过 120B 模型,说明语言匹配可能比规模更重要。
什么是方差坍缩?
指预测回答的分布相对真实分布变窄。在本研究中,它影响所有方法,包括随机森林,而不只是 LLM。
来源:Ku, C.-T., Hsu, C., Huang, P.-C., Liu, F. C.-s., Cheng, I.-L., & Kang, Y. (2026). Silicon Sampling via Cross-Survey Transfer. arXiv 预印本 2607.03091。
最后更新:2026 年 9 月 11 日。本文是 Qualitati 研究团队对第三方研究的独立编辑摘要,与论文作者无关联,也未获其背书。