AI 问卷受访者会给出符合社会期许的回答吗?
Qualitati 研究团队 · 2026-07-23 · 8 分钟阅读
硅样本(silicon samples)——即由大语言模型模拟的问卷受访者——与人类在敏感问题上的表现一样,倾向于过度报告社会认可的态度。2025 年 12 月发表的一项研究发现,用中性语言改写提示词,是降低这种“社会期许偏差”、让 AI 回答更接近真实人类问卷数据的最可靠方法。
随着研究者开始尝试用 LLM 生成的“数字孪生”受访者来预测试问卷、模拟公众舆论,一个熟悉的测量问题以新的形式重新浮现。如果合成受访者夸大了对社会认可立场的支持,所得数据恰恰会在敏感议题研究最需要准确的地方产生误导。一篇新的预印本论文对四种纠偏方法进行了检验。
什么是硅抽样中的社会期许偏差?
社会期许偏差是指受访者在回答敏感问题时,倾向于给出在他人看来可以接受的答案,而不是真实想法。在人类问卷中,它会扭曲有关种族、性别、政治、收入和健康的回答。“硅抽样”(silicon sampling,也称随机硅抽样)是指以人口统计特征为条件,用 LLM 生成问卷回答,从而实际上模拟一名受访者。该研究关注的问题是:LLM 基于人类文本训练、又被调校得趋于顺从,可能会复制甚至放大同样偏向社会认可答案的倾向。
这项 2026 年受关注的研究检验了什么?
在论文 Mitigating Social Desirability Bias in Random Silicon Sampling 中,Chapala、Mironov 和 Deng(2025)提出了一个直接的问题:提示词措辞能否减少这种偏差,并提高硅样本与人类样本的一致性?据作者介绍,他们在三个模型(Llama-3.1 系列和 GPT-4.1-mini)上,将合成回答与真实的美国全国选举研究(ANES)数据进行对照,并使用Jensen-Shannon 散度(JSD)及 bootstrap 置信区间来衡量一致性。JSD 越低,说明 AI 的回答分布越接近真实人群的实际报告。
他们评估了四种基于提示词的纠偏策略:
| 策略 | 原理 | 报告的效果 |
| 改写提示词 | 用中性、非诱导性的措辞重写问题 | 最有效——减少了回答向社会可接受选项的集中 |
| 反向计分题项 | 在语义上反转题项,以抵消方向性牵引 | 效果因题项而异 |
| 启动(元指令) | 在提问前指示模型如实作答 | 无系统性益处;导致回答趋同 |
| 前言(元指令) | 在问卷模块前加入一段框架性陈述 | 无系统性益处;导致回答趋同 |
研究发现了什么?
中性改写胜出。根据 Chapala 等人(2025)的研究,改写提示词是最有效的干预手段,削弱了模型把回答扎堆到社会可接受选项上的倾向。反向计分对部分题项有帮助,对另一些则无效。两种“直接让模型说实话”的方法——启动和前言——没有表现出系统性益处,而且值得注意的是,它们加剧了回答的同质化:模型的答案趋于一致,而不是再现人类意见真实的分布。
最后这一点很重要。一个过于“自我一致”的合成样本,可以说比单纯有偏的样本更糟:它掩盖了让问卷数据有价值的分歧与方差。这项研究共包含 24 张表格和 9 张图,结果表明真正起作用的杠杆是问题设计,而不是层层叠加指令。
中性改写在实践中是什么样子?
胜出的策略并不花哨,却很具体。与其问“你支持帮助弱势群体吗?”——这会暗示哪个是被认可的答案——中性版本会对称地呈现取舍,并去掉带有价值判断的表述,让任何一个选项都不显得是“好”的选择。这一结果呼应了数十年来的问卷方法论指导:平衡、非诱导的措辞能降低受访者(无论是人类还是合成的)感受到的从众压力。变化的只是对象:同样用来保护人类自我报告的方法,如今也能保护你交给模型的提示词。
这对研究者意味着什么?
实际启示是:纠正 AI 模拟受访者的偏差,与经典问卷方法论非常相似。减少社会期许压力的方式与对待人类受访者相同:措辞保持中性,避免诱导性表述,谨慎使用反向计分量表。让 LLM“如实回答”并不能替代一个写得好的问题。
对于使用合成受访者来试测研究工具的团队,这提示我们应把 AI 样本库视为预测试和压力测试工具,而不是人类实地调查的替代品——在敏感议题上尤其如此。如果你正在尝试模拟样本库,Qualitati 上的 Digital Twin Panel 和 AI Surveys 等工具最适合用来在向真实参与者发放问卷之前发现含糊或诱导性的措辞,然后再用人类数据加以验证。
需要注意的局限
该研究只覆盖了三个特定模型和美国政治态度数据(ANES)。中性改写能否迁移到其他领域(健康、消费者行为、职场态度),或迁移到更新的闭源模型,本研究并未检验。此外,总体分布上的“更一致”并不等于个体层面的回答准确。降低可测量的偏差改善了数据的形态,却不能证明合成受访者的思考方式与任何真实个体相同。
常见问题
什么是随机硅抽样?
这是一种以人口统计属性为条件、用大语言模型生成问卷回答的方法,生成的模拟“受访者”可以像人类样本一样进行汇总分析。
LLM 真的存在社会期许偏差吗?
是的。根据 Chapala 等人(2025)的研究,由于 LLM 基于人类文本训练并被调校得趋于顺从,它们在敏感题项上往往过度呈现社会认可的答案——这与人类自我报告中的偏差相同。
减少这种偏差的最佳方法是什么?
在这项研究中,用中性措辞改写问题是最有效的方法。仅仅指示模型“说实话”(启动或前言)没有帮助,反而降低了回答的多样性。
可以用 AI 取代人类问卷受访者吗?
敏感研究不行。现有证据支持用合成受访者来预测试和完善问题,再用真实的人类数据进行验证,而不是用它来替代人类受访者。
最后更新:2026 年 7 月 23 日。
本文是对第三方研究的独立编辑摘要;Qualitati 与该研究作者并无关联。完整的方法和结果请参阅原论文。