总模拟调查误差(TS2E):如何审查 LLM 生成的问卷数据
Qualitati 研究团队 · 2026-09-23 · 7 分钟阅读
简要回答:总模拟调查误差(Total Simulated Survey Error,TS2E)是 2026 年提出的一个框架,它把经典的总调查误差(Total Survey Error)模型移植到由大语言模型生成的问卷回答上。它把可能出错的地方分为测量误差(测的是什么)、代表性误差(模拟的是谁的观点)和评估谬误三类,让研究者能够追溯合成问卷究竟错在哪里,而不是只报告一个总体准确率。
合成受访者(也称硅样本或数字孪生)如今在学术研究和市场研究中已相当常见。大多数验证工作只问一个问题:LLM 的回答与人类基准有多接近?来自曼海姆大学、GESIS、格拉茨大学和杜伊斯堡-埃森大学的研究者在一篇新预印本中指出,这是错误的分析单位。单一的匹配分数无法告诉你问题出在提示词、人设(persona)、模型,还是评估方式上。
什么是总模拟调查误差框架?
TS2E 是一份映射到 LLM 生成问卷全生命周期的误差来源清单。根据 Sen、Ahnert、von der Heyde、Lasser、Weiß 和 Strohmaier(2026)的论述,它沿用了总调查误差传统(Groves 和 Lyberg,2010)的核心划分:测量误差降低构念效度,代表性误差降低对目标总体的可推广性。作者在此基础上加入了只有当“受访者”是模型时才会出现的误差。
该框架还区分了两类成因。一类误差来自研究者的设计选择,例如人设的写法;另一类来自当前 LLM 的固有局限,例如训练中吸收的刻板印象。这一区分很重要:只有第一类能通过重新设计研究来修正,第二类只能被记录或加以补偿。
TS2E 在每个阶段识别出哪些误差?
该框架沿着问卷从设计到分析的流程展开。下表按论文的描述汇总了七类误差。
| 阶段 | 误差 | 类型 | 问题所在 |
| 施测前 | 设定误差 | 测量 | 问题未能完整捕捉构念(与人类问卷相同)。 |
| 施测前 | 表述误差 | 测量 | 为适配模型而改写问题、选项或输出格式,导致含义发生偏移。 |
| 施测前 | 人设构建误差 | 代表性 | 所选人设、其属性或措辞与目标总体不匹配;源调查中的误差也会被继承。 |
| 施测中 | 回答生成误差 | 测量 | 模型回答不佳:选项顺序效应、社会期许、拒答、指令遵循差、多次运行结果不稳定。 |
| 施测中 | 人设模拟误差 | 代表性 | 无论人设写得多仔细,模型都无法很好地刻画某些群体。 |
| 施测后 | 回答处理误差 | 测量 | 解析自由文本或 JSON、或使用 LLM 评判器时,误读了模型的原意。 |
| 施测后 | 调整误差 | 代表性 | 用人类调查权重重新加权,隐含假设模型与人类犯的是同一类错误。 |
来源:Sen 等(2026),第 3 节。人设构建误差与人设模拟误差是 LLM 问卷特有的,在人类问卷中没有完全对应的误差类型。
三种评估谬误是什么?
即使模拟设计得很好,也可能被错误地评判。论文指出了将合成回答与人类数据比较时的三个逻辑陷阱:
- 基准真值谬误。人类调查数据本身也有误差,并非完美的金标准。它还可能被污染:模型可能在训练中见过这份调查,或者“人类”回答本身就是借助 AI 写成的。
- 单一最佳指标谬误。没有哪一个指标能单独证明效度。个体层面的得分、分布距离和下游效应量可能彼此矛盾,描述性统计吻合也不能保证得出相同的实质性结论。
- 情境漂移谬误。在某一情境(比如一次选举)中验证过的模拟,被默认可用于“相似”情境(下一次选举、另一个国家)。作者指出,目前没有公认的方法衡量两个情境有多相似,而闭源商业模型也可能随时间悄然变化。
作者如何检验这个框架?
他们开展了一项多元宇宙分析(multiverse analysis),模拟 2024 年美国总统选举中的投票选择,并以美国全国选举研究(ANES)作为参照。每项设计选择都被系统地变化:
- 任务措辞:投票问题的两种表述。
- 人设:仅人口统计变量,或人口统计变量加态度变量(如党派和意识形态),每种又分为直接的“你是……”格式和访谈格式。
- 模型:来自 Llama、OLMo 和 Qwen 三个系列的六个开源权重模型,每个系列两种规模。
- 回答处理:JSON 输出、由 LLM 评判器读取的自由文本,或由关键词匹配读取的自由文本。
- 调整:使用或不使用 ANES 调查权重。
由此得到 288 种配置。加权前的 144 种配置分别用 5 个随机种子、在 4,779 名 ANES 受访者上运行,共生成 3,440,880 条模拟回答。代码已在 GitHub 公开。
哪些设计选择影响最大?
人设内容起主导作用,其他大多数选择的影响要小得多。根据 Sen 等(2026),所有配置的总体加权 F1 分数约为 0.52。主要发现如下:
- 人设中的态度变量是最大的杠杆。直接格式、包含人口统计加态度变量的人设平均 F1 为 0.624,仅含人口统计变量的为 0.434。作者提醒,党派认同与投票选择高度相关,在实际应用中可能无法获得。
- 问题措辞没有显著影响(F1 为 0.52 对 0.518)。
- 不同配置差异巨大。最佳配置的 F1 达到 0.686,最差仅为 0.308。作者认为这种敏感性说明当前 LLM 模拟相当脆弱。
- “最佳”模型取决于指标和群体。Qwen-30B 的 F1 最高,OLMo-32B 的分布距离最小,而对保守派受访者,其他模型表现更好。
- 用关键词解析自由文本使表现略有下降,但具有统计显著性。
- 用 ANES 权重重新加权也略微拉低了总体结果,与调查实践的常规预期相反。
同一配置多次重复运行的结果保持稳定,因此对这些开源模型而言,可靠性的问题小于其对设计选择的敏感性。
这对使用合成受访者的研究者意味着什么
实践上的启示是:像对待任何其他测量工具一样对待 LLM 问卷——记录每一项设计选择,并测试不止一种方案。论文建议研究者:
- 预注册模拟设计,因为最佳与最差配置之间的差距为挑选有利结果留下了空间。
- 报告多个指标,并按子群体拆分结果,而不只报告总体。
- 分别检验可靠性与敏感性:重复同一提示词,以及对提示词做无关紧要的微小改动。
- 模拟历史调查时谨慎使用闭源商业模型,因为其训练数据和版本变化无法核查。
- 在情境之外进行验证,例如在后续调查轮次上检验,再宣称模拟具有可推广性。
论文附录提供了一份文档清单,扩展了包括 AAPOR 标准在内的现有报告规范。如果你在 Qualitati 的数字孪生等模拟样本上预试问题,TS2E 的各个阶段就是一份很实用的记录清单。当目标是获得关于真实人群的证据时,面向真人受访者发放的对话式工具,如 AI 问卷,则可以彻底避免人设误差和模拟误差。
常见问题
TS2E 与总调查误差有何不同?
它保留了测量误差与代表性误差的划分,但增加了 LLM 特有的误差,即人设构建误差、人设模拟误差和回答生成误差,另外还加入了一组在以人类数据为基准评估合成回答时出现的评估谬误。
更丰富的人设能消除合成问卷的偏差吗?
不能自动做到。在本研究中,加入态度变量显著提升了投票选择的预测,但作者强调,这些态度变量在实际应用中可能无法获得,而且无论人设如何设计,某些群体仍然模拟得不好。
可以只用一个准确率分数来验证合成受访者吗?
不可以。案例研究中的两个指标分别选出了不同的最佳模型,子群体结果也与总体排名不同。作者建议根据具体用途选择并报告多个指标。
这项案例研究能推广到所有合成问卷吗?
作者明确表示不能。它只是用开源权重模型在一项美国投票选择任务上演示该框架,本研究中不显著的设计选择在其他情境下可能很重要。
原始来源:Sen, I., Ahnert, G., von der Heyde, L., Lasser, J., Weiß, B., & Strohmaier, M. (2026). Total Simulated Survey Error: Designing and Diagnosing Survey Responses from Large Language Models. arXiv:2609.10280.
最后更新:2026 年 9 月 23 日。本文是对第三方研究的独立编辑摘要;Qualitati 与论文作者无关联。