合成问卷数据为何让置信区间失真
Qualitati 研究团队 · 2026-08-25 · 7 分钟阅读
合成问卷数据——由 LLM 生成而非从真人处收集的回答——所附带的置信区间通常窄得离谱。Tan 与 Zrnic 2026 年的一篇论文显示,在真实的选举调查数据上,这类朴素区间只有 3% 的情况覆盖了真值;他们提出的校准方法则恢复了有效的覆盖率。
这篇论文解决的是什么问题?
它解决的是 silicon sampling 的误差棒问题。研究者早已知道合成受访者存在偏差;更棘手的问题是,一个合成估计究竟能作为什么的证据。如果你生成 2,000 个 LLM「受访者」并计算 90% 置信区间,这个区间反映的是模型输出分布内部的抽样噪声——而不是该分布与现实之间的距离。区间精确地刻画了错误的量。
《Valid Inference with Synthetic Data via Task Exchangeability》(Lezhi Tan 与 Tijana Zrnic,arXiv 预印本,2026 年 6 月,2026 年 8 月修订)正面处理了这一点。其论证是:若不对真实分布与合成分布之间的联系作任何假设,仅凭合成样本进行推断是不可能的——因此有意义的做法,是找出能让推断重新成立的最弱假设。
什么是任务可交换性(task exchangeability)?
任务可交换性是这样一个假设:你的新研究问题,在统计意义上可与一组你确实拥有真实数据的历史问题互换。具体而言:你此前做过 30 项类似调查,每项都同时有真实回答与合成回答。在每一项上,你都能测出合成估计与真值之间的差距。如果新任务抽自同一个任务总体,那么这些历史差距就能告诉你,新的合成估计大概会偏离多远。
方法由此推出。据 Tan 与 Zrnic(2026),流程为:
- 用合成样本计算普通置信区间。
- 对每一项历史任务,估计真实数据答案与合成数据答案之间的差距。
- 取这些历史差距的经验分位数。
- 用该分位数把合成区间向两侧扩宽。
结果是一个带有可证明覆盖率保证的区间。它比朴素区间宽得多——而这正是刻意为之。宽度本身就是结论:它是你没有真正去收集数据所应付的诚实代价。
朴素的合成区间失效得有多严重?
非常严重,且在三个截然不同的领域中表现一致。下表列出的覆盖率(区间实际包含真值的比例;目标约为 90–95%)如下。
| 基准 | 合成数据来源 | 朴素覆盖率 | 校准后覆盖率 |
| ANES 情感温度计(33 项目标任务) | GPT-3.5 | 3% | 97% |
| Pew ATP 总统支持率(8 个预测波次) | GPT-4o | 0% | 100% |
| Arena autorater,胜率(74 个模型中的 73 个) | LLM autorater | 19% | 100% |
| Arena autorater,Bradley-Terry 分数 | LLM autorater | 约 73% | 93.3% |
有两个细节值得细读。第一,ANES 校准后区间的中位宽度为 29.8 分(量表为 0–100 的情感温度计)——范围极大,但这就是该任务下诚实的不确定性该有的样子。第二,Pew 的案例最令人不安:朴素区间在 8 个预测波次中一个都没有包含真值,因为合成偏差是系统性的,而非随机噪声。再多的合成受访者也无济于事。这正是关键所在。
这对研究者意味着什么?
意味着一项合成研究的可信度,取决于你能用来校准它的真实数据历史。三点实践含义:
- 保留你过去的真实数据研究。在这一框架下,一批由真人收集的历史研究不再只是存档,而成了校准集。多年运行同一份追踪调查的团队,处境远好于从合成优先起步的团队。
- 合成优先适用于初筛,而非点估计。如果校准后的区间跨度达 30 分,研究仍能区分大效应与零效应——只是无法支撑「支持率为 46%」这样的结论。
- 追问你的任务究竟与哪些任务相似。作者明确指出,可交换性是一项实质性要求,而非形式手续。把 2020 年选举的校准套用到 2026 年的产品概念测试,并不在该定理的保护范围内。
同样的逻辑也适用于定性研究。如果你用 Digital Twin Panel 或 Synthetic Focus Group 做早期探索,严谨的做法是在部分研究中继续做真实访谈,以便观察模拟版本偏移了多少。Qualitati 的 AI Interviewer 与各项合成工具,正是为与真实数据收集并行使用而设计的,而非取代它。
这套方法的局限在哪里?
作者直言不讳。覆盖率保证是在任务分布上边际成立的,而非以某一具体任务的特征为条件——因此即便流程本身正确、平均意义上无误,单项研究仍可能严重偏离,这一点与 conformal prediction 类似。该方法还要求历史任务具备真实数据;它免去的是为当前任务收集真实数据的需要,而不是研究整体对真实数据的需要。此外,界定一个真正可交换的任务总体,是一项没有算法能替你做的判断。
论文中的扩展缓解了第一项约束:加权变体在可交换性仅近似成立时能够平滑退化;混合版本则在你同时拥有部分真实数据与合成数据时,对两类区间取交集。
常见问题
这是否意味着合成问卷受访者毫无用处?
并非如此。这说明的是它们的不确定性长期被错误报告。论文中校准后的区间是有效的——只是很宽。宽而诚实的区间可用于探明方向与初筛;窄而错误的区间则任何用途都谈不上。
需要多少历史数据?
实验中的任务数量在数十量级——ANES 有 33 项历史任务,Pew 分析使用 40 个校准波次,autorater 研究中有 73 个留一法模型。由于关键是取经验分位数,历史任务的数量比单个任务内受访者的数量更重要。
这套方法在问卷之外适用吗?
适用。第三项基准就是 AI 模型评测——涵盖 74 个模型的 280,737 组「人类对 autorater」比较,其中「合成数据」指的是由 LLM 充当评委、替代人类评分者。任何以模型替代人工标注的场景,结构都是一样的。
如果我从未收集过真实数据,还能用吗?
无法获得形式化的保证。若在可比的历史任务上没有真实观测,就没有任何东西可用来校准合成差距;论文明确指出,那种情况下推断是不可能的。
原始文献:Lezhi Tan 与 Tijana Zrnic,《Valid Inference with Synthetic Data via Task Exchangeability》,arXiv 预印本 arXiv:2606.13629(2026 年 6 月,2026 年 8 月修订)。
最后更新:2026 年 8 月 25 日。本文是对第三方研究的独立编辑性摘要,与作者无关联、亦未获其背书;该预印本尚未完成同行评审。