LLM 人设能模拟交叉身份吗?2026 年 8 个模型的研究
Qualitati 研究团队 · 2026-09-17 · 7 分钟阅读
LLM 人设能模拟交叉身份吗?并不可靠。一项 2026 年对八个大语言模型的研究发现,当合成受访者被赋予两到三个人口特征时,其回答大多只反映其中一个特征。据 Rennard 和 Xypolopoulos(2026)报告,在 75–82% 的子群体中,单一特征对双特征人设回答的解释力优于两个特征的叠加组合。
合成问卷受访者常被宣传为触达难招募群体的廉价方式:年长的西班牙裔天主教徒、年轻的共和党女性、拥有大学学历的低收入黑人选民。这些稀有交叉群体恰恰是人类样本最稀薄、成本最高的地方。这项研究检验的是:用多重身份提示 LLM,得到的究竟是该群体的真实观点,还是扁平得多的东西。
这项研究测试了什么?
研究将 LLM 人设与皮尤研究中心 American Trends Panel 15 轮调查中的每一个真实交叉子群体进行对比。作者 Virgile Rennard 和 Christos Xypolopoulos 于 2026 年 8 月 24 日在 arXiv 发布了预印本(arXiv:2608.23005)。
- 数据:2017–2021 年实施的 15 轮 Pew ATP 调查,每轮包含 67–128 道封闭式题目、2,524–10,221 名受访者。只有真实受访者不少于 20 人的子群体单元才被计为基准真值。
- 身份维度:七个——年龄、性别、种族、收入、党派、宗教和教育程度。
- 人设:每道题 31 个单特征、405 个双特征和 1,355 个三特征画像,共 1,791 个不同画像。
- 模型:八个——GPT-4o、GPT-4o-mini、GPT-5.5、Claude Haiku 4.5、Claude Sonnet 5、Gemma-2-9B、Mistral-7B 和 Llama-3.1-8B。
- 规模:约 21.1 million(2,110 万)个模拟回答分布。
- 核心检验:“组合竞赛”——判断双特征人设的误差更像两个单特征效应之和(真正整合),还是只像其中之一(坍缩)。
真实交叉群体的表现如何?
在真实问卷数据中,交叉群体的观点大致可加,而且身份叠加越多越独特。作者报告,真实子群体的观点约等于各单一身份成分之和,但从一个身份到三个身份,其独特性增长 2.5 倍。换言之,交叉本身携带着研究者希望合成样本能够复现的真实信号。
LLM 人设多常坍缩为单一身份?
大多数时候都会。据 Rennard 和 Xypolopoulos(2026),在各模型中,最佳单一特征在 75–82% 的双特征子群体中胜过叠加组合;例如 GPT-4o-mini 为 78.4%。真实人类单元在同一检验中为 44.4%,接近其可达上限 49.3%。维度越深差距越大:对三特征人设,完全叠加的预测只在 7.8–10.0% 的单元中胜出。
| 指标 | 真实受访者 | LLM 人设 |
| 单一特征胜过叠加组合(双特征) | 44.4% 的单元 | 75–82% 的子群体 |
| 叠加预测胜出(三特征) | 观点大致可加 | 7.8–10.0% 的单元 |
| 身份叠加时的独特性 | 从一个到三个特征增长 2.5 倍 | 误差基本持平(GPT-4o-mini TV 0.212 / 0.238 / 0.269) |
| 校准后坍缩指数(双特征) | — | 0.83–0.95 |
更好的提示词能解决吗?
不能。在所有测试的提示策略下坍缩都依然存在。每次调用只给一个人设时为 75.3–83.4%;思维链指令被描述为无效(79.0–85.5%);读取对数概率的结果落在同一区间;颠倒特征顺序后,76–88% 的单元中被保留的特征不变。
模型会保留哪个身份?
几乎是随机的——但有一个令人担忧的例外。模型保留对真实受访者最重要特征的比例仅为 53.3–57.9%,只比 50.4–52.2% 的置换基线高 3–7 个百分点。党派是唯一一个保留情况与其重要性相符的维度。种族的保留率偏低 9.5 个百分点,宗教偏低 5.0 个百分点,而作者指出二者恰恰是真实观点最强的驱动因素。性别则被过度保留 9 到 17 个百分点。种族压制在指令微调之前的基础模型中就已存在。
准确率差距究竟从何而来?
主要来自单一特征的校准偏差,而非组合规则。模型误差是人类抽样噪声的 1.8–4 倍。当作者用真实的单特征分布进行叠加重组时,双特征的平均误差降至总变差 0.062,低于噪声下限。这表明改进合成数据的路径在于将每个身份校准到实测的群体差异,而不是设计越来越复杂的人设。
这对研究者意味着什么
应把交叉合成人设最多视为单一身份的估计。从论文得出的实践启示:
- 不要用人口特征人设提示来估计小的交叉单元。作者指出,多层回归与后分层(MRP)仍是小单元估计的标准方法。
- 对合成样本进行规范审计。他们建议设定明确的人类抽样噪声下限、对相似度指标做零假设校准,并进行分样本验证。
- 警惕种族和宗教。这是模型最常丢弃的维度,相关子群体结论最需要保持怀疑。
- 合成样本用于预试,而非最终结论。像 Digital Twin Panel 这样的工具可以在正式实施前压力测试题目,但关于稀有子群体的结论仍需要真实的人——例如通过 AI Interviewer 对这些受访者开展研究。
作者也指出了局限:数据为美国英语封闭式题目,未测试基于访谈的条件设定,调查年份(2017–2021)早于模型训练截止时间,且已发布的 Pew 汇总结果可能存在于预训练数据中。
常见问题
什么是交叉合成人设?
它是一种 LLM 提示,要求模型以同时具备多个特征的人的身份作答,例如特定的年龄、种族、宗教和党派,而不是单一的人口标签。
GPT-5.5 或 Claude Sonnet 5 等更新的模型会更好吗?
研究纳入了这两个模型,但只在两轮调查的子集上测试,作者提醒不要对前沿模型做宽泛推论。坍缩模式在全部八个模型中都出现了。
那么合成问卷数据就没用了吗?
不是。结论更窄:人设一次只代表一个身份。只要结果经过人类数据验证,它们仍可用于问卷预试或单一维度的探索。
小子群体估计应该用什么?
论文指出应在真实问卷数据上使用多层回归与后分层,这仍是小单元估计的标准方法。
最后更新:2026 年 9 月 17 日。本文是对第三方研究的独立编辑摘要(Rennard & Xypolopoulos,2026,arXiv:2608.23005);Qualitati 与作者无关联。