2026 年 10 月 AI 用户研究现状:合成受访者能替代真人吗?
Qualitati 研究团队 · 2026-10-11 · 9 分钟阅读
简短回答:截至 2026 年 10 月 11 日,AI 用户研究的现状可以归结为一个发现:合成受访者能对上平均值,却抓不住个体差异和态度变化。新研究显示,LLM 人设能复现总体均值,但会丢失人与人之间的差异,也会误判观点如何转变。用真实的历史回答来校准人设有帮助,但不能替代真实受访者的检验。
最后更新:2026 年 10 月 11 日
这是我们每月发布的 AI 用户研究现状报告:梳理新研究、新工具和搜索变化,对开展 AI 主持访谈、对话式问卷、合成样本和 AI 辅助定性分析的研究者意味着什么。在 2026 年 9 月版中,我们的主题是:AI 的输出可能看起来正确,推理过程却不正确。9 月 13 日以来发表的研究,让这一点在一个领域尤为突出:合成受访者与数字孪生。
要点速览
- 2026 年 10 月 2 日发布的一项研究覆盖 845 名美国成年人,发现人设描述只能还原真实个体间差异的 53–67%;加入每位受访者此前的问卷回答后,差异基本恢复到人类水平(Pourtaheri 与 Zareei,2026)。
- 2026 年 9 月 26 日发布的一项研究测试了三个开源权重模型家族,发现模拟出的跨量表相关与 2,058 人的人类样本吻合程度为 r = 0.70–0.73,但所测的最新 Llama 版本在三项核心指标中有两项表现最差(Lee 与 Wang,2026)。
- 2026 年 9 月 14 日发布的一项诊断研究使用 526 个人设和 72 个问题,发现所测的五个前沿模型全都误判了人们在获得平衡信息后如何改变看法(Wali 与 Tayyab,2026)。
- 在访谈方面,本月的证据更支持把 AI 当作人类访谈员身边安静的助手,以及一种能自适应、但深度仍然有限的自助式访谈员。
- Google 的 2026 年 9 月垃圾内容更新于 9 月 24 日开始,持续了 13 天 16 小时(Google 搜索状态面板)。
适合谁读
正在使用、或被要求使用合成受访者、数字孪生或 AI 访谈员的学术研究者、博士生、研究实验室和市场研究公司,需要判断这些证据在论文、伦理审查申请或客户报告中能支撑什么结论。
2026 年 10 月 AI 用户研究现状:对上平均值很容易,对上个体很难
AI 用户研究是指用 AI 收集或分析研究数据:AI 主持访谈、带自适应追问的对话式问卷、合成受访者,以及 LLM 辅助的编码和主题分析。10 月的证据指向一个简单的规律:对语言模型来说,匹配总体平均值很容易;匹配个体之间的差异以及个体如何变化则很难。而如果只报告汇总指标,这个差距是看不见的。
这与我们本月详细介绍过的两项研究相呼应。Ahn、Mao 和 Lee 发现,LLM 替身只能解释个体受访者偏离题目平均值部分的 3.05%(我们的解读);Netzer 和 Sambandam 则表明,各研究报告的数字孪生准确率差异很大,主要是因为它们测量的东西不同(我们的解读)。
进展一:过去的行为胜过对一个人的描述
Khashayar Pourtaheri 和 Ahmad Zareei 使用了一个两轮追踪样本,845 名美国成年人完成了 14 种行为偏差的测量,包括风险偏好、时间偏好、过度自信和推理。他们给合成人设逐步提供更丰富的信息:不提供任何信息、人口统计特征、人格特质、认知得分,最后是受访者此前的问卷回答,同时扣留所有用于计分目标偏差的题目(arXiv:2610.03998)。
在总体层面,每种条件看起来都不错:每个合成受访者有 7.1–8.1 种偏差,人类为 7.1 种。但在表面之下,基于描述的人设只达到人类重测信息量的 7–12%。加入行为历史后提升到 28%,并且在全部 17 个人口群体中都是最佳条件。合成回答还表现出比真实回答更强的教育和收入差异。
我们的解读:人口统计和人格简介,主要是给了模型一个可以扮演的刻板印象;真实的过往回答,给它的才更接近这个人本身。即便如此,达到人类重测信息量的 28%,距离可替代的受访者仍然很远。
进展二:开源权重模型确实承载了真实结构,但版本迭代并非越新越好
Grandee Lee 和 Wang Yue 用真实受访者对一份心理测量量表的原话回答来设定人设,再在第二份量表上测量这些人设,形成 139 组配对网格,并与 2,058 人的样本对照。在每个模型家族中,模拟出的跨量表相关与人类数据的吻合度都在 r = 0.70–0.73,主要靠的是方向判断正确,而不是大小精确(arXiv:2609.32638)。
我们的解读:对于出于隐私原因需要本地开源权重模型的实验室,这是个好消息。但更有实际意义的是那个警示:更新的模型版本并没有更好。你在去年模型上做的验证,不能直接沿用到今年的模型。
进展三:人设不会像真人那样更新观点
Ahmed Wali 和 Hassaan Tayyab 基于 America in One Room 数据构建了一套协商式民调诊断。每个模型都失败了,而且各有各的失败方式。GPT-5.1 的人设在获得平衡信息后对另一党派变得更加敌视,而人类则变得不那么敌视(外群体问题上 80% 出现反转,政策问题上为 26%)。Gemini 2.0 Flash、Claude Sonnet 4.5 和 Llama 3.3 70B 的变化方向正确,但幅度是人类的 5–7 倍;DeepSeek V3 几乎没有变化(arXiv:2609.15849)。作者把这种现象称为"自我谄媚":顺从模型自己对该人设的刻板印象。
我们的解读:任何在合成受访者身上测试信息、概念或干预的研究,问的都是一个动态问题。静态准确率对此毫无说明力。这与我们 10 月 7 日介绍的首次点击研究一致:人设让合成数据看起来更可信,却没有更准确。
本月其他进展:AI 访谈员是助手,而不是替代者
- 实时辅助在保持安静时才有效。在一项涉及 18 名访谈员的研究中,AI 建议让每场追问从约 6 个增加到 9–10 个,但访谈员拒绝让 AI 充当评估者或联合访谈员(我们的解读)。
- 小型本地模型也能实现自适应深度。一个运行在 Llama 3.2 3B 上的专业水平自适应访谈员,在 246 场访谈中有 78.9% 与受访者自报的专业水平一致(我们的解读)。
- 便宜不等于深入。一个聊天机器人以 €0.04 的模型成本访谈了 74 位社会科学家,但没有达到定性访谈通常要求的深度(我们的解读);在一份 custom GPT 实地报告中,66 名受访者里只有 19.7% 表示追问帮助他们说得更多(我们的解读)。
- LLM 对开放文本的编码表现中等,且因题而异。GPT-5.4 在 903 条回答上与人类编码者的调整兰德指数为 0.61,不同题目之间从 0.31 到 0.85 不等(我们的解读)。
合成受访者保真度阶梯(Qualitati 框架)
这个阶梯是 Qualitati 原创的规划工具。每一级都是关于合成数据的更强主张。请报告你实际检验过的最高一级,并把结论限制在这一级之内。
| 级别 | 能支撑的主张 | 10 月证据 | 依赖它之前的最低检验 |
| 1. 总体吻合 | "总体均值是这样的" | 即使个人信息很少也容易达到 | 将均值和分布与真实的基准问卷对比 |
| 2. 方差吻合 | "人们之间的差异有这么大" | 描述只能还原 53–67% 的真实差异 | 对比标准差和细分群体的离散程度,而不只是均值 |
| 3. 结构吻合 | "这些态度是相互关联的" | 跨量表相关 r = 0.70–0.73;随版本变化 | 每部署一个模型版本就重新检验 |
| 4. 个体吻合 | "这个孪生体的回答像这个人" | 仅凭描述达到重测信息量的 7–12%;加入过往回答为 28% | 为每位受访者保留真实回答作检验;筛查问题的可回答性 |
| 5. 动态吻合 | "人们会这样回应这条信息" | 五个前沿模型全部未通过协商测试 | 对照真实人类的前后变化做诊断;否则不要做此主张 |
人工审阅说明:各级的划分是对所引预印本的实践性综合,并非经过验证的测量标准。任何高于第 2 级的主张,发表前请由方法论专家审阅。
本月 AI 搜索(GEO)有何变化
根据搜索状态面板,Google 的 2026 年 9 月垃圾内容更新于 9 月 24 日开始,持续 13 天 16 小时。从 2026 年 5 月核心更新到本文撰写时,没有列出新的核心更新。对于发布方法论内容的研究团队,一贯的做法依然适用:注明日期的主张、链接的一手来源,以及 AI 答案引擎可以不失真引用的简短定义式回答。
Qualitati 的定位
Qualitati 是一个来自欧洲、价格亲民的定性研究平台,面向高校和研究公司,并把数据隐私与 GDPR 放在核心位置。它支持文本和语音形式的 AI 主持访谈;提供 Active Listener 模式,为人类访谈员实时提供提示和环节进度追踪;支持 AI 主持焦点小组和合成焦点小组;以及带 AI 追问的对话式问卷。ThemeLens 可在多达 100 份访谈记录中将编码映射到研究问题,并附上可追溯到受访者的引文;QDA Workspace 支持归纳式和演绎式编码。
结合本月的证据,我们建议把合成焦点小组用于探索和问题设计,然后在得出结论之前,通过 AI 主持访谈或对话式问卷让真实受访者参与。你可以查看透明定价,或在我们的合成用户与真实受访者对比指南中比较各种方案。
局限与方法论问题
- 预印本。三项新研究均为 arXiv 预印本,在同行评审过程中可能会有变化。
- 样本以美国为主。行为偏差样本和协商数据都来自美国;能否迁移到欧洲或多语言人群尚未验证。
- 测的是问卷任务,不是访谈。三项研究测量的都是封闭式回答。对开放式定性回答的保真度可能更低,也更难测量。
- 模型更替。文中提到的若干模型已被新版本取代。重点在于检验流程,而不是排行榜。
- 何时不应使用合成受访者:当研究问题关乎个体为何做出决定、他们如何回应新信息,或涉及训练数据中代表性不足的群体时。
常见问题
2026 年 10 月 AI 用户研究的现状如何?
AI 访谈和 AI 辅助分析已进入日常使用。新的研究焦点是合成受访者:它们能匹配总体平均值,却会丢失个体差异,并误判观点如何变化。
更丰富的人设能让合成受访者更准确吗?
描述的帮助很小。在 2026 年 10 月 2 日发布的一项研究中,加入人口统计、人格和认知得分只能还原 53–67% 的真实差异,而加入受访者此前的回答则能恢复到接近人类的水平。
更新的 LLM 是更好的合成受访者吗?
不一定。2026 年 9 月 26 日发布的一项研究发现,所测的三个 Llama 版本中最新的一个在三项核心指标中有两项表现最差。请对你使用的每个版本分别验证。
合成受访者能用来测试信息或干预吗?
现有证据表明不能。2026 年 9 月 14 日发布的一项诊断研究发现,所测的五个前沿模型都误判了人们在获得平衡信息后如何更新观点,表现为反转、过度变化或几乎不变。
研究团队应如何报告合成数据?
说明你检验过的最高保真度级别,例如总体、方差、结构、个体或动态吻合,并把结论限制在这一级。同时报告模型版本和验证基准。
结论
2026 年 10 月 AI 用户研究的现状在合成数据问题上很清楚:对上平均值很便宜,对上个体和动态变化则不然。用真实行为来校准人设,每个模型版本都重新验证;凡是关于人们如何不同、如何变化的主张,都要让真实受访者参与。使用 30 个免费额度开始,与真实受访者一起开展 AI 主持访谈、对话式问卷或 ThemeLens 分析。
本文是对公开研究的独立编辑性总结。最后更新:2026 年 10 月 11 日。