如何用 AI 预测试问卷题目(2026)
Qualitati 研究团队 · 2026-09-08 · 9 分钟阅读
简短回答:AI 问卷预测试,指的是在正式发放问卷之前,用 LLM 对草拟题目模拟认知访谈。在迄今最有力的一项公开测试中,一个"引导式"模拟认知测试提示词在一份 20 题问卷中查出了 75% 的人为植入缺陷,耗时不到一小时、成本仅几美元(Sturgis、Roberts 与 Robinson,2026 年 4 月)。把它当作筛查工具,把人类留给确认环节。
核心要点
- 在 Survey Futures 的研究中,表现最好的 LLM 配置查出了 75% 的已知题目问题,误报率很低,每份 20 题问卷的成本仅几美元(Sturgis、Roberts 与 Robinson,2026)。
- 模拟认知测试与专家评审捕捉的是不同类型的问题。两者都要跑;单靠任何一种都不够。
- 结果对提示词设计与模型选择高度敏感——在开放权重模型上表现良好的结构化提示词,在被测试的闭源模型上表现很差。
- 诱导式追问会抬高认同率。2025 年一项研究发现,在诱导式追问下,受访者认可某个不太可能的题目理解的频率,是开放式追问下的五倍以上(Conrad 等,2025)。AI 预设脚本的追问在结构上就容易落入同样的偏差。
- 可落地的工作流是一个漏斗:先用 LLM 扫描整份问卷,再对被标记出的少数题目做真人认知访谈。
什么是 AI 问卷预测试?
AI 问卷预测试,是指在数据收集之前用大语言模型评估草拟的问卷题目——方式要么是对照已知的问题缺陷分类体系审查措辞(模拟专家评审),要么是模拟一位受访者边作答边出声思考、并回答关于每道题的追问(模拟认知访谈)。
它所模仿的传统方法是认知访谈,其理论框架是 Tourangeau 的问卷作答四阶段模型:理解、提取、判断、作答映射。参与者一边回答草拟题目一边讲出自己的推理过程,或回答有针对性的追问,由分析者找出题目在哪里失效。
认知访谈确实有效,但也慢而昂贵,所以在实践中被严格配给。Sturgis 等人指出,美国的学术机构每一轮通常是中位数最少约五位、最多约二十位受访者——这样的小样本只能可靠地暴露出最普遍的问题。对一份 60 题的问卷来说,对每道题都做穷尽式真人测试根本不现实。
2026 年的证据究竟说了什么
最直接的证据来自 2026 年 4 月发布的 Survey Futures 第 15 号工作论文(伦敦政治经济学院的 Patrick Sturgis 与 Thomas Robinson;洛桑大学的 Caroline Roberts)。它的设计是一项检出率任务,而不是演示:20 道人为植入了问题的题目,外加 7 道来自欧洲社会调查(ESS)的题目作为"设计良好"的对照组。研究比较了三种模拟认知测试提示词变体与一个更简单的专家评审提示词。
作者报告的主要结果:
- 检出率。最佳配置——引导式认知测试变体——查出了 75% 的已知问题,误报率很低。
- 互补性。模拟认知测试与专家评审识别出的问题类型不同,这与人类研究中的长期发现一致(Presser 与 Blair,1994):两种方法无法互相替代。
- 脆弱性。检出率与误报率对提示词设计和模型选择敏感。在开放权重模型上效果好的结构化提示词,在被测试的闭源模型上表现很差。开放权重模型检出更多,但在区分有缺陷题目与设计良好题目上差得多——它们标记得更多,包括本来没问题的。
- 经济性。对一份 20 题问卷的完整评估,在一小时内完成,成本几美元。
请认真读"脆弱性"这一条,因为它最可能反噬你。一个命中率会随提示词措辞浮动的预测试方法,还算不上测量工具——它是一个筛查启发式。这个区分决定了它该被放在工作流的哪个位置。
另一条证据线指向同一方向。在 《Exploring LLMs for Automated Generation and Adaptation of Questionnaires》(CUI '25;Adhikari、Hartland、Weber 与 Cannanure)中,研究者搭建了一条生成、LLM 预测试并跨文化改编问卷的流程,并在 238 位美国受访者和 118 位南非受访者中进行评估。受访者认为经 LLM 预测试的文本更具体,经 LLM 改编的题目略微更清晰、偏差更少。有用,是增量式的,但谈不上颠覆。
题目预测试分诊矩阵
这是 Qualitati 用来决定"哪道题该花哪种方法"的框架。前提是:LLM 筛查几乎免费,真人认知访谈不是,而稀缺资源是受访者的时间——所以只把它花在"出错后果严重、且 LLM 不太可能查出"的地方。
| 题目重要性 ↓ / LLM 可检出性 → | LLM 高可检出性 (措辞、双重问题、含糊量表、选项缺失) | LLM 低可检出性 (文化指涉、敏感框架、领域术语、预设前提) |
高重要性 (关键因变量、细分驱动题、定价题、受监管内容) |
先筛后验。先做一轮 LLM,再对修订后的措辞做 5–8 场真人认知访谈。LLM 省下的是第一轮修订,不是最后一轮。 |
真人优先。直接对目标人群做认知访谈。LLM 只在之后使用,作为对修订后题目的第二双眼睛。 |
低重要性 (描述性、探索性、企业属性题) |
只用 LLM。接受残余风险。这类题目通常根本没做过任何预测试,75% 的检出率在这里毫无疑问是净收益。 |
LLM 加专家评审。不要占用受访者时间。让一位方法学专家对照缺陷分类体系读一遍被标记的题目。 |
这个矩阵只做一件事:阻止团队在"出错代价高昂"的题目上,把"我们让 AI 过了一遍"当成已完成的预测试。
如何执行一次 AI 认知预测试:五步流程
第一步——先建立问题分类体系
在写任何提示词之前,先写下你要找什么。基于分类体系而非一句开放的"找出问题"来提问,正是 Survey Futures 研究中引导式变体优于较弱提示词的原因。以下是一份可用的起始清单,对应 Tourangeau 的各阶段:
- 理解:含义模糊的术语、未定义的行话、双重问题、含糊的量词("经常""定期")。
- 提取:过长的回忆参照期、要求提供没人会记录的次数。
- 判断:预设前提、诱导性框架、社会赞许性的作答方向。
- 作答映射:选项不穷尽或互相重叠、缺少"不适用"、量表标签与题干不匹配。
第二步——跑两轮独立的检查,而不是一轮
A 轮是模拟专家评审:把题目和分类体系交给模型,要求它输出被标记的问题、对应的分类类别和一个改写版本。B 轮是模拟认知访谈:给模型一个具体的受访者人设,让它作答,然后逐阶段追问它的推理。不要把两者合并成一个提示词。已发表的发现是它们捕捉的东西不同——合并就等于扔掉了同时跑两轮的理由。
第三步——放入你确信没问题的对照题
这一步最常被跳过,却正是让输出可解读的关键。在批次中掺入几道你确信设计良好的题目——成熟问卷中经过验证的量表题很合适。如果模型在对照题上也报出了问题,说明它在这份问卷上的误报率高到不可信,你应当先换提示词或换模型,再去读任何真正的标记结果。Survey Futures 的设计正是为此使用了 7 道欧洲社会调查题目。
第四步——变换人设,然后看分歧
用若干个覆盖你真实样本教育程度、领域熟悉度与文化跨度的不同人设来跑认知访谈这一轮。你并不是在模拟一个有代表性的样本——证据很明确,LLM 受访者在心理测量上并不能替代真人。你要找的是一个更窄的信号:哪些题目的模拟理解会随人设改变。无论任何单个模拟答案本身是否准确,理解上的不稳定都是一个正当的红旗。
第五步——对标记结果分诊并分流
把标记分成三类。立即修改:模型给出了具体改写、措辞缺陷明确无误的题目。交给真人测试:分诊矩阵中高重要性一行的所有题目,以及每一道人设之间出现分歧的题目。忽略:那些与对照题相当、模型只是在向某个分类类别做模式匹配、却说不出可信失效机制的标记。把"忽略"的决定写下来;这份审计轨迹是让筛查保持诚实的东西。
追问中立性检查清单
这里存在一个具体而讨论不足的方法论风险,值得单独设一道控制。Conrad 等人在 《Probing in Cognitive Interviews can Promote Acquiescence》(2025)中发现,当访谈者直接询问某个不太可能成立的题目理解时,受访者认可该理解的频率是接受开放式追问者的五倍以上——这种认同偏差在更年轻、教育程度更低的受访者中最强。
AI 主持人的追问是预设脚本的,因此在结构上就倾向于诱导性。更糟的是,一个模拟受访者的 LLM 本身就是被"顺从性"调优过的系统,还在被问诱导性问题——认同偏差的条件叠加了两层。上线前逐条检查每一个追问:
- 追问是否点名了某个具体理解?改写成开放式("你回答那道题时在想什么?")。
- 它是否内嵌了你预期的答案("那个数字里你把兼职工作算进去了吗?")?换成复述请求("用你自己的话说说,那道题在问什么。")。
- 它是否是在请受访者评价题目,而不是报告自己的作答过程?请人点评题目会招来客气话;报告过程不会。
- 你是否对每位受访者都用完全相同的方式追问?一致性是 AI 主持人胜过人类的地方——但前提是脚本本身中立。
- 专门针对模拟认知访谈:至少跑一组完全不提供任何理解暗示的追问,把它的产出与引导组作比较。差距过大,就是在警告你——你在制造发现。
Qualitati 的位置
Qualitati 是一个面向产品、UX 与客户洞察团队的 AI 用户研究平台。其中有两部分与预测试直接相关。
第一是带 AI 追问与分支逻辑的对话式问卷。对话式问卷本身不是预测试,但它改变了预测试需要防范的东西:当问卷本身能追问时,一道仅仅是含糊的题目就不像固定问卷中那样致命,因为追问可以把意图救回来。预测试的精力于是集中在题干和选项上,而不是穷举每一种可能的误读。
第二是文本与语音形式的 AI 主持访谈,它让漏斗中"真人"的那一半在成本上可行,从而使流程的第三步真正做得起来。一天之内、用 3 种语言、对 8 个人做认知访谈,与排一位主持人的档期,是完全不同的经济命题。Qualitati 支持 10 种语言的研究,这对 Adhikari 等人研究的跨文化改编场景尤其重要。
Qualitati 不做的,是替你判断一道题是否可以安全发放。上面的分诊矩阵,正是把人的判断放在已发表证据指出 LLM 筛查最弱的那些位置上。
局限,以及什么时候不该这么做
有四件事必须坦诚。
75% 是一项研究的上限,不是你可以直接继承的基准。那是若干提示词变体中最好的一个,测的是一套专门构造、缺陷已知的 20 道题,用的是特定模型。作者自己就报告了检出率随提示词设计与模型选择而变化。在你用对照题实测之前,你自己问卷上的命中率是未知的。
人为植入的缺陷比真实缺陷容易。一个刻意植入的双重问题,比"一位真正的肿瘤科医生读到一位市场人员写的题目"时产生的那种微妙、领域特有的误读要清晰得多。对你最需要发现的问题,请预期更差的表现。
模拟受访者不是受访者。心理测量证据明确表明,LLM 样本不能直接替代真人问卷数据。以上所有内容都把模拟当作题目缺陷的探测器,绝不当作实质性发现的来源。
不要只用 AI 做预测试——不适用于临床或健康结局量表、具有法律或监管后果的题目、风险在于参与者受到伤害而非测量误差的敏感经历类问题,以及任何你需要向审稿人或伦理委员会为其效度辩护的工具。在这些场景中,LLM 那一轮只是初稿清理,真人认知访谈仍然是证据本身。
人工复核提示:本文的方法论主张均取自所引研究。对受监管或高风险工具采用模拟认知测试的团队,应在其取代现有预测试流程的任何环节之前,请一位问卷方法学专家审阅该流程。
结论
AI 问卷预测试配得上"筛查工具"这个位置,而不是"裁决者"。2026 年的证据支持一个具体的主张——一轮引导式 LLM 认知测试能以几美元的成本找出约四分之三的植入题目缺陷——同时拒绝一个更宽泛的主张,因为这个比率在不同提示词与模型间并不稳定,而且该方法遗漏的东西与专家评审并不相同。用 LLM 扫描整份问卷,掺入对照题以便读懂输出,然后把真人访谈花在"出错就会毁掉整项研究"的题目上。
常见问题
AI 能取代认知访谈吗?
不能。Sturgis、Roberts 与 Robinson(2026)把基于 LLM 的题目测试定位为补充手段,适用于对大量题目做早期筛查,以及资源受限导致无法做真人测试的场景。模拟认知测试与专家评审检出的问题类型不同,两者又都不同于真实受访者暴露出的东西。
我能用 LLM 预测试多少道题?
基本上可以全部。关键在于成本结构:在 Survey Futures 的研究中,一份 20 题问卷的完整评估在一小时内完成,成本几美元。约束条件从预算转移到了你分诊标记结果的能力上。
AI 问卷预测试该用哪个模型?
先测再定。已发表的发现是:在开放权重模型上效果良好的结构化提示词,在被测试的闭源模型上表现很差;开放权重模型检出更多问题,但在区分有缺陷与干净题目上表现更差。用对照题去测量你自己的配置,而不是继承别人的。
模拟专家评审与模拟认知访谈有什么区别?
专家评审从方法学者的立场出发,对照已知设计缺陷的分类体系评估题目文本。认知访谈则模拟一位受访者尝试作答,并追问其推理。前者捕捉预设前提与诱导性框架;后者捕捉只有在有人真正尝试作答时才会显现的困难。
AI 预测试适用于多语言问卷吗?
这是一个很有前景的用例,也是资源缺口最大的场景。Adhikari 等人(CUI '25)在美国与南非样本上测试了 LLM 对问卷的改编,发现在清晰度与感知偏差上有温和的改善。把它当作第一遍;文化指涉与习语位于分诊矩阵的低可检出性一列。
对话式问卷能替代预测试吗?
不能,但它改变了风险结构。自适应追问能以固定问卷做不到的方式,从一道含糊的题目中挽回意图,这使预测试的精力转向题干与选项。但它无法修复诱导性框架或错误的回忆参照期。
开始使用
在你的下一份问卷上跑一遍上面的流程,然后把被标记的题目带进真人访谈。免费开始,赠送 30 积分——无需信用卡——或查看透明定价,在决定之前先看清按积分计费的使用费率。
最后更新:2026 年 9 月 8 日。本文是对公开研究的独立编辑性综述,不代表所引作者或机构的观点。