如何筛除 AI 研究中的欺诈受访者
Qualitati 研究团队 · 2026-09-05 · 8 分钟阅读
简短回答:AI 主持研究中的欺诈受访者分三类:机器人、借助 LLM 作答的真人,以及为拿到报酬而在筛选环节撒谎的人。用三层防线来拦截——通过可控渠道招募、设计一份难以伪造的筛选问卷、再对访谈记录本身做审计,利用长文本定性数据才有的破绽。事后识别的代价,远低于一个不得不撤回的结论。
AI 主持研究为何成为欺诈目标
任何一项给受访者付费、并通过公开链接接受报名的研究,本质上都是一个报酬市场,而报酬市场必然吸引欺诈。2024 到 2026 年之间发生的变化是:伪造一个看似可信的受访者所需的工具,变得既免费又通用。今天的受访者不必自己写出一段关于产品上手体验的漂亮描述,他把问题粘贴进聊天机器人就行了。
实测规模因渠道而异,差距极大。Xu 与 Malkin(2026)在 SOUPS 2026 上发表的研究跑了 250 份问卷,发现借助 LLM 作答的比例在 Prolific 上低于 10%,在 Mechanical Turk 上却超过 80%——差距之大,使得「欺诈率是多少」在不指明招募来源时根本无从回答。另一项 2026 年 5 月的调查中,Conjointly 估计其自有平台数据中有 4–8% 的疑似机器人活动,剔除「速答者」后降至 2–3%;他们还指出,这些可疑作答者更像是有组织的真人欺诈,而非高水平的自动化。
定性研究之所以反应更慢,是因为大家默认它自带防护:一场 30 分钟的访谈,总该能把非真实受访者筛掉吧。而如今,正是这个假设成了漏洞本身。
三类欺诈受访者
它们需要的对策不同,因此值得分开来看。
| 类型 | 具体含义 | 主要防线 |
| 自动化机器人 | 由脚本或浏览器 agent 从头到尾完成整项研究 | 招募管控、时间分析、LLM 会失败的任务 |
| 借助 LLM 的真人 | 真人把问题粘贴进聊天机器人,再把答案粘贴回来 | 访谈记录层面的分析、追问、语音模式 |
| 资格欺诈 | 真人如实作答,但谎报入选资格以获取报酬 | 筛选问卷设计、与独立记录交叉核验 |
资格欺诈最常见,却最少被讨论。Ziminski 与 Liddell-Quinty 于 2025 年 12 月在 BMJ Open Quality 上撰文,描述的正是线上定性招募中的这一模式:报名在极短时间内密集涌入、Gmail 地址呈现相似的命名规律、IP 地理位置扎堆或明显不合理。他们建议的防御手段并不花哨——一份有意为之的触达与招募计划、一份简短的筛选问卷,以及以社区参与式招募取代公开链接。
究竟什么方法能识别 LLM 代答
2026 年文献中有两个发现值得记住,因为它们与直觉相反。
请受访者「不要用 AI」并不能解决问题。Xu 与 Malkin 测试了平台选择、问卷长度、明确要求不使用 AI,以及禁用复制粘贴。这些措施确实降低了 LLM 的使用率——但作者报告说,它们并不必然改善数据质量。一个把边缘受访者从「粘贴」推向「瞎猜」的威慑手段,并没有为你换来更好的数据集。
陷阱题胜过分类器。Conjointly 的「认知陷阱」思路是嵌入一些人类稳定能做对、而 LLM 稳定做错的任务——他们举的例子是一个经过改动的 Müller-Lyer 错觉图,模型会凭记忆中的固定模式作答,而不是看眼前的刺激材料。报告的失败率为 LLM 51–100%,而人类正确率为 78–96%。这一原则不限于视错觉:任何一道正确答案取决于模型看不到的细节、或与某个著名问题的标准版本相矛盾的题目,都可以充当陷阱。
就定性研究而言,访谈记录本身就是一个问卷所不具备的识别面。经由聊天机器人产出的回答,往往在每一道问题上都结构工整得高度一致、倾向于概括而非叙事、被追问时抗拒给出具体细节,并且总是老老实实回答被问到的那个问题,不像真人那样发散跑题。而一句「带我回到最近一次发生这件事的时候,包括你在那之前做了什么」,是很难靠「粘贴—返回」的循环来应付的。
AI 访谈欺诈筛查表
这是一份原创的三层清单,可用于任何 AI 主持的研究。每一层拦截的都是上一层漏掉的东西;单独任何一层都不够。
第一层——招募(在任何人报名之前)
- 优先使用已知名单、客户数据库或经过审核的样本库,而非公开链接。
- 不要在可被抓取的招募文案中公布报酬金额。
- 使用一次性的唯一访谈链接,而不是一个共享 URL。
- 事先设定一个预期的招募速度——如果某个小众 B2B 人群在一小时内涌入 40 份报名,那是信号,不是运气。
第二层——筛选问卷(访谈之前)
- 至少包含一道开放题,要求作答者给出该领域特有的亲身细节,而不是一段定义。
- 包含一项可与独立记录核验的信息(账号、订单、职位)。
- 加入一道低风险的注意力题或陷阱题,让模型凭记忆而非凭题面作答。
- 记录报名时间戳、邮箱命名规律和粗粒度地理位置——并且成批审阅,而不是逐个查看。欺诈体现在分布里,而不在单个个案里。
第三层——访谈记录审计(访谈之后)
- 标记那些在所有问题上回答长度与结构几乎恒定的访谈记录。
- 标记那些在连续两次要求讲述具体经历后仍停留在抽象层面的回答。
- 核查筛选问卷中的自述与访谈叙述之间是否存在内部矛盾。
- 把回答延迟与回答长度作对比——一段又长又工整的答案却是瞬间给出的,值得再看一眼。
- 在阅读数据之前就确定排除规则,并记录每一次排除及其理由。
最后一条是方法学上的保障,而非反欺诈手段。在看到某位受访者的回答是否支持你的假设之后再把他排除,无论每一次排除单看多么合理,都属于「研究者自由度」问题。
Qualitati 在其中的位置
Qualitati 是一个面向产品、UX 与客户洞察团队的 AI 用户研究平台,支持文字与语音形式的 AI 主持访谈与焦点小组、对话式问卷,以及一次可覆盖至多 100 份访谈记录的 AI 主题分析。
平台的若干能力与上述分层相对应。AI 主持访谈可以配置为追问具体经历、而不是接受第一个答案,这正是第三层中访谈记录层面的防线——一个会追问「具体是什么时候,接下来发生了什么」的主持人,产出的数据在可测量的意义上更难伪造。语音模式抬高了「粘贴—返回」循环的成本,但并未将其消除。带 AI 追问的对话式问卷,天然适合承载一份能根据作答内容自适应的第二层筛选。而由于 ThemeLens 会把每一个主题锚定到受访者原话上,剔除一份访谈记录后可以直接重跑分析,无需拆解一套手工搭建的编码手册。
我们并不把自动欺诈识别宣称为一项产品功能。上面这套筛查是一种研究运营实践;诚实的说法是:平台让其中几层更容易执行,而不是让这几层变得不必要。
局限与取舍
这里的每一项控制手段都有代价。
- 更严的招募会降低样本多样性。封闭名单和客户数据库更安全,但代表性更差。对于面向你尚未触及人群的探索性研究,这个取舍很昂贵。
- 陷阱题会失效。一旦某道认知陷阱被公开传播就不再管用,而模型能力也在推进。任何具体的陷阱题都应被视为易腐品。
- 误判会伤害真实受访者。非母语者、使用辅助技术的人,以及单纯写字工整的人,都可能显得「过于结构化」。排除必须建立在多项信号相互印证之上,绝不能凭单一标记。
- 流行率估计不可迁移。上文的 4–8%、以及 10% 到 80% 的数字,描述的是特定平台在特定时点的情况。你自己的比率,是关于你自己渠道的一个实证问题。
- 这些都不是合规或安全方面的主张。欺诈筛查关乎数据效度,与知情同意、隐私和伦理审查义务是两回事。
人工复核说明:排除标准以及任何针对具体受访者的欺诈判定,都应在影响已发布结论或报酬决定之前,由一位具名研究者复核。
适合谁,以及什么时候不必这么做
本文适用于通过公开或样本库渠道开展有偿研究的研究运营负责人、UX 研究者和洞察团队。对于同事之间的内部研究、没有报酬因而没有造假动机的无偿研究,以及与你本就相识的人逐个约定的访谈,这套做法过于繁重。在那些场景里,只做第三层就足够了。
常见问题
线上研究中的欺诈受访者有多普遍?
这几乎完全取决于渠道。Xu 与 Malkin(2026)发现借助 LLM 作答的比例在 Prolific 上低于 10%,在 Mechanical Turk 上超过 80%;Conjointly 在 2026 年 5 月的分析中估计其平台上疑似机器人占 4–8%,剔除速答者后为 2–3%。
要求受访者不要使用 AI 有用吗?
部分有用。Xu 与 Malkin 测试了明确要求,以及禁用复制粘贴和缩短问卷;使用率确实下降了,但作者报告说数据质量并不必然改善。
AI 主持人能在访谈过程中识别出欺诈受访者吗?
并不可靠,任何负责任的平台都不应声称能做到。AI 主持人能做的是追问具体经历与细节,从而产出让人工复核者事后更容易发现破绽的访谈记录。
语音访谈比文字访谈更安全吗?
它抬高了把问题转手给聊天机器人所需的成本,但并不是解决方案——语音可以照着念,而且语音本身还带来无障碍与转录准确性方面的额外考量。
可以仅凭一个危险信号就排除某位受访者吗?
不可以。单一指标会对非母语者和书写工整的受访者产生误判。应要求多项证据相互印证、在分析之前定好规则,并记录每一次排除。
核心结论
欺诈受访者如今已是有偿线上研究的常态运行条件,而非边缘个案,AI 主持访谈也并非自带防护。可行的防御是分层的、并且乏味的:管住招募渠道、设计一份难以伪造的筛选问卷,并按照你在看数据之前就写好的规则去审计访谈记录。这三层没有一层可以省略,也没有任何一层是足够的。
免费开始,赠送 30 个额度——无需信用卡——或在开展下一项 AI 主持研究之前先查看透明定价。
参考来源
- Xu, Z., & Malkin, N. (2026). A Penny for Your Prompts: Experiments Detecting and Mitigating LLM Usage by Survey Respondents. SOUPS 2026. arXiv:2607.00403
- Conjointly(2026 年 5 月 18 日发布,2026 年 8 月 10 日更新)。We went looking for bots. conjointly.com
- Ziminski, D., & Liddell-Quinty, E.(2025 年 12 月)。线上定性研究中识别潜在欺诈受访者的策略。BMJ Open Quality. 罗格斯大学公共卫生学院综述
- NORC at the University of Chicago (2026). Fraudulent respondents and bots in nonprobability surveys: A literature review. norc.org
最后更新:2026 年 9 月 5 日。
本文是对第三方研究的独立编辑性综述。Qualitati 与文中引用的作者或平台无任何隶属关系,上述解读为我们自己的观点。文中涉及的竞品与平台表述均基于截至 2026 年 9 月 5 日的公开信息。