AI 用户研究现状:2026 年 8 月
Qualitati 研究团队 · 2026-08-23 · 11 分钟阅读
最后更新:2026 年 8 月 23 日
简要回答
截至 2026 年 8 月 23 日,AI 用户研究的核心问题已从"AI 能否访谈真人"转向"什么样的 AI 采集回答才算好回答"。8 月有三项进展值得关注:一个界定访谈回答质量的实证语料库、一项显示 AI 辅助访谈以话题广度换取追问深度的对照研究,以及欧盟将高风险 AI 法案义务推迟至 2027 年 12 月。
核心要点
- 该领域的重心已从可行性转向评估。2026 年第三季度的开放问题是测量,而不是能力。
- 一个来自 14 个真实研究项目、包含 343 份访谈记录与 16,940 条回答的新语料库发现,与研究问题的直接相关性是回答质量最强的预测因子——而清晰度与基于 surprisal 的信息量并未与质量相关(Ivey、Field 与 Xiao,2026)。
- 2026 年 8 月 3 日发布的一项准实验研究发现,AI 辅助访谈覆盖的话题更少(9.6 个对 14.5 个),但每个话题的追问次数是三倍(3.43 次对 1.15 次)。
- 欧盟数字综合法案(Digital Omnibus)于 2026 年 7 月 27 日生效,将大多数独立高风险义务的期限从 2026 年 8 月 2 日推迟到 2027 年 12 月 2 日。面向真人交互的 AI 透明度义务在实质上未变:受访者仍应知道自己在与机器对话。
- 使用下文的 2026 年第三季度 AI 研究技术栈审计表,在下一个规划周期前对自己的设置从五个维度打分。
2026 年 8 月,这个领域实际处于什么位置
2026 年的 AI 用户研究对多数产品、UX 与洞察团队来说已不再是实验,而是一套生产级工作流:AI 主持访谈、带自适应追问的对话式问卷,以及基于 LLM 的访谈记录主题分析。过去两个月改变的不是能力本身,而是围绕它的测量文献变得严肃起来。
大约两年时间里,已发表研究中占主导的问题是:AI 主持人能否维持连贯、非诱导性的对话,以及 LLM 能否以接近人类的信度对访谈记录进行编码。这些问题如今部分已有定论,部分已经过时。2026 年 8 月的研究提出了一个更难的问题:当一项 AI 驱动的研究产出 400 份访谈记录时,你如何知道其中任何一份值得采集?
适合谁阅读
已经在运行、或即将采购 AI 主持研究,并希望了解当前证据支持什么结论的产品经理、UX 研究员、客户洞察负责人、市场研究人员与研究运营(ResearchOps)团队。
进展一:回答质量终于有了实证定义
对任何评估 AI 访谈者的人来说,本季度最重要的论文是《What Makes a Good Response? An Empirical Analysis of Quality in Qualitative Interviews》(Jonathan Ivey、Anjalie Field、Ziang Xiao,2026 年 4 月 6 日提交)。作者构建了一个定性访谈语料库,包含来自 14 个真实研究项目的 343 份访谈记录、16,940 条受访者回答,随后检验了 10 项已被提出的回答质量指标,看它们能否预测该回答是否真正对研究发现有贡献。
其中两项结果应当改变团队评估 AI 主持人的方式。
- 与关键研究问题的直接相关性是最强的预测因子。既不是长度,也不是新颖度。
- 清晰度与基于 surprisal 的信息量未能与质量相关——尽管两者都被广泛用作自动评估的替代指标。
从策略上看,这是对 AI 主持研究中一种特定失效模式的警告。基于 surprisal 的指标会奖励在词汇上出人意料的回答。一个朝该信号调优的 AI 主持人会追逐花哨的枝节话题,并给自己打出高分,同时偏离研究真正的问题。如果供应商的质量看板显示"信息量"或"丰富度"却不说明计算方式,请追问清楚。
进展二:AI 辅助以广度换深度
2026 年 8 月 3 日,一项被试间准实验研究考察了用于需求获取访谈的 AI 辅助脚本管理,将"AI 辅助但未受训"组与"受训但无 AI"组进行比较。该工作流将基于理论的脚本生成与实时话题覆盖追踪、按需追问生成结合起来——在功能上接近 UX 研究场景中实时访谈助手的角色。
| 指标 | AI 辅助(未受训) | 仅受训(无 AI) |
| 脚本质量得分(0–100) | 92.8 | 74.8 |
| 每场访谈覆盖话题数 | 9.6 | 14.5 |
| 每个话题的追问次数 | 3.43 | 1.15 |
| 脚本问题实际被问出的比例 | 86% | 69% |
这一模式是自洽的:AI 支持带来了更好的访谈提纲与深得多的追问,代价是每场覆盖的话题更少。参与者认为实时话题追踪是最有用的功能(86% 认同)。
与进展一并读,这更值得鼓舞而非警惕。如果与研究问题的相关性才是价值的预测因子,那么在 9 个相关话题上各追问三次,很可能比在 14 个话题上各追问一次得到更好的访谈记录。但这也意味着话题覆盖现在必须被显式设计。深度是自适应主持人的默认行为,广度不是。请注意该研究的领域:软件工程中的需求获取,而非消费者 UX。其机制可以推广,但具体数字不应被当作 UX 基准来引用。
进展三:监管时钟改变了,但伦理没有
欧盟数字综合法案于 2026 年 7 月 24 日在《欧盟官方公报》上公布,并于 2026 年 7 月 27 日生效。它将附件三下大多数独立高风险义务的期限从原定的 2026 年 8 月 2 日推迟到 2027 年 12 月 2 日,附件一下嵌入受监管产品的 AI 则推迟至 2028 年 8 月 2 日(参见 AI 法案实施时间线与 Gibson Dunn 的摘要)。
多数 AI 主持的用户研究本来就不属于附件三的高风险范畴——该附件针对的是招聘、信用评分、教育与执法等领域。对研究团队而言,一直以来真正相关的是透明度义务:与 AI 系统交互的人应当知情。改变的并不是这项义务,底层的研究伦理更是丝毫未变。无论合规日历怎么说,知情同意、数据保留期限,以及明示的联系真人的权利,仍是底线。
人工复核提示:监管时间线在变动且因司法辖区而异。在依赖本文任何日期前请与法务确认;本文不构成法律意见。
2026 年第三季度 AI 研究技术栈审计表
这是 Qualitati 原创的评分量表。在下一个季度规划周期前,对每个维度打 0–2 分(0 = 缺失,1 = 部分具备,2 = 稳健)。满分 10 分。
| # | 维度 | 得 2 分意味着什么 |
| 1 | 相关性可测量 | 你能把每段访谈记录追溯到某个具体研究问题,并会复核对话中偏离问题的比例。 |
| 2 | 广度与深度的控制 | 你的提纲声明了必答话题,主持人会实时追踪覆盖情况,而不是受访者说到哪就追问到哪。 |
| 3 | 分析可审计 | 每个 AI 生成的主题都能链接回可打开的受访者原话引用,且编码流程可复现。 |
| 4 | 告知与知情同意 | 受访者被告知正在与 AI 对话、录制了什么、保留多久,以及如何联系到真人。 |
| 5 | 人工解读闭环 | 在研究发现离开团队前,由具名研究员复核 AI 主题;没有任何报告基于未经复核的综合结果发出。 |
如何解读得分。8–10 分:你的技术栈能经受挑剔的利益相关方质询。5–7 分:你有可用的自动化,但关于其质量的证据薄弱——先修维度 1。0–4 分:你扩大采集的速度快于建立信任的速度;暂停增量,先把测量装上去。
Qualitati 在其中的位置
Qualitati 是面向产品、UX 与客户洞察团队的 AI 用户研究平台。对照上述三项进展:
- 相关性与覆盖。Qualitati 支持文字与语音的 AI 主持访谈,Active Listener 模式为真人访谈者提供实时提示与章节追踪——正是 8 月 3 日研究中参与者评为最有用的实时话题覆盖功能。
- 可审计性。ThemeLens AI 主题分析以 map-reduce 流程一次处理最多 100 份访谈记录,将编码映射到研究问题,并综合出带受访者原话引用的主题。QDA Workspace 支持 AI 辅助的归纳式与演绎式编码、编码手册生成与主题可视化。
- 方法广度。AI 主持焦点小组会追问、引入沉默的声音、检验共识并对抗群体思维;对话式问卷加入 AI 驱动的追问与分支逻辑;Voice Analytics 提取音高、响度变异性、语速与嗓音质量等声学特征;研究支持 10 种语言。
- 透明度。按 credit 公开计价,注册即赠 30 credits 免费额度,无需信用卡。Qualitati 由一位 HEC Paris 研究者创立,其主持人行为与主题分析流程均对照学术定性研究文献编写并公开记录。
局限与取舍
1. 两项研究不等于领域共识。回答质量语料库与需求获取实验都是特定领域中的单项研究。其方向具有参考价值,但数字受领域限制。
2. 深度偏好是双刃剑。每个话题追问三次的自适应主持人,也可能把受访者追问到开始编造。深度并不自动等于质量。
3. 合成受访者仍属探索性用途。合成焦点小组适合在正式实施前压力测试访谈提纲,但它不是关于真实客户的证据,也不应被当作证据来报告。
4. 监管延期不是避风港。各国规则、行业规则与伦理审查(IRB)要求不受欧盟时间线变动影响。
什么时候不该用这种方法
当话题涉及临床或法律敏感性、当受访者属于需要受训真人的脆弱群体、当研究依赖多次真人接触建立的信任,或当研究的关键在于一次深入的专家访谈而非规模化时,请不要使用 AI 主持。
常见问题
2026 年 8 月 AI 用户研究处于什么状态?
采用面已经很广,开放问题转向了评估。2026 年 8 月的文献聚焦于定义与测量回答质量、理解 AI 辅助访谈中的深度与广度权衡,以及适应变动后的欧盟合规日历。
究竟什么能预测一个好的访谈回答?
在 2026 年那项涵盖 343 份访谈记录、16,940 条回答的定性访谈语料库研究中,与关键研究问题的直接相关性是回答是否对发现有贡献的最强预测因子。清晰度与基于 surprisal 的信息量与质量并不相关。
AI 辅助访谈覆盖的内容更少吗?
在 2026 年 8 月 3 日的准实验中确实如此:每场访谈 9.6 个话题,而无 AI 时为 14.5 个;但每个话题追问 3.43 次,而无 AI 时为 1.15 次。如果广度对你的研究重要,请在提纲中设定必答话题。
欧盟 AI 法案 2026 年 8 月的期限过去了吗?
大多数独立高风险义务原定的 2026 年 8 月 2 日期限,已被 2026 年 7 月 27 日生效的数字综合法案推迟至 2027 年 12 月 2 日。面向与 AI 交互者的透明度义务,以及常规研究伦理义务,仍然适用。
合成受访者可以取代真人了吗?
不可以。合成焦点小组适用于压力测试讨论提纲这类探索性工作。关于真实客户的发现应当来自真实客户。
现在该如何评估一个 AI 研究平台?
用上文 2026 年第三季度 AI 研究技术栈审计表的五个维度打分:相关性可测量、广度与深度的控制、分析可审计、告知与知情同意,以及人工解读闭环。
结论
2026 年 8 月的 AI 用户研究,是一个正在成熟的领域。能力之问让位于测量之问,而最早的一批真实答案——相关性胜过新颖度、深度以广度为代价、告知义务比任何合规日历都更持久——正是团队本季度就能据以行动的那类结论。在采购更多访谈量之前,先用上述五个维度审计你的技术栈。
准备好把这些落地了吗?注册即免费获得 30 credits——无需信用卡——运行 AI 主持访谈、焦点小组、对话式问卷或主题分析项目,查看透明定价,或将 Qualitati 与 Outset.ai、Listen Labs 和 NVivo 对比。上一期请见我们的 2026 年 6 月领域现状。
本文是对第三方研究与监管报道的独立编辑性摘要,与相关研究作者无隶属关系,也未获其背书。最后更新:2026 年 8 月 23 日。