AI 主持访谈 vs 人工访谈:成本、深度与数字孪生(2026)
Qualitati 研究团队 · 2026-09-29 · 7 分钟阅读
AI 主持的访谈能和人工主持的访谈一样好吗?就挖掘客户需求而言,一项预注册的 2026 年研究(317 名消费者)给出的答案是肯定的。AI 主持在深度上与人工访谈相当,覆盖的主题更多,并且在相同预算下挖掘出的独特需求是人工访谈的两倍多。但仍有两处差距:受访者面对 AI 时听起来情绪投入更低,而且更丰富的访谈并没有带来更准确的数字孪生。
这项研究是 Yuting Deng、Jingxuan Liu、Olivier Toubia 和 Naman Jain 撰写的 AI-Moderated Interviews for Market Research and Digital Twins Calibration(arXiv 预印本 2609.29143,2026 年 9 月)。它是少数同时将 AI 主持人与人工主持人以及更便宜的静态方案进行比较、并在固定研究预算下开展的实验之一。
这项研究测试了什么?
研究者将消费者随机分配到三种访谈形式之一,其他条件保持一致。受访者通过 Prolific 招募,并筛选为家装决策者(正在考虑购买门窗的房主),该品类是与一家行业合作伙伴共同选定的。根据 Deng 等人(2026)的设计,研究包含三个组:
- AI 主持组(N = 139):语音访谈,由 LLM 读取每条转写后的回答,并决定是追问还是进入下一题。
- 静态组(N = 154):相同的开放式问题、相同的语音形式,但没有自适应追问。
- 人工主持组(N = 24):由受过训练的人工主持人进行的实时访谈。
各组样本量不等是有意为之。每组获得约 $5K 的可比市场成本预算,而一次人工访谈的成本大约是 AI 访谈的五倍(论文成本表中为每次
63.33 对 $33.33),因此同样的钱能买到的人工访谈要少得多。正是这种设定,让这项研究对规划真实项目的人很有参考价值。
AI 主持的访谈能挖多深?
在互动和深度上,AI 主持与人工主持大致相当,并明显优于静态访谈。AI 组受访者平均发言 8.1 分钟,静态组为 4.3 分钟;字数为 952 对 609;发言轮次为 30.5 对 8.3(均 p < .001)。人工访谈更长(11.3 分钟、1,404 字),但 AI 与人工主持人的轮次在统计上相近(30.5 对 32.4,p = .238)。
更长并不等于覆盖更广。在购买旅程模块中,AI 主持人覆盖了 9 个可能主题中的 7.29 个,人工主持人为 6.08 个,静态访谈为 5.90 个。在四个问题模块中,AI 访谈有三个模块覆盖的主题多于人工访谈;除简短的开场模块由人工主持人挖得更深外,其余模块的平均深度相当或更高。在控制回答长度后,AI 相对静态访谈的优势依然存在,说明 AI 并不只是让回答变长。
受访者体验没有受损。AI 组与静态组的自评愉悦度(7 分制,5.65 对 5.59)和舒适度(6.37 对 6.27)在统计上没有差异。
AI 访谈比人工访谈更具成本效益吗?
按这项研究的数据,是的,而且差距很大。下表汇总了论文在固定预算下的客户需求覆盖情况(Deng 等人,2026)。
| 条件 | 访谈数 | 独特客户需求 | 每次访谈成本 | 每条需求成本 |
| AI 主持 | 139 | 238 | $33.33 | 9 |
| 静态 | 154 | 188 | $33.33 | $27 |
| 人工主持 | 24 | 109 | 63.33 | $36 |
最引人注目的是访谈数量相同时的比较。在 24 次访谈的 bootstrap 匹配比较中,AI 主持平均挖掘出 111.5 条独特需求,接近 24 次人工访谈的 109 条,远高于静态访谈的 75.9 条。换言之,AI 主持人每次访谈发现的需求数量与人工相当,而成本只有约 20%。在全部预算下,它挖掘出的需求总数最多,是人工主持的两倍多。
人工主持人在哪些方面仍占优势?
人工主持人在情绪投入上仍占优势。研究者用语音情绪模型对每位受访者的音频进行效价、唤醒度和支配度评分(均为 0–1 量表)。与 AI 对话的受访者相比,与人工对话的受访者听起来更积极(效价 0.528 对 0.471)、更有活力(唤醒度 0.517 对 0.359)、更自信(支配度 0.562 对 0.449)(均 p < .001)。AI 访谈和静态访谈在三项指标上均无统计差异,而 AI 访谈中的停顿更多。
作者认为,这是人工主持目前最明显的优势,尤其是在融洽关系、情感或敏感信息披露很重要的研究中。受访者对 AI 访谈者感到舒适、访谈记录内容丰富,并不意味着他们在情绪上真正投入。
更丰富的访谈能造出更好的数字孪生吗?
在这项研究中不能。论文后半部分为每位受访者构建了 LLM "数字孪生",让它预测本人对六个真实营销刺激物(邮寄广告、电视广告和产品宣称)的反应——这些刺激物本人看过,但孪生没有看过。
- 访谈优于人口统计信息。基于完整访谈记录构建的孪生,在大多数指标上比仅基于人口统计信息的孪生预测得更好。
- AI 主持的数据并不优于静态数据。完整画像孪生的评分准确率,用 AI 主持访谈记录时为 .743,用静态访谈记录时为 .742(p = .888)。自适应访谈带来的额外丰富度并没有换来更好的量化预测。
- 加入相似任务略有帮助。加入受访者对一个高度相关刺激物的回答后,评分准确率从 .743 提升到 .787(p < .001),但产品宣称排序的一致性几乎没变(.348 到 .367,p = .26)。
- 孪生的推理方式与人不同。开放式推理与本人越相似的孪生越准确。孪生在解释选择时更偏分析,而人们对图片和视频的反应更偏直觉。
按作者的表述,实际含义是:若要预测对某类特定刺激物的反应,来自高度相关任务的校准数据比更长的访谈更重要。
这对研究者意味着什么
- 用 AI 主持做规模化探索。当目标是梳理客户需求、待完成任务或痛点时,AI 访谈者有望承担大部分人工田野预算,并扩大样本。
- 融洽关系要求高的主题仍交给人。敏感、情绪化或涉及身份认同的研究,最可能受到这种可测量的情绪投入差距影响。
- 不要默认访谈记录能让孪生变准。如果打算用数字孪生做预测,请用留出的真人回答加以验证,并加入与预测目标相似的校准任务。
- 留意适用边界。这是单一的高卷入度品类、单一 AI 平台、某一时点的一组模型。作者指出,低卷入度或情绪强烈的主题可能表现不同。
常见问题
AI 主持的访谈能取代人工访谈者吗?
在客户需求探索方面,Deng 等人(2026)的证据表明 AI 主持是有力的替代方案:深度相近、主题覆盖更广,每次访谈成本约为 20%。对于依赖融洽关系或情感披露的研究,人工主持人仍表现出可测量的优势。
AI 主持的访谈便宜多少?
在这项研究中,一次 AI 主持访谈成本为 $33.33,人工主持为
63.33;每条独特客户需求的成本为 9 对 $36。
基于 AI 访谈构建的数字孪生更准确吗?
它们优于仅基于人口统计信息的画像,但并不比基于静态、非自适应访谈构建的孪生更准确。加入高度相关任务的回答能适度提高评分准确率。
这项研究经过同行评审了吗?
还没有。它是 2026 年 9 月发布的 arXiv 预印本,研究经过预注册。请将这些数字视为有力的早期证据,而非定论。
最后更新:2026 年 9 月 29 日
本文是对第三方研究的独立编辑摘要。Qualitati 与该研究作者无任何关联。完整方法与结果请参阅原始论文。