用 AI 实现大样本量定性研究(2026)
Qualitati 研究团队 · 2026-07-06 · 12分钟阅读
最后更新:2026 年 7 月 6 日
简短回答
大样本量定性研究,指的是以过去只属于问卷调查的样本规模开展开放式、自适应访谈——从传统的 8 到 15 人,扩展到数十甚至数百人。它之所以在 2026 年变得可行,是因为 AI 主持人可以并行开展访谈,AI 辅助分析可以完成转录稿编码,从而消解了 Steinar Kvale 在 1996 年指出的分析者瓶颈。但这套方法只有在保留饱和度逻辑、人工核验与书面审计轨迹时才站得住脚。
核心要点
- 旧的样本上限是一种带宽限制,而非方法定律。8 到 15 场访谈的样本量,取决于一名分析者能读完并编码多少材料,而不是洞察真正饱和的时点(Kvale, 1996)。
- 异质性研究需要更多而非更少的访谈。被频繁引用的"9 场即饱和"结论只适用于同质样本;系统综述表明,混合样本通常需要 20 到 40 场以上(Vasileiou et al., BMC, 2018)。
- AI 打通了流程的两端。同一套基础设施既能规模化主持访谈,也能完成编码与聚类,这正是大样本量定性研究对洞察团队来说变得可行的原因(Harvard Business Review, April 2026)。
- 规模会放大方法误差。一份薄弱的访谈提纲或一套未经核验的编码本,不会在 200 场访谈中被平均掉——它只会被复合放大。扩大规模之前,请先使用下方的大样本就绪度评分卡。
"大样本量定性研究"究竟指什么
定性研究由数据的形态定义,而不是由房间的大小定义。回答是开放式的、自适应的、富含情境的,主持人跟随受访者而非照本宣科。这一定义中没有任何一条限制样本量。上限来自一项现实约束:在项目截止之前,一名人类分析者只能读完、编码并综合有限数量的转录稿。
Steinar Kvale 在其 1996 年的著作 InterViews 中把这称为"1,000 页问题"——即如何处理一项严肃访谈研究所产生的转录稿之山(Kvale, 1996)。三十年来,学界的答案是保持小样本,并把这一限制称作"深度"。大样本量定性研究,正是这一瓶颈在两端同时被解除后的结果:AI 主持人并行开展大量访谈,AI 辅助编码把由此产生的转录稿转化为结构化、可主题化的数据。
为什么小样本惯例从来不像它看上去那样有原则
为微小样本辩护时最常被引用的数字,是 Guest、Bunce 与 Johnson 在 2006 年得出的结论:饱和大约出现在第 9 场访谈。但那项研究使用的是同质样本、聚焦的问题与固定的主持人(Guest et al., 2006)。商业与产品研究极少具备这些条件。当 Vasileiou 及其同事在 2018 年于 BMC Medical Research Methodology 上综述 214 项研究时,他们发现异质样本通常需要 20 到 40 场甚至更多访谈,而且许多已发表论文在没有证据的情况下就宣称达到了饱和(Vasileiou et al., 2018)。
Malterud、Siersma 与 Guassora 提出的信息强度(information power)框架彻底重构了这个问题:适当的样本量取决于五项因素——研究目标、样本特异性、理论运用、对话质量与分析策略——而不是某个神奇数字(Malterud et al., 2016)。一个宽泛的探索性问题,配上异质人群与薄弱理论,其信息强度得分低,这意味着它需要更大的样本。而这恰恰描述了大多数探索型研究。大样本量定性研究并非对严谨性的背离;对许多研究而言,它正是饱和度文献一直以来暗含的结论。
Qualitati 的位置
Qualitati 是一个面向产品、UX 与洞察团队的 AI 用户研究平台,端到端支持大样本量定性工作。文字与语音形式的 AI 主持访谈可并行运行,并以自适应追问深入探询,使每场访谈保持对话感,而不至于退化为问卷。随后,ThemeLens 以 map-reduce 式主题分析流程一次处理至多 100 份转录稿,将编码映射到研究问题,并综合出以受访者原话为锚点的主题。QDA 工作台支持归纳式与演绎式编码以及编码本生成,让研究者能够核验机器的产出,而不是全盘接受。
这里的设计意图很关键:平台的构建方式确保规模不会抹去审计轨迹。编码始终关联到原始片段,主题始终锚定到引语,最终决定权仍在人手中。这正是大样本量定性研究与"单纯生成大量文本"之间的区别。
大样本就绪度评分卡
规模不是免费的。一份有缺陷的访谈提纲或一套未经核验的编码本,不会在 200 场访谈中被稀释——它会被成倍放大。这份由 Qualitati 提出的评分卡是一次起飞前检查:每个维度评 0、1 或 2 分,只有总分达到 12 分中的 8 分及以上,才可以扩大研究规模。
| 维度 | 0 — 尚未就绪 | 1 — 部分就绪 | 2 — 可以扩大规模 |
| 研究问题 | 模糊或仅为探索性 | 问题聚焦但人群宽泛 | 问题清晰且有明确的子问题 |
| 访谈提纲 | 未经测试的草稿 | 已在少数受访者中试测 | 已试测,且追问逻辑通过验证 |
| 抽样逻辑 | "能招募多少算多少" | 有目标 N 值与粗略依据 | N 值由信息强度论证 |
| 编码本方案 | 没有;指望 AI 自己找出来 | 编码本草稿,无人工核查 | 编码本已试用并经人工核验 |
| 审计轨迹 | 未记录模型或提示词 | 记录了部分设置 | 模型、提示词与人工修改均有记录 |
| 人工监督 | AI 输出原样交付 | 仅做抽查 | 形成主题前有结构化人工复核 |
规律在于:就绪度存在于设计与文档之中,而不在模型之中。AI 消除了分析者瓶颈,但没有免除研究者对研究本身的责任。
大样本量定性研究的工作流
- 先针对人群做设计,再用信息强度确定 N 值。异质的受众与宽泛的目标会推高数字;聚焦的问题与特定的细分人群则会压低它(Malterud et al., 2016)。
- 扩大规模前先试测访谈提纲。主持人的追问逻辑会被完全一致地应用于每一场访谈,因此一份薄弱的提纲带来的是系统误差,而非随机误差。参见我们关于撰写 AI 主持访谈提纲的说明。
- 固定并记录你的分析设置。锁定模型版本与较低的温度参数,并把两者都记录下来,使这次运行可靠且可复现——这正是我们在LLM 分析能否复现一文中讨论过的可复现性缺口。
- 先核验编码,再提炼主题。对照干净的编码本做演绎式编码,是 AI 最擅长的环节;诠释性的主题构建,则是它最容易漂移的环节。请在"编码到主题"这一步保留人工介入。
- 把饱和度当作一条曲线,而不是一道闸门。有了数百场访谈,你可以真正绘制出新编码何时不再出现,而不是事后断言已经饱和(Vasileiou et al., 2018)。
局限与取舍
大样本量定性研究并非放之四海而皆准的升级,诚实的实践意味着说明它在哪里会失效。
- 单场访谈的深度可能变薄。在数百场会话中规模化运行的 AI 主持人,可能对情感复杂的时刻追问不足,而熟练的人类主持人会紧追不放。对于敏感或高度探索性的主题,判断上仍更倾向于规模较小、由人主持的研究(Greenbook, 2026)。
- 规模可能为薄弱证据"洗白"。从 300 场浅层访谈中得出的自信主题,看上去可能比对 12 场深度访谈的细致解读更权威。数量不等于效度。
- 数据质量风险随 N 上升。更大规模的远程样本更容易混入敷衍作答者或机器人,因此筛选与质量检查更重要,而非更次要。
- 审计负担会增加。访谈越多,需要记录的编码决策就越多。缺乏纪律性的记录,即便样本量令人印象深刻,可靠性与可确证性也会受损。
人工复核提示:关于饱和度与适当样本量的主张,属于依赖情境的方法论判断。请把上述数字当作有文献依据的参考点,而非固定规则,并在方法部分为你自己的 N 值作出论证。
适合谁——以及何时不该用
适合谁:面向异质受众开展探索性研究的产品、UX 与用户洞察团队;需要在问卷级样本量上获得定性质感的市场研究者;以及研究问题在信息强度上得分较低、因而确实需要更多访谈的研究者。
何时不该用:针对同质群体、范围收得很紧、十来场访谈已足以饱和的研究;需要人类主持人判断力的敏感或临床主题;以及任何你无法承诺人工核验与审计轨迹的项目。在这些情况下,做扎实的小样本研究胜过做得很快的大样本研究。
常见问题
大样本量定性研究还算"定性"吗?算。定性研究由开放式、自适应、富含情境的数据定义,而不是由样本量定义。做更多这样的访谈,并不会把方法变成定量的。
多少场访谈算"大样本"?没有固定门槛,但一般指超出传统的 8 到 15 场,进入数十乃至数百场的量级——而饱和度文献本就提示异质性研究通常需要这样的规模(Vasileiou et al., 2018)。
访谈越多,洞察就越好吗?并非自动如此。越过饱和点之后,额外访谈只增加成本而不产生新编码。大样本的价值在于人群异质或问题宽泛的场景,而不该作为默认选择。
AI 能可靠地分析数百份转录稿吗?AI 可以规模化地编码与聚类,但可靠性取决于经过核验的编码本、固定并记录的设置,以及在主题定稿前的人工复核。参见我们的指南:AI 编码在何处失效。
这和带开放题的问卷有什么不同?问卷向所有人提出同一组固定问题;AI 主持的访谈则会针对每位受访者自适应地追问与深挖,产生静态开放文本框无法提供的深度。
最大的风险是什么?让规模替代严谨——因为样本量看起来很唬人,就把未经核验的 AI 主题直接交付。审计轨迹才是让大样本站得住脚的东西。
结论
大样本量定性研究不是噱头;它是一项持续三十年的约束被解除的结果。Kvale 的"1,000 页瓶颈"之所以存在,是因为一名分析者处理不完那些转录稿,而随之而来的小样本往往在事后被合理化为"深度"。AI 在主持与分析两端同时移除了瓶颈,使异质、范围宽泛的研究得以达到饱和度文献一直暗示它们所需要的样本量。但代价没有变:严谨性仍然来自研究设计、人工核验与书面审计轨迹——而在规模之下,这些更加重要,因为误差会被复合,而不会被平均掉。
准备好规模化地开展定性研究了吗?免费开始,赠送 30 点额度——无需信用卡——并运行一项带 ThemeLens 分析的 AI 主持访谈研究。或者查看透明定价,将 Qualitati 与 Outset.ai、Strella、Listen Labs、NVivo、Qualtrics、ATLAS.ti 和 MAXQDA 进行比较。