什么是质性研究中的数据饱和?
Qualitati 研究团队 · 2026-07-11 · 10分钟阅读
简要回答:数据饱和是质性研究中的一个节点,此时增加访谈不再产生新的编码、主题或洞察,数据变得冗余。实证综述发现,对于同质样本,编码饱和往往在 9 至 17 次深度访谈之间达到,但这个数字是参考区间,而不是规则。饱和取决于你的方法、样本多样性与问题范围,并且应当被透明地报告,而不是简单断言。
什么是质性研究中的数据饱和?
数据饱和指的是这样一个时刻:继续收集质性数据,无论是访谈、焦点小组还是开放式回答,都不再产生与研究问题相关的新信息。新的参与者只是在重复此前受访者已经说过的内容;没有新编码浮现,既有主题只是被进一步强化。饱和是质性研究者用来说明样本量"足够"的最常见理由,也是论证研究严谨性与可信度的核心。
最后更新:2026 年 7 月 11 日。本指南解释这一概念、关于你实际需要多少次访谈的证据、数据饱和与理论饱和之间的重要区分,以及 AI 辅助分析如何改变这笔账。
核心要点
- 饱和=冗余。饱和是在新数据不再产生新编码或新主题时达成的,而不是在你凑够某个目标数字时达成的。
- 证据指向一个区间,而不是一个神奇数字。一项 2021 年的系统综述发现,深度访谈研究通常在 9 至 17 次访谈之间达到饱和(Hennink & Kaiser, 2022)。
- 数据饱和与理论饱和是两回事。数据饱和关乎信息冗余;理论饱和关乎一套充分展开的解释,往往需要大约两倍的访谈量(Journal of Global Marketing, 2025)。
- 饱和取决于方法。现象学、扎根理论与框架分析对"足够"各有各的逻辑。
- AI 改变的是经济账,不是概念本身。当收集与编码都很便宜时,你可以在理论饱和之后继续抽样,主动检验你的主题,但冗余仍然需要判断,而不能想当然。
这个概念从何而来
饱和源自扎根理论,Glaser 与 Strauss 描述了持续抽样直到范畴被"饱和"、不再出现新属性为止。随着时间推移,它扩散到几乎所有质性传统,成为默认的充分性论证。被引用最多的实证检验来自 Guest, Bunce & Johnson (2006),他们记录了 60 次访谈中的饱和过程,发现 88% 的浮现主题与 97% 的最重要主题在第十二次访谈时就已出现,这正是被广泛复述的"大约 12 次访谈"经验法则的由来。
你实际需要多少次访谈?
诚实的回答是:视情况而定,但实证文献给出了有用的锚点。一项 2022 年的系统综述回顾了 23 项对饱和做过实证检验的研究,发现深度访谈研究在 9 至 17 次访谈之间达到饱和,中位数约为 12–13;焦点小组研究大致在 4 至 8 个小组时达到饱和(Hennink & Kaiser, 2022)。有两点告诫极其重要。
第一,这些数字主要适用于研究问题狭窄聚焦的同质样本。跨文化、多地点或高度多样化的研究需要多得多的访谈,能够跨地点成立的元主题往往需要 20 至 40 次访谈。第二,饱和是分层的:编码饱和(你已听到问题的全部范围)通常比意义饱和(你完全理解每一个问题)来得更早,有一项分析把后者定位在 16 至 24 次访谈。
饱和基准(截至 2026 年 7 月)
| 研究设计 | 典型饱和区间 | 来源 |
| 同质样本深度访谈 | 9–17 次访谈(中位数约 12–13) | Hennink & Kaiser, 2022 |
| 编码饱和与意义饱和对比 | 编码约 9–17;意义约 16–24 | Hennink et al., 2017 |
| 焦点小组讨论 | 4–8 个小组 | Hennink & Kaiser, 2022 |
| 跨文化/多地点 | 元主题约需 20–40 次访谈 | Guest et al.;多地点综述 |
请把这些视为规划与预注册时的初始预期,而不是一条可以机械套用的停止规则。
数据饱和与理论饱和的对比
这一区分正是许多质性研究悄悄出错的地方。数据饱和强调冗余信息的反复出现:当参与者不再告诉你任何新东西时,你就停止。理论饱和优先考虑你正在生成的理论在解释上的充分性:当你的概念模型被完整设定、每个范畴都得到发展并彼此关联时,你才停止。
《Journal of Global Marketing》2025 年的一项分析认为,仅依赖数据饱和常常导致过早收尾与薄弱的理论化,而把数据饱和当作一个中间里程碑、随后继续推进至理论饱和,更有利于质性工作的解释性目标。关键在于,该文指出理论饱和所需的访谈量往往约为数据饱和的两倍(Ahmed, 2025)。如果你的目标是描述一系列经验,数据饱和可能就够了。如果你的目标是解释某个机制,你多半需要理论饱和。
批评:饱和正受到挑战
饱和并未被普遍接受为严谨性标准。《Social Science & Medicine》2026 年的一篇论文指出,饱和被不恰当地用作数据充分性的万能辩护,并提出了一个更宽泛的框架(Q-FORS)来把受访者抽样操作化,因为不同质性传统对充分性有不同的逻辑(Social Science & Medicine, 2026)。一个相关概念是信息效力(Malterud 等人),它主张样本所承载的相关信息越多,所需参与者就越少,一项目标狭窄、样本贴合度高、对话有力的研究,即使 N 很小也可以是充分的。实践含义是:不要只写一句干巴巴的"已达到饱和"。要报告你是如何做出这一判断的。
饱和报告检查清单(Qualitati 框架)
评审越来越倾向于把"已实现饱和"视为缺乏支撑的断言而予以驳回。使用这份清单,让你的充分性论证站得住脚,无论你是手工编码还是借助 AI。
- 预先界定饱和类型。说明你主张的是编码饱和、意义饱和、数据饱和还是理论饱和,它们不可互换。
- 预先设定停止逻辑。在收集之前就决定你将如何识别冗余(例如,连续两次访谈都没有出现新编码)。
- 逐次访谈追踪新编码。为每份转录稿引入的新编码保留一份简单日志;曲线趋于平缓就是你的证据。
- 同时报告数量与节点。写明你最终的 N,以及大约在第几次访谈之后新信息不再出现。
- 考虑样本多样性。说明你的样本是同质的还是多样的,并相应调整预期。
- 做一轮证伪检验。在宣布收尾之前,主动寻找与你的主题相矛盾的个案(参见我们的负个案分析指南)。
- 陈述局限。承认饱和是一种判断,换一个样本可能会浮现出不同的主题。
AI 如何改变饱和这个问题
AI 主持访谈与 AI 辅助编码改变的是饱和的经济账,而不是其底层逻辑。对 2026 年而言,有三个变化值得重视:
- 收集更便宜,因此你可以抽样到数据饱和之后。当多做一次访谈的成本很低时,就没那么大理由在冗余刚露头时停下。你可以继续朝理论饱和推进,并用多出来的数据对模型做压力测试。
- 编码更快,因此冗余几乎可以实时看见。AI 编码流水线能在数据陆续到达时展示每份转录稿的新编码曲线,把饱和从事后断言变成一项被持续监测的指标。
- 风险转移到了虚假信心上。一个把一切都收拢成一组整齐主题的模型,可能只是抹平了细微差别,却看起来已经饱和。AI 提高了显式的人在环证伪步骤的重要性(参见我们关于 AI 质性研究可信度的说明)。
人工复核提示:饱和是一项方法论判断。AI 辅助编码是否"看得足够多",仍然需要研究者对照原始转录稿以及相互矛盾的个案加以确认。
Qualitati 在其中的位置
Qualitati 是面向产品、UX 与客户洞察团队的 AI 用户研究平台。它正是为饱和所要求的工作流而建:持续收集,配以快速且可审计的分析。AI 主持访谈支持文本与语音,让你以很低的边际成本持续抽样,因此达到饱和乃至越过饱和做检验都是切实可行的,而不受预算限制。ThemeLens 以 map-reduce 式主题分析流水线一次处理多达 100 份转录稿,把编码映射到你的研究问题上,并把每一个综合出来的主题锚定到参与者原话,从而让"是否还在出现新编码?"这个问题变得可观察,而不是靠猜。QDA 工作台支持 AI 辅助的归纳与演绎编码并允许人工覆写,因此分析者可以对照底层数据确认冗余,而不是凭信任接受一个饱和主张。
Qualitati 并不代替研究者判断何时算够,它只是让支撑这一判断的证据更容易看见,并支持多达 10 种语言。定价透明:注册即获赠 30 点数的免费层级,无需信用卡,且按点数公开费率。
局限与取舍
- 饱和数字受情境约束。9–17 这一区间针对的是问题聚焦的同质样本;多样化或探索性研究需要更多访谈,盲目套用基准会导致抽样不足。
- 冗余不等于完备。反复听到相同主题,可能意味着你的抽样框太窄,而不是现象已被完全理解。
- AI 可能制造出表面上的饱和。激进的主题合并看起来像收敛;请务必对照原始数据与证伪个案加以核验。
本文适合谁,以及何时需要谨慎
本文适合谁:正在规划访谈或焦点小组研究、需要为样本量提供正当性论证的 UX 研究者、产品经理、市场研究者与洞察团队。何时需要谨慎:如果你的研究是建构理论而非描述性的,不要停在数据饱和;如果你的样本高度多样或涉及多个地点,请预期 N 会大得多;如果你使用 AI 编码,请把"没有新编码"当作一个待验证的假设,而不是结论。
常见问题
达到数据饱和需要多少次访谈?
实证综述发现,问题聚焦的同质样本深度访谈研究通常在 9 至 17 次访谈之间达到饱和,中位数约为 12–13(Hennink & Kaiser, 2022)。多样化或多地点研究需要的访谈量则要多得多。
数据饱和与理论饱和有什么区别?
当新参与者不再补充新信息时,就达到了数据饱和。当你正在生成的理论或概念模型被充分展开时,才达到理论饱和。理论饱和的门槛更高,往往需要大约两倍的访谈量。
饱和是衡量样本量充分性的可靠指标吗?
它被广泛使用,但争议也在增加。近期研究认为饱和常被过于宽松地套用,并建议报告你是如何做出判断的,同时考虑信息效力等替代方案(Social Science & Medicine, 2026)。
AI 会改变我需要多少次访谈吗?
它改变的不是底层概念,而是经济账。更便宜的 AI 主持收集让你可以越过数据饱和、朝理论饱和抽样,而 AI 编码让冗余几乎可以实时观察,前提是由研究者对照原始数据加以核验。
小样本能达到饱和吗?
可以,只要样本具有很高的信息效力:目标狭窄、相关性密集、参与者对话有力,都能让小 N 变得充分。请说明你的小样本为何足够,而不是只断言已经饱和。
结论
数据饱和是一个有用的规划锚点,却是一条薄弱的停止规则。搞清楚你主张的是哪一种饱和,报告你是如何判断的,并且尤其是在 AI 参与其中时,把"没有新编码"当作需要对照数据加以核验的事情,而不是可以想当然的终点线。如果你想在不承担人工收集与编码成本的前提下达到并越过饱和加以检验,请运行一项 AI 主持的访谈研究,并让 ThemeLens 把冗余显性化。免费开始,赠送 30 点数,无需信用卡。