定性数据分析:方法、流程与工具(2026 指南)
撰稿:Anqi Yu (Ghent University) · 审校:Prof. Shubin Yu (HEC Paris) · May 2026 · 更新日期: 2026-05-30 · 17 min read
你已经做完了访谈、焦点小组,或汇集了数百份开放式回答。现在你盯着一堆转录稿,琢磨着如何把所有这些文字变成你能够站得住脚的研究结果。这一步——定性数据分析——是定性研究中大部分智识工作实际发生之处,也是研究者最常感到迷茫之处。
本指南是整个过程的一张实用地图:什么是定性数据分析、从原始转录稿到成文结果的分步工作流、主要分析取径及各自的适用时机、编码究竟如何运作、哪种软件契合你的需求,以及 AI 如今在哪些环节加快进度而不取代你的判断。如果你想先了解更宽广的基础,请从我们的定性研究入门指南开始;本篇则深入分析。
什么是定性数据分析?
定性数据分析(QDA)是组织、考察和解读非数值数据——访谈转录稿、田野笔记、开放式回答、文档、图像——以识别模式、主题和意义的过程。它产出的不是统计量,而是对人们所说、所做和所指的结构化、有证据支撑的解释,立足于数据本身。
不同于遵循固定公式的统计分析,QDA 是解释性和迭代性的。你在数据与不断发展的想法之间来回往复,每一遍都精炼你的理解。做得好时,它是系统而透明的——任何人都应能追溯你如何从一段原始引文走到一个最终主题。
定性 vs. 定量数据分析
两类分析回答不同的问题,依赖不同的逻辑。理解这一对比,能厘清 QDA 究竟用于何处。
| 方面 | 定性数据分析 | 定量数据分析 |
| 数据 | 文本、音频、图像、观察 | 数字和测量值 |
| 目标 | 解释意义和模式 | 检验假设、量化关系 |
| 过程 | 迭代且涌现 | 线性且预先设定 |
| 核心技术 | 编码和主题构建 | 统计检验 |
| 产出 | 主题、叙事、模型、理论 | 统计量、p 值、效应量 |
| 质量标准 | 可信度 | 效度和信度 |
你将分析的数据类型
QDA 技术适用于多种数据来源,而多数项目会混合使用若干种:
- 访谈转录稿——最常见的定性数据来源
- 焦点小组录音——包括参与者之间的互动
- 开放式调查回答——简短但往往量大
- 田野笔记和观察——来自民族志或实地走访
- 文档和记录——政策、报告、媒体、档案
- 在线文本——评论、论坛帖、社交媒体
- 视觉与多媒体数据——照片、视频、屏幕录制
定性数据分析的流程
尽管取径各异,几乎每一项定性分析都会经历同样的七个阶段。把它们当作一个循环,而非一条直线——随着理解的深入,你往往会回头重来。
- 准备与转录——把录音转为文字、清理数据,并对识别性细节匿名化。AI 转录如今能在几分钟内完成第一遍。
- 熟悉数据——反复阅读数据,在开始标注任何内容之前写下关于初步印象的备忘录。
- 编码——为数据片段附上简短、有意义的标签,以便检索和比较。
- 归类——把相关编码归入更宽泛的类别和候选主题。
- 识别主题和模式——把类别精炼为能就数据相对于你的问题捕捉到重要内容的主题。
- 解释——阐明这些主题意味着什么、它们如何相互关联,以及它们如何回答你的研究问题。
- 验证与撰写成文——对照数据检验你的解释,然后以支撑性引文和清晰的分析性叙事将其呈现。
定性数据分析的取径
"取径"指的是引导你分析的方法论。每种取径都有自己的逻辑,恰当的选择取决于你的研究问题和范式。
主题分析
最广为使用且最灵活的取径:识别、分析并报告整个数据集中的模式(主题)。Braun and Clarke 的六阶段方法是标准参照。当你想要丰富、详尽的模式而又不愿固守某一理论流派时最为适用。
扎根理论
旨在通过迭代编码和持续比较直接从数据中建立一个新理论,数据收集与分析同时进行。当几乎没有既有理论契合你的现象时最为适用。
内容分析
系统地对文本分类,并可量化概念的出现频率,处于定性与定量的边界上。当你需要对数据中所呈现内容作出结构化、有时可计数的概括时最为适用。
叙事分析
关注人们讲述的故事——其结构、序列,以及个体如何理解自己的经历。当故事本身、而非仅其主题,成为研究对象时最为适用。
话语分析
考察语言如何在社会情境中被用来建构意义、身份和权力。最适合研究沟通、修辞,以及言谈和文本的社会功能。
框架分析
一种基于矩阵的取径(个案为行,主题为列),在应用型和政策研究中颇为流行。当你需要跨个案、对照部分预先设定的问题进行透明、可比较的分析时最为适用。
解释现象学分析(IPA)
极为细致地探究少数人如何理解某段重要的亲身经历。最适合采用小型、同质样本的深入、个体性研究。
你应该选择哪种取径?
| 如果你的目标是…… | 考虑 |
| 在数据集中灵活地发现模式 | 主题分析 |
| 从头建立一个新理论 | 扎根理论 |
| 概括并可能计数概念 | 内容分析 |
| 理解人们如何讲述自己的人生 | 叙事分析 |
| 分析语言、权力和修辞 | 话语分析 |
| 为应用/政策工作比较个案 | 框架分析 |
| 深入研究某段亲身经历 | IPA |
编码:分析的引擎
无论你选择哪种取径,编码都是驱动它的实际机制。编码是一个捕捉某段数据片段含义的简短标签,让你能够分组相似材料并在整个数据集中加以比较。
归纳 vs. 演绎编码
- 归纳编码——编码从数据中浮现,没有预先设定的清单。最适合探索性工作。
- 演绎编码——你应用一本基于理论或先前研究构建的编码手册。最适合检验或扩展既有框架。
- 混合编码——多数真实研究从若干敏感性概念出发进行演绎,同时对归纳编码保持开放。
编码的层级
- 开放编码——初步、细粒度的一遍,标注一切感兴趣之处。
- 轴心编码——发现编码之间的关系,并将它们归入类别。
- 选择性编码——围绕一个核心主题或主线整合各类别。
几项有用的技术
- 原位编码——以参与者自己的话作为编码标签,以贴近他们的声音。
- 编码手册——一份界定每个编码的活文档,含纳入/排除规则和示例,使编码保持一致。
- 备忘录撰写——边做边写分析性笔记;备忘录正是原始编码开始转化为解释之处。
手动、软件辅助和 AI 辅助分析
实际开展这项工作大致有三种方式,而且它们日益相互融合。
| 方式 | 它意味着什么 | 最适合 |
| 手动 | 荧光笔、便利贴或电子表格 | 非常小的数据集;学习这门手艺 |
| 软件辅助(CAQDAS) | 诸如 NVivo 或 ATLAS.ti 之类的工具,用于组织、编码和检索 | 需要审计轨迹的中到大型研究 |
| AI 辅助 | LLM 建议编码和主题;研究者验证 | 大型数据集和快速的初步编码 |
AI 并不把研究者从分析中移除——它改变了研究者时间的去向。你不再花数周做第一遍编码,而是把那段时间花在审阅、修正和解释上。判断仍归人类;繁重的劳作则变快了。
可靠的模式是人在回路:AI 在几分钟内于整个数据集上提出编码和候选主题,你则对照数据检查它们、修正错误,并对最终解释负责。这既维系了严谨,又消除了使大型定性研究如此缓慢的瓶颈。
定性数据分析软件
软件不会替你分析数据,但它让组织、编码和检索数据变得远为可控——并且它创建了审稿人所期待的审计轨迹。以下是主要选项的比较。
| 工具 | 典型成本 | AI 辅助 | 内置转录 | 学习曲线 |
| NVivo | 1,000+ 美元/年 | 有限 | 附加组件 | 陡峭 |
| ATLAS.ti | $$ | 有(较新) | 附加组件 | 中等—陡峭 |
| MAXQDA | $$ | 有限 | 附加组件 | 中等 |
| Dedoose | $(按月) | 有限 | 无 | 中等 |
| Taguette | 免费 / 开源 | 无 | 无 | 平缓 |
| QualiTaTi | 免费版;Scholar 自每月 19 美元起 | 有——核心功能 | 有,自动 | 平缓 |
诸如 NVivo 和 ATLAS.ti 之类成熟的桌面套件功能强大,但价格高昂且学习费力。诸如 Taguette 之类的开源选项降低了门槛,但功能较少。AI 原生平台将转录和 AI 辅助编码整合进单一工作流,这正是它们对没有机构许可证的学生和小型团队具有吸引力的原因。
确保分析的严谨
由于 QDA 是解释性的,其可信度依靠透明和纪律,而非统计。从一开始就把这些实践纳入其中:
- 审计轨迹——记录每一项决定,从编码手册的更改到主题的界定,使分析可复现。
- 三角验证——跨多个数据来源、方法或分析者印证研究结果。
- 成员核查——与参与者分享解释,确认它们听来真切。
- 评分者间信度——当多人编码时,测量一致程度(如 Cohen's κ、Krippendorff's α)并解决分歧。
- 反身性——记录你自己的视角如何塑造你所注意到和得出的结论。
- 负面个案分析——主动寻找与你正在浮现的主题相矛盾的数据,并加以说明。
需避免的常见错误
- 概括而非分析——描述人们所说的话,却不解释其含义。
- 挑选符合心意的引文——选取契合你叙事的证据而忽略其余。
- 过多浅层编码——给一切都编码,却从未凝聚为有意义的主题。
- 混淆话题与主题——主题就数据提出一个观点;话题不过是一个主题领域。
- 跳过审计轨迹——使自己无法解释如何得出研究结果。
- 把数据强塞进先验框架——忽略不符合你预期的内容。
一个实例
假设你访谈了 25 名在家中管理慢性病的患者。
- 准备——自动转录全部 25 场访谈,然后核实并匿名化每一份。
- 熟悉数据——阅读每份转录稿,为诸如"害怕成为负担"等反复出现的想法撰写备忘录。
- 编码——一次 AI 辅助的初步处理生成诸如"配给药物""向家人隐瞒症状"和"信任 vs. 怀疑医生"等编码,你在编码手册中加以精炼和界定。
- 归类——把编码归入诸如自我管理策略和情绪劳动等类别。
- 主题——发展出一个主题:"患者同时管理疾病和家人的感受。"
- 验证——进行负面个案核查,在一个样本上确认评分者间一致,并与若干患者进行成员核查。
- 撰写成文——以代表性引文呈现每个主题,并将其与文献相联系。
要点回顾
- 定性数据分析通过系统、迭代的过程,把非数值数据转化为有证据支撑的解释。
- 工作流从准备和熟悉数据,经编码、构建主题、解释,到验证。
- 选择你的取径——主题、扎根理论、内容、叙事、话语、框架或 IPA——以契合你的问题。
- 编码是引擎;严谨来自审计轨迹、三角验证、信度核查和反身性。
- AI 辅助、人在回路的分析消除了第一遍的瓶颈,同时把解释留在人类手中。
常见问题
用简单的话说,什么是定性数据分析?
它是理解非数值数据——如访谈和笔记——的过程,方法是组织数据、用编码标注它,并解释那些能说明人们所指的模式和主题。
定性数据分析的主要方法有哪些?
最常见的是主题分析、扎根理论、内容分析、叙事分析、话语分析、框架分析,以及解释现象学分析(IPA)。主题分析最广为使用且最灵活。
在定性分析中,编码意味着什么?
编码是用捕捉含义的简短标签标注数据片段,使你能够在整个数据集中分组、检索和比较相似材料。编码随后被组织为类别和主题。
AI 能分析定性数据吗?
能——AI 可以转录数据、建议编码、运行主题建模和情感分析,并在几分钟内于整个数据集上提出候选主题。它在人在回路模型中效果最佳,由研究者验证和解释每一项结果。
定性数据分析使用什么软件?
常见工具包括 NVivo、ATLAS.ti、MAXQDA、Dedoose、开源的 Taguette,以及诸如 QualiTaTi 这样在单一工作流中结合转录和 AI 辅助编码的 AI 原生平台。
如何确保定性分析的严谨?
通过透明和纪律:保持审计轨迹、跨来源三角验证、核查评分者间信度、进行成员核查、践行反身性,并分析与你的主题相矛盾的负面个案。
编码和主题有什么区别?
编码是对某段特定数据片段的细粒度标签;主题是一种更宽泛的模式,由多个编码构建而成,就数据集相对于你的研究问题提出一个分析性观点。