AI 定性研究中的可信度(2026)
Qualitati 研究团队 · 2026-07-05 · 11分钟阅读
最后更新:2026年7月5日
简短回答
可信度(trustworthiness)是定性研究者用来证明其发现值得相信的方式。经典框架——Lincoln 与 Guba 提出的可信性、可迁移性、可靠性与可确证性四条标准——在 AI 参与编码与提炼主题时依然适用,但责任的落点发生了转移。在 AI 辅助分析中,标准不变,你还需要额外留下一条关于提示词、模型版本与人工决策的审计轨迹。2026年的一项研究发现,可靠性是大语言模型最难独立满足的一条标准。
核心要点
可信度在定性研究中意味着什么
可信度是定性研究赢得他人对其发现之信任的标准。由于解释性研究并不追求统计意义上的推广,实证主义的内部效度、外部效度、信度与客观性等术语并不适用。1985年,Egon Guba 与 Yvonna Lincoln 提出了四条平行标准,此后一直是该领域的基石(National University LibGuides, 2026):
- 可信性——这些发现是对数据的合理解读吗?(对应内部效度)
- 可迁移性——这些发现能否适用于其他情境,你是否提供了足够细节让读者自行判断?(对应外部效度)
- 可靠性——过程是否记录充分、足够一致,以至于另一位研究者可以照着走一遍?(对应信度)
- 可确证性——发现是扎根于数据,而非研究者的偏见?(对应客观性)
多数当代方法论学者会加上反身性——研究者主动审视自身位置如何塑造其解读——作为第五条要求,在反身性主题分析中尤其如此(Amin 等, ScienceDirect, 2024)。这一切不会因为由模型完成第一轮编码而改变。改变的是每条标准的证据必须从哪里来。
AI 为何给可信度框架带来压力
AI 辅助的定性数据分析(QDA)如今已成主流:NVivo、ATLAS.ti、MAXQDA 与 AI 原生平台都提供基于 LLM 的编码、摘要与主题建议。效率提升是真实的。风险在于速度掩盖了推理过程。大语言模型可以在几分钟内生成一份看上去干净利落的编码本,却不留下任何关于它为何这样编码某个片段的记录——而这份缺失的记录,恰恰是可靠性与可确证性所要求的。
2026年发表于《Anatomical Sciences Education》的一项研究,专门着手为 AI 辅助分析制定可信度标准。其结论直白:典型的商用 LLM 往往并未被编程为能够识别可靠性所需的全部要素,从而在严谨性的这一面向上造成了严重问题。作者特别点出透明性、持续的人类参与与审计轨迹,是让 AI 辅助分析经得起检验的关键策略(Lazarus 等, 2026)。2025年一篇工作流论文从工程角度得出了相同结论:其"兼顾效率与严谨"的流程建立在可见的 LLM 推理与研究者控制之上,而非不加批判地接受模型输出(Gao 等, 2025)。
有两种失效模式值得点名。第一是沉默的非确定性:同一条提示词跑两次,LLM 可能返回不同的编码;除非你固定并记录设置,否则这会悄悄侵蚀可靠性——我们在LLM 分析是否可复现一文中讨论过这一复现性缺口。第二是流畅的虚构:模型写出很有说服力的主题摘要,却未必锚定在参与者实际说过的话上——这本质上是可确证性问题,却被包装成可信性的胜利。
AI 可信度清单
这是一份由 Qualitati 制定的清单,把每条标准对应到 AI 辅助分析中可举证的具体做法。请把它当作方法部分的写作脚手架:如果你无法指着"如何举证"这一列说出做法,那就说明这条标准尚未满足。
| 标准 | 它要求什么 | 在 AI 参与时如何举证 |
| 可信性 | 发现是对数据的合理解读 | 用人类编码员对 AI 编码做三角验证;与参与者进行成员核查;让每个主题都锚定到逐字引语 |
| 可迁移性 | 读者能判断是否适用于自身情境 | 对场景与样本作厚描述;说明哪些内容交由 AI 解读、哪些没有 |
| 可靠性 | 过程有记录、可重复 | 记录模型名称与版本、确切提示词、temperature 与日期;为编码本做版本管理;保留每一次人工覆盖的决策日志 |
| 可确证性 | 发现来自数据而非偏见 | 把每个发现回溯到原始文本片段;按定义抽查 AI 编码;在最终编码集之外保留原始 AI 输出 |
| 反身性 | 研究者审视自身影响 | 撰写包含提示词设计选择的立场备忘录;记录你在何处与模型意见相左及其原因 |
贯穿这张表的规律是:AI 把可信度的重担集中到了文档记录与人类判断之上。模型可以加速编码;但只有你才能产出那条让编码经得起检验的审计轨迹。
一套能保住严谨性的人在环中工作流
严谨性不是在最后勾选的一个复选框,而是分析过程中的一组习惯:
- 固定你的设置并记录下来。开始之前先锁定模型版本与一个较低的 temperature,并把两者都记下来。这是为可靠性所能做的成本最低的一件事。
- 让 AI 的推理保持可见。要求模型为每个编码给出理由,并引用它所依据的确切文本,以便评审者核对二者的对应关系(Gao 等, 2025)。
- 先人工核验,再提炼主题。依据清晰编码本的演绎式编码是 AI 最可靠的环节;解释性的主题建构才是它容易跑偏的地方。在让任何内容汇聚成主题之前先复核编码——这正是人在环中标注的理由。
- 检验一致性,而不是假定一致。与其信赖一份工整的输出,不如测量 AI 与人类编码员实际达成一致的频率,详见我们的AI 编码的评分者间信度一文。
- 对结论做成员核查。条件允许时,把主题带回给参与者确认;成员核查仍是提升可信性最有力的手段之一,AI 无法取代它。
Qualitati 的位置
Qualitati 是一个面向产品、UX 与客户洞察团队的 AI 用户研究平台。它的设计目标,是让 AI 带来的可信度负担更容易承担,而不是更沉重。它的 ThemeLens 主题分析流程会把编码映射到你的研究问题,并把每个综合出的主题锚定到参与者引语上,使发现始终可回溯到来源——这直接服务于可信性与可确证性。QDA Workspace 同时支持归纳式与演绎式编码以及编码本生成,让人类始终掌控解释性的那一步。Qualitati 的主持人行为与双模型督导架构均有文档记录,并对照学术定性研究文献持续改进,这正是2026年那套标准所要求的透明性。
Qualitati 不会做的,是替你免去审计轨迹。你仍需记录自己的提示词、版本与覆盖决策,反身性也仍由你自己负责。在分析环节,本平台把自己定位为 NVivo、Qualtrics、ATLAS.ti 与 MAXQDA 的 价格透明的 AI 原生替代方案——但没有任何工具(包括我们的)能凭一己之力让研究发现变得可信。
局限与取舍
三点诚实的提醒。第一,Lazarus 等人(2026)的标准是在特定学科情境中提出的,仍处于早期阶段;请把它视为强有力的信号而非既定规范,并预期该领域会继续打磨它。第二,更多的文档记录有实实在在的成本——记录每一条提示词与每一次覆盖会拖慢分析,而承受截止期压力的团队会忍不住跳过这一步,而那恰恰是可信度崩塌的时刻。第三,其中一些保障措施取决于具体工具如何暴露模型设置;如果某个平台隐藏了模型版本或提示词,你就无法完整举证可靠性,此时应在方法部分如实说明,而不是暗示一种你无法证明的严谨性。稿件中任何关于模型行为的论断,在投稿前都值得经过人工复核。
适合谁读,以及何时不该用 AI
适合谁读:使用 AI 对定性数据做编码或提炼主题,并需要其方法经受同行评审或相关方质询的 UX 研究者、ResearchOps 团队、市场研究者与学者。
何时不该依赖 AI:误读会带来实际后果的高度敏感或高度含混的材料;数据量极小、手工分析比搭建审计轨迹更快的情况;以及你无法控制并记录模型设置的场景。在这些情况下,只把 AI 用于范围狭窄、定义明确的任务——或者干脆不用。
常见问题
可信度的四条标准是什么?
可信性、可迁移性、可靠性与可确证性,由 Lincoln 与 Guba 于1985年提出,作为内部效度、外部效度、信度与客观性在定性研究中的对应物。反身性常被加为第五条。
使用 AI 会让定性研究变得不那么可信吗?
本质上不会,但它转移了风险。AI 可能因为隐藏推理过程而削弱可靠性与可确证性,因此可信度取决于透明性、人类监督与有据可查的审计轨迹(Lazarus 等, 2026)。
哪一条可信度标准对 AI 而言最难满足?
可靠性。2026年的一项研究发现,商用 LLM 往往并未被设计成能呈现证明过程一致且有记录所需的要素,因此这份记录必须由你自己补上。
AI 辅助分析中的审计轨迹是什么?
是一份被保留下来的记录,包含模型名称与版本、确切提示词、temperature 等关键设置、分析日期,以及每一次接受或覆盖 AI 编码的人工决策——正是这些证据让你的过程可重复。
如果数据由 AI 编码,还需要做成员核查吗?
需要。把发现带回给参与者,是以任何模型都无法替代的方式检验可信性。AI 能加快编码,却无法验证你的解读是否与参与者的本意相符。
反身性如何应用于 AI 辅助研究?
你的提示词设计,以及你决定让模型去解读什么,都是塑造研究发现的研究者决策。一份反身性说明应当记录这些选择,而不只是你个人的立场。
结语
AI 的到来并未改变定性研究中的可信度——可信性、可迁移性、可靠性、可确证性与反身性这些标准,依然决定你的发现是否可信。改变的是 AI 把重担转移到了透明性与文档记录上。保持人在环中,保留审计轨迹,让每个主题都锚定到一条引语,AI 辅助分析就能与手工工作一样严谨——甚至更快。跳过这些,速度只会让你更早抵达一个错误答案。
用30个免费额度开始——无需信用卡——运行一场 AI 主持访谈,或做一次让每个主题都可回溯到参与者引语的 ThemeLens 主题分析。查看透明价格,或就 AI 原生的定性分析,把 Qualitati 与 NVivo、Qualtrics、ATLAS.ti 和 MAXQDA 作比较。