定性研究方法部分如何报告 LLM 使用(2026)
Qualitati 研究团队 · 2026-09-14 · 10 分钟阅读
最后更新:2026 年 9 月 14 日
简短回答
在定性研究中报告 LLM 使用情况,应在方法部分说明:使用了哪个模型及版本、使用时间、通过何种接口、用于哪个分析步骤、采用了哪些提示词和参数、运行了几次,以及研究者如何核查输出。2026 年 6 月 16 日发表的一项范围综述发现,75% 的 LLM 辅助定性研究完全没有报告参数设置——多数论文恰恰在这些细节上有缺失。
如何报告定性研究中的 LLM 使用,如今已是一项实际技能,而非形式要求。期刊要求提供,审稿人会检查。一句"ChatGPT 协助了编码"的方法描述,读者无法据此判断你的主题是否可靠。
本文梳理了当前出版方政策和 2026 年的研究证据,并在文末提供一份可直接使用的清单和一段模板文字。
核心要点
- 一项综述纳入 75 篇 2020–2025 年发表的 LLM 辅助定性研究,发现 74 篇写明了模型名称,但只有 13 篇报告了 temperature,56 篇(75%)完全未报告任何参数(Kempny 等,2026)。
- 目前尚无定稿的、专门针对 LLM 的定性研究报告指南。COREQ+LLM 是对 2007 年 COREQ 清单的扩展,EQUATOR Network 仍将其列为开发中(Fehring 等,2025)。
- Nature Portfolio 要求在方法部分记录 LLM 的使用(Nature Protocols 编辑政策)。APA 期刊要求作者在方法部分说明将 AI 用于编码或分析的情况(APA)。
- 把 temperature 设为 0 并不能保证结果可复现,因此应报告运行次数及各次结果的差异。
- 投稿前请对照下方的 LLM 方法披露清单。
为什么现在必须重视定性研究中的 LLM 使用报告
报告 LLM 使用,是指为读者提供足够的细节,使其能够判断——最好还能复现——AI 系统对你的定性数据做了什么。传统定性研究的可信度建立在可见的分析路径上:谁做了编码、编码手册如何演变、主题如何形成。当 LLM 承担了部分工作,这条路径的一部分就会变得不可见,除非你将其记录下来。
这一缺口是可以量化的。在 2026 年 6 月 16 日发表于 BMC Medical Research Methodology 的范围综述中,Kempny、Frings、Rust、Meister 和 Fehring 分析了 75 篇同行评审的实证研究,其中 93% 使用了 OpenAI GPT 模型。综述报告:
- 61% 的研究提供了完整或部分提示词,其余研究几乎没有提供提示词细节。
- 45% 的研究未说明模型的调用方式。其余研究中,38 项使用 API 或网页界面,5 项在本地运行模型。
- 97% 的研究包含某种人工核查,但人机一致性从 36% 到 99% 不等,因此仅凭"我们核查过"说明不了什么。
作者认为,亟需专门的报告指南。在 COREQ+LLM 正式发布之前,研究者只能自行拼凑标准。
出版方目前的要求
各方政策不尽相同,但都指向一点:用于研究数据的 AI,应写进方法部分,而不仅是致谢。
务必阅读目标期刊自己的作者指南。许多期刊有自己的规定,而且要求变化很快。
为什么"temperature 0"不等于可复现
很多方法部分写道分析采用 temperature 0 "以确保一致性"。证据并不支持这种说法。在 2026 年 6 月一项涵盖 7 种条件、690 次 API 调用的研究中,Tamba 发现,即使采用贪婪解码,部分边界案例仍会得出不同判断,而调整 top_p 和 top_k 也无法消除差异(Tamba,2026)。论文建议多次运行并报告方差,而非只报告单次输出。
这与我们此前报道的结果一致:LLM 重复执行相同分析时常常得出不同结论。一些较新的模型甚至已不再接受 temperature 设置。因此,诚实的报告应包括:所用参数(或"不可配置")、运行次数,以及如何处理各次运行之间的差异。
LLM 方法披露清单
这份清单由 Qualitati 编制,综合了 Kempny 等综述发现的缺口与上述出版方要求。COREQ+LLM 发布后,本清单不能替代该指南。
A. 模型
- ☐ 提供方、模型名称,以及确切的版本或快照标识
- ☐ 使用日期(同名模型会被更新)
- ☐ 调用方式:网页聊天、API、具名研究平台或本地部署
B. 任务
- ☐ 模型承担的分析步骤:转录、初始编码、起草编码手册、应用编码、主题综合或引文检索
- ☐ 所服务的分析方法:反思性主题分析、编码手册式主题分析或内容分析
- ☐ 没有交给模型完成的部分
C. 输入与参数
- ☐ 在附录或补充材料中提供完整提示词,包括系统指令
- ☐ temperature、top_p 和输出长度上限;若界面不开放,注明"不可配置"
- ☐ 为适应上下文长度,访谈记录如何切分或分批
- ☐ 数据送入模型前所做的去标识化处理
D. 稳定性与人工审核
- ☐ 每个步骤的运行次数,以及各次运行分歧的处理方式
- ☐ 谁审核了输出、审核比例,以及一致性统计量及其分母
- ☐ 被研究者修改或否决的编码或主题示例
E. 治理
- ☐ 受访者是否同意由 AI 处理其数据
- ☐ 提供方的数据保留与训练条款
- ☐ 研究者反思性:使用 AI 可能如何影响了解读
模板段落
"我们于[日期]通过[接口]使用[提供方]的[模型、版本],对[n]份去标识化访谈记录进行[任务]。提示词见补充材料[X]。参数设置为[temperature / top_p,或'用户不可配置']。每个步骤运行[n]次,各次运行之间的差异通过[程序]解决。[研究者角色]审核了[比例]的 AI 编码(一致性:[统计量],n = [单位数]),并进行了[修改说明]。主题建构与解读由研究团队完成。受访者已同意 AI 辅助分析。"
适用人群,以及何时不宜使用此方法
适用于学术定性研究者、发表案例研究的 UX 研究者,以及需要向高管解释"这个结论是怎么得出的"的洞察团队。
何时不宜照搬:如果 LLM 只是修改了稿件语法,多数政策会区别对待,请查阅期刊关于文字编辑的规定。如果你的认识论立场是强烈的诠释主义,清单无法替代关于模型如何影响你解读数据的反思性说明——请一并写入。
局限与取舍
- 完整提示词可能很长。放入补充材料,而不要删减。
- 在消费级聊天界面中,版本标识可能无法获取。请如实说明——不写会被视为遗漏。
- 一致性统计量可能具有误导性。简单编码上的高一致性可能掩盖诠释性编码上的分歧。尽可能按编码逐项报告一致性。
- 标准仍在变化。本清单反映截至 2026 年 9 月 14 日的公开政策与证据,应作为起点,并由研究者对照本领域规范进行人工审核。
Qualitati 的定位
Qualitati 是面向产品、UX 和客户洞察团队的 AI 用户研究平台,可开展 AI 主持的访谈、焦点小组和对话式问卷,并分析结果。其 ThemeLens 主题分析采用有文档记录的 map-reduce 流程,可一次处理多达 100 份访谈记录,将编码映射到研究问题,并以受访者原话支撑主题。与开放式聊天会话相比,这种结构更容易在方法部分逐步说明。QDA Workspace 支持 AI 辅助的归纳式和演绎式编码,并保留人工审核。
平台不会替你写好披露内容。日期、运行次数和人工审核决策仍需你自己记录。
常见问题
如果只用 AI 做转录,也需要披露吗?
通常需要。转录生成了你要分析的数据,因此应写明工具名称以及访谈记录的核查方式。请在期刊作者指南中确认具体要求。
只写"ChatGPT"够吗?
不够。Kempny 等(2026)发现几乎所有研究都写了模型名称,但多数遗漏了参数和部署细节。请提供版本、日期、调用方式、提示词和参数。
提示词应该放在哪里?
方法部分简要描述,补充材料提供全文。APA 建议保留提示词和输出,以便编辑索取。
temperature 0 能让分析可复现吗?
不能。一项 2026 年的研究发现,temperature 0 下输出仍可能不同。请报告运行次数及差异的处理方式。
有没有官方的定性研究 LLM 报告指南?
目前还没有。COREQ+LLM 正在开发中。在其发布前,可将 COREQ 或 SRQR 与期刊的 AI 政策以及上文这类清单结合使用。
局限部分也要提到 AI 吗?
是的,只要模型的作用可能影响了研究发现,例如压缩了主题数量或遗漏了特定文化语境下的含义。
结论
做好定性研究中 LLM 使用的报告,关键在于让不可见的步骤变得可见:模型、版本、日期、提示词、参数、运行次数和人工审核。2026 年的证据显示,参数和部署方式是最常见的遗漏,不妨从这里入手。如果你需要一个便于描述的分析流程,可以免费注册获得 30 积分,或查看透明定价。
本文是对截至 2026 年 9 月 14 日公开政策与研究的独立编辑综述,不代表任何出版方对其政策的官方解释。