LLM 分析真的可复现吗?定性研究人员需要了解的内容
Qualitati 研究团队 · 2026-07-12 · 11分钟阅读
简短回答:默认情况下不会。大语言模型对相同输入可能返回不同的输出——即使在温度设置为0时也是如此——而且托管模型会通过无声版本更新和弃用而改变。对于定性研究者来说,这威胁了可依赖性和可确认性。可重现性可以通过记录的、统计学形式实现:记录完整配置,至少运行两次分析,报告重复测试一致性(运行间的Cohen's kappa),并根据人工编码样本进行验证。
LLM分析可重现吗?
定性分析中的可重现性一直是一个微妙的主张——两个人工编码员也不会完全一致。但当LLM进行编码时,两个不同的不稳定性进入管道,大多数方法部分目前忽视了这一点。第一个是版本内非确定性:相同的模型、相同的提示和相同的设置在星期二的编码可能与星期一不同。第二个是版本间漂移:论文中引用的模型在审阅者或重复者尝试重新运行分析时的行为可能会改变——或者根本不再存在。
最后更新:2026年7月12日。本指南介绍了这两种不稳定性为何发生、经验证据说了什么、为什么这对定性严谨性很重要,以及你今天就可以采用的具体日志记录和一致性协议。
主要要点
为什么LLM即使在温度为0时也会给出不同答案?
采样温度是明显的随机源:在典型设置下,模型以概率方式抽取标记,所以两次运行按设计而分岐。大多数研究者知道为分析任务设置温度为0(贪心解码)。较少人知道这也不会产生相同的输出。
Ouyang及同事系统地重新运行相同的代码生成请求,发现即使在"确定性"设置下也存在大量不稳定性;在默认设置下,大多数任务在重复请求间产生零个测试等效输出(ACM TOSEM,2025)。在多个模型间对据称确定性配置的一项独立研究得出相同结论:贪心解码缩小但不能消除差距(Atil等,2024)。
该机制现在已被充分理解。在一个演示中,对相同提示进行1,000次温度为0的补全采样产生了80个唯一输出。主要原因不仅仅是浮点噪声,而是批处理大小依赖:GPU规约的数值结果取决于有多少其他请求与你的请求一起在服务器上进行批处理,而作为API用户你无法看到或控制(Thinking Machines Lab,2025)。混合专家架构增加了另一条路径:专家路由可能随服务器负载变化。当两个候选标记几乎平手时,中间激活中的一位差异会翻转输出——以及它之后的每个标记。
对研究者的实际启示是:你无法承诺托管LLM分析的位级相同重新运行。你能承诺的是有记录的配置和测量的运行间一致性水平。
什么是模型版本漂移,为什么弃用很重要?
托管模型是移动目标。提供者重新训练、微调并无声更新稳定名称背后的模型。规范演示是Chen、Zaharia和Zou的纵向评估:在2023年3月到6月之间,GPT-4在素数识别方面的准确率从84%下降到51%,代码格式化错误增加,遵循用户指令的意愿下降——而同一时期改进了其他任务(ChatGPT的行为如何随时间变化?,2023)。GPT-3.5和GPT-4的趋势经常指向相反方向,这意味着你甚至不能假设漂移是单调改进。
弃用是更难的截止期限。提供者按数月至数年的日程退役模型快照。一旦你使用的快照消失,精确复制分析就变得不可能——再多的日志记录也无法让工具回来。存在两个缓解措施:固定有日期的快照而不是浮动别名(例如,版本化的模型ID而不是"最新"别名),并将模型的原始输出与数据一起存档,以便在模型被弃用后分析本身仍可审计。
为什么不可重现性威胁定性严谨性?
在Lincoln和Guba的可信度框架中,可依赖性询问发现是否一致且可重复,可确认性询问发现是否由数据塑造而不是由分析员(或工具)特异性塑造。两者通常通过审计线索来演示:读者应该能够将每个主题追溯回编码决定到原始数据。
不稳定的AI编码员同时破坏两者。如果"编码员"在重新运行时产生不同代码,审计线索中的编码决定描述随机过程的一个实现,而不是稳定程序。证据表明不稳定性足够大以影响研究:Reiss发现对ChatGPT重复相同标注输入产生的一致性低于接受的可靠性阈值,即使是轻微的提示改写也改变了输出(Reiss,2023)。任务类型也很重要:在医学教育编码研究中,GPT-4应用固定人工编码簿达到了对人类的平均Cohen's kappa为0.71,但在归纳模式下仅31%的AI生成代码与人类代码匹配(《学习分析期刊》,2024)。演绎编码与紧密编码簿远比开放归纳生成稳定得多。
你应该记录什么以使LLM分析可重现?
将模型视为工具并记录其校准。下表是方法部分(或补充文件)应包含的最低限度。
| 记录内容 | 为什么重要 |
| 提供者和精确模型ID(固定、有日期的快照) | 浮动别名无声改变;有日期的快照最接近固定工具 |
| 每次分析运行的访问日期 | 锚定分析以应对版本漂移;提供者无通知更新模型 |
| 采样参数(温度、top_p、最大标记、种子如果提供) | 这些极大改变输出分布;"默认"跨提供者和时间不同 |
| 完整提示文本:系统提示、任务指令、编码簿、少样例 | 轻微措辞改变可测量地改变标注(Reiss,2023) |
| 运行次数和聚合规则(单次运行、多数投票、汇总) | 汇总或多数投票的输出比单次运行更可靠,必须描述以被复制 |
| 后处理规则(代码合并、归一化、排除) | 无声清理步骤是不可重现性的经典来源 |
| 原始模型输出、已存档 | 快照弃用后唯一保证的复制工件 |
| 运行间一致性统计 | 量化不稳定性而不隐藏它(见下一部分) |
你如何测量LLM编码是否稳定?
从心理测量学借用重测逻辑:运行相同分析两次或多次,将运行视为两个编码员,计算一致性系数——Cohen's kappa用于两次运行的分类代码,Krippendorff's alpha用于三次或更多运行或更复杂数据。这将"模型可能变异"变成审阅者可以评估的数字。根据普通的Landis-and-Koch阅读,运行间kappa高于0.80是强的;0.61–0.80是实质但值得收紧的;低于这个,你的编码簿或提示未充分指定,单次运行分析不应信任。
三个实际改进:
- 如果运行间一致性低,在扩展前修复提示。模糊的代码定义产生人类和机器都不可靠;模型在放大编码簿问题。我们关于如何编码定性数据的指南涵盖编写能经历此测试的代码定义。
- 为生产编码汇总运行。三次或五次运行的多数投票可测量地改进任何单次运行的可靠性(Reiss,2023)。
- 分别报告机器-人类一致性和机器-机器一致性。模型可以与自己完全一致,但仍然是错的。查看我们关于LLM–人类编码员级间可靠性的深度探讨以获取基准和研究设计。
人工参与循环验证在哪里适配?
重测一致性防护措施对抗不稳定;它不防护措施对抗稳定错误的模型。补充控制是人工审查分层样本:抽取AI编码段的随机样本(按代码分层,因此罕见代码也被检查),让研究者盲目编码,计算人-AI kappa,调解分歧。保持分歧日志——这是审阅者实际想要的可确认性证据。运行一个故意不确认通道:搜索与新兴主题相矛盾的段落,然后接受AI的合成。我们的审计AI定性编码的清单从头到尾指导这个过程。
LLM可重现性清单
- 固定有日期的模型快照;永远不要在浮动的"最新"别名上分析。
- 将温度设置为0(或最小值)——但仍不要假设确定性。
- 在主要分析前在版本控制下冻结提示和编码簿。
- 至少运行两次完整分析;报告运行间kappa或alpha。
- 为最终代码分配使用多数投票或跨运行汇总。
- 将原始模型输出与时间戳和运行元数据一起存档。
- 验证分层人工编码样本;报告人-AI一致性。
- 记录模型输出后应用的每个后处理步骤。
- 说明模型的访问日期并在限制中确认弃用风险。
- 当可重现性是优先级时,倾向于演绎编码簿应用而不是无约束归纳生成。
Qualitati如何适配
Qualitati的分析工具围绕AI输出必须可审计而不是信任的假设构建。ThemeLens将每个合成主题锚定到针对源转录本验证的逐字参与者引用,因此人总是可以将主张追溯回数据——可确认性要求,运作化。QDA工作空间在人工覆盖下保持AI辅助编码,让你重新运行、比较和纠正代码分配而不是接受单次随机通道。因为运行成本低,上述运行两次然后比较协议是实际而不是理想的。价格透明,按使用付费,有免费层测试工作流。
限制和权衡
- 托管模型的完美复制是不可达成的。日志记录和一致性统计界定不确定性;它们不消除它。只有具有固定推理堆栈的本地托管开放权重模型接近比特级可重现性,以大能力和基础设施成本为代价。
- 重测一致性测量稳定性,而不是有效性。高运行间kappa与低人-AI kappa意味着一致但校准错误的工具。
- 证据基础年轻且变化中。大多数已发表可靠性研究测试了2023–2025年模型;较新模型在某些任务可能更稳定而在其他任务容易漂移。在自己数据上重新验证。
常见问题
将温度设置为0是否使LLM具有确定性?
否。它移除采样随机性但不移除服务器端推理中的批处理相关数值变异或混合专家路由效应。实证研究发现重复相同请求仍在温度0下分岐(Ouyang等,2025)。
在我的方法部分中命名模型够吗?
否。"我们使用了GPT-4"描述一个改变系统的家族,而不是一个工具。报告有日期的快照ID、访问日期、采样参数、完整提示、运行次数和聚合规则——并存档原始输出。
我应该为重复LLM运行报告什么一致性统计?
Cohen's kappa用于两次运行的分类代码;Krippendorff's alpha用于三次或更多运行、缺失数据或非名义代码。与人-AI一致性验证样本一起报告。
期刊会接受LLM辅助定性编码吗?
越来越多是的,当可靠性情况明确提出时:记录配置、运行间一致性、人工验证样本和从主题到引用的审计线索。未记录的单次运行AI编码是审阅者拒绝的。
结论
LLM分析在比特级相同意义上不可重现,假装否则是一个严谨性问题,等待审阅者找到它。它们在对定性研究重要的意义上可重现:作为具有测量稳定性的记录程序。固定快照、记录配置、运行两次、报告kappa、保持人工在循环中。如果你想要一个内置审计线索的工作流,尝试Qualitati QDA工作空间——免费开始,无需信用卡。