LLM与人类编码员的一致性如何?2025年可靠性研究
Qualitati 研究团队 · 2026-05-30 · 7分钟阅读
最后更新:2026年5月30日
简要答案
在2025年的一项研究中,GPT-4o和GPT-4.5与人类编码员在真实定性数据集的四个主题中的三个上达到了实质性一致(Cohen's kappa > 0.6),但在领域通用主题上仅达到中等一致。大语言模型在具体代码上可以与人类编码员的一致性相匹配——但在抽象构念上仍需人类监督。
Qualitati的定位
Qualitati的QDA Workspace和ThemeLens允许AI在文稿中提出和应用代码,同时研究人员审查并验证每个代码——兼具速度与人类在环严谨性。查看透明定价。
完整文章见qualitati.com/blog/llm-human-coder-inter-rater-reliability-2026。