开放式问卷编码:用 LLM 还是机器学习?(2026)
Qualitati 研究团队 · 2026-09-10 · 9 分钟阅读
简短回答:2026 年,在开放式问卷编码上,提示式 LLM 的准确率通常高于传统机器学习分类器,但一致性更差,也更难解释。微调模型或成对比较设计能弥补大部分差距。选择哪种方法,取决于项目更需要什么:稳定、可审计的类别分布,还是对新主题快速、灵活的编码。
最后更新:2026 年 9 月 10 日
过去,开放式问卷编码总要二选一:人工编码几百条回答,或训练一个监督分类器并接受粗糙的类别。LLM 改变了可选项。三项近期研究让我们可以依据证据而非厂商宣传来比较这些方法,而它们的结论并不完全一致。
要点
关于 LLM 问卷编码,2026 年的证据说明了什么?
LLM 是很强的编码者,但不能直接替代经过验证的测量流程。每项研究各自揭示了一种失效方式。
LLM 与传统机器学习
Akinde、Akinde、Emiola 与 Akinsola(arXiv,2026 年 5 月 4 日提交)在美国全国学生参与度调查(NSSE)的开放式回答上,将 GPT 系列、LLaMA 和 Twitter-roBERTa 模型与传统机器学习进行比较。核心结论:LLM 在分类准确率上普遍胜过传统模型,尤其是细腻的情感和主题。同样重要的提醒是:一致性和可解释性会受损。
提示与微调
von der Heyde、Haensch、Weiß 与 Daikeler(Survey Research Methods,2025)对德语受访者关于为何参与问卷的回答进行编码。零样本和少样本结果因模型而差异很大,只有微调 LLM 表现令人满意。更微妙的发现是:由于提示式模型在某些类别上更准,最终数据中各类动机的占比被扭曲了。如果你要报告百分比,这比单一准确率更重要。
打分与成对比较
DiGiuseppe 与 Flynn(Public Opinion Quarterly 90(3),2026 年 3 月 27 日发表)请 1,400 名美国成年人解释利率是如何决定的。六个 LLM 完成了约 28,000 次成对判断,再由贝叶斯 Bradley-Terry 模型转化为知识得分。成对比较估计在不同 LLM 间的相关高于 0.87(前沿模型高于 0.95),而直接 0–10 打分为 0.72 至 0.91。与专家编码相比,前沿模型的 F1 超过 0.8。
决策矩阵:哪种开放式问卷编码方法适合你?
这份 Qualitati 问卷编码决策矩阵总结了每种方法在什么情况下是站得住脚的选择。它是我们对上述研究的综合,而非基准测试。
| 方法 | 最适合 | 主要风险 | 最低验证要求 |
| 提示式 LLM(零样本/少样本) | 探索性编码、新出现或不断变化的主题、预算有限 | 类别层面的错误扭曲报告占比;多次运行结果漂移 | 人工对随机样本双重编码;比较类别分布,而不只是一致率 |
| 微调 LLM | 跨多轮问卷复用的稳定编码手册 | 需要标注训练数据;锁定在原编码手册上 | 留出测试集,按类别评分 |
| 传统机器学习分类器 | 大规模、固定类别、严格可复现 | 遗漏细微差别;情感和新主题较弱 | 各类别的精确率与召回率 |
| LLM 成对比较 | 量化潜在特质(知识、质量、强度) | 比较次数多;产出的是得分而非类别 | 与封闭式测量或专家评分做相关检验 |
| 人工编码 | 小样本、敏感话题、需要诠释深度 | 成本与速度 | 评分者间信度 |
信任 AI 编码的问卷数据之前:五步清单
- 冻结编码手册,在编码全部数据前写好定义和示例。参见我们的编码手册漂移指南。
- 对随机样本进行人工双重编码并报告一致性。我们的评分者间信度指南介绍了相关统计量。
- 比较分布:检查人工样本与 AI 样本中各编码的占比是否一致,而不只看总体一致率。
- 重跑一个子集以衡量一致性,并固定模型版本和提示词。
- 阅读边缘案例:低置信度编码或被归为"其他"的回答,往往藏着新主题。
Qualitati 的定位
Qualitati 是面向产品、UX 和客户洞察团队的 AI 用户研究平台。其对话式问卷由 AI 进行追问,因此回答比单一文本框更丰富。回答和访谈记录随后可在QDA Workspace中编码(支持 AI 辅助的归纳与演绎编码以及编码手册生成),或用ThemeLens一次综合多达 100 份访谈记录。整个流程让研究者审阅和修改编码,而不是盲目接受。价格按积分公开,新账户可获得 30 个免费积分。
局限与方法论问题
- 2026 年的 arXiv 比较研究是预印本,摘要未报告各模型的具体数值,其结论应视为方向性的。
- 三项研究使用的数据各不相同(学生参与度、问卷参与动机、经济知识),语言为英语和德语,结果未必适用于你的领域或语言。
- 与人工编码者高度一致并不证明效度:人类也可能有相同的盲点。
- DiGiuseppe 与 Flynn 还在受访者中发现了 AI 生成的回答,提醒我们数据质量问题在编码之前就已存在。
人工审阅说明:本文的方法建议综合自已发表研究,应由合格的研究者根据具体项目调整。
适用人群与不适用情形
本指南适用于需要编码数百到数千条开放式回答的问卷研究者、UX 研究者和洞察团队。对于小型、敏感或高风险研究,或者报告的数字将驱动决策而你没有人工编码的验证样本时,不要单独依赖 AI 编码。
常见问题
在开放式问卷编码上,LLM 比机器学习更准确吗?
根据一项 2026 年基于学生问卷文本的比较,通常是的,但一致性和可解释性更弱。
编码问卷回答需要微调 LLM 吗?
不一定。但在一项德语研究中,微调是唯一表现令人满意的方法,因此对于跨多轮复用的稳定编码手册,它是更稳妥的选择。
什么是 LLM 成对比较?
模型判断两条回答中哪一条更体现某一特质,再由 Bradley-Terry 模型把大量判断转化为得分。它在不同模型间比直接打分更稳定。
如何验证 AI 编码的问卷数据?
由人工对随机样本双重编码、报告一致性、比较编码分布,并重跑一个子集检查一致性。
Qualitati 能编码开放式问卷回答吗?
可以。Qualitati 的 QDA Workspace 提供 AI 辅助的归纳与演绎编码,并由研究者审阅结果。
结论
用 LLM 做开放式问卷编码,如今已足够准确可用,前提是你做检验。探索阶段用提示式 LLM,固定且重复的方案用微调或传统模型,量化特质用成对比较。然后验证分布,而不只是一致率。免费开始,获得 30 个积分,运行一次带 AI 辅助编码的对话式问卷,或查看透明定价。
本文是对所引研究的独立编辑摘要。最后更新:2026 年 9 月 10 日。