如何分析问卷开放式问题的回答?3种AI方法与验证清单(2026)
Qualitati 研究团队 · 2026-07-24 · 11 分钟阅读
最后更新:2026年7月24日
简短回答
要大规模分析问卷开放式问题的回答,应根据目标选择方法:想知道受访者说了什么,用 LLM 辅助的主题编码;需要在某个潜在维度上排序或打分,用 LLM 成对比较;已有固定的类别清单,则用少样本(few-shot)分类。无论哪种方法,在信任输出结果之前,都要先用一份人工编码的基准样本进行验证。
核心要点
- 开放式问题比封闭式量表能收集到更丰富的数据,但过去编码成本太高——这正是多数团队要么干脆删掉它们、要么只挑几条引语一扫而过的原因。
- 2026年3月发表于 Public Opinion Quarterly 的一项研究表明,LLM 成对比较将开放文本映射到连续维度上的一致性,高于直接让模型给出 0–10 分评分;在六个模型之间,Bradley–Terry 估计值的相关系数均高于 0.87。
- 2025年发表于 International Health 的一项研究,对刚果民主共和国家庭疫苗接种问卷中的自由文本回答进行分类,报告的准确率从 61.5% 到 96% 不等;经过微调或提供 20–100 个少样本示例后,准确率大幅提升。
- 准确率取决于方法,而不仅仅取决于模型。影响最大的单一杠杆,是给模型提供示例以及对所测构念的清晰定义。
- 使用下文的开放文本分析方法选择器和开放式回答验证清单,选择合适的方法并证明它确实有效。
为什么问卷开放式回答总是无人分析
几乎每个问卷团队都熟悉这种情形。你加入两三道开放式问题,因为封闭式量表无法捕捉受访者为什么这样作答。数据收集很顺利。然后 4000 条自由文本回答堆在表格的一列里,没有人有三周时间去编码。开放文本最终沦为汇报幻灯片的“引语矿”——几条生动的原话,谁往下翻得最远就由谁挑选。
这是一个测量问题,而不仅是工作量问题。人工挑选的引语是你自己数据中的非随机样本。既然要收集开放文本,你就需要一种站得住脚的方式来归纳全部内容,而不只是表格顶部那几条。
大语言模型改变了这件事的成本结构,但没有改变“必须证明归纳结果准确”这一要求。2026年真正有用的问题,已不再是“AI 能读懂开放文本吗?”,而是“用哪种方法,以及我如何证明它有效?”
三种方法,三种不同任务
关于如何分析问卷开放式回答的大部分困惑,源于把它当成了一项任务。实际上它是三项。
1. 主题编码:受访者说了什么?
这是经典的定性研究任务——归纳式地提炼编码,将其归并为主题,报告出现频率并给出锚定引语。当你的研究问题是探索性的(“是什么在驱动用户流失?”)、且事先并不知道有哪些类别时,这是合适的方法。
LLM 辅助编码如今已能胜任问卷规模的数据,但现有证据表明,应把模型输出视为初稿。2026年发表于 International Journal of Qualitative Methods 的一项开源模型比较研究发现,基于编码手册的演绎式编码比自由的归纳式编码产出更可用的结果,而且相当比例的机器生成编码存在重复或内容单薄的问题(Misra 等,2026)。质量的真正来源,是人工对编码手册的整合。
2. 分类:每条回答是否属于某个已知类别?
当你已经有了类别清单——取消原因、采用障碍、产品领域——任务就是分类,这也是三种任务中最容易量化评估的一种。你可以构建基准集、计算准确率并不断迭代。
目前最好的公开证据来自全球卫生领域。Burstein、Mafuta 和 Proctor 以刚果民主共和国四年家庭接种覆盖率问卷中照护者说明“未给孩子接种疫苗”原因的自由文本为数据,测试了零样本提示、少样本提示、微调和语义嵌入四种方法。与精心整理的基准相比,准确率从 61.5% 到 96% 不等,提升来自微调,或仅需 20–100 个标注示例(International Health,2025年9月)。
这一区间本身就是核心发现,它既是承诺,也是警告。一个不带任何示例的零样本提示,结果可能落在区间的最低端。
3. 量表化:每条回答在多大程度上体现了 X?
有时你根本不需要类别,而需要一个分数——一条回答有多专业、多负面、多具体——以便把开放文本作为变量,与封闭式题目一起使用。
2026年3月发表于 Public Opinion Quarterly、由 Matthew DiGiuseppe(莱顿大学)和 Michael Flynn(堪萨斯州立大学)撰写的论文,是迄今对这一问题最严谨的研究。他们没有让模型为每条回答打 0–10 分,而是让模型判断成对回答——哪一条更能体现该概念——然后拟合贝叶斯 Bradley–Terry 模型,得到带不确定性区间的连续分数(DiGiuseppe & Flynn,POQ 90(3),2026)。
在六个模型之间——GPT-4o 与 GPT-4o mini、Llama 3.1 405B 与 8B、Gemma 3 27B 与 4B——Bradley–Terry 估计值的相关系数均高于 0.87,最大的几个模型之间达到 0.95。直接的 0–10 分评分一致性较差。在 300 对样本上与人类专家编码者相比,前沿模型的 F1 超过 0.8。以“对利率的了解程度”作为测试概念,所得分数的表现符合预期:高分者对美联储更熟悉,也更能正确回答事实性问题。
这一方法论要点并不局限于政治学。相对判断(“A 是否比 B 更 X?”)比绝对判断(“请给 A 打 0 到 10 分”)更容易让模型保持一致。如果你需要把开放文本当作测量指标,比较法是更站得住脚的路径。
开放文本分析方法选择器
这是 Qualitati 自主设计的决策矩阵。请选择与你对开放文本的实际需求相匹配的那一行。
| 你的目标 | 方法 | 你需要提供什么 | 如何验证 | 工作量 |
| 发现未知的原因或主题 | LLM 辅助归纳编码,随后人工整合编码手册 | 研究问题;对编码手册草稿的一轮审阅 | 对 10–20% 的子样本安排第二编码者;检查主题与引语的匹配度 | 中 |
| 按已知清单统计回答数量 | 少样本或微调分类 | 参照刚果研究,准备 20–100 个标注示例 | 留出的基准集;报告准确率及各类别错误 | 低–中 |
| 在潜在维度上为回答打分 | LLM 成对比较 + Bradley–Terry | 对该维度的精确定义 | 专家编码的样本对(F1);与封闭式题目做相关分析 | 高 |
| 为利益相关方汇报做总结 | 以受访者引语为锚点的主题综合 | 先有编码数据——绝不直接总结原始文本 | 把总结中的每一个论断回溯到已编码片段 | 低 |
| 识别敷衍或离题的回答 | 基于规则的筛查 + 模型标记,并由人工复核 | 事先设定的长度、重复度和相关性标准 | 排除前人工复核所有被标记的案例 | 低 |
替代文本建议:一个五行决策矩阵,将问卷开放式回答的分析目标对应到方法、所需输入、验证方式和工作量。
开放式回答验证清单
无论选择哪种方法,当有人质疑数字是否可靠时,你至少应能拿出以下证据。
分析之前
- 写下开放文本应当回答的构念或研究问题。
- 在看到任何模型输出之前,人工编码 100–300 条随机抽取的回答作为基准。
- 确定你可接受的准确率阈值——以及模型未达标时你将如何处理。
- 将筛查 AI 生成的受访者回答和敷衍文本作为单独步骤。
分析过程中
- 记录模型名称与版本、提示词以及所提供的全部示例。
- 给模型提供示例。刚果研究的证据表明,这是提升准确率最大的单一杠杆。
- 将模型原始输出与人工修改后的输出分开保存。
- 对于量表化任务,优先采用成对比较而非直接评分,并在后续分析中保留不确定性。
报告之前
- 报告与人工基准的一致性,而不只是最终百分比。
- 专门检查少数类别——总体准确率会掩盖稀有类别上的失败。
- 每个主题都要锚定到可识别受访者的原话引语。
- 在方法部分明确说明哪些步骤使用了 AI 辅助。
Qualitati 的定位
Qualitati 是面向产品、UX 和客户洞察团队的 AI 用户研究平台,其中有两部分可直接用于问卷开放式数据。
第一,对话式问卷改变了输入本身。它不是一个静态的开放文本框,而是在回答过于简短时由 AI 追问——因此你分析的是经过展开的回答,而不是三言两语的碎片。开放文本分析的很大一部分难度在于原始材料太稀疏,无法可靠编码;在收集阶段追问,比在分析阶段抢救稀疏文本成本更低。
第二,ThemeLens 负责归纳。它运行 map-reduce 流程,可一次处理多达 100 份转录稿,将编码映射到你的研究问题,并综合出以受访者引语为锚点的主题。QDA Workspace 支持归纳式和演绎式编码并可生成编码手册,因此你可以人工整合机器起草的编码手册,而不是全盘接受。研究可使用 10 种语言中的任意一种进行,这在开放文本以多语言形式到来时尤为重要。
Qualitati 无法替你省去上述验证步骤——任何平台都做不到。基准样本需要你自己来编码。
局限与权衡
在任何人据此搭建工作流之前,有几点注意事项值得说明。
准确率因构念不同而差异巨大。刚果研究中 61.5%–96% 的区间并不是围绕均值的噪声——它反映了提示策略和类别难度之间的真实差异。在实际测量之前,请假设自己处于区间的低端。
量表化方法需要一个清晰的潜在维度。DiGiuseppe 和 Flynn 明确指出,他们的方法需要一个可清晰识别的维度,LLM 的领域知识边界尚未厘清,而且有些概念在不同模型之间的一致性较低。“情感倾向”或“主题知识”或许可行;“品牌意义”大概不行。
成对比较的计算成本很高。可能的样本对数量随样本量呈平方级增长。这是实实在在的成本考量,决定比较哪些样本对也因此成为方法的一部分。
受访者如今也在使用 AI。POQ 论文作者直接指出了这一点:问卷受访者可能越来越多地使用 LLM 来撰写开放式回答,这会污染正要分析的数据本身。对此进行筛查,正在从边缘情况变为标准的数据质量步骤。
模型漂移问题尚未解决。托管模型会变化。1月运行的分析在7月重复时未必能复现。请记录版本;在可复现性最重要的场景下,可考虑使用能够固定版本的开放权重模型。
敏感研究提示:对于受监管、临床或具有政策影响的研究,应将 AI 辅助的开放文本分析视为需要合格方法学专家人工审核的环节,而不是一种已验证的测量工具。
适用对象——以及何时不宜使用
在以下情况使用这些方法:你有超过几百条开放文本回答、明确的分析目标,并且有能力人工编码一份基准样本。
在以下情况不要使用:回答少于大约 100 条(自己读一遍——更快也更好);构念存在争议或高度依赖诠释;数据足够敏感,编码错误会造成现实伤害;或者你无法提供验证样本。在最后一种情况下,诚实的做法是对开放文本做描述性报告,而不是将其量化。
常见问题
分析问卷开放式回答的最佳方法是什么?
不存在单一的最佳方法——取决于目标。要发现主题,使用 LLM 辅助编码并由人工整合编码手册。要按已知类别计数,使用提供 20–100 个示例的少样本分类。要在某个维度上为回答打分,使用成对比较加 Bradley–Terry 模型——2026年的 POQ 研究发现,这比直接 0–10 分评分更一致。
AI 编码问卷开放式回答的准确率有多高?
已发表的准确率差异很大。2025年的 International Health 研究报告,与人工基准相比准确率为 61.5% 到 96%,具体取决于提示策略,提升主要来自少样本示例和微调。正因为区间如此之宽,你应该在自己的数据上测量准确率,而不是假定已发表的数字可以直接套用。
LLM 需要多少示例才能较好地对问卷文本分类?
刚果疫苗接种研究发现,仅需 20–100 个标注示例,即可在自由文本回答分类上取得较高准确率。这是一个实用的门槛:人工标注 100 条回答只需一个上午,而这是整个工作流中回报最高的一段时间。
为什么成对比较比让模型直接评分更好?
相对判断比绝对判断更稳定。在 POQ 研究中,基于成对比较的 Bradley–Terry 估计值在六个不同规模的模型之间相关系数均高于 0.87,而零样本 0–10 分评分即便在最大的几个模型之间一致性也较低。贝叶斯框架还能给出不确定性区间,这是点估计式评分做不到的。
如果无法全部分析,还应该设计开放式问题吗?
应该,但要更少、更好。一道目标明确、配有 AI 追问的开放式问题,比四个泛泛的文本框能产出更多可编码的材料。对话式问卷正是围绕这一权衡而设计的。
需要披露 AI 协助分析了回答吗?
对于学术发表和大多数客户项目,需要。说明哪些步骤使用了 AI 辅助、使用了哪个模型及版本,以及进行了哪些人工审核。这已是定性研究报告中的标准要求,也是一份站得住脚的审计追踪的基础。
结论
分析问卷开放式回答的瓶颈已经转移。它不再是编码能力,而是验证纪律。2026年的证据令人鼓舞:LLM 成对比较能够一致地将开放文本映射到潜在维度上,少样本分类只需一百个标注示例就能达到较高准确率。但这两项结果都附带经过测量、公开发表的误差率,而且没有你自己的基准,二者都无法直接迁移到你的数据上。
选择与目标匹配的方法,开始前人工编码 100 条回答,并在报告结果时一并报告一致性。这就是全部的方法纪律。
延伸阅读:LLM 能编码问卷开放式回答吗?以及内容分析与主题分析的区别。
免费开始,获赠 30 积分——无需信用卡——运行一次对话式问卷,然后用 ThemeLens 分析开放文本。或查看透明定价,在决定前了解每积分的使用费率。