动态问卷:LLM 能实时聚类开放题作答吗?
Qualitati 研究团队 · 2026-09-02 · 6 分钟阅读
动态问卷是一种边收边读的问卷:LLM 实时把开放题作答聚类成主题,针对每位受访者追问一个个性化问题,再把浮现出来的主题呈现给受访者去评分和排序。2026 年的一项研究发现,LLM 聚类与人工判断的一致性约为 89%。
这项研究测试了什么?
Lei 等人(2026)搭建了一个问卷平台,做了三件普通问卷做不到的事。第一,在问卷进行过程中就把陆续到达的开放题作答聚类成主题。第二,根据每个人刚写下的内容生成一个量身定制的追问。第三,把聚类结果重新变成刺激材料:后续的受访者会看到同伴产生的主题,并对其评分、排序和回应。
团队在一所大学里用大约两个月做了两项实地研究。研究 1 为一场职业发展工作坊征集面板问题(n = 52 名学生受访者,其中 18 人完成了后续反馈问卷,另访谈了 1 位招聘负责人)。研究 2 请学生指出工程课程体系中的缺口(n = 41 名受访者,26 份后续问卷,另访谈了 3 位院系管理者)。两项研究合计有 44 名受访者提供了结构化反馈,4 位利益相关方就产出是否可用接受了访谈。
LLM 聚类有多准?
准到足以使用,但不同主题之间差异明显。据 Lei 等人(2026)报告,职业工作坊问卷产生了 6 个聚类,平均准确度为 83.8(满分 100);课程体系问卷产生了 9 个聚类,准确度为 92.7——总体平均为 88.9。另外有 70.8% 的受访者认同他们看到的聚类清晰、连贯、彼此可区分。
两项研究之间的落差才是有意思的地方。课程方面的意见具体、用词稳定("我们从来没学过版本控制"),因此聚类干净利落。职业工作坊的问题则更发散,也更容易同时横跨两个主题,而这正是自动聚类开始退化的地方。凡是在一项范围收得很紧的产品研究和一项开放式探索研究上都跑过 AI 编码的人,对这种模式都不会陌生。
已报告结果一览
| 指标 | 职业工作坊 | 课程体系缺口 |
| 受访者人数 | 52 | 41 |
| 后续反馈问卷 | 18 | 26 |
| 生成聚类数 | 6 | 9 |
| 平均聚类准确度(满分 100) | 83.8 | 92.7 |
| 排序得分区间 | 0–68 | 18–63 |
数据来源:Lei 等人(2026)。两项研究的总体聚类准确度为 88.9/100。
为什么让受访者给主题排序很重要?
因为它修补了开放题数据最古老的短板:内容丰富,却不知道哪些看法真正有代表性。在常规研究中,研究者读完 90 条自由文本作答,自行决定哪些主题重要,而这个优先级判断是事后由一个人做出的主观决定。
在动态问卷里,优先级本身变成了数据。后来的受访者对先前受访者产生的主题进行排序,于是每个主题同时带有定性描述和定量分数。Lei 等人(2026)报告,在职业工作坊研究中,排序得分与认同某一主题的受访者比例呈正相关——两个信号讲的是同一个故事。在课程体系研究中,这种一致性在排名靠前的聚类上成立,但在排名靠后的聚类上减弱;作者将其归因于时间效应:在收集后期才浮现的主题被更少的人看到,累积排序票数的机会也更少。
这是一个真实的设计约束,不是脚注。如果你采用这种方法,出现顺序会让早期主题占便宜。第一天冒出来的主题人人都能排序,第十天才冒出来的主题只有掉队的人能排。
受访者和利益相关方怎么看?
受访者对个性化追问和排序环节总体持正面态度;接受访谈的 4 位利益相关方——1 位招聘负责人和 3 位管理者——都认为经过聚类和排序的产出比原始作答堆更有价值。一致的抱怨在于长度:追问和排序环节增加了作答时间,部分受访者报告了疲劳感。作者把这一点作为定性模式而非百分比报告,因此应当把它当作设计警示,而不是一个测得的效应量。
这对研究者意味着什么
三条实用结论,按对工作流程的影响程度排列。
- 聚类准确度与主题高度相关,所以要在自己的主题上做预试。同一所大学、同一个平台上的两项研究之间就有 9 分的差距,这提醒我们不要假设某个头条准确度数字可以直接迁移。在大规模投放前,先把 20 条作答跑一遍你的流程,亲自读一读聚类结果。
- 实时追问是你能买到的最便宜的深度。对一个含糊的作答追问一次,就能把无法使用的回答变成可编码的回答。这与 AI 主持访谈背后的机制完全相同——区别只在于每位参与者身上花多少次追问。
- 要明确地为受访者的时间做预算。动态问卷是用作答时长换数据质量。如果你的激励方案和招募话术假定这是一份五分钟的问卷,那么加上追问和排序任务后,代价会以流失率的形式显现。
从方法论上讲,诚实的定位是:这是一个有前景的原型,而不是一件经过验证的测量工具。在一所院校、以学生样本做的两项实地研究,且聚类准确度是对照研究团队自己的判断评估的,属于早期证据。机制令人信服,但可推广性尚未确立。
常见问题
什么是动态问卷?
指 LLM 在作答陆续到达时即时处理它们的问卷:把开放题作答聚类成主题、生成个性化追问,并把浮现的主题回呈给受访者评分和排序。它介于静态问卷与完整访谈之间。
LLM 对开放题作答的聚类有多准?
在这项研究中平均为 88.9(满分 100),依主题在 83.8 到 92.7 之间(Lei 等人,2026),并有 70.8% 的受访者认同聚类清晰且彼此可区分。两项研究之间的差异足以说明:应当在自己的数据上先做预试。
它会取代定性访谈吗?
不会。动态问卷是在大样本上对每位受访者做一到两次追问;访谈则是对少数几个人做几十次追问。二者回答的是不同的问题——主题的广度,还是单个叙述的深度。
用标准问卷工具能实现吗?
实时聚类加排序这个闭环不行,它要求在投放过程中就分析作答。AI 问卷与 ThemeLens 这类对话式问卷工具覆盖了自适应追问和主题提取这两半;而文中描述的同伴排序环节目前仍是研究原型。
原始文献:Lei, K., Ladenburg, A., Petiwala, Z., Wang, Z., Jhawar, D., Bisht, I., Kumar, A., & Lee, D. T. (2026). Dynamic Surveys: Using LLMs to Blend Qualitative Depth, Quantitative Structure, and Collaborative Interaction. Proceedings of the ACM on Human-Computer Interaction. arXiv:2608.00357
最后更新:2026 年 9 月 2 日。本文是对第三方研究的独立编辑性摘要;QualiTaTi 与论文作者无关联,文中所有数据均引自已发表的论文。