问卷开放题语音回答:数据更丰富,无应答更多(2026)
Qualitati 研究团队 · 2026-09-11 · 8 分钟阅读
简短回答:问卷开放题的语音回答通常比打字回答长两到三倍,作答用时也更短,但跳过的人要多得多。在一项 2024 年针对 1,001 名德国受访者的随机化智能手机实验中,39% 的人跳过了口头追问,而书面追问只有 8%。应把语音作为获取深度的可选项,而不是唯一的作答方式。
最后更新:2026 年 9 月 11 日
开放题是问卷获得"为什么"的地方,也是受访者最容易放弃的地方:在手机上用拇指打出的回答往往只有寥寥几个词。让人们直接说话是显而易见的解决办法,而问卷方法学者已经在足够多的随机实验中检验过它,可以说清它能带来什么、不能带来什么。本文总结问卷语音回答的相关证据,补充 2026 年关于自动转写的研究发现,并给出一个何时使用语音的决策矩阵。
核心要点
- 语音回答更长。各项研究中,口头回答的长度大约是打字回答的两到三倍。
- 语音回答更常被跳过。在一项 2024 年实验中,口头追问的无应答是书面追问的四到五倍。
- 更长不等于更丰富。同一实验发现两种方式得到的主题相近。
- 自动转写成为新的薄弱环节。2026 年一项对三种语音识别工具的比较发现,每种工具的失败方式各不相同。
- 最佳实践是提供选择,而不是替代。保留文字输入,并在编码前审核转写稿。
什么是问卷中的语音回答?
语音回答是指受访者通过说话(通常对着智能手机)而非打字来回答问卷开放题。问卷保存音频,之后经人工或自动语音识别转写,再像其他开放文本一样编码。听写是一种相关但不同的选项:手机键盘实时把语音转成文字,研究者只能看到文字。
研究发现了什么?
现有证据主要来自德国和西班牙在线样本库中的随机实验,结论相当一致。
回答更长、更快
在一项关于敏感话题的智能手机实验中,Höhne、Gavras 与 Claassen(2024)发现,在全部四道敏感开放题上,语音回答的长度都是文字回答的两倍以上,而作答用时更短。在一项网络追问实验中,Lenzner、Höhne 与 Gavras(2024)报告口头回答的词数约为三倍:第一道追问为 43.82 对 14.18 个词,第二道为 41.19 对 12.08 个词。
不作答的人多得多
同一网络追问研究(N = 1,001,Forsa Omninet 样本库)发现,口头组约 39% 的人没有回答第一道追问,书面组仅为 8%。Höhne 等人引用的早期研究报告语音回答的流失率约为 45%,文字约为 13%。Revilla、Couper、Bosch 与 Asensio(2020)发现,录音作答的无应答明显高于打字,听写则略高。作答意愿也因人而异:Lenzner 与 Höhne(2022)研究了谁愿意使用语音输入以及原因——这很重要,因为选择性无应答是一种偏差,而不只是样本变小。
多出来的词不一定带来多出来的洞见
Lenzner、Höhne 与 Gavras 发现两种方式得到的主题相近,口头回答仅在第一道追问上提及的主题略多。他们的总体结论是结果喜忧参半,没有明显的赢家。口头回答包含更多停顿、重复和语境,这对解读有价值,但并不保证产生新的编码。
AI 能可靠地转写问卷语音回答吗?
不经核查就不能。Revilla、Ochoa、Höhne 与 Couper(2026)用三种工具转写了 859 条西班牙语语音回答:
| 工具 | 主要优势 | 主要问题 |
| Google Cloud Speech-to-Text | 94.2% 的转写稿被评为非常清晰 | 26% 的音频文件未能转写,尤其是较长的录音 |
| OpenAI Whisper | 99.8% 的案例生成了转写稿 | 28.5% 至少多出一个词,19.2% 缺词;有效率 79.6% |
| Vosk | 覆盖率 90% | 标点薄弱;仅 10.7% 被评为非常清晰 |
作者还比较了人工编码与 GPT-4o 对转写稿的编码。两者一致性为弱到中等,Cohen's kappa 随质量维度不同在 0.00 到 0.63 之间。实践启示:转写环节会悄无声息地塑造你的数据,而且失败方式各异(丢文件还是凭空加词)。要有意识地选择工具,并抽查音频与文字是否一致。
语音回答决策矩阵
这个矩阵是 Qualitati 基于上述研究的自有归纳。可以逐题判断语音是否值得付出无应答的代价。
| 情境 | 建议 | 原因 |
| 叙事型问题("请讲讲您上一次…") | 在文字之外提供语音选项 | 这类问题最看重长度和语境 |
| 简短的事实或列举题 | 仅文字 | 语音只增加无应答,不增加内容 |
| 必须人人作答的关键结果题 | 默认文字,语音可选 | 语音的无应答可能高出四到五倍 |
| 读写能力较低或打字困难的受访者 | 醒目地提供语音 | 消除作答障碍 |
| 回答将被大规模自动编码 | 仅在审核转写稿的前提下使用语音 | 语音识别工具会丢文件或加词 |
| 需要语气、语速或情绪 | 使用语音,并作为音频分析 | 转写稿会丢失声学信号 |
语音回答准备清单
- 每道启用语音的题目都保留文字输入。
- 知情同意页说明音频会被录制、存储和转写。
- 预测试检查 iOS 和 Android 上的录音按钮与麦克风权限。
- 合并结果前,比较选择语音与选择文字的人群。
- 抽取一部分转写稿(例如 10%)与音频核对。
- 编码方案在两种方式间一致地处理停顿和重复。
何时不应使用语音回答
- 当某道题的全面覆盖比深度更重要时。
- 当受访者在公共或共享空间作答时,例如通勤者或职场样本。
- 当伦理审批或数据政策不允许存储音频时。
- 当转写工具对所涉语言或口音支持较差时。
Qualitati 的定位
Qualitati 是面向产品、UX 和客户洞察团队的 AI 用户研究平台。其对话式问卷会由 AI 提出追问,并可嵌入以文字或实时语音进行的 AI 主持访谈题,让想说话的受访者可以说,而问卷其余部分保持结构化。对于口头数据,AI 主持访谈支持 10 种语言的语音或文字访谈,Voice Analytics 提取音高、响度变化和语速等声学特征,ThemeLens 可跨最多 100 份访谈记录归纳主题并附上受访者原话。在任何平台上都应同样谨慎:报告前请审核转写稿和编码。
这些证据的局限
大多数实验来自德国和西班牙的在线样本库以及少数几个研究团队,因此在其他国家、语言和人群中结果可能不同。无应答率也在很大程度上取决于界面设计以及语音选项的引入方式。请把上述数字视为方向而非对你研究的预测,并进行预测试。
常见问题
问卷中语音回答比打字回答更好吗?
语音回答更长、作答更快,但被跳过的频率高得多,也不一定产生更多主题。它适合获取叙事深度,而不是覆盖面。
受访者为什么会跳过语音题?
研究指向隐私顾虑、身处公共场所、不习惯录音,以及麦克风权限等技术障碍。不同受访者群体的意愿也不同。
应该用听写还是录音?
在 Revilla 等人 2020 年的研究中,听写把回答保留为文字,无应答仅比打字略高;录音保留了更丰富的音频,但无应答明显更高。
哪种语音识别工具最适合问卷回答?
在 2026 年 JSSAM 的比较中没有工具全面胜出。Google 文字最清晰但漏掉了许多文件;Whisper 几乎全覆盖但会加词。无论选哪种都要抽样审核。
LLM 能代替人工编码语音回答吗?
可以辅助,但在 2026 年的研究中 GPT-4o 与人工编码者的一致性只有弱到中等。请保留经人工审核的编码手册,并在依赖它之前检验一致性。
结论
问卷语音回答是用覆盖面换深度。在叙事型问题上提供语音,保留文字输入,审核转写,并在合并前检查各方式的作答人群。想并排尝试口头与文字回答,可免费开始,获得 30 积分,或查看透明定价。
本文是对已发表研究的独立编辑摘要。方法学建议应结合你自己的研究设计和伦理要求进行审阅。