多语言访谈中的语码转换:2026 年指南
Qualitati 研究团队 · 2026-08-21 · 9 分钟阅读
简答:Code-switching(语码转换)——受访者在同一句话中混用两种语言——正是多语言研究流程最容易崩溃的地方。转录错误集中出现在语言切换点上,而语言模型对混合文本的处理具有方向性差异。截至 2026 年 8 月,解决之道并非换一个更好的模型,而是一套工作流程:标注语言混用情况、审计切换点准确率,并在受访者的主导语言中完成分析。
为什么语码转换在多语言访谈中如此关键
当你问一位在巴塞罗那工作的双语产品经理她如何使用你的仪表盘时,你得到的不会是纯正的西班牙语,而是承载着英语名词的西班牙语句法:"el onboarding fue confuso, pero el dashboard sí me gustó." 这就是语码转换。在双语者中,它是常态而非边缘情况。
这给定性研究带来了一个具体却极少被讨论的风险。大多数转录与分析工具都假设一个文件只有一种语言。当说话者切换语言时,声学模型、分词器和下游编码环节会同时失效——而且恰恰失效在承载产品含义的那些词上,因为那些词通常正是借用的英语术语。
结果是一个悄无声息的数据质量问题:访谈记录读起来很流畅,主题看起来也很合理,但受访者说出最有价值内容的那些句子,恰恰最可能已被扭曲。
核心要点
- 语码转换对自动语音识别的影响在不同系统间差异很大——2026 年 ServiceNow-AI 对七个前沿 ASR 模型的基准测试发现,顶尖系统的性能损失很小,而其他系统则大幅退化,这意味着模型选择在这里比在单语音频中重要得多。
- 语言模型对混合文本的处理是不对称的:在英语中插入外语词元会损害理解能力,而在其他语言中嵌入英语往往反而有帮助。
- 错误集中在切换点上,因此语料层面的词错误率会掩盖问题。应当测量每个切换点前后两到三个词窗口内的准确率。
- 外来词不等于语码转换。将两者混为一谈会虚高你的错误率估计,并浪费审核时间。
- 可行的缓解手段是流程性的:预先声明预期的语言对,审计切换点样本,在主体语言中做分析,并让双语审核者核验每一条你准备发表的引语。
2026 年的证据究竟说明了什么
语音识别:稳健性的差异大于难度本身
在 2026 年 6 月 9 日发布的一项基准测试中,ServiceNow-AI 的研究者在西班牙语-英语、法语-英语、加拿大法语-英语和德语-英语的语码转换语音上评估了七个前沿语音识别系统——包括 AssemblyAI Universal 3-Pro、Deepgram Nova 3 Multilang、ElevenLabs Scribe V2、Google Gemini 3 Flash、Mistral Voxtral Small、Nvidia Parakeet TDT 以及 OpenAI Whisper Large V3 Turbo。每段话语都与单语主体语言基线和单语英语基线进行了对比(ServiceNow-AI, 2026)。
最重要的发现并不是语码转换普遍很难,而是语码转换把稳健的系统与脆弱的系统区分了开来。表现最好的系统相对单语基线只有很小的性能损失;较弱的系统则明显退化,其中 Whisper 在德语-英语语言对上的相对退化幅度最大。对研究团队而言,这改变了决策方式:你不能依据单语准确率排行榜挑选转录供应商,然后假定这个排名对你的双语受访者同样成立。
错误藏在哪里:切换点与外来词
HiKE 评估框架(Paik 等,2025 年 9 月投稿,2026 年 1 月修订)提出了一个可直接迁移到研究实践中的方法论要点。HiKE 是一个非合成的韩语-英语语码转换基准,其贡献在于标注方案:它在词、短语和句子三个层级上分层标注语码转换,并单独标注外来词。
这种区分很重要。出现在韩语句子中的"feedback"可能只是一个已被固化的外来词,而非真正的语言切换;把两者等同处理会扰乱你计算出的任何准确率估计。HiKE 还报告称,多语言 ASR 模型在语码转换材料上起初表现欠佳,但通过针对性微调可以改善——这是有用的背景信息,不过大多数研究团队并不会自己去做微调。
分析环节:没人预料到的不对称性
转录只是流程的一半。在 "Lost in the Mix: Evaluating LLM Understanding of Code-Switched Text"(Mohamed 等,2025 年 6 月)一文中,作者构建了标准推理与理解基准的语码转换变体,发现了一个方向性效应:当外语词元打断英语文本时,模型性能明显退化;而在其他语言中嵌入英语,反而经常提升理解表现。
请把这一点当作工作流程指令来读。一份夹杂英语产品术语的西班牙语访谈记录属于有利方向;一份被塞入西班牙语短语的英语访谈记录则属于不利方向。如果你的标准作业流程是"先全部翻译成英语,再做编码",那你可能正在把较容易的情况转换成较困难的情况。同一篇论文还指出,基于提示词的缓解手段效果参差不齐,而微调则更为稳定——对于没有微调预算的团队而言,这意味着提示词技巧并不是可靠的解决办法。
更宏观的图景与此一致。一篇覆盖 15 个以上 NLP 任务、30 多个数据集和 80 多种语言、综述了 327 项研究的调查得出结论:大多数大语言模型在混合语言输入上仍然吃力,且语码转换数据集与评估方法仍然有限(Sheth 等,2025)。该综述特别指出,对话式、语音和多模态的语码转换是发展最不充分的领域——而这恰恰就是定性访谈所处的地带。
受访者是有意切换语言的
还有一项发现把语码转换从噪声重新定义为信号。2026 年 CHI 会议的一篇扩展摘要报告了一项针对 84 位多语言用户的混合方法研究——结合问卷、半结构化访谈与交互日志——考察他们在与 LLM 对话时如何选择和切换语言。初步发现是:语码转换是一种策略性实践,用于管理任务效率、语言精确度和情绪舒适度(CHI 2026 Extended Abstracts)。
如果这一点在研究访谈中同样成立——而访谈方法学者长期以来也提出过类似观点——那么受访者切换回母语的那一刻,往往标记着访谈记录中情绪负荷最重的段落。把它压平成单语输出,恰恰摧毁了你最想要的那一段。
语码转换就绪度审计
这是 Qualitati 为面向双语受访者开展访谈的团队提供的框架。请在实地开展研究之前完成,而不是事后补做。
| # | 步骤 | 具体做法 | 通过标准 |
| 1 | 声明语言对 | 为每个受访细分群体指明预期的主体语言与嵌入语言(例如西班牙语为主体,英语为嵌入) | 每个招募细分群体在实地开展前均已声明语言对 |
| 2 | 区分外来词 | 列出你所在领域在主体语言中已被原生使用的借用术语,并将其标记为外来词而非语言切换 | 每个语言对都有一份成文的外来词清单 |
| 3 | 做稳健性试点 | 用候选系统转录 3–5 段试点录音,在同一批音频上进行横向比较 | 所选系统是在语码转换音频上验证的,而非依据单语基准 |
| 4 | 审计切换点 | 在随机样本中人工核查每个切换点前、中、后 2–3 个词的窗口 | 切换点准确率与整体准确率分开报告 |
| 5 | 选定分析语言 | 尽可能在主体语言中编码;避免预先翻译成英语 | 研究方案中有成文的决定与理由说明 |
| 6 | 核验发表引语 | 由双语审核者对照音频(而非访谈记录)核查每一条引语 | 100% 的发表引语均已对照原始音频核验 |
切换点风险矩阵
用它来判断一项研究需要多少人工审核。
| 语言距离 | 低切换频率 | 高切换频率 |
| 相近语言对(如西班牙语-英语) | 低风险——仅抽查引语 | 中等风险——审计切换点样本 |
| 远距语言对(如中文-英语、阿拉伯语-英语) | 中等风险——审计切换点样本 | 高风险——对任何用于引用的访谈记录做完整双语审核 |
这篇文章适合谁
面向双语或多语受访者开展访谈的研究团队:拉丁美洲、东南亚、海湾地区或印度的消费者洞察研究;面向移民或侨民用户的用户体验研究;专业词汇为英语但日常对话并非英语的企业级研究;以及任何在多个市场开展同一项研究并跨市场比较主题的团队。
什么情况下不适用这套方法
如果你的受访者确实是单语者,这套审计只会增加成本而无收益——按你的标准流程执行即可。如果你的研究涉及法律或临床敏感性,那么对语码转换语音做自动转录根本就不是正确的起点;应当委托专业的双语转录,AI 只用于下游综合分析。而如果你需要就特定语言对的切换点准确率给出可供发表的可辩护结论,请把上面的审计当作内部质量关卡而非证据——它是一套审核程序,而不是一项验证研究。
Qualitati 在其中的位置
Qualitati 是一个面向产品、用户体验与消费者洞察团队的 AI 用户研究平台,支持十种语言的研究:英语、中文、法语、挪威语、荷兰语、德语、西班牙语、葡萄牙语、日语和阿拉伯语。
平台中有三个部分与上述工作流程直接相关。AI 主持访谈可以用受访者本人的语言进行,而不必强制使用英语,这样就保留了主体语言完整性——也就是下游分析中较有利的那个方向。ThemeLens 以 map-reduce 流程对最多 100 份访谈记录做主题分析,把编码映射到研究问题,并用受访者引语锚定主题,因此每个主题都保有一条可追溯回具体段落的线索,供你核查。而 QDA Workspace 支持人机协同的归纳式与演绎式编码,正是双语审核者执行审计第 6 步的地方。
Qualitati 无法做到的,是免除这套审计的必要性。没有任何平台能保证任意语言对的切换点转录准确率,任何声称能做到的供应商,描述的都是单语基准。截至 2026 年 8 月,诚实的立场是:语码转换研究需要一个人工核验环节,而平台的职责是让这个环节变得低成本、可追溯,而不是假装它并不必要。
局限与开放问题
本文需要附上三点说明。第一,上文讨论的 ASR 基准测试覆盖的是欧洲语言对,其排名不应被假定可迁移到中文-英语、阿拉伯语-英语或印地语-英语。第二,CHI 关于策略性语码转换的发现是以扩展摘要形式报告的初步结果,且针对的是人与 LLM 的对话,而非研究访谈——将其类比到访谈情境是一种推论,理性的人可以对此持不同意见。第三,"Lost in the Mix" 评估的是推理与理解基准,而非专门的定性编码;那种方向性不对称是分析设计中一个较强的先验判断,而不是在主题分析上测得的效应。
该领域尚未回答的开放问题是:切换点转录错误究竟在多大程度上改变了一项研究最终产出的主题?还没有人端到端地做过这个实验;在有人做出来之前,保守的做法就是核验。
常见问题
定性研究中的语码转换是什么?
语码转换是指说话者在同一场对话中——往往是在同一个句子中——在两种或多种语言之间交替。在访谈中,它通常表现为一种占主导地位的"主体"语言承载着来自另一种语言的嵌入词或短语,最常见的是非英语句子中夹带英语的技术或产品词汇。
AI 转录能处理语码转换吗?
部分能,且表现参差不齐。2026 年 ServiceNow-AI 的基准测试发现,表现最好的语音识别系统在语码转换音频上的准确率损失很小,而较弱的系统则大幅退化。由于系统之间的差距在混合语言语音上被放大,你应当在自己的双语试点录音上验证所选系统,而不是依赖单语准确率对比。
分析前应该先把访谈记录翻译成英语吗?
通常不应作为默认做法。"Lost in the Mix"(Mohamed 等,2025)的证据表明,在英语文本中插入外语词元会削弱模型理解能力,而在其他语言中嵌入英语则往往反而提升理解。在受访者的主体语言中做分析,能让你处在这种不对称性有利的一侧。翻译应当用于成果报告,而不是用于编码。
什么是切换点,为什么要单独测量它?
切换点是说话者变换语言的边界。错误集中在其前后两到三个词的窗口内,因此语料层面的词错误率可能看起来尚可接受,而含义最密集的那些段落却是错的。单独报告切换点准确率,能暴露出总体数字所掩盖的失效。
外来词等同于语码转换吗?
不等同。外来词是已经成为主体语言一部分、连该语言的单语者也会使用的借用词;语码转换则是语言系统之间的真实交替。HiKE 框架正是出于这个原因将两者分开标注——把它们混为一谈会虚高错误率估计,并增加审核工作量却不带来任何质量提升。
应该审计多少份访谈记录的切换点准确率?
目前没有公开的标准,我们也不会凭空发明一个。一种站得住脚的内部做法是:随机抽取足以覆盖每一个招募语言对和每一位访谈员的样本量,并在第一轮发现了会改变某条引语或某个编码的错误时扩大样本。请记录你抽样了什么以及为什么这样抽样。
结论
多语言访谈中的语码转换并不是一个可以留到事后清理的转录小麻烦——它是一个结构性弱点,而且恰好位于你最丰富的数据所在之处。2026 年的证据表明:工具层面的缺口是真实存在的,但各系统之间差异很大;语言混用的方向会改变模型的应对能力;受访者切换语言的理由本身就值得保留。这些都不是换一个更好的模型就能解决的。解决之道在于声明你的语言对、审计切换点、在主体语言中做分析,并让一位双语人工审核者核验你准备发表的每一条引语。
Qualitati 以十种语言支持 AI 主持访谈、AI 主持焦点小组、对话式问卷与 AI 主题分析。免费开始,赠送 30 个积分——无需信用卡——或查看透明定价了解公开的单积分费率。
最后更新:2026 年 8 月 21 日。本文是对公开研究与产品信息的独立编辑性综述;涉及竞品与工具的表述反映的是发布之日的公开信息。文中的方法论建议是一套审核程序,而非经过验证的量表——需要做出受监管或用于发表之结论的团队,应当另行寻求方法学审核。