做 AI 分析前该先翻译访谈吗?
Qualitati 研究团队 · 2026-09-04 · 9 分钟阅读
简短回答。只有当你的分析团队无法阅读源语言时,才应在分析前翻译访谈记录。用原始语言编码、再翻译产出——主题、编码定义和实际引用的语句——能保住真正重要的意义,并把有损环节从两步减到一步。先翻译本质上是一个人员配置决策,只是被包装成了方法决策。
没人写进方法部分的那个抉择
每个多语言项目都会走到同一个岔路口。你手上有 40 份葡萄牙语、日语和阿拉伯语的访谈,而分析报告要用英文写。从录音到报告之间,翻译一定会发生。真正的问题只是它发生在哪一步——而答案会改变你的研究发现本身。
可选的顺序有两种:
- 先翻译。用源语言转录,把每份访谈记录译成英文,然后对英文做编码。
- 先用源语言。用源语言转录并编码,然后翻译编码手册、主题,以及你真正会引用的那些语句。
多数团队会不假思索地选择先翻译,因为这样语料看起来整齐划一,一位分析师就能包办全部工作。这份便利是真实的,代价同样真实,只是很少被写下来。International Journal of Qualitative Methods 2022 年的一篇综述发现,定性健康研究对翻译流程的报告长期被忽视——读者往往无从得知什么被翻译了、由谁翻译、在哪个阶段翻译(Yunus 等,2022)。没有被报告,就意味着没有被审视。
要点速览
- 先翻译会在解释之前插入一个有损环节,于是下游每一个 code 都继承了翻译所做的压缩。
- 先用源语言把有损环节挪到解释之后,此时你能看见自己在压缩什么,并作出选择。
- 机器翻译质量在各语言间并不均等。一项 2026 年针对 24 组双向语言对的基准测试发现,BLEU 分数从法律文本到文学文本下降了 68.7%,某些低资源语言对的得分接近于零(arXiv:2510.07877)。访谈话语更靠近文学那一端,而非法律那一端。
- LLM 主题分析已被证明可以直接在至少一种非英语语言中运行:2024 年一项研究以意大利语 prompt 对意大利语半结构化访谈做归纳式主题分析,得到的主题与人类研究者独立产出的主题相似(De Paoli,2024)。
- 无论哪种顺序,都无法免除在意义被决定的那一环节需要一位双语人类。
为什么顺序比质量更重要
人的直觉是去争论翻译准确度。那是错的坐标轴。先假设你的翻译极其出色,它仍然是一次阅读——一组被消解掉的歧义。"Complicado" 变成了"complicated"而不是"awkward"。一位日语受访者句尾的委婉标记变成了一个句号。阿拉伯语中表达亲昵的指小形式变成了一个中性名词。
这些都是微小的解释性决策。在先翻译的路径里,它们全都在编码之前做出,由一个本职是翻译而非分析、且并不知道你的研究问题在意哪些区分的人(或系统)做出。编码者随后编码的是这些消解结果,而不是原本的歧义,并且根本没有办法看出这里曾经有过一个选择。
在先用源语言的路径里,同一处歧义依然在——但它抵达的是那个正在寻找它的人。他们可以把它编码为歧义,可以标记它。当它最终变得重要时,他们可以就此写作。
这正是方法论文献长期主张"在可行时用采集语言做分析"的原因。AI 并没有改变这个逻辑,它改变的是可行性。
2026 年改变的是可行性,不是原则
先用源语言过去卡在人员配置上。你需要一位精通语料中每一种语言的分析师。一项涵盖六种语言的研究,就意味着六位分析师,或者一次妥协。
有两项进展移动了这道门槛——同时值得精确地说清它移动了多远。
LLM 能在它所支持的语言中做编码。上文那项意大利语研究是一个针对性的存在性证明:以意大利语 prompt、在意大利语访谈记录上,一个预训练模型产出了可用质量的 code。论文自身的表述是有条件的——适用于多语言工作,"只要该语言被所用模型支持"。这个条件承担了实质性的分量。
支持程度参差不齐,而且方式可预测。2026 年的那项翻译基准测试是关于这种不均衡形状的最清晰公开证据。跨语系的语言对表现逊于同语系语言对;差距随模型规模扩大而收窄,但并未闭合。输出中检测到的偏差集中在低资源源语言上,在 1,439 组人工标注语言对中,文化与社会文化偏差占到被标记实例的 75% 以上。那项研究测量的是翻译而非编码——但用一种模型处理得很差的语言做编码,未必比从这种语言翻译出来更安全。
所以 2026 年诚实的立场不是"AI 解决了多语言定性分析",而是:对于支持良好的语言,源语言编码如今已便宜到可以作为默认选项;对于支持薄弱的语言,你只是把一个已知风险换成了一个研究更少的风险。
分析语言决策矩阵
按下面四行给你的项目打分。这是一个实践者启发式框架,不是经过验证的量表。
| 因素 | 倾向先用源语言 | 倾向先翻译 |
| 研究问题 | 人们如何谈论它——框架、隐喻、迟疑、身份、情绪 | 人们报告了什么——请求的功能、说出的价格、采取的步骤、失败的任务 |
| 语言支持 | 高资源语言,你的模型与 ASR 覆盖良好 | 低资源语言,模型编码不可靠但能找到人类译者 |
| 团队 | 至少有一位审阅者能读源语言 | 团队中无人能读该语言,也雇不到 |
| 产出 | 发表、监管归档,或任何引语具有证据分量的场合 | 内部汇报,方向性信号已经足够 |
三到四行落在左列:用源语言编码,只翻译你要引用的内容。三到四行落在右列:先翻译是站得住脚的——把它写进方法说明,并把引语当作转述来对待。结论分裂通常意味着第三行才是真正的约束条件,而解法是补一位审阅者,不是换一套方法。
那个没人命名的混合路径
还有第三种顺序,实践中常被使用,却几乎从不出现在方法部分的描述里:用源语言编码,翻译 code,跨语言对齐,然后引用源语言原文并附上译文注解。它的代价是多开一次对齐会议,而这正是多数严谨的多语言项目最终收敛到的做法。在你的写作中给它一个名字,好让审稿人能够评估它。
源语言编码审查——六项检查
如果你用原始语言编码,无论是人工还是借助 AI,以下六项检查针对的正是这条路径特有的失败模式。
- Prompt 语言与数据语言一致。用英文 prompt 处理葡萄牙语访谈记录,等于悄悄邀请模型先用英文思考再在内部回译。让二者一致,并写明你用的是哪一种。
- Code 名称统一用一种语言,定义写两种。为 code 标签选定一种工作语言以保持编码手册可排序,但每条定义都用两种语言写。两种定义之间的分歧,是"同一个 code 在不同语料中含义不同"的最早信号。
- 跨语言对齐是一个排进日程的步骤。两位分析师编码两种语言,就会产出两本编码手册。合并它们属于分析工作,不是行政工作,需要在日历上占一个格子。
- 双语审阅者按语言抽查 10%。不是全部语料,够抓出被系统性误用的 code 即可。
- 引语同时给出原文与译文。两者都要。只有译文的引语,读者无法证伪。
- 记录语言相关的行为异常。如果模型在某一种语言上拒答、含糊其辞或表现退化,那是关于你研究工具的一项发现,应写入局限性部分。
适用人群——以及何时不必纠结
在以下情况使用先用源语言:语料跨越多种语言;你的问题关乎意义而非计数;团队中每种语言至少有一人能读;或产出会接受外部审视。
在以下情况跳过这场争论:所有受访者本来就是用分析语言接受访谈的;或这是一次快速的内部信号核查,方向性发现已经足够,且不会有人逐字引用受访者。不要为一场两天的汇报花一周去设计翻译架构。
Qualitati 的位置
Qualitati 是面向产品、UX 与客户洞察团队的 AI 用户研究平台,涵盖 AI 主持访谈与焦点小组、对话式问卷,以及 AI 辅助的定性分析。
Qualitati 支持 10 种语言的研究——英语、中文、法语、挪威语、荷兰语、德语、西班牙语、葡萄牙语、日语和阿拉伯语——覆盖访谈本身以及随后的分析。具体而言,这意味着一场用日语进行的访谈可以作为日语来分析:ThemeLens 以 map-reduce 流水线一次性处理至多 100 份访谈记录,把 code 映射到研究问题,并合成带有受访者原话锚点的主题;QDA Workspace 支持归纳与演绎编码以及编码手册生成。走源语言路径,不需要你为每种语言手工搭一条流水线。
平台不会替你做的,是对齐决策。把一本日语编码手册与一本德语编码手册合并属于解释性工作,上面那六项检查依然适用。语言支持也不等于同等支持:2026 年那项基准测试的告诫在任何工具内部都成立,包括我们的工具——你的模型处理得差的语言,编码也会差。
定价按 credit 公开,注册即赠 30 credits 免费额度,无需信用卡。
局限与坦白的告诫
- 直接证据很单薄。据我们所知,尚无已发表的头对头试验对同一批语料用两种顺序各编码一次并比较所得主题。这样的研究本应存在,但就我们所能找到的范围而言并不存在。以上全部推理都建立在邻近证据之上。
- 意大利语那项研究只涉及一种语言、一个数据集。它确立了非英语 LLM 主题分析可以奏效,并未确立它在你的语言、你的数据、你的标准下也能奏效。
- 那项翻译基准测试测的是翻译。把它关于语系与低资源语言的发现外推到编码质量,是一次推断,不是一次测量。
- "受支持语言"没有公认定义。各家厂商(包括我们)公布语言清单时都不附带逐语言的质量下限。请把任何此类清单当作你自己做试点的起点,而不是保证。
- 本文未建模成本。翻译 40 份访谈记录和翻译 30 个主题是两张非常不同的账单,哪个更便宜取决于我们无法一般化的费率。
人工审阅说明:上述决策矩阵与六项检查是从跨语言定性方法论中综合出的实践者框架,不是经过验证的量表。在它们进入预注册或伦理审查材料之前,请先请一位方法论学者过目。
结论
是否在分析前翻译访谈记录,应当取决于谁能读源语言,而不是取决于什么能让表格看起来整齐。翻译就是解释;把它放在编码之后,让分析师能看见这个选择,而不是放在编码之前,让它以既成事实的形态抵达。在语言支持良好的地方,用原始语言编码如今是更便宜也更站得住脚的默认选项;在支持不好的地方,请写进局限性,而不要假定模型已经处理妥当。
常见问题
做定性分析之前应该先翻译访谈吗?
只有在分析团队中无人能读源语言时才应如此。在编码前翻译,意味着每一个 code 都被施加在别人已经消解好的数据阅读之上。用源语言编码、之后再翻译主题与选定引语,能把解释性决策留在分析师手中。
AI 能用英语以外的语言做主题分析吗?
对于模型支持良好的语言,可以。2024 年一项研究以意大利语 prompt 对意大利语半结构化访谈做归纳式主题分析,发现所得主题与人类研究者独立产出的主题相似。论文自身的告诫——这一结论成立的前提是"该语言被所用模型支持"——才是关键条件。
机器翻译对研究访谈记录来说够用吗?
高度取决于语言对与语域。一项 2026 年覆盖 24 组双向语言对的基准测试发现,翻译质量从法律文本到文学文本下降 68.7%,在某些低资源语言对上接近于零。访谈言语——带有委婉、习语与情绪语域——的行为更像文学文本而非法律文本。
先翻译路径最大的风险是什么?
看不见的压缩。翻译消解掉的歧义,可能恰恰是你的研究问题所关心的,而编码者永远不会知道这里曾有过一个选择。译好的访谈记录读起来流畅而完整,这正是损失不被察觉的原因。
用了 AI,还需要双语研究者吗?
需要。AI 改变的是你需要多少双语人力,而不是是否需要。最低限度是:每种语言一位审阅者抽查一部分已编码片段,并核验最终产出中出现的每一条引语。
论文中应如何报告翻译步骤?
写明翻译了什么(访谈记录、code,还是仅引语)、在哪个阶段、由谁或由什么系统完成,以及是否做过任何核验。已发表的定性研究普遍省略翻译流程的报告,因此把它写清楚是一笔低成本的可信度收益。
用你自己的数据试一试
Qualitati 提供 AI 主持访谈、AI 主持焦点小组、对话式问卷,以及 10 种语言的 AI 辅助主题分析,并公开按 credit 计费的用量费率。注册免费领取 30 credits——无需信用卡——或查看透明定价。如果你正在评估从传统 QDA 软件迁移,可参阅我们的 NVivo 替代方案指南与 MAXQDA、ATLAS.ti 与 NVivo 对比。
延伸阅读:用 AI 做多语言定性研究、为什么回译对定性研究失效,以及多语言访谈中的语码转换。关于 AI 辅助编码究竟能被信任到什么程度这一更宏观的问题,可参阅 Schroeder 等(2024)对研究者所报告的规范缺口的讨论。
最后更新:2026 年 9 月 4 日。本文为独立编辑性综述。竞品与工具相关表述反映截至该日期的公开信息;凡细节未公开处,我们如实说明,而非估算。