什么是实境编码(In Vivo Coding)?2026 定性研究指南
Qualitati 研究团队 · 2026-09-12 · 10 分钟阅读
最后更新:2026 年 9 月 12 日
简短回答
实境编码(in vivo coding)是一种定性编码方法:直接用受访者自己的原话(加引号)为资料贴标签,而不是使用研究者的术语。它是 Johnny Saldaña 所描述的第一轮编码技术,目的是在任何抽象发生之前,完整保留受访者的声音。它尤其适用于早期分析、术语密集的领域,以及“究竟采用谁的语言”确实重要的研究。
核心要点
- 实境编码的意思是用受访者的原话编码——是
"it just fights me"(“它就是跟我对着干”),而不是 Usability frustration(可用性挫败感)。
- 它是第一轮编码方法,而不是完整的分析。Saldaña 将其定位为早期的一轮处理,之后再进入更高层级编码的第二轮。
- 它的主要价值在于防止漂移。因为编码就是受访者的原话,你无法在第一周悄悄换上自己的框架,然后忘记自己这么做过。
- AI 编码工具在结构上天然不利于它。语言模型默认会转述,而转述恰恰是实境编码唯一明令禁止的事。
- 2026 年关于诠释深度的证据好坏参半。一项 CHI 2026 研究考察了一款端侧 LLM 编码工具,发现研究者信任它做表层信息提取,但不信任它处理隐含的、分散的意义。
- 在决定手动还是借助 AI 执行这一方法之前,请先使用下文的实境编码保真度检查清单和编码方法选择表。
什么是实境编码?
实境编码是一种定性数据分析方法,其中每个编码都是一个词或短语,逐字取自受访者本人的口述或书面表达。in vivo 的拉丁语本义——“在活体之中”——正是要义所在:编码停留在资料鲜活的语言之内,而不是被翻译成学术或产品词汇。
该方法是 Saldaña《The Coding Manual for Qualitative Researchers》(《定性研究者编码手册》)中最知名的第一轮编码技术之一,在方法论文献中也以逐字编码、字面编码、本土术语编码等名称出现(参见 Wiley《International Encyclopedia of Communication Research Methods》中的 In Vivo Coding 词条)。惯例是给实境编码加上引号,这样任何阅读编码手册的人都能一眼看出哪些标签来自受访者、哪些来自分析者。
一个完整示例
取一段假想的新用户引导访谈中的一句话:
“我没完成设置。我一直在等它告诉我它想让我做什么,可它始终没有,所以我干脆关掉标签页,回去用电子表格了。”
| 编码方法 | 所贴编码 | 保留了什么 | 失去了什么 |
| 实境编码 | “一直在等它告诉我它想让我做什么” | 受访者的心智模型:他们期待被引导 | 与换种说法表达同一意思的其他受访者之间的可比性 |
| 描述性编码 | 设置中途放弃 | 事件发生在用户旅程的哪个环节 | 用他们自己的话说,为什么会发生 |
| 过程编码 | 退回原有工具 | 行动及其方向 | 放弃时的情感质地 |
| 概念 / 分析性编码 | 引导期望落空 | 一个可以用来建构理论的构念 | 全部原始措辞;抽象现在归你所有 |
请注意,概念编码并没有错。它只是一个主张——而实境编码的纪律在于:你应在第二轮中公开地、有记录地提出这个主张,而不是在第一轮中无意间做出。
适用人群
开展探索性访谈的 UX 研究者和产品经理;在圈内词汇很强的品类中工作的市场与客户洞察团队(临床医生、开发者、交易员、游戏玩家、教师);方法部分必须经得起审稿的学术定性研究者;以及负责制定团队编码规范、确保两位分析者产出可比编码手册的 ResearchOps 负责人。
实境编码何时值得投入
与描述性编码相比,实境编码每份访谈记录耗时更长,产出的初始编码列表也更庞杂。在以下四种情形中,这种取舍是值得的。
- 早期的探索性研究:过早套用你的类属会扼杀研究发现。如果你已经知道类属是什么,那你做的是演绎式编码——参见归纳式编码与演绎式编码。
- 术语密集或亚文化领域。当受访者说出“影子 IT”“那份黑名单”或“氛围检查”时,这个词本身就是数据。把它压平为
非正式流程 会毁掉其中的信号。
- 关于语言本身的研究。命名研究、定位、信息传达测试、客服工单分类,以及任何最终会变成文案上线的内容,都应该用客户的原话编码——因为交付物本身就是文字。
- 权力不对等或敏感议题研究。当受访者正被一个历来对他们命名不当的机构所描述时,保留他们自己的用语是一种伦理立场,而不仅仅是方法论选择。它与反身性实践天然契合。
何时不宜使用
在以下情形中,可以跳过它,或将其降级为抽查:你正在按既定框架大规模编码;你的访谈记录是机器翻译的(所谓“逐字”措辞已经是译者的,而不是受访者的——参见AI 分析前是否应先翻译访谈);研究问题关注的是频次而非意义;或者访谈记录质量太差,逐字短语更多是 ASR 造成的伪影,而不是说话者的原话。
如何选择第一轮编码方法
| 如果你的目标是… | 使用 | 原因 |
| 听到受访者自己如何界定问题 | 实境编码 | 编码不会跑到数据前面去 |
| 按顺序梳理发生了什么 | 描述性 / 过程编码 | 便于跨案例比较 |
| 检验既有框架 | 演绎式 / 先验编码手册 | 覆盖面与信度 |
| 自下而上建构理论 | 实境编码 → 再做聚焦 / 主轴编码 | 扎根理论的顺序;参见主题分析与扎根理论 |
| 在数百条回答中统计主题 | 内容分析或 LLM 辅助编码 | 实境编码无法聚合;参见开放式问题编码:LLM 与机器学习之比 |
实境编码遇上 AI:转述问题
这里有一个值得直说的张力。大语言模型被训练来产出流畅、规范、抽象化的语言,而实境编码要求的恰恰相反:未经打磨、未经规范、属于受访者本人的语言。让一个通用模型“给这份访谈记录编码”,它绝大多数时候会返回分析者口吻的概念编码——Onboarding friction、Trust barrier、Feature discoverability——因为在它的训练数据里,编码就长这样。模型并没有出故障,它只是在回答一个与实境编码不同的问题。
2026 年的实证图景支持你在委派任务时说得具体一些。在一项 CHI 2026 研究中,研究者考察了 ChatQDA——一款端侧运行的开源 LLM 编码工具,报告了作者所说的“有条件信任”:研究者看重该系统提取显性内容的能力,但对其深层诠释存疑,并观察到这些开源模型往往只能识别出对话中位置相近的表层、直接陈述,无法可靠地把分散片段中的意义联系起来。这是一项小型研究——四名参与者,每人一份 5 页的访谈记录——因此应把它视为关于失败模式的信号,而非效应量。
放到实境编码的语境下看,这一局限反而格外合用。表层的、局部锚定的提取,恰好就是实境编码任务的形态。找到受访者实际用过的短语并将其锚定到访谈记录中的具体行,是一项偏检索性质的工作;判定三个不同短语属于同一个构念,则是诠释性工作——而同一项研究表明,这部分你应该自己保留。
更广泛的研究也指向同一方向:2025 年发表于《Sociological Methods & Research》的一项生成式 LLM 定性编码研究发现,模型在匹配人工编码结果方面可以接近监督式机器学习的表现;而 QualAnalyzer 研究则认为,实际要求在于过程可审计性——每个编码都能追溯到产生它的文本片段。对实境编码而言,片段级可追溯性不是锦上添花,而是该方法对“正确”的定义本身。
一个真正能产出实境编码的提示词模式
如果你确实要用模型做第一轮实境编码,就要对它的默认倾向加以约束:
对每个有意义的片段,返回:(1) 编码,必须是从访谈记录中逐字复制的原文片段,2–8 个词,不得转述、不得使用同义词、不得调整语序;(2) 其所在的行号或时间戳;(3) 说话者。不要创建类属、主题或分析性标签。如果片段中没有任何一段原文能独立承载该意义,请返回 NO_VERBATIM_SPAN,而不是编造一个标签。完全按原样保留受访者的语法、俚语、含糊措辞和粗话。
NO_VERBATIM_SPAN 这个退出选项很关键。没有它,被要求给出逐字编码的模型就会编造“近似逐字”的编码,这是最糟糕的结果——一个看起来像引文、实际上并非引文的字符串。这与我们在定性分析中的幻觉引文一文中讨论的是同一类失败。
实境编码保真度检查清单
这是 Qualitati 的原创工具。在编码手册进入第二轮之前,用它检查任何一轮实境编码——无论人工还是 AI 辅助。每项计一分;8 分及以上站得住脚,5–7 分需要返工修补,低于 5 分则是披着引号外衣的分析者口吻编码。
- 逐字检查。每个编码字符串都逐字符出现在访谈记录中。用字面文本搜索抽查 10%,不要靠肉眼。
- 出处检查。每个编码都附带访谈记录 ID、说话者,以及行号或时间戳。
- 说话者检查。没有任何编码取自访谈者或主持人的发言轮次。这是最常见的隐性错误,在 AI 主持的访谈中更严重,因为主持人的措辞流畅、易于引用。
- 语域检查。在含糊措辞、自我修正、俚语和不流畅表达承载意义时,编码予以保留。一组语法工整的编码,就是一组被编辑过的编码。
- 抽象检查。没有任何编码是受访者绝不会说出口的名词短语。
"it just fights me" 合格;"usability friction" 不合格,哪怕加了引号。
- 覆盖检查。没有可编码逐字片段的段落被如实标注,而不是被硬套上编码。
- 分布检查。编码没有集中在每份访谈记录的前三分之一——这是疲惫的人工编码者和被截断的模型上下文共同的特征。
- 重复检查。在这一阶段,几乎相同的短语保持彼此独立。合并是第二轮的决定,且须明确做出。
- 翻译检查。对于非源语言资料,编码以原语言保存并附注释义,而不是被译文替换。
- 第二读者检查。另一个人能从标注的片段中重新推导出至少 80% 的编码。如果做不到,说明这些片段承担的作用比你以为的要少。关于信度的更多讨论,参见AI 定性编码中的编码者间信度。
Qualitati 的定位
Qualitati 是面向产品、UX 和客户洞察团队的 AI 用户研究平台。其中有两个部分与实境编码直接相关。
- QDA Workspace 支持 AI 辅助的归纳式与演绎式编码、编码手册生成和主题可视化——第一轮逐字编码就在这里完成,你也可以在自己掌控的第二轮中把它们提升为更高层级的编码。
- ThemeLens 可一次对多达 100 份访谈记录运行 map-reduce 主题分析,将编码映射到研究问题,并综合出附有受访者锚定引文的主题。“受访者锚定”正是其中相关的纪律:保留引文的主题可以被审计、追溯到说话者本人。
数据收集同样重要。实境编码的质量取决于它所能利用的语言,因此会追问、而不是接受第一个答案的 AI 主持访谈,能产出更多可编码的逐字素材——而当措辞本身就是重点时,Active Listener 模式可以让人类访谈者留在现场,并获得实时提示。覆盖 10 种语言的多语言研究能力,让检查清单第 9 项中的原语言要求切实可行,而不只是一种理想。
Qualitati 公开按积分计费的使用费率,注册即可免费获得 30 积分,无需信用卡。
局限与取舍
三点坦率的提醒。
实境编码无法规模化,而这在一定程度上正是其设计使然。一百份访谈记录的逐字编码不是分析,而是一部语词索引。该方法的产出必须由一位愿意为抽象负责的人来归纳。那些采用实境编码却跳过第二轮的团队,最终得到的是丰富却无法使用的数据。
逐字不等于真实。一个短语只有在访谈记录准确、主持人没有先说出它、翻译也没有制造出它的情况下,才真正属于受访者。ASR 的错误率在不同口音之间并不均匀——参见转录中的口音偏差——因此逐字保真度在你的样本中分布不均,可能悄然左右谁的语言能在编码中存留下来。
AI 方面的证据基础薄弱且很新。本文引用的 2026 年研究都是小样本用户研究和探索性比较,而不是具有既定构念效度的基准测试。人工审阅提示:如果你的方法部分要声称 AI 辅助的编码保留了受访者的声音,这一主张需要你在自己的数据上做有记录的验证——引用别人一项只有四名参与者的研究是撑不住的。
常见问题
实境编码就是引用原话吗?
不是。引文是你呈现的证据;实境编码是你用于分析的标签。同一个短语可以兼具二者,但编码必须足够简短,才能在整个数据集中反复出现,而且它附着于一个文本片段,而不是一整段示例文字。
实境编码应该多长?
短到足以作为标签,长到足以独立承载意义。两到八个词是常用范围。一整句话通常是一段尚未被编码的引文。
实境编码能和既有编码手册结合使用吗?
可以,而且这是一种常见的混合做法:用先验编码保证覆盖面,同时并行做一轮实境编码,捕捉框架中没有位置的内容。实境编码这一层就是编码手册已经过时的早期预警。
实境编码适用于开放式问卷回答吗?
适用,但有一个前提:书面问卷回答已经过受访者的自我修饰,因此其语言不如访谈口语那样自然。语音回答介于两者之间——措辞更丰富,但无应答也更多,详见我们关于问卷中的语音回答的文章。
LLM 能可靠地做实境编码吗?
在严格约束下——精确片段、行号引用、明确的拒答选项——它能有效完成提取这一步;但不应信任它来判断哪些不同的短语表达的是同一个意思。CHI 2026 的 ChatQDA 研究恰恰发现了这种分化:表层提取尚可,而对分散在整份访谈记录中的意义则力有不逮。
实境编码之后做什么?
进入第二轮:用模式编码、聚焦编码或主轴编码把实境编码归入类属,再发展主题。在 Saldaña 的框架中,第一轮本就是刻意的暂定结果;把它当作最终结论,是该方法最常见的误用。
结论
实境编码是一种小而严格的纪律,却有着超乎寻常的效果:它迫使你对数据的第一轮处理使用受访者的语言,从而让之后的每一次抽象都成为可见的决定,而不是不可见的决定。随着 AI 进入编码工作流,这一纪律变得更有价值,而不是更无关紧要——因为一个流畅的模型的默认做法就是立即抽象,并且永远不会告诉你原话去了哪里。用 AI 做附带出处的精确片段提取;把“这些片段意味着什么”的判断留给自己。
免费获得 30 积分,在 QDA Workspace 中运行第一轮编码,或查看透明定价。如果你正在比较工具,可以看看 Qualitati 与 NVivo、ATLAS.ti、MAXQDA 及 AI 原生研究平台的对比,或者创建账户,今天就为一份访谈记录编码。