什么是阶梯访谈法?2026 年手段—目的链访谈指南
Qualitati 研究团队 · 2026-08-22 · 10 分钟阅读
简短回答:阶梯访谈法(laddering)是一种结构化追问方法,它引导受访者从具体的产品属性出发,经由该属性带来的结果,一路上升到让它真正重要的个人价值观。该方法由 Reynolds 与 Gutman 于 1988 年提出,是手段—目的链理论的访谈实施部分,产出的是属性—结果—价值(ACV)链条,而不是功能反馈。
什么是定性研究中的阶梯访谈法?
阶梯访谈法是一种深度访谈形式:主持人反复追问某个既定偏好为什么重要,沿着抽象层级逐级攀升,直到受访者说出一个无法再拆解的个人价值观。每一个回答都成为下一次追问的输入。其产出不是一份喜欢与不喜欢的功能清单,而是一条链条——一个把产品拥有什么与这个人想成为什么样的人连接起来的因果故事。
该技术是手段—目的链理论的诱导环节,由 Reynolds 与 Gutman 在 1988 年发表于Journal of Advertising Research的论文中确立为研究方法。这一理论的主张简单而经久:人们买的不是属性,而是属性带来的结果;而他们在意这些结果,是因为自己持有的价值观。
ACV 链条的三级台阶
- 属性(Attribute)——具体、可观察的特性。"仪表盘一秒之内就加载完成。"
- 结果(Consequence)——这一特性为人带来了什么,先是功能层面,再是社会心理层面。"我可以在两场会议之间快速看一眼数据。"进而:"我不会毫无准备地走进会议室。"
- 价值(Value)——最终服务的目标状态。"我希望别人觉得我是一个凡事都掌控得住的人。"
实务上常把这三级细分为五层——属性、功能性结果、社会心理性结果、工具性价值、终极价值——这也是阶梯法常被教成"连问五到七次为什么"的原因。这个次数是经验法则,不是规则。当受访者开始描述自己而不是产品时,这条阶梯就走完了。
核心要点
- 阶梯法回答的是某个功能为什么重要,而不是人们喜不喜欢它。它适用于定位、传播话术与优先级争议——不适用于可用性缺陷。
- 这个方法足够老、规范也足够明确(Reynolds 与 Gutman,1988),这恰恰是它比开放式探索访谈更容易自动化的原因。
- 对话式代理做阶梯访谈已有实证支持:在一项 256 名受访者的组间实验中,Rietz 与 Maedche 发现基于聊天机器人的阶梯访谈获得的回答数量约为问卷式阶梯法的两倍,且回答显著更长。
- 2026 年的研究正从单代理转向带监督的架构。LadderTeam 预印本(2026 年 8 月 17 日)让一个访谈代理搭配一个在后台静默运行的裁判代理,专门监测跑题与过早结束。
- 高收敛率不等于高质量。LadderTeam 报告的链条收敛率为 99.1%,但与标准答案对照的终点匹配率只有 81.0%——这个落差代表的是那些结束了却没有抵达的阶梯。
为什么阶梯法在 2026 年重新受到关注
阶梯法一向昂贵。一条像样的阶梯需要经验丰富的主持人、一次只面对一位受访者,以及大量耐心;后续分析还要在几十份访谈记录之上构建蕴涵矩阵与层级价值图。很多知道这个方法的团队依然不做,因为单位洞察成本太高,排期也极其折磨人。
AI 主持攻击的正是这个约束。相比探索式访谈,阶梯法出奇地适合自动化,原因是结构性的:下一个问题是上一个回答的函数。它有明确的停止条件、明确的推进方向、明确的产出形态。一个只需要问"那这一点为什么对你重要?"——同时能识别回避、重复与抽象层级——的访谈者,远比一个必须临场发明探索议程的访谈者更容易实现。
已发表证据究竟说了什么
| 研究 | 时间 | 设计 | 主要发现 |
| Rietz 与 Maedche,Ladderbot(Int. J. Human-Computer Studies) | 2022 | 组间设计,256 名受访者,智能手机使用价值观 | 对话式代理阶梯访谈获得的回答数量约为问卷式阶梯法的两倍且显著更长;易学性评分显著更高 |
| LadderChat(Springer, Chatbots and Human-Centered AI) | 2025 | 6 位研究者参与的形成性评估 | 基于 LLM 的自适应追问,并实时可视化 ACV 链条;目前仅有早期阶段证据 |
| Aithal、Kotz 与 Mitchell,LadderTeam(arXiv 预印本) | 2026 年 8 月 17 日 | 216 次模拟运行(4 个模型 × 3 种追问方法 × 3 个界面场景 × 2 种人格 × 3 次迭代),另有一个真人验证阶段 | 链条收敛率 99.1%,终点匹配率 81.0%,跑题率为零;ACV 追问优于 5-Whys 与 JTBD 变体 |
这张表要仔细读,因为真正有意思的数字是那个落差。LadderTeam 的作者自己也指出了:收敛率衡量的是阶梯是否干净地结束,而终点匹配率衡量的是它是否结束在正确的位置。有 19% 的运行把对话停在了低于真实价值观的那一级台阶上。一个只汇报收敛率的看板会显示 99%,却什么也没告诉你。
把这些结果当作采购信号的人还要注意两点。LadderTeam 的主要评估使用的是带有两种人格设定(迟疑型、简短型)的脚本化标准受访者,而不是真实用户——这是为了把访谈者质量隔离出来的刻意选择,但也意味着向真实人群的推广性尚未检验。而 LadderChat 的评估只有 6 位研究者参与,那是形成性研究,不是效度验证。
什么时候该用阶梯法,什么时候不该用
阶梯法是一件专用工具。把它用在错误的问题上,既浪费受访者的时间,也会产出没人能采取行动的链条。
| 情境 | 用阶梯法? | 原因 |
| 两个团队对该做哪个功能各执一词,都拿用户诉求当依据 | 用 | 阶梯能揭示这些诉求服务的是同一个底层价值观还是不同的价值观 |
| 定位或话术测试——你需要能引起共鸣的语言 | 用 | 终极价值是文案所在之处;属性只是参数表所在之处 |
| 理解某个客群在功能满意度很高的情况下为何流失 | 用 | 满意度是在属性层测量的;流失通常发生在更高的层级 |
| 在某个流程中寻找可用性缺陷 | 不用 | 该做任务式可用性测试;阶梯法只会从那个坏掉的按钮上抽象走开 |
| 在没有任何假设的情况下摸清一个陌生领域 | 不用 | 阶梯需要一个起始属性;应该先做开放式探索访谈 |
| 价值层带有强烈身份色彩的敏感话题 | 谨慎 | 反复追问"为什么"可能显得像审问;需加入明确的退出选项与人工复核 |
| 动机各异的 B2B 采购决策小组 | 用,但按角色分开 | 每个角色单独做阶梯;跨角色汇总的链条会自相矛盾 |
Qualitati 阶梯质量评分表
阶梯法最常见的失败不是问题问得不好——而是一条过早停下的阶梯被当作完成品记录下来。这正是 LadderTeam 作者点名的那种失败,而它对人类主持人同样成立。在进入分析之前,用以下五条标准给每一条阶梯打分。每条计 0、1 或 2 分;总分低于 7 分(满分 10 分)的阶梯应标记为需要重访,或从价值图中剔除。
| 标准 | 0 分——不合格 | 1 分——部分达成 | 2 分——合格 |
| 落地性——阶梯是否从一个真实、具体的属性起步? | 从抽象说法起步("我喜欢好设计") | 从一个品类起步,而非某个具体实例 | 从受访者未经提示自己说出的具体、可观察的特性起步 |
| 上升性——每一级台阶是否真的上升了一层? | 有两级或更多台阶在重述同一层级 | 出现一次停滞,但随后恢复上升 | 每一级都严格比下面一级更抽象 |
| 终止点——它结束在价值观而非结果上吗? | 结束在功能性收益上("它节省时间") | 结束在社会心理性结果上 | 结束在受访者无法再拆解的自我描述式目标状态上 |
| 归属性——每一级是否都是受访者自己的语言? | 主持人给出价值观,受访者只是附和 | 主持人转述,受访者确认 | 每一级都能追溯到一句可以直接引用的受访者原话 |
| 无回避——受访者是否真的投入其中? | 反复说"我不知道",阶梯仍被强行推进 | 出现一次回避,换角度重新切入 | 没有回避,或回避已通过回到具体情境而化解 |
归属性这一行最需要严防,而且人类与 AI 主持人在这里的失败方式完全相同。疲惫的主持人替对方说出了价值观——"所以这是关于掌控感?"——受访者点头,因为附和比思考容易。这条链条从此看起来像数据,实际却源自访谈者。在访谈记录复核中,凡是首次出现在主持人发言中的台阶,一律记 0 分。
一套可以直接改用的追问阶梯
追问的措辞比次数更重要。请轮换使用下面这些问法,而不是一遍遍重复"为什么?"——那到第三轮就变成审问了:
- 第 1 级到第 2 级:"这让你能做到什么,是原本做不到的?"
- 第 2 级到第 3 级:"当这件事发生时,对你来说有什么不一样?"
- 第 3 级到第 4 级:"这一点为什么值得拥有?"
- 第 4 级到第 5 级:"如果这件事一直成立,那会说明你是个什么样的人?"
- 卡住或回避时:"想一想上次它没有这样运作的时候——那是什么感觉?"
- 怀疑出现停滞时:"这跟你刚才说的是同一件事,还是不一样的事?"
最后这个追问是防止虚假上升最便宜的护栏。它让受访者自己来判定层级,而不是把判断留给主持人去猜。
Qualitati 在其中的位置
Qualitati 是面向产品、UX 与消费者洞察团队的 AI 用户研究平台。它可以进行文字与语音形式的 AI 主持访谈、AI 主持焦点小组,以及带 AI 追问的对话式问卷,随后用 ThemeLens 主题分析与 QDA Workspace 分析所得的访谈记录。
就阶梯法而言,平台中有三个部分尤其相关:
- AI 主持访谈可以按阶梯协议配置——一个种子属性加一套自适应追问序列——并跨受访者并行进行,这正好解除了让大多数团队根本做不了阶梯法的排期约束。
- Active Listener 模式让人类主持人继续坐在访谈席上,同时实时推送提示并追踪章节进度。对阶梯法来说这是更保守的选项:由人来判断阶梯何时停滞,助手负责追踪对话当前处在哪一级。
- ThemeLens 可在多达 100 份访谈记录之间把编码映射到研究问题,并综合出以受访者原话为锚的主题——正是把一条条独立阶梯汇聚成近似层级价值图的那一步。
Qualitati 不做的事情,是替你按上面这份评分表给阶梯打分。阶梯质量是关于抽象层级的人类判断,我们宁愿把这一点讲清楚,也不愿暗示存在一个并不存在的自动化严谨性检查。这份评分表是供你的团队在访谈记录上执行的复核流程,可以借助平台的记录与编码工具来完成。
Qualitati 支持十种语言——英语、中文、法语、挪威语、荷兰语、德语、西班牙语、葡萄牙语、日语与阿拉伯语——这一点对阶梯法比对多数方法都更重要,因为终极价值带有文化模式,事后再翻译一条价值链会丢失受访者自己的表述框架。
局限与方法论警示
阶梯法有实实在在的批评者,而自动化只会让这些质疑更尖锐,并不能化解它们。
- 这个方法可能制造出结构。手段—目的链理论假设受访者心中存在一个层级。反复追问"为什么"无论原本是否存在层级都会产出一个层级,因为受访者天然配合。这是对阶梯法最古老的批评,对人类与 AI 主持人一视同仁。
- 收敛率指标会美化自动化系统。正如 LadderTeam 自己的结果所示,一个系统可以关闭 99% 的阶梯,同时把其中 19% 停在错误的台阶上。任何以"完成率"或"收敛率"表述的厂商指标,都应被读作过程指标,而非质量指标。
- 模拟评估不等于现场证据。这份 2026 年预印本的主要结果来自带有两种人格设定的脚本化受访者。那是隔离访谈者质量的正当做法,却不足以支撑关于真实人群的论断;作者本人也这么说。
- 反复追问存在伦理底线。攀升到终极价值意味着要求人们说出自己并未打算审视的身份主张。请披露访谈形式,允许受访者在不结束整场访谈的前提下终止某一条阶梯,并在敏感话题上保留人工复核访谈记录。可参阅我们关于 AI 主持研究中的知情同意 的指南。
- 严谨性通常丢失在汇总环节。构建蕴涵矩阵要求判断哪些不同的话语属于同一个构念。这个判断就是编码,编码有的信度问题它一样都有——参见我们关于 AI 辅助编码的评分者间信度 的讨论。
这篇文章写给谁
正在裁决路线图之争的产品经理;需要拿到客户真正用来描述自己的语言的品牌与定位团队;在调查满意度分数没能预测出的流失的洞察负责人;以及那些从文献中熟知阶梯法、却从来没有预算把它规模化跑起来的研究者。
什么时候不要用这个方法:当问题是"这个能不能用"时;当你手上没有任何候选属性作为起点时;或者当研究对象属于反复进行个人化追问会带来风险的人群时。
常见问题
阶梯法和 5 Whys 有什么不同?
5 Whys 是一种根因分析技术,向下追溯到某个机械性失效;阶梯法则向上攀升到个人价值观。两者共用一个追问词,此外别无相似之处。值得注意的是,2026 年的 LadderTeam 评估把 ACV 追问与 5-Whys、JTBD 变体做了比较,发现 ACV 在这项任务上最可靠,在迟疑型人格上达到 94.4%。
我需要做多少次阶梯访谈?
目前没有专门针对阶梯法的公开标准,我们也不会凭空发明一个。传统手段—目的链实务通常在构建层级价值图之前,为每个客群跑 20 到 40 条阶梯,理由是价值图需要足够多的重复连接才能设定有意义的阈值。请把这当作惯例而非证据,并记录你自己的停止规则。我们关于 数据饱和 的指南讲解了背后的一般逻辑。
AI 主持人能做阶梯访谈吗?
已发表的证据表明,对话式代理能够诱导出阶梯,而且能比问卷式方案获得更长的回答(Rietz 与 Maedche,2022,n=256)。至于 AI 主持人能否可靠地把阶梯终止在正确的价值层级,证据要弱得多——2026 年的模拟研究报告的终点匹配率是 81.0%。今天站得住脚的立场是:AI 主持让阶梯法在规模上变得负担得起,而阶梯质量仍然需要人工复核。
什么是层级价值图?
它是一项阶梯研究的汇总产出:一张网络图,其中节点是属性、结果与价值,边是在受访者之间出现频次高于某个选定截断值的蕴涵关系。它由一个蕴涵矩阵构建而成,该矩阵统计每个元素引向其他每个元素的次数。
阶梯法能用在焦点小组里吗?
在经典形式下效果很差。阶梯在构造上就是个体化的,而群体情境恰恰引入了会让受访者接受别人价值陈述的从众压力。如果你需要群体数据,请先做个体阶梯,再用小组去检验得出的价值话语。可参阅我们关于 焦点小组中的主导型受访者 的文章。
怎样才算一条完成的阶梯?
当受访者的回答开始描述自己而不是产品,并且继续追问只会得到重述而非新的层级时,这条阶梯就完成了。请用"这跟刚才说的是同一件事还是不一样的事?"这个追问去确认,而不要假定停滞处就是顶端。
结论
阶梯访谈法仍然是从产品属性通向"人们为什么在意它"最直接的路径;近四十年过去,它的流程被规定得足够严密,机器已经可以执行。2026 年的证据在规模上确实令人鼓舞——对话式代理拿到的回答比问卷式阶梯法更多也更长——在质量上则同样发人深省,因为已报告的最佳自动化系统仍有大约五分之一的阶梯停在了错误的高度。规模可以买。判断力要自己留着。
Qualitati 以十种语言提供 AI 主持访谈、AI 主持焦点小组、对话式问卷与 AI 主题分析。免费开始,赠送 30 个 credits——无需信用卡——或查看透明定价了解已公开的每 credit 费率。
最后更新:2026 年 8 月 22 日。本文是对公开研究与产品信息的独立编辑性综述;关于竞品与工具的表述反映的是发布之日的公开来源。阶梯质量评分表是一套复核流程,而非经过效度检验的量表——需要作出受监管或用于发表之论断的团队应寻求方法学审阅。