如何开展概念测试访谈(2026 年指南)
Qualitati 研究团队 · 2026-08-04 · 9 分钟阅读
简答:概念测试访谈是让受访者对一个描述出来或做成原型的产品概念作出反应,并深入追问为什么的主持式对话。采用单一概念(monadic)设计,按购买决策而非人口统计特征招募,把反应与购买意愿区分开,并把陈述性偏好当作假设 — 而不是预测。
什么是概念测试访谈?
概念测试是指在动手开发之前,把一个想法 — 产品、功能、定位语、包装或广告 — 呈现给目标受众,观察他们如何反应。Contentsquare 的概念测试指南把它定义为收集对新想法的反馈,用以判断可行性并改进最终产品。
概念测试访谈是其中的定性一半。问卷告诉你 62% 的人给某个概念打了 4 分或 5 分;访谈则告诉你他们打 4 分是因为误读了定价模式 — 这是完全不同的产品决策。包括 Qualtrics 和 Looppanel 在内的多数实务指南都建议二者结合,而不是二选一。
适合谁阅读
- 需要判断某个路线图上的赌注能否经受用户检验的产品经理。
- 希望在设计投入高保真工作之前验证概念的 UX 研究员。
- 筛选信息传达、包装或定位方案的洞察与品牌团队。
- 在写代码之前想压力测试价值主张的创业者。
核心要点
- 概念测试访谈回答概念为何成立或失败的原因;概念问卷回答程度。两者都要做,且按此顺序。
- 默认使用单一概念设计 — 每位受访者只看一个概念 — 除非你的决策本身就是在几个方案之间做选择。
- 按决策而非人物角色招募。只有真正会购买或拍板的人才是有效受访者。
- 陈述出来的购买意愿系统性偏高。只把它当作相对排序信号,绝不当作绝对预测。
- 每个概念、每个细分人群 5 到 8 场访谈是合理的探索性下限;人群异质性高时要往上加。
第一步:先写决策,再写访谈提纲
概念测试最常见的失败,是做了一个什么都改变不了的研究。在起草任何问题之前,先写下这样一句话:
"如果受访者的反应是 [X],我们就 [做 A];如果是 [Y],我们就 [做 B]。"
如果你无法用团队真正会采取的行动填满这两个分支,那你做的是自我安慰,而不是研究。要么砍掉这个研究,要么重新界定决策。
第二步:选择概念测试设计
设计决定了你的数据能支撑什么、不能支撑什么。截至 2026 年 8 月 4 日,实务中常用的三种设计各有取舍:
| 设计 | 做法 | 最适合 | 主要风险 |
| 单一概念(monadic) | 每位受访者只看一个概念 | 对单个概念获得干净、无污染的读数 | 要比较多个方案需要更多受访者 |
| 连续单一概念 | 每位受访者按轮换顺序看多个概念 | 用较小样本比较 2–4 个方案 | 顺序与疲劳效应;靠后的概念得到的反应更浅 |
| 对比 / 选择式 | 多个概念并排呈现 | 明确的权衡决策与优先级排序 | 会逼出市场上其实并不存在的偏好 |
定性工作默认选单一概念设计。并排对比会制造出差异化:即使真实顾客在市场上单独遇到其中任何一个都察觉不到区别,受访者也一定会在两个概念之间找出差异。Decision Analyst 那份历史悠久的概念测试白皮书就"独特性"陷阱提出了相关论点 — 测试环境中的新奇感,与购买环境中的差异化并不是一回事。
第三步:按决策招募,而不是按人口统计
"B2B SaaS 公司的 UX 研究员,25–45 岁"是人口统计。"过去 12 个月内为团队选过研究工具的人"才是决策。第二种甄别问卷得到的是你能据以行动的概念反馈;第一种得到的只是意见。
实用的甄别规则:
- 按近期行为甄别,不要按声称的兴趣。"过去 90 天内你是否做过 X"胜过"你会不会对 X 感兴趣"。
- 至少纳入一个理应拒绝该概念的细分人群。人人都喜欢的概念,通常是描述得太模糊,让人无从反对。
- 排除职业受访者,以及任何能说出你公司是赞助方的人。
- 确保受访者池真正反映目标受众,而不是碰巧方便找到的人 — 不具代表性的反馈是导致代价高昂的错误结论的常规路径。
第四步:呈现概念,但不要推销它
概念刺激材料应当中性、完整、平淡。三条规则:
- 不要使用你不会写进法律文件的形容词。"无缝""毫不费力""强大"会污染受访者的反应。描述它做什么就好。
- 写出价格,或者明确说明价格尚未确定。没有价格的概念,是在一个想象中为零的价格下被评价的,其反应对开发决策毫无价值。
- 各概念之间保持保真度一致。无论底层想法如何,精致的视觉稿总会赢过纯文字描述。
第五步:走完追问阶梯
下面是 Qualitati 概念追问阶梯 — 针对每个概念的五级追问序列。每一级都必须问透才能进入下一级;直接跳到第 4 级,正是团队最终只拿到客气而无用数据的原因。
| 层级 | 目标 | 示例提问 |
| 1. 理解 | 确认他们在无提示下理解了这个概念 | "用你自己的话说,这是什么,是给谁用的?" |
| 2. 相关性 | 把概念定位到他们真实的生活或工作流中 | "你上一次遇到这个概念要解决的问题是什么时候?带我走一遍。" |
| 3. 反应与理由 | 同时拿到评价和其依据 | "你的第一反应是什么?具体是什么在驱动这个反应?" |
| 4. 替代 | 识别真正的竞争集合 | "如果它明天就存在,你会停止做什么?" |
| 5. 采纳成本 | 暴露那些扼杀好概念的阻力 | "在你能用上它之前,还需要谁点头同意?" |
第 4 级是最少被用到、也最具诊断力的一级。一个反应热烈、却答不出"你会停止做什么"的概念,就是一个背后没有预算的概念。
要避免的问题
- "你会用这个吗?" — 几乎没有预测力;改问他们今天实际在做什么。
- 把"你愿意付多少钱?"当作开放题 — 只会产生锚定噪音。应当测试具体价格点。
- "你喜欢蓝色还是绿色?" — 在概念本身尚未验证之前就问细节偏好。
- 任何自带答案的问题("如果有……会有多大帮助?")。
第六步:分析反应,而不是评分
概念测试访谈的分析单元是理由,不是分数。对每份访谈记录编码四件事:
- 误读 — 受访者在理解错误时,以为这个概念是什么。把这些聚类;它们通常是文案问题,而不是产品问题。
- 异议 — 区分针对概念本身的异议和针对描述方式的异议。只有前者才应当改变路线图。
- 替代对象 — 用受访者自己的话说出,这个概念会取代什么。
- 采纳障碍 — 审批、集成、切换成本、合同。
然后统计频次。如果 8 位受访者中有 7 位误读了同一句话,这个发现的决策价值远高于 3.8 的平均分。
Qualitati 概念测试就绪度记分卡
在正式执行之前给你的研究打分,满分 10 分。低于 7 分,产出的数据只会让团队争论,而不会让团队行动。
| # | 标准 | 通过条件 |
| 1 | 决策界定 | if/then 决策的两个分支都已写下,且团队都能接受 |
| 2 | 设计匹配 | 除非决策确实是在多个方案间做选择,否则采用单一概念设计 |
| 3 | 甄别有效性 | 按明确的近期时间窗内的行为甄别,而非按声称的兴趣 |
| 4 | 可证伪人群 | 至少纳入一个有可能拒绝该概念的细分人群 |
| 5 | 刺激材料中性 | 无推销性形容词;各概念保真度一致 |
| 6 | 呈现价格 | 展示了价格,或明确的价格占位说明 |
| 7 | 追问深度 | 每个概念的提纲都触及第 4 级(替代) |
| 8 | 样本下限 | 每个概念、每个明确细分人群 ≥ 5–8 位受访者 |
| 9 | 分析计划 | 编码框架在执行前写好,而不是事后补 |
| 10 | 定量跟进 | 对任何会牵动重大投入的定性信号,已有量化定级计划 |
概念测试访谈需要做多少场?
对探索性概念工作而言,每个概念、每个有实质差异的细分人群 5 到 8 场访谈,是一个站得住脚的起点。这个逻辑借自可用性研究:Nielsen Norman Group 的五用户经验法则建立在同质用户群体内边际收益递减之上 — 而 NN/g 明确指出,该法则只是迭代的起点,并不适用于定量测量或异质受众。
这条注意事项在概念测试中比在可用性测试中更重要。可用性问题是界面的属性,会在不同用户身上重复出现;概念反应则是个人处境的属性,不会重复。如果你有三类买家,你就有三个研究,而不是一个。
Qualitati 在其中的位置
Qualitati 是一个面向产品、UX 与客户洞察团队的 AI 用户研究平台。具体到概念测试:
- AI 主持访谈(文字或语音)会对每一位受访者一致地走完追问阶梯,所以不会因为访谈拖长就跳过第 4 级。
- 对话式问卷具备 AI 驱动的追问与分支逻辑,让你能以问卷的规模做概念测试,同时仍然捕捉每个评分背后的原因。
- Active Listener 模式在概念敏感到需要真人在场时,为人类主持人提供实时提示与章节追踪。
- ThemeLens 可一次对至多 100 份访谈记录做主题分析,并把编码映射到研究问题 — 这正是你从单一概念研究中快速得到误读与异议聚类的方式。
- QDA Workspace 支持按上文四类编码框架做演绎编码,也支持对你未曾预料之处做归纳编码。
- 多语言研究覆盖 10 种语言,适用于跨市场测试的概念。
定价按 credit 公开列出,新账户注册即获 30 credits,无需信用卡。查看透明定价或用 30 credits 免费开始。
局限,以及什么时候不该用这个方法
概念测试访谈有实实在在的方法论天花板,值得直说。
- 陈述性偏好不等于显示性偏好。人不擅长预测自己未来的行为,而访谈情境会放大迎合倾向。概念访谈能排序和解释,但不能预测采纳率。
- 新奇会抬高分数。任何新东西相对于熟悉之物都测得更好。要对照一个你此前执行过的基准概念,而不是对照零。
- 小样本定性研究无法测算市场规模。若决策涉及重大投入,请在访谈之后补一个功效充足的定量测试。
- 不要用概念访谈定价格点。请使用专门的定价研究方法;访谈中开放式的支付意愿问题会产生锚定假象。
- 概念不可实现时不要做。测试工程上已经排除的东西,只会消耗受访者的善意和团队的信誉。
- AI 主持的注意事项:AI 主持人能一致地执行提纲,但读不懂现场气氛。对于情绪负荷重或高度敏感的概念,人类主持人 — 可辅以 Active Listener — 仍是更好的工具。任何会在正式发表研究中承担分量的方法论主张,使用前都应由人类研究者审阅。
结论
当概念测试访谈围绕一个决策来构建、采用单一概念设计、按行为招募、并一路追问到替代与采纳成本时,它才对得起自己的成本。在定量测试之前做它,编码理由而非评分,并对陈述性意愿的数字保持克制。
常见问题
概念测试和可用性测试有什么区别?
概念测试评估一个想法值不值得做;可用性测试评估做出来的东西能不能用。概念测试发生在设计投入之前,可用性测试在之后。二者的方法、样本逻辑和成功标准都不同。
一场访谈里能测几个概念?
在连续单一概念设计中测 2 到 4 个,并在受访者之间轮换顺序。超过 4 个,疲劳会把靠后的反应压平,数据也就不再可比。
AI 能主持概念测试访谈吗?
可以。AI 主持访谈能对大量受访者同时执行一致的追问序列并作自适应追问,这很适合概念测试,因为其提纲高度结构化。敏感或情绪复杂的概念仍然更适合人类主持人。
概念测试时应该展示价格吗?
应该,或者明确说明定价尚未确定。没有价格就被评价的概念,实际上是在零成本下被评价的,这会抬高之后的每一个信号。
只做定性概念测试够吗?
就方向判断和问题诊断而言,往往够。但涉及重大投入的 go/no-go 决策则不够 — 请补一个样本量足以侦测到会改变你决策的差异的定量概念测试。
每个概念需要多大样本?
每个概念、每个明确细分人群 5 到 8 位受访者是合理的探索性下限。真正决定所需样本量的是人群异质性,而不是总人数。
开始使用
在 Qualitati 上运行一次 AI 主持的概念测试、一份对话式问卷,或一个主题分析项目。用 30 credits 免费开始 — 无需信用卡 — 或比较透明的按 credit 定价。也可参阅我们关于撰写 AI 主持访谈提纲、为 AI 主持访谈设计甄别问卷以及开展持续发现访谈的指南。
最后更新:2026 年 8 月 4 日。本指南是对公开方法论资料的独立编辑性综述;文中产品描述仅涉及 Qualitati。