如何用 AI 做日记研究(2026 操作指南)
Qualitati 研究团队 · 2026-08-11 · 9 分钟阅读
一句话回答。日记研究(diary study)要求受访者在自己的真实情境中,连续数天或数周记录经历,因此你捕捉到的是真实发生的事,而不是事后回忆的版本。用 AI 来做,关键是:把作答节奏压低、把单次记录做短、让 AI 主持人对每条记录只追问一次,并把抽样、知情同意和结果解读留给人。依从性设计比工具选择更重要。
最后更新:2026 年 8 月 11 日
为什么要做日记研究?
大多数产品团队已经在做访谈。当研究问题带有一个单次访谈够不到的时间维度时,你才需要补上日记研究:习惯是如何形成的、每周工作流中挫败感在哪一刻达到峰值、新用户引导之后态度如何漂移、真实一天中哪些时刻产品完全没有触及。Nielsen Norman Group 把日记研究描述为一种纵向方法,它产出受访者自我报告的行为与态度记录,研究者事后分析这些记录以理解习惯与模式(NN/g)。
这个取舍是真实存在的。访谈排期便宜,但用它来支撑"多久发生一次"这类频率结论并不可靠。日记研究正好相反:数据贴近事件发生的那一刻,难点在于让人持续记录下去。
要点速览
- 日记研究降低回忆偏差,但引入了依从性问题——请先把依从性问题设计好。
- 已发表的经验取样研究显示平均作答率接近 78%,并且在天与天之间、一天之内的不同时段都存在可预期的衰减。
- 取样频率是一个设计杠杆:2026 年《Field Methods》的一项研究中,把提示分散到全天的效果优于压缩进一个短时段。
- 样本流失的主战场是新手引导环节,而不是日记本身——而且流失并非随机。
- AI 帮助最大的是两个接缝:对每条记录做一次自适应追问,以及最后跨受访者的主题综合。它救不了一个设计糟糕的作答节奏。
关于依从率,证据究竟说了什么
日记研究与经验取样法(ESM)同属一个方法家族,而 ESM 被测量的严谨程度远超用户体验实践通常承认的水平。有两项发现值得据此做设计。
1. 平均依从率尚可,且衰减可预期。在一项 ESM 元分析中,Rintala、Wampers、Myin-Germeys 与 Viechtbauer(2019,《Psychological Assessment》)报告平均作答率为 78%(95% CI 74-82)。在这一均值内部,作答率在 12:00 至 13:30 之间最高(83%),在 07:30 至 09:00 之间最低(56%);参与度随研究进程下降,到第 5 天降至 73%(PubMed)。
把它读成三条设计指令:不要在清晨第一时间发提示;预期到第一周结束时大约四分之一的记录会缺失;把"第 5 天记录变少了"当作方法本身的已知属性,而不是研究失败。
2. 频率与新手引导决定了你的样本。Ohme、Charlton、Toth、Araujo 与 de Vreese 发表于《Field Methods》(线上 2025 年 10 月 15 日;第 38 卷第 2 期,2026 年 5 月)的研究,把 250 名荷兰受访者随机分入两种为期七天的设计:每日分散型(7 份问卷分散在 14 小时内)或每小时密集爆发型(12 份问卷压缩在 2 小时窗口内)。分散型条件的依从率显著高于爆发型条件(Field Methods)。
最该拿给利益相关方看的是流失数字。在 1,411 名初始招募者中,只有 250 人——17.82%——完成了移动端 ESM 流程,而且系统性流失集中在新手引导阶段。真正进入 App 的受访者偏向更年轻、受教育程度更高、更懂技术;作者报告年龄、教育、技术熟练度与隐私素养都能显著预测参与。换句话说,日记研究的招募漏斗本身就是一件抽样工具,而且是有偏的那种。
作答节奏决策矩阵
作答节奏是最可能让一项日记研究翻船的单一选择。请从研究问题出发来选,而不是从日历出发。
| 研究问题 | 作答节奏 | 周期 | 单次时长 | 主要风险 |
| 新手引导之后习惯如何形成? | 每天 1 条,晚间 | 2-3 周 | 2-3 分钟 | 后半周衰减 |
| 每周工作流在哪里断裂? | 事件触发,受访者自行发起 | 2 周 | 3-5 分钟 | 常规事件被漏报 |
| 一天之内情绪如何变化? | 3-5 次提示,分散在清醒时段 | 5-7 天 | 60-90 秒 | 疲劳;样本偏向时间充裕者 |
| 某个罕见时刻前后发生了什么? | 事件触发外加每周一次回顾 | 3-4 周 | 5 分钟 | 数据非常稀疏 |
| 不同市场的体验差异何在? | 每天 1 条,使用受访者母语 | 2 周 | 2-3 分钟 | 分析阶段的翻译漂移 |
由上述证据可得两条规则。把提示分散到全天,而不是扎堆。以及,如果必须在"每天更多次"和"更多天数"之间选择,请选更多天数——拥挤的一天之内的衰减,比节奏合理的一周之间的衰减更陡。
AI 真正能帮上忙的地方
诚实的表述是:AI 改善两个特定接缝,方法的其余部分并不因它而改变。
接缝一:对每条记录的追问
日记记录的典型弱点是太单薄。受访者写下"今天这个 App 挺烦人",研究者四天后才读到,早已错过追问到底发生了什么的时机。AI 主持人可以在当下提出一次结合上下文的追问——这正是一行日志与一条可用观察之间的差别。
这里需要克制。追问一次,不是三次。如果每天晚上的一条日记都膨胀成一场访谈,那是最快丢掉整个样本池的方式;NN/g 一贯的建议是让记录保持简短,并与受访者保持联系,以降低疲劳与脱落。
接缝二:跨受访者、跨天数的综合
一项为期三周、25 名受访者、每天一条记录的研究,会产生约 525 条记录——做统计太少,手工编码又太笨重,而这恰恰是分析最容易被悄悄跳过的规模。AI 辅助的主题分析适合这种体量的语料,前提是编码手册由人掌控、引文由人复核。我们关于分析开放式作答的指南把同一套模式应用在问卷文本上。
AI 帮不上忙的地方
它修不好一个索求过多的作答节奏,找不回在新手引导阶段流失的受访者,也无法告诉你一条缺失的记录意味着"今天什么都没发生"还是"我放弃了"。日记数据中的缺失本身携带信息,解读它是人的工作。
Qualitati 日记研究设计清单
在招募之前逐条走一遍。每一条都对应一种在纵向定性设计中反复出现的失败。
- 把带时间维度的问题写清楚。如果一次访谈就能回答,那就去做访谈。
- 从上面的矩阵中确定作答节奏——并写下理由,免得在实地执行中途被重新谈判掉。
- 把单次记录时长封顶在 3 分钟,并在上线前找两个人试跑计时。
- 避开 07:30-09:00 的提示窗口;锚定在中午或晚间。
- 为新手引导阶段的流失留预算,而不只是日记期的脱落。假定从邀请到第一条记录之间的漏斗才是流失主战场。
- 事先确定最小可用数据量:分析开始变得有意义所需的受访者数 x 天数。
- 把每日提问写成模板,而不是每天新拟一道题,这样记录之间才可比。
- 每条记录只允许一次自适应追问。
- 规划好告知。如果由 AI 主持记录,受访者应在同意之前知情。
- 提前定好缺失处理规则——什么算一份完成的日记,部分完成的日记如何进入分析。
每日记录模板
一份可复用的每日模板,刻意保持简短:
- 今天你用 [产品/任务] 做了什么?(开放文本)
- 过程怎么样?(1-5 分,外加一句话)
- 有没有哪个瞬间特别突出 - 好的或坏的?(开放文本,选填)
- 自适应追问:基于上一题作答生成的一次探问,仅在记录中出现了没有给出理由的评价性表述时才提出。
最后一行就是 AI 的全部贡献。请把它限制在这个范围内。
Qualitati 适配在哪里
Qualitati 是一个面向产品、UX 与客户洞察团队的 AI 用户研究平台。就日记研究而言,相关能力包括:
- 对话式问卷,具备 AI 驱动的追问与分支逻辑——正是"一条简短的每日记录 + 一次自适应探问"的天然载体。参见什么是对话式问卷。
- ThemeLens 主题分析,一条 map-reduce 流水线,可一次跨最多 100 份访谈记录运行,把编码映射到研究问题,并用带受访者出处的引文综合主题——这正是多周日记语料所形成的工作形态。
- QDA Workspace,用于归纳式与演绎式编码以及编码手册生成,适合你想自己掌控编码手册、而不是直接接受机器生成结果的场景。
- 10 种语言的多语言研究(英语、中文、法语、挪威语、荷兰语、德语、西班牙语、葡萄牙语、日语、阿拉伯语),因此跨市场日记研究可以用每位受访者的母语进行。参见如何开展多语言访谈。
- 透明定价:注册即赠 30 积分的免费额度,无需信用卡,并在定价页公开按积分计费的用量费率。
Qualitati 不提供带推送通知的专用移动端日记 App。如果你的设计依赖在固定时点进行原生移动端提示,请单独规划这一层。
局限与取舍
有三点值得直白说明。
自我报告终究是自我报告。贴近事发时刻的记录降低了回忆偏差,但并不消除社会赞许性偏差;而且"知道每天晚上要交一条记录"这件事本身,就可能改变被测量的行为。
这些依从率数字来自相邻领域的文献。上文的 78% 均值与 17.82% 完成率,来自社会科学与临床研究中的经验取样,而非带商业激励的 UX 日记研究。请把它们当作对流失形态的校准,而不是对某个具体样本池的预测。
真正威胁效度的是非随机脱落。如果坚持记录到底的正是本来就喜欢这个产品的人,那么三周热情洋溢的记录读起来会很像证据。在你展示任何一个主题之前,先把完成者的画像与起始样本做对比。这类方法学判断,值得交给团队里的研究者复核,而不是照单全收任何工具给出的结论——包括我们的。
适合谁 - 以及什么时候不该用
在以下情况使用日记研究:问题涉及变化、频率或你无法观察到的情境;体验分散在一整周而非集中于一次会话;或者已知回忆不可靠。
在以下情况不要用:你这周就要答案;行为只发生一次且容易记住;某个可用性问题更适合通过观察对方完成任务来回答;或者你无法安排一个人在实地执行期间随时阅读记录。
常见问题
日记研究应该做多久?
常见区间是两到四周。少于一周通常捕捉不到变化;超过四周则会不断累积流失,除非所研究的现象本身确实变化缓慢,否则收益不成比例。
需要多少受访者?
日记研究通常招募 10-30 人,因为每人贡献多条记录。请为"招募到首条记录"之间的显著流失留出余量,并按完成日记的目标数量来招募,而不是按邀请数。
应该预期怎样的依从率?
已发表的 ESM 研究平均约有 78% 的提示被作答,并随天数下降(Rintala 等,2019)。带明确激励的商业 UX 研究可能更好;没有激励的往往更差。
AI 可以主持日记记录吗?
可以,但仅限于"对每条记录提出一次结合上下文的追问"这一狭窄任务。请在知情同意阶段告知、把追问次数固定住,并让人在实地执行期间就阅读记录,而不是只在最后才看。
日记研究和纵向问卷有什么区别?
纵向问卷在多个时间点重复同一批封闭式题目,用以测量固定维度上的变化。日记研究收集开放的、带情境的叙述,让维度从记录中自行浮现。
怎样分析日记数据才不会被淹没?
随记录到达即时编码,而不是最后一次性处理;把编码手册牢牢掌握在人手中;用 AI 辅助的主题分析做跨受访者综合 - 然后用带出处的受访者引文逐一验证每个主题。
结论
当研究问题里带着一只时钟时,日记研究就值得做。这个方法的失败模式不在分析环节 - 而在依从性,而依从性早在实地执行开始之前,就由作答节奏、单次时长、提示时点和新手引导漏斗决定了。AI 值得占据的位置只有两个狭窄的槽位:每条记录一次自适应追问,以及最后的综合。其余部分,请自己设计。
免费开始,赠送 30 积分 - 无需信用卡 - 即可运行对话式问卷形式的日记记录、AI 主持访谈,或一个 ThemeLens 主题分析项目。也可以先查看透明定价。
本文为独立编辑性综述。方法学表述依据截至 2026 年 8 月 11 日的公开信息。你自己研究中的设计选择,应由具备资质的研究者复核。