LLM 能做投射技术吗?2026 年六模型对比研究
Qualitati 研究团队 · 2026-09-21 · 7 分钟阅读
大语言模型(LLM)可以为词语联想、句子完成等投射技术生成合成回答,覆盖的主题与人类消费者提出的主题大量重合——但表达方式更具修饰性、风格明显不同,而且无法告诉你某种认知在人群中有多普遍。这是 2026 年 7 月一项将六个 LLM 与 173 名人类受访者对比的研究的核心结论。
什么是投射技术?为什么要用它来测试 LLM?
投射技术是一类间接的引出方法:研究者不直接让人给品牌打分或从列表中选择,而是让他们补全一句话、说出最先想到的词,或对一个模糊情境作出反应。目的是挖掘受访者在直接问卷题目中不会主动表达的联想、情绪与需求。
对合成数据来说,这比李克特量表难得多。合成受访者不仅要复现平均偏好,还要复现联想的分布——广度、重复程度,以及那些偶然冒出的独特想法。这正是 Stephen L. France(密西西比州立大学)与 Pia A. Albinsson(阿巴拉契亚州立大学)在 2026 年 7 月 7 日发布于 arXiv 的论文 Synthetic Consumer Insight Generation with Large Language Models 中试图衡量的问题。
这项研究测试了什么?
作者使用了一项早期旅游研究的人类数据,并让 LLM 完成相同任务。人类基准来自美国一所州立大学的学生样本:173 名受访者针对五个目的地——拉斯维加斯、洛杉矶、纳什维尔、新奥尔良和纽约——完成了词语联想和句子完成任务。LLM 部分是完整的因子实验,每个条件生成约 173 条合成回答,以与人类样本规模对应。
| 因素 | 测试水平 |
| 投射任务 | 词语联想;正向句子完成;负向句子完成 |
| LLM | ChatGPT 3.5、ChatGPT 4.1、ChatGPT 5.1、Gemini 2.5 Flash、Grok 4.1(非推理版)、Mistral Medium 3.1 |
| 温度(temperature) | 1.0、1.2、1.4、1.6、1.8 |
| 提示词 | 基础版(即给人类的原始措辞);扩展版;扩展版 + “从完整分布中采样”;以及在后者基础上加入 10 条或 50 条人类示例回答(few-shot) |
研究从多个维度比较回答:基础文本特征(词数、词长、停用词比例、词汇量)、六项多样性与集中度指标(包括归一化熵和 Simpson 集中度)、结构主题模型,以及针对每座城市最具区分度词汇的 “lift” 分析。
LLM 的回答与人类有多接近?
内容接近,风格不同。France 与 Albinsson(2026)发现,在合适的提示词与温度设置下,LLM 生成的回答在多样性特征上与人类数据相似,涵盖的主题也相近。作者分别对人类词语联想和最接近人类的 LLM 条件(Gemini 2.5 Flash、扩展提示词、温度 1.8)拟合九主题模型,结果高度一致——好莱坞的拥挤人潮、新奥尔良与纳什维尔的派对文化在两边都出现了。
不过,差异同样值得关注:
- 侧重点不同。对纳什维尔,LLM 的主题集中在辣味炸鸡和单身派对。人类也提到了单身派对,但它并不在人类最具区分度的前十个词里。
- 多样性的来源不同。LLM 表面上的丰富性很大程度来自自造的复合形容词——如 “walletemptying”、“bachelorettepacked”、“beignetfueled”——而不是真正不同的想法。
- 回答更长。在三项任务中,人类回答都是最短或接近最短的;LLM,尤其是高温度下的扩展提示词,写出的文字更长、更铺陈。
在归一化熵上,人类回答在两项句子完成任务中得分最高,在词语联想中排名第二——仅次于上述 Gemini 高温度条件。
哪些设置最关键?
研究者的设计选择与模型本身同样重要。作者的回归模型解释了文本特征的大部分差异,R² 从 0.538(词汇量)到 0.896(停用词比例),多样性指标的 R² 则在 0.498 到 0.688 之间。主要杠杆包括:
- 温度。温度升高使三项多样性指标全部上升、三项集中度指标全部下降(p < .001)。低于 1.0 时 OpenAI 模型几乎是确定性输出;高于 1.8 时退化、不连贯的输出比例高到无法接受。
- 提示词设计。四种扩展提示词在全部六项指标上都显著提高了多样性(24 组提示词×指标比较全部 p < .001)。为人类写的提示词,并不自动是适合 LLM 的提示词。
- few-shot 人类示例。在提示词中加入 10 条或 50 条真实回答,既保留了多样性提升,又把风格和内容拉向人类基准——一种 “更有针对性” 的多样性。
- 模型选择。与 Gemini 2.5 Flash 相比,ChatGPT 3.5、ChatGPT 4.1 和 Grok 4.1 的多样性显著更低(p < .001)。ChatGPT 5.1 比早期 ChatGPT 版本更冗长、也更多样。没有哪个模型在所有指标上都胜出。
这对研究者意味着什么
作者刻意没有给出简单的“能”或“不能”。合成投射数据适合用来探索可能联想的范围——用于构思、定性研究的预调研,或在预算紧张时补充小规模人类样本。但它不能作为估计普遍程度的依据:论文明确警告,不应用 LLM 输出来断言多少比例的消费者持有某种看法。
由此可得三条实践建议:
- 把温度、提示词措辞和示例视为研究方法的一部分并如实报告。合成数据是整套配置的产物,而不只是模型的产物。
- 不要把词汇上的新奇误当作新的洞察。检查“多样”的合成回答里究竟是新想法,还是只是新形容词。
- 保留人类基准。这项研究的价值正来自有 173 条真实回答可供对比——任何合成样本都应遵循同样的纪律。
如果你在早期探索阶段使用合成受访者,Synthetic Focus Group 与 Digital Twin Panel 等工具最适合扮演同样的角色:生成需要用真人检验的假设,而不是取代真人。
需要注意的局限
人类样本仅为一所大学的在校学生,研究领域是城市旅游,且出于成本考虑未测试最昂贵的前沿模型(Gemini 只测试了中档的 Flash 版本)。这些结果描述的是 LLM 输出在单一话题上与单一人群的比较,推广之前应先重复验证。
常见问题
LLM 能在投射研究中取代人类受访者吗?
不能。在这项 2026 年的研究中,LLM 复现了许多相同的宽泛联想,但风格与侧重点不同,作者也提醒不要用合成回答来估计某种认知的普遍程度。
生成合成开放式回答时,温度设多少最好?
在本实验中,较高温度(最高 1.8)产生了更接近人类的多样性;低于 1.0 时 OpenAI 模型几乎是确定性的,高于 1.8 则不连贯文本过多。最佳取值因模型和任务而异。
few-shot 示例能让合成数据更真实吗?
它们有助于引导。加入 10 条或 50 条真实人类回答,既保留了扩展提示词带来的多样性提升,又把风格和内容引向人类数据。
哪个 LLM 生成的投射回答最多样?
取决于指标。高温度加扩展提示词时,Gemini 2.5 Flash 和 ChatGPT 4.1 在词语联想上表现良好;而从集中度指标整体看,ChatGPT 3.5、ChatGPT 4.1 和 Grok 4.1 的多样性低于 Gemini。
最后更新:2026 年 9 月 21 日。本文是对 France 与 Albinsson(2026)第三方研究的独立编辑摘要,与作者无隶属或背书关系。完整方法与结果请参阅原始论文。