夜雨聆风学习资料网

ARTICLE · 1114175

AI合成用户能替代真人调研吗?

AI合成用户能替代真人调研吗?

如果你管理一家初创团队,或者作为独立开发者做出一款新产品,

很大概率在社交媒体上刷到过这类宣传:

厂商在首页打出的数字令人心动: 85% 准确率、90% 相关性、几分钟出洞察。

很多人以为这是某种刚刚成熟的黑科技。

但如果你顺着首页横幅,

一路翻进这些团队公开的技术白皮书、底层评测方法文,

或是他们引用的基础论文最深处的附录,

会读到一套完全相反的陈述。

驱动本文的五句关键判断,

全部出自这个赛道里最头部的商业公司与最权威的基础研究团队:

01 / 架构能否迁移?

这句话出自斯坦福大学 Joon Sung Park 等人的论文预印本 arXiv:2411.10109 第三版(v3)局限性章节第四条。

这篇论文中途改过题名:

v1:《Generative Agent Simulations of 1,000 People》(一千个人的生成式智能体模拟)

v2 起:《LLM Agents Grounded in Self-Reports Enable General-Purpose Simulation of Individuals》(基于自述构建的大模型智能体可实现个体的通用模拟)

几乎所有售卖「合成用户」或「合成受访者」的商业 SaaS,

都在发布会或融资幻灯片里把这篇论文奉为科学基石。

然而,正是这篇基石论文的作者们,在 2026 年 6 月更新的 v3 中清清楚楚写道:

他们验证过的所有结论,仅建立在特定闭源模型之上;这套架构换到最常见的 Llama 或 Qwen 等开源模型上能否成立,依然是一个完全未知的开放问题。

更具讽刺意味的是: 自述估值达到 20 亿美元的赛道领头羊 Simile,在 2026 年 8 月披露的技术博客中承认,

自家基座模型正是基于 Qwen3.5-27B 微调而来。

一边是基础研究者在附录里坦陈「换成 Qwen 行不行,不知道」; 另一边是商业公司用微调版 Qwen 宣称能够

「预测任何人在任何情境下的行为」。

那个著名的「85%」,究竟是怎么算出来的?

要看懂这个落差,必须拆解论文演进过程中,那个著名的「85%」的数学构造。

2024 年 11 月论文发布 v1:

团队找来 1,052 名美国真实受访者,每人进行两小时深度访谈;

用访谈语料构建合成受访者,替他们回答包含 177 道题目的社会调查问卷;

结果显示:合成受访者对上真实答案的原始准确率是 68.85%。

68.85% 怎么就变成了 85%?

因为 85% 实际上是一个相对折算值: 研究团队让同一批真人参与者两周后把同样问卷重做一遍,真人两次复述自己的重合度是 81.25%。

论文团队把「真人两次复述自己」的 81.25% 设定为满分天花板,做了一个除法:

$68.85% \div 81.25% \approx 84.74% \approx 85%$

所谓论文里的 85%,根本不是「AI 对现实行为的预测准确率达到了 85%」。 它的真实定义是: 「在回答静态选择题时,合成受访者复现一个人两周前自我认知一致性比例的 85%。」

当这个数字流传到大众媒体,分母开始丢失:

2025 年 2 月,IBM 报道时还完整带上了分母;

2026 年 3 月,《Nature》新闻特稿报道同一个数字时,句子变成了:

合成受访者「在回答问卷时准确率为 85%」——「隔两周」那半句被彻底吞掉了。

到了 2026 年 4 月的 v2,题集精简为 150 道。分母基准变为 79.53%,原始对上率降为 65.67%,最终折算出的头条数字从 85 降为:

访谈版:83%

问卷版:82%

问卷加访谈:86%(对纯人口学基线 74%)

到了 2026 年 6 月的 v3,作者在正文末尾正式列出了五条编号局限:

  1. 相关性脱轨:引用范德堡大学 Bisbee 等人的实证,大模型模拟回答估算出的效应系数,有 48% 与真人基准存在显著差异;在偏离的系数里,有 32% 连正负影响方向都是颠倒的;
  2. 效应量系统性放大:合成受访者模拟实验会把处理组和对照组之间的细微差异,报得比真实人类实验更大;
  3. 跨文化未知:全部数据均来自英语语料,非英语及跨文化情境是否等效完全未知(而 Simile 官方开篇案例恰恰是巴西老年人买薯片);
  4. 统计学增益虚无:基于两小时深访构建的合成受访者(83 分),与仅仅填了一张基础问卷构建的合成受访者(82 分),在统计学上分不出高下($p = .16$);在经济博弈实验中,5 种复杂构建方案无一显著战胜纯人口统计学基线($p = .16$)。

花两个小时深度访谈真人并喂给大模型,在统计学意义上,并没有显著胜过一张简单的基础信息表。

02 / AI还不如盲猜

这句话出自欧洲合成用户代表厂商 Synthetic Users(简称 SU) 在 2026 年 7 月发布的底层技术实测报告。

执笔者正是 SU 的创始人与研究员。

然而,在 SU 官网首页的首屏横幅上,赫然印着巨大的宣传语: 「85-92% 准确率」。

翻遍宣称 85-92% 的那篇方法文,这两个数字仅存在于大标题中。

正文实际测试样本小得惊人: 仅 8 位真人受访者对比 8 位合成用户,针对单一场景做了一道题,自家团队设定评分权重,用「一个简单的 GPT」完成打分。

0.106 vs 0.100:一场自杀式的诚实披露

但在 2026 年 7 月的定量研究中,SU 展现出了近乎自杀式的学术诚实。

团队使用 Ipsos 在斯洛伐克针对 1,000 名真人进行的民意调查(包含 12 个是/否问题)检验自身模型。

他们引入了统计学上的全变差距离(TVD)来量化模拟误差。

TVD 相当于一把校秤: 测量真实人群与合成受访者在概率分布之间的错位有多大。

数值越小越好:0 代表完美重合,1 代表彻底对立。

在这项留出测试中,SU 公布了三组核心数据:

未经校准直接生成:TVD 误差为 0.181;

拟合圈内(模型看过的题目):TVD 误差可以压到 0.066;

留出题目(从未见过的题目):TVD 误差回升到 0.106。SU 称这 0.040 的落差为「泛化的代价」。

但残酷的真相隐藏在基准对照里:

抽样下限 0.024:从同样人群中重抽 1,000 名真人做调查,两批真人之间本身就会存在的自然噪声;

零信息盲猜锚 0.100:完全不使用任何 AI 模型,闭着眼睛根据当地人口普查年龄性别去瞎猜,产生的期望误差正是 0.100。

对比结果一目了然: 当合成受访者在留出题目上跑出 0.106 的 TVD 时,

对比 0.100 的零信息盲猜基线(TVD 越小越好)—— AI 不仅没赢,反而输给了盲猜。

SU 计算了模型综合技能分(Skill Score,0 分代表打平盲猜,正数才代表赢过盲猜): 最终得分是 −0.07。

面对这个输给瞎猜的负分,团队在报告中写下一句自评原话:

更致命的是同质化: 团队让模型生成了 400 个合成受访者,但答题路径展开后发现,他们实际上只呈现出 51 种不同的答案组合。

表面上拥有不同姓名、职业的数字分身,核心逻辑高度同质化。

03 / 谁是外部评级者?

这句话出自自述估值 20 亿美元的 Simile 在 2026 年 8 月发布的技术博客《Building confidence in Simile》。

在同一家公司的官网上,展示着完全不同维度的商业野心:

B 轮融资宣布帖中写着要「确证地预测未来」;

官方使命写着「预测任何人在任何情境下的行为」;

在 AWS Marketplace 挂出高达 1,500 万美元的 36 个月企业大单。

0.736:衡量的是质检员,不是流水线零件

Simile 在文章中公布的核心指标是一个达到 0.736 的 AUROC 分数。

很多非专业买家极容易把它误读为「AI 预测消费者行为的准确率达到了 73.6%」。

但 AUROC 是一个二阶指标: 它衡量的不是工厂流水线上的零件合格率有多高,而是质检员挑出次品的能力准不准。

0.736 量度的是:Simile 的置信度模型去判断「某次合成受访者模拟误差是大是小」的判别力,而不是模拟本身的准确率;

如果仅仅利用基础人口特征去预测误差,AUROC 只有 0.566(0.5 即纯随机瞎猜)。

那么质检的合格红线又是怎么定出来的? Simile 定义了一条「决策级(Decision-Grade)」红线:TVD < 0.16(单项绝对偏差不超过 16 个百分点)。

而这个 0.16 的分水岭,是由 Simile 自家的 14 位团队成员,通过约 2,750 次人工主观打分定下来的。 这就是为什么作者在文末写下了那句引语:他们期待未来能有更多来自外部独立评级者的检验。

在全篇方法文中,Simile 仅给出一例直接呈现模拟输出的真实案例: 佛罗里达州外卖小费意愿调查,模拟 93.4% 愿意给小费,真人基准为 87.3%,TVD 误差为 0.0615(过线)。

而在官网首页展示的电动车调研中,百分比分布打上的却是未公布具体含义的中间置信标签。

04 / 难的部分当然是把预测做对

这句话出自 Simile 联合创始人 Bernstein 2026 年 9 月的长文《Building the What-If Machine》。

通篇没有出现任何准确率数字,全篇仅有的两个量化数据是 Zillow 房产算法失败导致的 3.04 亿美元资产减值,以及一个假想中的 9% 涨价推演。

如果说欧美团队把局限写在附录与技术博客里,国内的包装则激进得多。

消失的分母与多重「85%」

典型标本是 atypica: Pro 档月费 129 元,宣称「几分钟出洞察」。官网不同角落并存着四个截然不同的 85:

英文首页横幅的「85% 行为准确率」;

中文首页的「85% 模拟准确率 / 行为一致性」;

某功能介绍里的「研究成本降低 85%」;

方法页深访档位的「85 分」。

拆解其方法页的五档语料一致性评估体系:

基础人口学:55 分

+性格量表:64 分

+企业会员消费记录:73 分

+社交媒体公开发言:79 分

+1 至 2 小时真人深度访谈:85 分

在 atypica 的定义中,这套百分制分数的满分 100 分,代表「真人隔两周复述自己的一致性基准(81%)」。

如果按照其自身设定的规则进行严格数学还原: 85 分 × 81% 基准,折回原始口径的真实重合度,仅约 68.9%。 厂商在宣传材料中从未主动向买家说明这个接近 69% 的折回值。

更值得警惕的是合成受访者的构成: 在其宣称的 30 万社媒分身与 1 万深访分身中,真正具备高信息密度的深访分身仅占约 3%(若按其百万分身口径计算则仅 1%)。

2026 年 7 月,atypica 工程博客自曝典型故障: 交付报告中赫然写着「一位 26 岁受访者表示要在加班后奖励自己一杯某饮品」,经后台数据回溯,库内没有任何真人说过这句话,纯属 AI 幻觉编造。

05 / 买方自查工具箱:四问与三格

面对扑面而来的「合成用户」或「合成受访者」推销,小团队决策者不需要成为统计学专家,只需掌握以下两组工具。

买方必问的四个问题

与任何销售沟通时,逐字抛出这四个问题:

你的数字是哪个词? 是准确率(Accuracy)、保真度(Fidelity)、一致性(Consistency)、相关系数(Correlation),还是二阶判别力(AUROC)?

分母是什么? 是完全没见过的全新留出题目,还是看过的拟合数据?是预测未来购买行为,还是静态模仿做选择题?

谁验的、拿谁的数据验的、验的人跟你什么关系? 完全独立的第三方机构还是内部自测?人类真实基准样本量多大?

首屏数字,在最深的技术文本里找得到吗? 对应白皮书哪一页哪一行(检索时请同时匹配厂商的专有术语)。

Ctrl+F 三格自查表

打开厂商提供的白皮书或论文,按下 Ctrl+F 搜索首页宣传的核心数字:

归类格子判定标准行业现状第一格:找得到且同口径首页指标在深层技术文档中有完全一致的留出实验支撑、明确分母与第三方独立复核目前完全空着。本轮调研涉及的所有商业标本无一达标。第二格:找得到但口径降级文档里能搜到,但属于旧版残留、折算分、最新版已下调或被正文末尾局限严格限定斯坦福论文(85 降为 83、加附录五条局限);Simile(0.736 为二阶质检指标且期待外部评级);atypica(85 分折回真实口径约 68.9%)。第三格:找不到出处 / 不可审计核心数字在深层文档中根本找不到量化链条,算法过程与训练数据完全不披露Synthetic Users(85-92% 中的 92 端全站无出处);Aaru(无技术白皮书、训练数据与模型算法完全不披露,不可审计)。

06 / 两者不可互换

这句话出自

全球民意测验与咨询权威盖洛普(Gallup)在 2026 年 5 月发布的方法论专栏。

这是整篇调查中,唯一出自真实采购客户侧的一手严正声明。

盖洛普使用约 1,000 名真人面板对照测试后,通篇未给任何夸张百分比,唯一结论是模拟分布「值得继续探索」,并划出了四道制度红线。 第四道正是:两者不可互换,永远不要用暗示直接测量真实人类的语言,来包装模拟出来的生成数据。

合成受访者真的一无是处吗?

并非如此。

美国用户体验咨询公司 Nielsen Norman Group与电商转化优化机构 The Good的评测指出: 把合成受访者当作低成本的「头脑风暴发散器」或「界面可用性启发式审查时,它能快速发现明显的逻辑漏洞与问题严重度排序。

它适合作为桌面研究的起点,但绝不能替代真实行为数据。

学术界也在探索真正有效的校准路径: Krsteski 等人(2025)研究指出,纯 AI 生成的合成受访者数据偏差高达 24%-86%;

但如果引入约 100 个真实人类回答(约占样本 1%)作为锚点进行后验校准,系统偏差能大幅压至 5% 以下。

但正如统计学家 Hullman 等人(2026)的方法论判决: 单纯去调整提示词或给模型做微调,根本无法从数学上保证它对未来行为预测的稳健性。

对于资源极度宝贵的小团队而言,

最致命的陷阱

是把大模型吐出来的「统计平均话术」,误当成了真实客户掏出真金白银时的行为决策。

核心参考文献索引

[1-3] Park 等,斯坦福生成式智能体论文预印本(v1/v2/v3) →

arXiv:2411.10109v1[1]

·

v2[2]

·

v3[3]

[4] Bisbee 等,《Political Analysis》32:401-416,2024 →

DOI: 10.1017/pan.2024.5[4]

[5] Marek 等,脑关联研究样本量与效应量陷阱,《Nature》603:654-660,2022 →

DOI: 10.1038/s41586-022-04492-9[5]

[6] Ashokkumar 等,大模型预测社会科学实验,《Nature》656:115-122,2026 →

DOI: 10.1038/s41586-026-10742-x[6]

[7] Krsteski 等,合成数据偏差与 1% 真人锚点校准机制,2025 →

arXiv:2510.11408[7]

[8] Hullman 等,方法论判决:调提示词与微调只配用于探索,2026 →

arXiv:2602.15785[8]

[9] SocSci210:人类行为预测微调评测,EMNLP 2025 →

ACL Anthology: 2025.emnlp-main.1530[9]

[10] MatrAIx 公开评测基建,2026 →

arXiv:2608.04205[10]

[12-15] Simile 官方披露 →

官网首页[11]

·

技术博客《Building confidence in Simile》[12]

·

Bernstein 长文《Building the What-If Machine》[13]

·

Series B 融资声明[14]

·

AWS Marketplace listing[15]

[19-23] Synthetic Users 官方实测与报告 →

官网首页[16]

·

留出实测论文《Predicting Real-World Quantitative Data》(PDF)[17]

·

85-92% 方法文[18]

·

偏离度对比研究[19]

·

数据源与天花板探讨[20]

[29-32] atypica 官方页面与工程记录 →

定价页[21]

·

项目介绍 PPT[22]

·

五档一致性信任地图[23]

·

自曝幻觉故障之工程博客[24]

·

精选案例库[25]

[34-36] Aaru 案例及民调争议 →

安永 Wealth Research 案例页[26]

·

Nate Silver 社交媒体原帖[27]

·

《Silver Bulletin》专栏剖析[28]

[37] 盖洛普(Gallup)方法论专栏《Gallup Begins Research on Simulated Responses》,2026-05-11 →

Gallup Methodology[29]

[38-39] 国际人机交互机构 Nielsen Norman Group(NN/g)技术评述 →

《Evaluating AI-Simulated Behavior》[30]

·

《Digital Twins: Simulating Humans with Generative AI》[31]

[40] The Good 第三方对照实测《AI User Research Tools Tested》,2026-03 →

The Good Insights[32]

[43-44] 权威第三方报道与特稿 →

《Nature》特稿:The first ‘AI societies’ are taking shape[33]

·

IBM Think 报道:Meet your AI twin[34]

References

arXiv:2411.10109v1:

https://arxiv.org/abs/2411.10109v1

v2:

https://arxiv.org/abs/2411.10109v2

v3:

https://arxiv.org/abs/2411.10109v3

DOI: 10.1017/pan.2024.5:

https://doi.org/10.1017/pan.2024.5

DOI: 10.1038/s41586-022-04492-9:

https://doi.org/10.1038/s41586-022-04492-9

DOI: 10.1038/s41586-026-10742-x:

https://doi.org/10.1038/s41586-026-10742-x

arXiv:2510.11408:

https://arxiv.org/abs/2510.11408

arXiv:2602.15785:

https://arxiv.org/abs/2602.15785

ACL Anthology: 2025.emnlp-main.1530:

https://aclanthology.org/2025.emnlp-main.1530/

arXiv:2608.04205:

https://arxiv.org/abs/2608.04205

官网首页:

https://www.simile.com/

技术博客《Building confidence in Simile》:

https://www.simile.com/blog/confidence

Bernstein 长文《Building the What-If Machine》:

https://www.simile.com/blog/what-if-machine

Series B 融资声明:

https://www.simile.com/blog/series-b

AWS Marketplace listing:

https://aws.amazon.com/marketplace/pp/prodview-2dgcuyuvjtszu

官网首页:

https://www.syntheticusers.com/

留出实测论文《Predicting Real-World Quantitative Data》(PDF):

https://outcomes.syntheticusers.com/papers/predicting-quantitative-data-with-synthetic-populations.pdf

85-92% 方法文:

https://www.syntheticusers.com/science-posts/how-we-measure-success

偏离度对比研究:

https://www.syntheticusers.com/science-posts/comparison-studies-the-opportunity-lies-in-the-deviation

数据源与天花板探讨:

https://www.syntheticusers.com/science-posts/so-where-does-the-data-come-from

定价页:

https://atypica.ai/pricing

项目介绍 PPT:

https://atypica.ai/deck/pitch

五档一致性信任地图:

https://atypica.ai/research/synthetic-consumer-trust-map

自曝幻觉故障之工程博客:

https://atypica.ai/engineering

精选案例库:

https://atypica.ai/featured-studies

安永 Wealth Research 案例页:

https://aaru.com/case-studies/ey-wealth-research

Nate Silver 社交媒体原帖:

https://x.com/NateSilver538/status/1837234622310273228

《Silver Bulletin》专栏剖析:

https://www.natesilver.net/p/ai-polls-are-fake-polls

Gallup Methodology:

https://news.gallup.com/opinion/methodology/709373/gallup-begins-research-simulated-responses.aspx

《Evaluating AI-Simulated Behavior》:

https://www.nngroup.com/articles/ai-simulations-studies/

《Digital Twins: Simulating Humans with Generative AI》:

https://www.nngroup.com/articles/digital-twins/

The Good Insights:

https://thegood.com/insights/ai-research-tools/

《Nature》特稿:The first ‘AI societies’ are taking shape:

https://www.nature.com/articles/d41586-026-00070-5

IBM Think 报道:Meet your AI twin:

https://www.ibm.com/think/news/ai-simulations-stanford-research

相关学习资料