英文标题:Say-one-thing-and-mean-another consumers? A multi-method study of functional demand mismatch in e-commerce AI assistants
作者:Shuai Chen, Yang Zhao(武汉大学信息管理学院)
发表期刊:Journal of Retailing and Consumer Services(Volume 92, 2026, 104820)
期刊信息:SSCI JCR Q1、中科院管理学大类一区Top期刊;2026年最新影响因子13.7
DOI:10.1016/j.jretconser.2026.104820
一、研究背景:当AI助手“上线”,用户真的满意吗?
近年来,各大电商平台纷纷推出AI助手——京东的“京言”、亚马逊的“Rufus”、淘宝的“AI购物助手”——旨在通过智能交互重塑购物体验。
然而,一个核心问题被忽视了:这些AI功能,真的是用户想要的吗?
当前AI助手的开发仍以“技术驱动” 为主导,工程师们“有什么技术就做什么功能”,而非“用户需要什么就做什么功能”。这种供需错配导致:一方面,平台投入大量资源开发功能;另一方面,用户却找不到真正有用的服务,甚至根本不知道某些功能的存在。
更复杂的是,用户需求往往是潜在且多层次的——面对新兴技术,用户通常难以清晰表达自己的具体期望。这种“用户说不出、平台猜不准”的困境,正是本研究要破解的难题。

二、理论基础
🏛️ Andersen行为模型
Andersen行为模型将用户需求分为两类:
主观需求:个体对自身需求的判断
客观需求:基于外部评估或专业标准识别出的需求
这两类需求往往存在差异。在技术领域,需求表达常常是碎片化、重叠甚至自相矛盾的——用户说出来的不一定是真正需要的,而真正需要的又未必说得出。
📊 BERTopic主题建模
BERTopic是一种结合预训练语言模型与主题聚类的无监督主题建模技术。其流程包括:
文本编码为高维语义嵌入
UMAP降维优化聚类效果
HDBSCAN无监督聚类形成主题
c-TF-IDF + MMR提取代表性关键词
🎯 MaxDiff偏好实验
MaxDiff(最大差异测量)是一种多属性比较方法。受访者从多个选项中选择“最想要的” 和“最不想要的” ,从而最大化选项之间的区分度。其优势在于:
高区分度:强制选择极端选项
无中立选项:避免中庸回答
认知负担低:每次只需比较少量选项

三、研究设计:三阶段混合方法
本研究提出了一个多源数据集成框架,分三个阶段系统分析AI助手功能的需求错配:
🔍 阶段一:BERTopic用户评论挖掘(客观需求)
数据来源:天池平台RecTmall数据集,包含11,224,814条用户评论
采样:提取前6,000,000条评论(数据量大,顺序非结构化,符合大数据实践)
情感分类:使用SnowNLP进行情感分析(0-1评分,>0.5正向,<0.5负向)
负向评论提取:筛选出1,718,723条负向评论
分词与词频统计:使用Jieba分词 + 四川大学机器智能实验室停用词表
高频词筛选:选择频率≥100的词汇,共3,953个术语
BERTopic建模:
UMAP降维:n_neighbors=10, n_components=5, min_dist=0.1
HDBSCAN聚类:min_cluster_size=100
最终合并为50个核心主题(见附录A)
高频词分析(Top 10) :
| 排名 | 术语 | 频率 | 排名 | 术语 | 频率 |
|---|---|---|---|---|---|
| 1 | 质量 | 230,599 | 6 | 衣服 | 125,077 |
| 2 | 卖家 | 193,827 | 7 | 物流 | 110,467 |
| 3 | 客服 | 174,037 | 8 | 感觉 | 96,592 |
| 4 | 态度 | 148,249 | 9 | 问题 | 93,737 |
| 5 | 快递 | 139,525 | 10 | 颜色 | 75,267 |
关键洞察:用户最关心的是产品品质、卖家服务、物流速度和产品属性——这些构成了AI助手“应该解决”的核心问题域。
🔬 阶段二:专家驱动的AI功能提取与语义映射
专家招募:通过Credamo平台邀请75位电商与HCI领域专家
数据收集:开放问卷,每位专家描述3-5个AI助手应用场景并提供关键词
有效响应:35份高质量响应,161条有效文本
语义编码:使用paraphrase-multilingual-MiniLM-L12-v2预训练模型生成高维语义向量
聚类与标注:KMeans聚类 + TF-IDF关键词提取 + 人工标注,最终定义8类核心AI功能:
| 编号 | 功能名称 | 代表关键词 |
|---|---|---|
| 1 | 个性化推荐 | 推荐、个性化、偏好、精准 |
| 2 | 智能定价 | 价格、比价、智能、生成 |
| 3 | 物流监控 | 物流、自动化、实时、跟踪 |
| 4 | 24/7自动响应 | 客服、自动、常见问题、智能 |
| 5 | 客服编排 | 机器人、人工、前台、接待 |
| 6 | 情感交互 | 语音、情绪、互动、压力 |
| 7 | 多模态搜索 | 搜索、图像、精准、生成 |
| 8 | 虚拟试穿 | 虚拟、试穿、服装、体验 |
语义映射:将BERTopic的50个用户主题与8类AI功能进行余弦相似度计算,保留相似度>0.2的Top-3映射关系,生成Sankey图可视化语义流动
嵌入重要性(EBI) :聚合每个AI功能的所有有效相似度分数,反映其在主题空间中的语义覆盖程度
🎯 阶段三:MaxDiff用户偏好实验(主观需求)
参与者招募:2025年7月10-17日,Credamo平台招募291名中国电商活跃用户
质量筛选:逻辑陷阱 + 异常时长过滤 + 人工复核,最终246份有效样本
样本特征:68.7%女性;52.8%年龄21-30岁;66.7%本科学历;56.9%来自民营企业
实验设计:基于8个属性,平台自动生成8组选择集(每组3次曝光,共738次属性曝光)
任务要求:每组选择“最想优先开发”和“最不想开发”的AI功能
偏好估计:多项式Logit模型计算每个功能的偏好份额,归一化后与EBI对比
差异计算:Diff = 客观重要性 - 主观偏好份额
阈值设定:将Diff分为正负两组,分别计算中位数作为识别“显著错配”的阈值
四、研究结果:8类AI功能的“错配图谱”
📊 客观需求 vs. 主观偏好
通过对比“嵌入重要性”(客观)与“MaxDiff偏好份额”(主观),研究识别出显著的功能供需错配:
| 功能类别 | 客观需求(EBI) | 主观偏好 | Diff值 | 错配方向 |
|---|---|---|---|---|
| 24/7自动响应 | 高 | 低 | 正(显著) | 被低估 |
| 客服编排 | 高 | 低 | 正(显著) | 被低估 |
| 智能定价 | 低 | 高 | 负(显著) | 被高估 |
| 个性化推荐 | — | — | 适中 | 基本匹配 |
| 物流监控 | — | — | 适中 | 基本匹配 |
| 情感交互 | — | — | 适中 | 基本匹配 |
| 多模态搜索 | — | — | 适中 | 基本匹配 |
| 虚拟试穿 | — | — | 适中 | 基本匹配 |
🏗️ 两大功能分类
基于错配分析,研究提出AI助手功能的两分法框架:
1️⃣ 基础功能——被用户“视而不见”的功臣
代表功能:24/7自动响应、客服编排
特征:客观需求高,主观偏好低(正Diff显著)
关键洞察:用户已“习惯成自然”——这些功能正常运行时无人问津,一旦出现故障则引发集中不满
策略:防守型策略——持续提升稳定性,通过界面设计增强用户感知价值(如显示“AI为您节省了X分钟”)
2️⃣ 增长型功能——用户期待但平台“尚未到位”
代表功能:智能定价
特征:主观偏好高,客观需求低(负Diff显著)
关键洞察:用户对个性化和智能化体验存在强烈未满足需求,但平台供给仍处早期探索阶段
策略:进攻型策略——采用MVP(最小可行产品)理念,优先试点高敏感度功能,通过用户反馈持续迭代
五、理论贡献
1. 提出面向电商AI助手的功能感知分析框架
首次将语义主题建模与用户偏好建模系统整合,从“客观需求”和“主观偏好”双视角解构用户期望,克服了单一数据源的局限。
2. 拓展Andersen行为模型的应用边界
将该模型从传统健康服务领域拓展至新兴技术情境,为理解用户在新兴技术面前的“潜在需求”与“表达需求”的错配提供了新视角。
3. 引入MaxDiff方法测量AI功能偏好
相对于传统Likert量表,MaxDiff具有高区分度、无中立偏倚、低认知负担等优势,为AI功能优先级排序提供了更精准的测量工具。
六、管理启示
🏢 给平台管理者的双轨战略
💎 基础功能:从“隐形”到“显性”
对于24/7响应和客服编排等基础功能:
防守型策略:持续提升算法稳定性和知识覆盖面
感知强化:通过界面设计让用户“看见”价值——如显示“AI已为您节省X分钟等待时间”、“自动回答了X个常见问题”
原因:用户只有在功能失效时才意识到其重要性——“隐形效用”需被“显性化”
🚀 增长型功能:从“概念”到“落地”
对于智能定价等增长型功能:
进攻型策略:采用MVP思路,优先试点高敏感度功能
数据闭环:建立用户反馈机制,形成高质量数据循环
用户教育:通过小规模试点和协同机制逐步塑造用户认知
配套保障:同步建立定价透明度、推荐公平性、算法可解释性等治理机制
⚖️ 更广泛的社会责任考量
基础功能的可及性:直接影响老年人和低数字素养群体等边缘化用户的体验
增长功能的心理适应:需关注用户的心理适应性和信任建立过程
平衡目标:平台在推进AI创新时,必须动态平衡商业效率与社会包容性
七、研究局限
⚠️ 局限
客观需求代理偏差:使用负向用户评论作为客观需求的代理,可能存在表达偏差和情境偏差
实验情境局限:MaxDiff虽有效测量了偏好强度,但未必能完全反映用户在真实情境约束下的行为选择
功能分类时效性:8类功能的分类受时间因素、市场动态和平台策略影响,可能随技术演进而变化
非传统量表验证:本研究未使用Cronbach's α、KMO等传统信效度检验(因非多题项量表),而是通过多方法三角验证确保可靠性
单平台数据:基于淘宝(Tmall)单一平台,研究结论可能存在情境局限
🔭 未来方向
跨平台验证:京东、拼多多、亚马逊等多平台对比
跨国比较:不同国家市场用户对AI功能的偏好差异
用户行为日志:将自报偏好与实际行为数据关联验证
纵向追踪:动态监测用户对AI功能的偏好演化
动态建模:加入时间维度,刻画功能需求的动态变化规律
英文文献阅读全流程:从文献如何“搜”到怎么“管”再到“读”的一站式攻略


END
点击关注,发送 "AI Consumer" 即可获取全文PDF
夜雨聆风