乐于分享
好东西不私藏

AI助手“会错意”?——电商平台AI功能与用户需求的错配之谜

AI助手“会错意”?——电商平台AI功能与用户需求的错配之谜

英文标题:Say-one-thing-and-mean-another consumers? A multi-method study of functional demand mismatch in e-commerce AI assistants

作者:Shuai Chen, Yang Zhao(武汉大学信息管理学院)

发表期刊Journal of Retailing and Consumer Services(Volume 92, 2026, 104820)

期刊信息:SSCI JCR Q1、中科院管理学大类一区Top期刊;2026年最新影响因子13.7

DOI:10.1016/j.jretconser.2026.104820

一、研究背景:当AI助手“上线”,用户真的满意吗?

近年来,各大电商平台纷纷推出AI助手——京东的“京言”、亚马逊的“Rufus”、淘宝的“AI购物助手”——旨在通过智能交互重塑购物体验。

然而,一个核心问题被忽视了:这些AI功能,真的是用户想要的吗?

当前AI助手的开发仍以“技术驱动” 为主导,工程师们“有什么技术就做什么功能”,而非“用户需要什么就做什么功能”。这种供需错配导致:一方面,平台投入大量资源开发功能;另一方面,用户却找不到真正有用的服务,甚至根本不知道某些功能的存在。

更复杂的是,用户需求往往是潜在且多层次的——面对新兴技术,用户通常难以清晰表达自己的具体期望。这种“用户说不出、平台猜不准”的困境,正是本研究要破解的难题。

二、理论基础

🏛️ Andersen行为模型

Andersen行为模型将用户需求分为两类:

  • 主观需求:个体对自身需求的判断

  • 客观需求:基于外部评估或专业标准识别出的需求

这两类需求往往存在差异。在技术领域,需求表达常常是碎片化、重叠甚至自相矛盾的——用户说出来的不一定是真正需要的,而真正需要的又未必说得出。

📊 BERTopic主题建模

BERTopic是一种结合预训练语言模型主题聚类的无监督主题建模技术。其流程包括:

  1. 文本编码为高维语义嵌入

  2. UMAP降维优化聚类效果

  3. HDBSCAN无监督聚类形成主题

  4. c-TF-IDF + MMR提取代表性关键词

🎯 MaxDiff偏好实验

MaxDiff(最大差异测量)是一种多属性比较方法。受访者从多个选项中选择“最想要的” 和“最不想要的” ,从而最大化选项之间的区分度。其优势在于:

  • 高区分度:强制选择极端选项

  • 无中立选项:避免中庸回答

  • 认知负担低:每次只需比较少量选项

三、研究设计:三阶段混合方法

本研究提出了一个多源数据集成框架,分三个阶段系统分析AI助手功能的需求错配:

🔍 阶段一:BERTopic用户评论挖掘(客观需求)

  • 数据来源:天池平台RecTmall数据集,包含11,224,814条用户评论

  • 采样:提取前6,000,000条评论(数据量大,顺序非结构化,符合大数据实践)

  • 情感分类:使用SnowNLP进行情感分析(0-1评分,>0.5正向,<0.5负向)

  • 负向评论提取:筛选出1,718,723条负向评论

  • 分词与词频统计:使用Jieba分词 + 四川大学机器智能实验室停用词表

  • 高频词筛选:选择频率≥100的词汇,共3,953个术语

  • BERTopic建模

    • UMAP降维:n_neighbors=10, n_components=5, min_dist=0.1

    • HDBSCAN聚类:min_cluster_size=100

    • 最终合并为50个核心主题(见附录A)

高频词分析(Top 10) :

排名术语频率排名术语频率
1质量230,5996衣服125,077
2卖家193,8277物流110,467
3客服174,0378感觉96,592
4态度148,2499问题93,737
5快递139,52510颜色75,267

关键洞察:用户最关心的是产品品质、卖家服务、物流速度和产品属性——这些构成了AI助手“应该解决”的核心问题域。

🔬 阶段二:专家驱动的AI功能提取与语义映射

  • 专家招募:通过Credamo平台邀请75位电商与HCI领域专家

  • 数据收集:开放问卷,每位专家描述3-5个AI助手应用场景并提供关键词

  • 有效响应:35份高质量响应,161条有效文本

  • 语义编码:使用paraphrase-multilingual-MiniLM-L12-v2预训练模型生成高维语义向量

  • 聚类与标注:KMeans聚类 + TF-IDF关键词提取 + 人工标注,最终定义8类核心AI功能

编号功能名称代表关键词
1个性化推荐推荐、个性化、偏好、精准
2智能定价价格、比价、智能、生成
3物流监控物流、自动化、实时、跟踪
424/7自动响应客服、自动、常见问题、智能
5客服编排机器人、人工、前台、接待
6情感交互语音、情绪、互动、压力
7多模态搜索搜索、图像、精准、生成
8虚拟试穿虚拟、试穿、服装、体验
  • 语义映射:将BERTopic的50个用户主题与8类AI功能进行余弦相似度计算,保留相似度>0.2的Top-3映射关系,生成Sankey图可视化语义流动

  • 嵌入重要性(EBI) :聚合每个AI功能的所有有效相似度分数,反映其在主题空间中的语义覆盖程度

🎯 阶段三:MaxDiff用户偏好实验(主观需求)

  • 参与者招募:2025年7月10-17日,Credamo平台招募291名中国电商活跃用户

  • 质量筛选:逻辑陷阱 + 异常时长过滤 + 人工复核,最终246份有效样本

  • 样本特征:68.7%女性;52.8%年龄21-30岁;66.7%本科学历;56.9%来自民营企业

  • 实验设计:基于8个属性,平台自动生成8组选择集(每组3次曝光,共738次属性曝光)

  • 任务要求:每组选择“最想优先开发”和“最不想开发”的AI功能

  • 偏好估计多项式Logit模型计算每个功能的偏好份额,归一化后与EBI对比

  • 差异计算:Diff = 客观重要性 - 主观偏好份额

  • 阈值设定:将Diff分为正负两组,分别计算中位数作为识别“显著错配”的阈值

四、研究结果:8类AI功能的“错配图谱”

📊 客观需求 vs. 主观偏好

通过对比“嵌入重要性”(客观)与“MaxDiff偏好份额”(主观),研究识别出显著的功能供需错配:

功能类别客观需求(EBI)主观偏好Diff值错配方向
24/7自动响应正(显著)被低估
客服编排正(显著)被低估
智能定价负(显著)被高估
个性化推荐适中基本匹配
物流监控适中基本匹配
情感交互适中基本匹配
多模态搜索适中基本匹配
虚拟试穿适中基本匹配

🏗️ 两大功能分类

基于错配分析,研究提出AI助手功能的两分法框架

1️⃣ 基础功能——被用户“视而不见”的功臣

  • 代表功能:24/7自动响应、客服编排

  • 特征:客观需求高,主观偏好低(正Diff显著

  • 关键洞察:用户已“习惯成自然”——这些功能正常运行时无人问津,一旦出现故障则引发集中不满

  • 策略防守型策略——持续提升稳定性,通过界面设计增强用户感知价值(如显示“AI为您节省了X分钟”)

2️⃣ 增长型功能——用户期待但平台“尚未到位”

  • 代表功能:智能定价

  • 特征:主观偏好高,客观需求低(负Diff显著

  • 关键洞察:用户对个性化和智能化体验存在强烈未满足需求,但平台供给仍处早期探索阶段

  • 策略进攻型策略——采用MVP(最小可行产品)理念,优先试点高敏感度功能,通过用户反馈持续迭代

五、理论贡献

1. 提出面向电商AI助手的功能感知分析框架

首次将语义主题建模用户偏好建模系统整合,从“客观需求”和“主观偏好”双视角解构用户期望,克服了单一数据源的局限。

2. 拓展Andersen行为模型的应用边界

将该模型从传统健康服务领域拓展至新兴技术情境,为理解用户在新兴技术面前的“潜在需求”与“表达需求”的错配提供了新视角。

3. 引入MaxDiff方法测量AI功能偏好

相对于传统Likert量表,MaxDiff具有高区分度、无中立偏倚、低认知负担等优势,为AI功能优先级排序提供了更精准的测量工具。

六、管理启示

🏢 给平台管理者的双轨战略

💎 基础功能:从“隐形”到“显性”

对于24/7响应和客服编排等基础功能:

  • 防守型策略:持续提升算法稳定性和知识覆盖面

  • 感知强化:通过界面设计让用户“看见”价值——如显示“AI已为您节省X分钟等待时间”、“自动回答了X个常见问题”

  • 原因:用户只有在功能失效时才意识到其重要性——“隐形效用”需被“显性化”

🚀 增长型功能:从“概念”到“落地”

对于智能定价等增长型功能:

  • 进攻型策略:采用MVP思路,优先试点高敏感度功能

  • 数据闭环:建立用户反馈机制,形成高质量数据循环

  • 用户教育:通过小规模试点和协同机制逐步塑造用户认知

  • 配套保障:同步建立定价透明度、推荐公平性、算法可解释性等治理机制

⚖️ 更广泛的社会责任考量

  • 基础功能的可及性:直接影响老年人和低数字素养群体等边缘化用户的体验

  • 增长功能的心理适应:需关注用户的心理适应性和信任建立过程

  • 平衡目标:平台在推进AI创新时,必须动态平衡商业效率与社会包容性

七、研究局限

⚠️ 局限

  • 客观需求代理偏差:使用负向用户评论作为客观需求的代理,可能存在表达偏差和情境偏差

  • 实验情境局限:MaxDiff虽有效测量了偏好强度,但未必能完全反映用户在真实情境约束下的行为选择

  • 功能分类时效性:8类功能的分类受时间因素、市场动态和平台策略影响,可能随技术演进而变化

  • 非传统量表验证:本研究未使用Cronbach's α、KMO等传统信效度检验(因非多题项量表),而是通过多方法三角验证确保可靠性

  • 单平台数据:基于淘宝(Tmall)单一平台,研究结论可能存在情境局限

🔭 未来方向

  • 跨平台验证:京东、拼多多、亚马逊等多平台对比

  • 跨国比较:不同国家市场用户对AI功能的偏好差异

  • 用户行为日志:将自报偏好与实际行为数据关联验证

  • 纵向追踪:动态监测用户对AI功能的偏好演化

  • 动态建模:加入时间维度,刻画功能需求的动态变化规律


英文文献阅读全流程:从文献如何“搜”到怎么“管”再到“读”的一站式攻略

END

点击关注,发送 "AI Consumer" 即可获取全文PDF