夜雨聆风学习资料网

ARTICLE · 1094863

AI到底改变了什么?从客服到工厂,看懂真实变化

AI到底改变了什么?从客服到工厂,看懂真实变化

不同任务里,AI 的效果为什么会差这么多?

2025 年发表的一项客服研究,分析了 5,172 名客服人员,发现获得 AI 辅助后,每小时成功解决的问题平均增加了 15%。〔1〕

另一项针对 16 名资深开源开发者的实验,使用的是 2025 年初的 AI 编程工具。在完成 246 项熟悉项目中的真实任务时,允许使用 AI 后,平均完成时间反而增加了 19%。〔2〕

顺着这两个案例往下看,会碰到比“AI 能写文章、画图片”更有意思的问题:它怎样传递经验,怎样改变分工,又会在哪些地方增加负担?

这些案例让我关心的,是 AI 怎样进入一项工作的具体过程。生成结果只是其中一步,使用结果还要经过判断、修改和验证。

01

先认清:模型提供能力,应用把能力接进工作

AI 的范围比聊天机器人更大。识别产品缺陷、预测设备异常、生成文字和图片,都可以属于 AI。大家最近常用的聊天助手,主要属于其中的生成式 AI。

拿语言模型来说,它在训练中从大量材料里学习语言、知识及其关联,再根据当前输入生成回答。它能处理未见过的提问,但生成过程并不等于逐句核实事实。这是理解它既有用、又会出错的起点。〔3〕

回答像模像样,与回答有事实依据,是两件事。缺少可靠材料时,它仍可能编出一个听起来合理的答案。这种现象通常被称为“幻觉”。给它接上搜索和资料库可以提供依据,但不能保证每次都正确。〔4〕

目前有代表性的模型家族,先认清来自谁就够了。下面的公司归属依据各家官方文档。〔5〕

模型家族
开发公司
GPT
OpenAI
Claude
Anthropic
Gemini
Google

国内常见的还有这些:

模型家族
开发公司
DeepSeek
深度求索
Qwen/通义千问
阿里巴巴
豆包/Seed
字节跳动
Kimi
月之暗面

这份表列的是家族,不是全部型号或能力排名。它们各有不同版本,也不能覆盖图像、视频、语音以及工业预测等所有模型。

模型和应用又有什么区别?ChatGPT 是应用,GPT 是模型家族。应用还需要处理文件、搜索资料、调用工具,才能把模型的能力变成可用的服务。

GitHub Copilot 就是一个例子。它是帮助开发者理解和修改代码的产品,背后可以接入 GPT、Claude、Gemini 等不同公司的模型。可选范围取决于套餐、客户端和管理设置。〔6〕

企业使用 AI,也不必都从头训练模型。可以接入现成服务,再配上自己的资料、权限和业务流程。

这与过去的办公自动化有什么不同?许多传统工具需要预先写清步骤,生成式 AI 则能根据自然语言处理改写、归纳、解释等不同任务。更多依赖经验、难以逐条写成规则的工作,开始有了可以尝试的工具。〔1〕

因此,同样一个模型,放在普通聊天框里和接进企业系统后,价值可能差很多。能拿到什么资料、能执行什么动作、结果由谁检查,都会影响它能帮到哪一步。

02

客服:AI把老员工的经验带给了新人

先看开头的 15%。

2025 年发表在《经济学季刊》的一项研究,分析了 5,172 名客服人员使用生成式 AI 助手的情况。平均而言,每小时解决的问题增加了 15%,经验较少、技能较弱的员工受益更多;最有经验的员工收益较小,部分质量指标还略有下降。〔1〕

研究中的系统主要在 2020—2021 年部署,向人工客服提供建议,员工可以采纳,也可以拒绝。这里观察的是人与助手共同工作的效果。〔1〕

为什么新人收益更大?研究者提出,AI 能把表现较好的员工的做法传递给其他人。〔1〕以前,新人需要慢慢积累的回应方式和处理思路,现在可以在工作过程中获得提示。

我看重的是这种经验传递。培训材料需要新人记住以后再用,AI 有机会把建议送到正在处理的问题面前,减少从“学过”到“会用”的距离。

但相同的提示,对老员工未必有同样价值。他本来就知道怎样回答,建议可能重复已有判断,甚至让回答变差。

这给企业一个判断标准:别只问“员工有没有用 AI”,还要看谁在用、解决什么问题。新人处理常见咨询,与资深员工处理复杂争议,需要的帮助不同。

15% 是这项研究中一个具体指标的变化,不能换算成“客服行业可以裁掉 15% 的人”。接下来是增加服务量、缩短等待,还是减少人员,取决于企业怎样安排。

03

程序员:代码生成快,任务未必完成快

软件开发把另一个问题暴露得很清楚:产出的速度,和工作的完成速度,可能不一致。

AI 评估机构 METR 在 2025 年做了一项随机实验:16 名熟悉各自开源项目的资深开发者,完成 246 项真实任务。使用的工具主要是 Cursor,以及当时的 Claude 3.5/3.7 Sonnet。允许使用 AI 时,平均完成时间反而增加了 19%。〔2〕

参与者在实验后仍觉得 AI 让自己快了约 20%。〔2〕感觉更省力,未必意味着计时结果更好。

对熟悉项目的人,一段代码要符合现有设计、处理特殊情况、通过检查,还得方便后续维护。我的理解是,若自己原本就能迅速完成,向 AI 解释要求、等待输出、检查修改,可能多出一轮工作。

所以,只看它几秒钟写了多少代码,很容易漏算成本。真正该比较的是:从提出需求,到得到可交付结果,总共花了多久。

不过,这个结果也不能当成今天所有编程工具的定论。

METR 在 2026 年 2 月公布后续研究时指出,新工具可能带来更多提速,但新样本存在选择偏差等问题,尚不能可靠估计当前效果。〔7〕

它既提醒我们别盲信“用了就快”,也提醒我们别把一次旧实验当成永久结论。工具在变,任务、使用者和质量要求也在变。

如果企业要评估效果,拿真实任务比较完成时间、返工量和最终质量,比展示一段漂亮的生成过程更有说服力。

04

宝洁:变化开始进入部门之间

接下来这个案例,已经超出了写文案和补代码。

宝洁是一家生产洗护和日用品的企业。涉及新产品时,研发人员与商业人员关注的问题不同:一个更懂技术实现,一个更懂消费者与市场。

一项涉及 776 名宝洁专业人员的随机实验,把个人和两人团队、使用和不使用 AI 的情况进行比较。2025 年公布的工作论文发现,在所测试的产品创新任务上,使用 AI 的个人,表现可以达到未使用 AI 的团队水平。〔8〕

研究还发现,没有 AI 时,两类专业人员的方案更偏向自己的领域;有 AI 后,方案更能兼顾技术与商业。这些任务模拟的是产品创新的早期阶段,不能直接推导成销量增长,更不能说一个人已经能取代整个研发部门。〔8〕

这个变化让我期待。AI 有可能降低接触另一门专业知识的门槛,让研发人员更早想到市场问题,让商业人员更早看见技术约束。

但初步方案是否可行,仍要经过专业验证。AI 提供另一个领域的思路,团队需要判断哪些有用、哪些与实际条件不符。

我的判断是,AI 会影响团队里一些基础咨询、信息转述和初步准备工作。跨部门讨论可以从更成熟的第一版开始,专业人员则把更多精力放在有争议、需要取舍的地方。

它可能改变的,是协作从哪里开始、谁先准备什么。团队仍然要对产品质量、生产条件和消费者体验负责。

05

教育:作业做得好,不代表学得好

到了教育领域,“更快得到答案”甚至可能偏离目标。

一项在土耳其高中开展、涉及近千名学生的数学研究,比较了普通 AI 助手、带教学约束的 AI 导师,以及不使用 AI 的情况。两种 AI 工具都基于 GPT-4。〔9〕

普通助手让练习表现提高,但在撤去 AI、独立完成考试时,这组学生的成绩比对照组低了约 17%。这里是相对差异,不是少了 17 个百分点。〔9〕

由教师参与设计、引导学生思考而非直接交出答案的导师工具,避免了这项实验中观察到的成绩下降。〔9〕

这不能说明所有 AI 教学都有效或有害,却把“目标”这件事讲得很具体:工具若围绕交出正确答案设计,可能帮人完成练习;围绕理解设计,就需要留住思考的过程。

我担心的是,工作里也有类似问题。初级员工整理材料、修改代码,看起来是在做重复劳动,同时也在建立判断能力。

当这些任务交给 AI 后,新人从哪里学习?组织需要安排练习、讨论和独立检查的机会。一个人如果长期只确认“看起来没问题”,未必能积累处理复杂问题的经验。

客服研究显示 AI 可以帮助新人,数学研究又提醒我们,帮助的方式很重要。能让人完成任务,与能让人逐渐掌握任务,需要分别检验。

06

从高炉到实验室,AI不只有聊天这一种用法

有些行业的变化,不能只拿聊天助手来解释。

2026 年 4 月,中国宝武披露,宝钢股份的 AI 智慧高炉正式投入应用,已在宝山基地的部分高炉使用。系统结合炼铁工艺积累与生产数据,服务于炉况预测和生产调控。〔10〕

这是企业披露的案例,不能据此认定整个钢铁行业都达到了同样效果。不过,它提供了一个具体方向:AI 可以进入生产过程,帮助处理相互影响的现场变量。

在这里,资料质量意味着传感器数据是否可靠,执行能力意味着能否接入生产系统,检查意味着工艺和安全约束是否满足。买一个通用模型,并不能自动完成这些工作。

到了生命科学,Google DeepMind 的 AlphaFold 用来预测蛋白质的三维结构。蛋白质的形状与功能有关,预测可以帮助研究者开展后续研究。公开数据库已经提供超过两亿个结构预测。〔11〕

但预测仍需结合具体研究判断。例如,AlphaFold 2 对某些结构变化和相互作用有局限。研究者要检查预测的可信度,决定怎样开展后续实验。〔12〕

这两个领域里,AI 的价值与专业数据、设备、实验密切相关。它可以减少一部分探索和判断成本,但后面的生产验证、实验验证仍要继续。

理解这一点,就能看出为什么“哪个聊天模型最强”无法回答所有行业的 AI 问题。

07

行业受到的影响,要看节省了什么,又增加了什么

把这些案例放在一起,我觉得最值得追踪的是三种变化。

第一种,准备一份可修改成果的成本下降。商品介绍、广告草图、会议纪要、初步代码,都可能更快得到第一版。亚马逊已让卖家用简短描述、图片或网页生成上架内容,再由卖家审核。〔13〕

对电商、广告、内容服务和软件开发,这会影响交付节奏。我的判断是,靠批量制作相似内容获得收入的环节,会承受更大的速度和价格压力。能理解真实需求、区分好坏、完成后续修改的人,仍有工作要做。

但一个人能交付更多,是否就一定需要更少的人?还要看需求有没有增加。生产成本降低,可能让小商家尝试过去负担不起的服务,也可能让企业用更少人完成原有业务。几个案例无法替我们算出整个行业的就业变化。

第二种,经验和专业知识的获取方式改变。客服新人获得及时提示,产品人员更容易跨越专业边界。企业的培训、分工和协作会受到影响,知识可能不再只沿着“老员工教新人、这个部门问那个部门”的路径流动。

金融行业也有具体应用:摩根士丹利的工具在客户同意后整理顾问会议,并生成供顾问编辑的后续材料。这些记录可以供后续工作参考,顾问仍需审核。〔14〕

第三种,检查和学习需要重新安排。AI 产出越多,检查者要面对的内容也可能越多。如果核查和返工增加的时间超过生成环节节省的时间,总成本就没有下降。程序员实验说明了为什么需要把整段过程算进去。

我的判断是,企业还要留意工作积压在哪里。第一版交得快了,若审核能力跟不上,成果仍会停在那里。要获得收益,可能需要连同流程一起调整。

教育案例进一步提醒我们,组织还要区分“今天完成工作”和“培养明天能独立负责的人”。省掉准备工作,不能顺手省掉所有学习机会。

所以,看到“某行业被 AI 改变”的新闻,我会先追问:它接走了哪项任务?最终结果有没有改善?谁得到帮助,谁承担了新增的检查工作?

这比单看使用人数或生成速度,更接近真实影响。

回到开头的 15% 和 19%:前者来自特定客服环境,后者来自特定时期的资深开发者实验。它们放在一起,提醒我们把任务、经验和成本放进同一张账里。

我对 AI 的期待,落在这些具体变化上:新人更容易得到指导,小团队更容易准备方案,研究者更容易开始下一步探索。它们能不能持续带来收益,要靠真实工作中的结果来证明。

—— Jaki

08

论证资料与来源

正文中的编号与下列资料对应。研究数据需结合样本、任务和研究时间理解;企业披露的案例用于说明实际应用,不代表全行业效果。

〔1〕客服研究:每小时解决的问题增加 15%。

Erik Brynjolfsson、Danielle Li、Lindsey Raymond:《Generative AI at Work》(https://doi.org/10.1093/qje/qjae044),2025 年 2 月 4 日在线发表,《经济学季刊》140 卷第 2 期,889—942 页。

研究分析 5,172 名客服人员,指标是每小时成功解决的客户问题数,平均增加 15%。系统主要在 2020—2021 年部署,基于 GPT-3,建议由人工决定是否采纳。结果来自特定企业,不能解释为全行业提效或裁员比例。

〔2〕程序员实验:允许使用 AI 后,完成任务耗时增加 19%。

METR:《Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity》(https://metr.org/blog/2025-07-10-early-2025-ai-experienced-os-dev-study/),2025 年 7 月 10 日发布。

16 名资深开源开发者完成 246 项真实任务,任务随机分为允许或不允许使用 AI。工具主要为 Cursor Pro 与 Claude 3.5/3.7 Sonnet。19% 是平均完成时间的相对增加;实验后参与者仍估计自己快了约 20%。结果限定于当时工具和这组任务。

〔3〕生成式 AI 的基本机制。

IBM:What is generative AI?(https://www.ibm.com/think/topics/generative-ai)。支持文中关于训练材料、规律学习、按输入生成内容,以及不同生成任务的解释。

〔4〕AI 幻觉与检索的局限。

Cloudflare:什么是 AI 幻觉?(https://www.cloudflare.com/zh-cn/learning/ai/what-are-ai-hallucinations/)。支持“流畅的回答可能不准确”“检索提供依据仍不能保证正确”的说明。

〔5〕常见模型家族与开发公司。

公司归属与模型名称依据以下官方材料核对,列举范围不等于全部模型或能力排名:

01

GPT/OpenAI:官方模型指南(https://developers.openai.com/api/docs/guides/latest-model)。

02

Claude/Anthropic:官方模型目录(https://platform.claude.com/docs/en/models/overview)。

03

Gemini/Google:官方模型目录(https://ai.google.dev/gemini-api/docs/models)。

04

DeepSeek/深度求索:官方接口文档(https://api-docs.deepseek.com/)。

05

Qwen/阿里巴巴:Qwen3 官方公告(https://www.alibabacloud.com/en/press-room/alibaba-introduces-qwen3-setting-new-benchmark)。此处只核对家族归属,未将 Qwen3 说成当前最新型号。

06

豆包、Seed/字节跳动:Seed2.1 官方公告(https://seed.bytedance.com/zh/blog/seed2-1-officially-released-advancing-ai-productivity)。

07

Kimi/月之暗面:官方帮助中心(https://www.kimi.com/en/help/new-user-guide/overview)。

〔6〕GitHub Copilot 使用哪些公司的模型。

GitHub:AI model hosting(https://docs.github.com/en/copilot/reference/ai-models/model-hosting)。支持 Copilot 可接入不同模型提供方的说明;可选模型受套餐、客户端和组织设置影响。

〔7〕编程实验的后续更新。

METR:《We are Changing our Developer Productivity Experiment Design》(https://metr.org/blog/2026-02-24-uplift-update/),2026 年 2 月 24 日发布。

研究者认为新工具可能带来更多提速,但后续实验存在选择偏差及时间测量问题,不能可靠估计当前效果。文中保留这项更新,避免将 2025 年的结果当成永久结论。

〔8〕宝洁产品创新与跨专业协作。

《The Cybernetic Teammate》工作论文,NBER w33641(https://www.nber.org/papers/w33641),2025 年公布;哈佛研究团队的解读(https://aiinstitute.hbs.edu/the-cybernetic-teammate-how-ai-is-reshaping-collaboration-and-expertise-in-the-workplace/),2025 年 4 月 2 日。

随机实验涉及 776 名宝洁专业人员,比较个人/团队与使用/不使用 AI 的情况。相关结果来自早期产品创新任务的评价,不等于产品上市后的销售效果,也不证明整个部门可以被替代。

〔9〕数学教学:练习表现与独立学习效果。

《Generative AI without guardrails can harm learning: Evidence from high school mathematics》(https://doi.org/10.1073/pnas.2422633122),2025 年发表于《美国国家科学院院刊》;另见 PubMed 摘要(https://pubmed.ncbi.nlm.nih.gov/40560616/)。

研究涉及土耳其高中近千名学生。普通 GPT-4 助手组撤去 AI 后,考试成绩相对对照组低约 17%;教学约束导师避免了实验中观察到的下降。17% 不是 17 个百分点,也不是所有 AI 教学的效果。

沃顿对研究的解释(https://knowledge.wharton.upenn.edu/article/without-guardrails-generative-ai-can-harm-education/)发表于 2024 年 8 月 27 日,属于论文正式发表前的研究解读。文中关于职场新人学习机会的讨论,是作者据此提出的类比分析。

〔10〕宝钢股份 AI 智慧高炉。

国资委刊载:中国宝武 AI 智慧高炉上线(https://www.sasac.gov.cn/n2588025/n2588124/c35400437/content.html),2026 年 4 月 9 日发布,所述上线日期为 4 月 3 日。

材料由中国宝武提供,支持文中关于投入应用、生产数据与工艺结合的说明。它属于企业披露,本文未据此给出独立验证的全行业提效比例。

〔11〕AlphaFold 与超过两亿个结构预测。

Google DeepMind:AlphaFold(https://deepmind.google/science/alphafold/)。数据库数字指蛋白质结构预测的数量,不代表每个结构都已通过实验确认。

〔12〕AlphaFold 2 的能力与局限。

EMBL-EBI:Strengths and limitations of AlphaFold 2(https://www.ebi.ac.uk/training/online/courses/alphafold/an-introductory-guide-to-its-strengths-and-limitations/strengths-and-limitations-of-alphafold/)。支持文中对结构变化、相互作用及使用边界的说明;这里的具体限制针对 AlphaFold 2。

〔13〕电商商品上架内容生成。

亚马逊:Product listings with generative AI(https://sellingpartners.aboutamazon.com/product-listings-with-gen-ai)。证明根据描述、图片或网页生成上架内容的功能存在,卖家仍需审核;本文未据此声称销量提高。

〔14〕金融顾问会议整理。

摩根士丹利:AI at Morgan Stanley Debrief 公告(https://www.morganstanley.com/press-releases/ai-at-morgan-stanley-debrief-launch),2024 年 6 月 26 日。支持客户同意后整理会议、生成后续材料并由顾问编辑审核的说明。

END

相关学习资料