点击蓝字,关注我们
今年以来,安徽省科学技术协会与合肥综合性国家科学中心科技传播中心携手,开启了“千万 IP 创科普”与“皖美科装”原创科普作品征集活动,涌现出了一大批优质的科普成果。
此次征集活动得到了全省各地科研人员、科普爱好者以及高校学生的积极响应,他们踊跃投稿。作品内容广泛,覆盖了量子信息、人工智能、生物医药、新能源等多个前沿科技领域。其形式丰富多样,包含图文、视频、动画等,且语言简洁易懂,能够以生动有趣的方式将复杂的科学原理呈现给公众,进一步激发了社会各界对科学技术的兴趣与热情。
我们将持续推出系列科普推文,一同探寻科学的奥秘,感受技术的温度。
2022年,一幅名为《太空歌剧院》的作品获得美国科罗拉多州博览会数字艺术比赛一等奖。作者杰森·艾伦(Jason Allen)并非职业画家,而是一名游戏设计师,这幅作品由AI绘画平台Midjourney辅助创作。
结果公布后,引发广泛争议。有人认为,这是人工智能赋能艺术创作的新起点;也有人质疑,AI参与创作的作品是否还能称为“创作”。

图1 《太空歌剧院》 | 图源,维基百科
此后,生成式人工智能的发展不断突破人们的想象。从文字、图像到音乐、视频,AI生成的内容逐渐走进大众视野,并广泛用于创意生产任务。如今,仅凭肉眼判断一篇文章或一幅图片究竟出自人类还是AI,已经越来越困难。
随之而来的,是一个更深层的问题:AI究竟是如何生成内容的?这是否意味着人工智能已经拥有了创造力,还是只是以一种全新的方式“组合”和“预测”信息?

01
AI为什么突然“什么都会”了?
时间回到2018年,当时的人工智能大多仍是“专才”,有的擅长识别图像,有的负责机器翻译,还有的能够下棋。通常,它们只能执行单一任务,能够同时完成多种任务的AI,已经足以登上科技新闻了。然而到了2022年底,ChatGPT的出现改变了公众对AI 能力的感知。ChatGPT不仅能够回答问题,还可以写诗、写代码、修改文章、设计方案,甚至围绕同一主题进行多轮连续对话。在公众视角中,AI似乎在短时间内展现出了处理复杂问题的能力。
这种跨越式的发展并非偶然,而是建立在多年技术积累的基础之上。其中,一个重要的转折点发生在2017年。这一年,谷歌研究团队发表了题为《Attention Is All You Need(注意力即一切)》的论文,提出了一种全新的神经网络架构——Transformer。如今,几乎所有主流大语言模型都建立在这一架构之上。
Transformer的重要突破,在于改变了人工智能处理信息的方式。过去的神经网络通常按顺序处理信息,难以同时关注整段内容;而Transformer引入了“注意力机制”,使模型能够同时建立序列中不同位置之间的关联,从而更好地理解上下文。
例如,当一句话中多次出现“苹果”时,模型能够结合上下文判断它指的是水果,还是一家科技公司。这种基于上下文的语义理解能力,是Transformer的重要优势之一。
更重要的是,Transformer能够充分利用图形处理器(GPU)进行大规模并行计算,大幅提升训练效率,使模型可以在海量数据上持续学习,并不断扩大参数规模。

图2 Transformer 架构原理 | 图源,AI生成
随着模型规模、训练数据和计算资源不断增长,研究人员发现,大模型的性能会随着规模扩大而持续提升,这一规律被称为“Scaling Law”(规模定律)。当模型达到一定规模后,一些能力会出现显著跃升,例如多轮对话、代码生成和复杂推理。这种随着模型规模增长而产生的非线性能力变化,被称为“Emergent Abilities”(涌现能力)。
对公众而言,这些能力仿佛一夜之间突然出现;但对于研究人员来说,它们更像是长期技术积累达到临界点后的自然结果。正是在模型、数据和算力持续协同发展的推动下,人工智能逐渐从只能完成单一任务的“专才”,成长为能够胜任多种复杂任务的“通才”,生成式人工智能时代也由此开启。
不过,这里的“通才”并不意味着AI已经像人一样理解世界。它之所以能够生成流畅的文字、图像甚至代码,本质上仍建立在统计学习和概率预测之上。那么,它究竟是如何做到这一点的?
02
AI到底是怎么“创作”的?
要理解AI的“创作”,需要进入一个非常朴素的操作层面:AI并不知道什么是“创作”,它所做的事情,本质上是预测下一个词元(Token)。这句话看似简单,却是理解大语言模型的关键起点。可以把它想象成一个填词游戏:当句子是“今天天气真___”时,人通常更可能填“好”,而非“兔子”。AI的机制与此类似,只是它处理的不是一两个词汇,而是来自互联网的大规模数据,包括书籍、网页、论文与代码等。

图3 预测下一个词元Token | 图源,AI生成
训练过程

训练过程可以这样理解:大模型在学习时,会基于已有上下文预测下一个词元,并将预测结果与真实答案进行比较,根据误差不断调整内部参数。这一过程在海量数据与大量迭代中持续进行。随着训练推进,大模型不仅逐渐学会词汇之间的搭配关系,还在统计结构中内化语法规律、语义关联以及一定的推理模式。
无论是文本生成还是图像生成,都遵循相似的生成范式。文本模型在生成过程中,会不断预测下一个词元,这些词元可以是词语、子词或字符;而图像生成模型则是在潜在空间中逐步构建图像结构。
以扩散模型 Stable Diffusion 为例,其生成过程可以理解为:从一张充满随机噪声的初始图像出发,通过多步迭代逐渐去除噪声,使图像结构不断收敛,最终形成可识别的视觉结果,例如一只猫、一片星空或一座城市。在这一过程中,提示词(Prompt)更类似于一种条件约束,用于引导生成方向,而非对图像内容的直接“绘制”。


图4《千与千寻》剧照(上) | 图源,豆瓣
图5《千与千寻》剧照(下) | 图源,AI生成

因此,当有人提出AI是否真正“理解”人类语言这个问题时,严格来说答案是否定的。AI并不具备人类意义上的理解能力,也不掌握任何自然语言的语义体验。它本质上是在高维统计空间中学习词元之间的概率关系。正是这种对语言统计结构的高度拟合,使得模型在实际输出中往往呈现出类似“理解”的行为表征。
03
AI创作是真正的“创作“吗?
这个问题并没有单一答案,但一个逐渐清晰的共识是:AI的“创作”与人类创作在生成机制上存在本质差异。
人类创作建立在具体的生命经验之上。梵高在阿尔勒的阳光中创作《向日葵》时,正处于特定的感知与情绪状态之中;李白写下“床前明月光”时,则处于异乡夜晚的思乡情境中。无论是视觉表达还是语言表达,作品都与创作者的身体经验、情感状态与认知结构紧密相连。
相比之下,AI的生成过程并不依赖任何主体经验。它没有在星空下发呆过,也没有体验过失落或喜悦。它只是学会了当人们描述某种场景时,通常会使用哪些词。

图6 梵高(左)与李白(右) | 图源,AI生成
这一差异也引出了对“创造力”本质的探讨。创造力通常被定义为新颖性与有用性的结合。从这一角度看,AI确实能够生成具有新颖组合特征的内容,例如跨领域概念的重组与表达形式的再组合。然而,当类似生成能力以高频率、低成本持续输出时,“新颖性”的稀缺性开始下降,创造性表达的边界被显著扩展,这导致了“创造力通胀”的出现,即,新颖性本身的区分度在信息环境中被稀释。
另一个重要问题是“幻觉”(Hallucination)。当模型面对不确定问题时,它并不会输出“不知道”,而是生成在统计学上最可能成立的文本序列。这并非AI的“故意编造”,从概率上看,一个看似自信的虚构答案,往往比诚实的“不知道”出现在训练数据中的频率更高。这就像是班里那个爱面子的同学,不懂的问题也敢于接话,而且编得煞有介事。
此外,AI的训练数据来自互联网,而互联网包含大量历史和结构性偏见。一个典型案例是2018年亚马逊的AI招聘系统:由于历史数据中工程岗位的简历大量来自男性,模型在评分中系统性地对女性候选人不利。这不是开发者刻意设定的歧视,而是数据的不均衡在机器学习中被放大。
04
从“创作“到“行动”:正在发生的转向
写到这里,一个自然的问题会浮现:讨论AI的“创作”是否仍然重要?如果只是进行高级的统计预测,那么它与计算器或搜索引擎的区别究竟在哪里?答案在于,AI正在完成两个关键层面的跃迁:
1
从“理解规则”到“理解概率”
传统编程依赖人为设定的明确规则,而现实世界往往无法被规则完全穷尽。AI所学习的,则是数据中的概率分布——在特定上下文情境下,哪种输出出现的概率更高。
2
从“回答问题”到“完成任务”
2023年前后,随着工具调用能力的引入,大模型开始能够自主选择并使用外部工具,组织多步骤流程,并在执行过程中进行调整与修正。这类能够进行任务规划与执行的系统,被称为智能体(Agent)。
Agent的出现,重新定义了“创作”的边界。过去的“创作”主要指内容生成,例如文本或图像;而在Agent框架下,“创作”进一步扩展为对任务流程本身的生成与组织。前者是对输入指令的响应,后者则是面向目标的过程建构。

图7 人类与Agent协作 | 图源,AI生成
一个典型的Agent包含四项核心能力:
感知与理解——能够处理图像、语音、视频、文档等多模态信息;
规划与推理——将复杂任务分解为可执行步骤,进行链式推理;
工具调用——调用浏览器、数据库、API等外部工具;
记忆与反思——在任务执行中积累经验,调整后续行动。
目前,Agent已在多个场景中实现落地。例如,具备自主检索与信息整合能力的智能助理,可以在一定程度上完成信息搜集与内容生成;在具身智能领域,融合环境感知与自主导航的系统(如智能轮椅),可实现对复杂环境的实时识别与避障,其感知范围可达0.1至25米,动态避障响应时间可控制在0.3秒以内。
05
MCP:AI连接外部世界的“通用接口”
Agent要发挥作用,必须连接外部工具与数据。然而,不同工具的接口往往各自为政:调用天气 API 是一套写法,发送邮件又是另一套。随着能力类型不断增多,这种接口“碎片化”提高了开发与集成成本,也制约了Agent能力的扩展。
2024年底,MCP(Model Context Protocol,模型上下文协议)作为开放标准被业界提出,目标是建立AI连接外部世界的通用接口。MCP定义了一套标准化的通信协议,AI应用可以通过同一接口连接数据库、文档、API、代码库等外部资源。开发者只需为数据源编写一次MCP服务器,任何支持MCP的AI系统都能直接使用。因此,有人将MCP比作AI世界的“USB接口”,正如USB标准统一了硬件设备的连接方式,MCP正在统一AI与外部世界的连接方式。
06
从“创作“到“行动”:正在发生的转向
Agent与MCP 的发展正共同指向一个更高阶趋势:AI 正从单一系统演化为由多个智能体构成的协作网络。在多智能体架构中,不同 Agent 分工协作,分别承担感知、规划与执行等角色,并通过信息交互实现协同决策。这种模式更接近一个虚拟的“数字团队”,以分布式协作完成复杂任务。
2025 年,谷歌推出 A2A(Agent-to-Agent)协议,与 MCP 形成战略互补:MCP 解决的是 AI 连接工具的标准化问题,A2A 则致力于 AI与 AI 之间通信的标准化。这一多个AI 协同工作的范式,正在从根本上重新定义“工作”的含义。未来,“一个人 + 一群 AI”有望成为标准的工作配置,人类的角色也将从亲力亲为的“执行者”,转变为“目标定义者”与最终的“结果评估者”。

图8 人类与Agent 集群协作 | 图源,AI生成
07
AI发展的未来图景
AI走过了漫长的探索历程。当下,AI演进的终点并非“AI取代人类”的科幻叙事,而是一种更为务实的人机分工格局:AI负责处理海量、重复、逻辑可推演的任务,人类则专注于定义方向、做出伦理判断,并承担最终责任。
AI可以生成技法成熟的图像,但作品之所以能够跨越时间长河,并不取决于技法本身;AI可以组合出符合语法规则的文本,但语言的意义来源于具体情境中的经验与表达目的。创作的核心价值,仍然根植于人类独特的生命体验。
未来

当AI逐步承担更多事务性工作之后,人类的注意力将更多转向那些无法被完全形式化的问题,例如,什么是有价值的选择?什么是合理的秩序?以及什么是值得投入的未来?

这些问题,本质上仍然需要由人类来回答。

夜雨聆风