乐于分享
好东西不私藏

你以为 AI 只是工具?它已经会自训、做手术、跑赢半马

你以为 AI 只是工具?它已经会自训、做手术、跑赢半马

如果有个东西,去年还在跟你聊天,今年已经能给人做腹腔镜手术、跑赢人类半程马拉松,你会怕吗?这就是 AGI,而它的轮廓,正被六大技术一笔笔勾勒出来。

几天前,两家中国 AI 公司的创始人,同一周各自发了一封内部信:智谱唐杰写的是"巨浪已来",宣布重金直指 AGI;MiniMax 闫俊杰更决绝,实现 AGI 前不再领薪。两个把身家押在 AGI 上的人,让人忍不住想问:AGI,是不是真的快来了?


2021年,国产剧《你好,安怡》播出。片中的安怡本来只是一台会做家务的机器人,但觉醒了意识,有了人类的情感,能像人一样自主思考、自主学习、自主决策,甚至介入了主人家的情感生活。

虽然这只是一部都市科幻剧,但剧里的幻想,却在渐渐照进现实。

有了自主意识,能自己思考、学习、做决定的机器人,我们该怎么定义?这,就是通用人工智能(AGI)。

学术界对AGI的定义目前还没统一。有人说能通过人类水平测试就算,有人要求必须能自主学习和改进,还有人觉得必须要有意识和情感才行。

定义没统一,但有一点共识大家都是认可的:把AI能力比作一座金字塔,AGI就是那个塔尖。技术每往前走一步,我们就离塔尖近了一点。

真正的通用智能,不是会做一件事,而是会同时想、会学、会自己拿主意。

现在的AI,在某一方面或许很强,比如写文章、绘画、生成视频。可让它同时做饭、收拾房间、陪孩子玩,这种又要想、又要学、还得自己拿主意的多线任务,还远远做不到。

过去两年,AI新闻像轰炸机一样,一波接一波。往后几年,AI仍是科技、社会甚至资本的热点。真正的AGI还没出现,但每一个热点,都是AI迈向AGI的又一步。


一、大语言模型:越来越像"大脑"

2024年5月,OpenAI发布GPT-4o,一个模型同时处理文本、图像、音频,平均响应延迟压到320毫秒(约0.3秒),AI第一次能像人一样边看边听边说。2025年GPT-5发布,首次把文本、代码、图像统一到一起处理,还能从一张手绘草图直接生成可运行的网页。2026年6月,GPT-5.6系列开启有限预览,旗舰模型Sol编程推理能力再上一个台阶,同时推出均衡版Terra和速度版Luna,分层供给,不同场景用不同档位。

OpenAI 在技术文档里轻描淡写地提到,Luna 其实是由旗舰版 Sol 自己训出来的,它自己找可用的 GPU、定训练配置、写启动脚本,全程没有人类工程师插手。过去训练一个顶级大模型,数据清洗、奖励模型设计、知识蒸馏、超参搜索,全靠几百名博士熬出来;现在 Sol 把这活儿自己干了。圈内人给这种现象起了个让人后背发凉的名字,叫递归自我改进。

过去训练一个顶级模型,要几百名博士熬;现在它自己训自己。

中国力量两样不容小觑。2025年1月,DeepSeek V3只花了约557.6万美元训练成本,性能就冲到全球开源AI最强;同年发布的DeepSeek-R1在V3基础上通过强化学习微调,增量训练成本仅29.4万美元,推理成本相比GPT-4暴降99%。2026年DeepSeek-V4发布,百万Tokens价格降至0.025元。

Anthropic同样不甘示弱。Claude Sonnet 5号称"最强agent模型",Claude Fable 5拿下1M上下文窗口和多项基准测试最佳成绩。2026年6月,Anthropic以965亿美元估值完成H轮融资,超越OpenAI成为全球估值最高的AI公司。从90亿美元年化收入跃升到300亿美元,只用了四个月。

从最初的聊天解闷,到后来的推理分析问题,再到今天同时看图、听语音、理解代码。大语言模型越来越像一个"电子大脑"。

虽然它没有意识、没有情感、没有身体、没有感官,只能待在屏幕里。


二、AI绘画:让AI有了"审美"

Midjourney、Stable Diffusion、Flux这些名字,在设计圈已经无人不知,早已成了创作者的生产工具。

2026年,AI生成的产品图、人像照片已经可以以假乱真。

OpenAI最新的GPT Image-2,按描述生成的老照片在社交媒体疯传。好多照片流传在网上,网友一开始当了真,后来又全给辟了谣。

GPT Image-2 刷屏后没几天,Meta 也交出了自己的答卷。7 月初,Meta 超级智能实验室发布首款图像生成模型 Muse Image(内部代号"芒果"),在第三方文生图榜单上冲到第二,紧追 OpenAI 的 GPT Image-2,两项分数只差 105 分。更特别的是,它不像传统生图工具听一句提示词出一张图,而是像一个智能体,会先联网搜真实信息、现场写代码算准版面,画完发现不对还能自己反思、改稿重画。Meta 说这种行为没被人专门教过,是在强化学习里自己长出来的。

图像模型也开始有了类似语言模型那套越练越会自己想办法的底层能力。

不管是审美水平,还是图片细节,AI都已经越来越接近人类。或许它还不懂什么是美,但它已经有了"审美"能力。


三、视频生成:让AI学会"叙事"

2024年Sora的60秒视频,震惊世界。到了2026年,AI视频还在刷新认知。

字节跳动Seedance 2.0引爆全网,阿里巴巴开源通义视频模型Qwen2.5-Video(支持长达数分钟连贯视频生成),快手可灵迭代到3.0,OpenAI Sora 2和谷歌Veo 3持续进化。几乎同时,DeepSeek-V4发布,推理成本再砍掉九成,用AI处理一部《三体》体量的小说,成本不到一分钱。

热闹还没停。7 月 9 日到 10 日,AI 视频赛道在 24 小时内接连炸出三声惊雷。先是快手可灵在旧金山发布 Kling 4,支持 60 秒 4K 连续生成、多镜头切换和原生对白;不到 12 小时,谷歌 DeepMind 把 Veo 4 全量开放,单价从 6 月的 0.5 美元每秒直接砍到 0.1 美元每秒;再过 5 小时,OpenAI 官宣 Sora 3 的 API 单价下调 60%。一天之内,单条 4K 视频的价格暴跌八成,行业把这 24 小时称为"AI 视频价格战元年"的起点。

AI视频生成已经走出试验阶段,进入广告制作的实用阶段,甚至能够生成电影级别的视频。

电影《盗梦空间》里,筑梦师可以在梦中构建出完整的世界。AI现在已经能做空间叙事了,是不是说明,它们也有了"筑梦"的本事?


四、AI智能体:让AI自主"动手"

2026年开年,OpenClaw以31万Star成为全球最火开源AI智能体框架。"养小龙虾",也成了职场人的开年时尚。

在ChatGPT把AI带出圈之后,人们对它的印象一直就是聊天,对着它写文章、画画、生成视频。OpenClaw一出来,AI不再只会"回答问题",还能自己规划、调工具、跑任务,甚至主动操作你的电脑。

这种"自主干活"的趋势,已经不只是极客玩具。业内有报告把 2026 年直接定义为智能体规模化落地元年,国内办公类智能体月访问量已经突破 2000 万次,企业里开始部署 AI 团队,让分析师、工程师、审核、设计多个角色分工协作,自己沟通、自己校验,一气呵成跑完一个项目。从"问答"到"干活",这道坎,今年算真正迈过去了。

此外,智能还给AI赋予了"人格"和"记忆"。AI从只能被动处理问题,开始能够自主"动手"。

或许有一天,我们的工作,尤其是每天对着电脑的职场人的工作,真能直接交给AI了。


五、自动驾驶:让AI睁开"双眼"

按国际SAE标准,自动驾驶分为六个等级:L0(无自动驾驶,人类全权操控);L1(驾驶辅助,如定速巡航);L2(部分自动驾驶,同时控制方向与加减速,但人类必须全程监控,目前主流量产车均在此级别);L3(有条件自动驾驶,特定场景下可脱手脱眼,但需随时准备接管);L4(高度自动驾驶,限定区域内无需人类干预,如Robotaxi);L5(完全自动驾驶,任何场景全自动驾驶,目前仍在研发中)。

2025年大家叫它"L3自动驾驶量产元年"。理想汽车宣布2025年做到L3级别自动驾驶,华为鸿蒙智行、小鹏XNGP加速落地。2026年北京车展,L3自动驾驶已经开始量产装配。

真正让人兴奋的,是L4级落地。百度旗下"萝卜快跑"已在武汉、北京、深圳等22座城市跑全无人Robotaxi,2025年在武汉率先盈亏平衡,单日订单峰值突破2.4万单,成了全球规模最大的L4级自动驾驶商业运营项目。

不只在城市马路上,矿区的无人驾驶也悄悄跑成了规模。截至今年 6 月,易控智驾的露天矿无人驾驶方案已经在 40 多座矿山落地,超过 3100 台无人驾驶矿卡常态化运行,在极寒、高温、高海拔的极端工况下连轴转。同样是"AI 司机",一个在武汉接乘客,一个在矿坑运矿石,各自把自动驾驶从演示场开进了真实生产。

AI"司机"不只在测试场跑,已经在城市街道工厂矿区自我迭代了。

我们常说"眼睛是人类心灵的窗口"。AI的这个"窗口",是不是也已经打开了?


六、具身机器人:给AI装上"身体"

特斯拉Optimus从概念机走到量产,Figure AI估值390亿美元,优必选Walker S2在比亚迪工厂部署。

具身机器人,已经走出了实验室、开始走进了现实。2026年春晚舞台,让大众真正觉得"机器人时代来了"。宇树科技、松延动力、魔法原子、银河通用的具身机器人齐齐亮相,实时感知舞台、自主调整步态,完成了武术舞蹈等高难度动作。

7 月,国产宇树 G1 通用人形机器人登上了国际顶刊《Nature》,它远程操控,完成了一头活体猪的腹腔镜胆囊切除微创手术,这是全球第一例由通用人形机器人做的活体手术。整套方案不用专用手术臂,机器人直接握着临床标准器械操作,单台耗时 56 分钟,两台协同只要 32 分钟。从跳舞到拿手术刀,人形机器人跨进的,是连很多专业设备都没啃下的精密医疗场景。

当机器人拿起手术刀,我们才真正看清,身体是智能最后一道门。

同年4月,北京亦庄,百余台人形机器人同场竞跑半程马拉松。冠军"闪电"机器人跑出50分26秒的成绩,已经超越了人类半马最佳成绩56分42秒。而从2025年首届赛事的2小时40分42秒到2026年破人类纪录,间隔仅一年,进步之快,令人咋舌。

2026年7月,蚂蚁灵波发布业界首个"具身原生"世界动作模型LingBot-VA 2.0,不再依托数字世界模型嫁接,而是为物理世界从头设计。它石智航全新一代A3轮式双臂具身工业机器人搭载旭日S600芯片,开启千台级规模化部署。具身智能从实验室驶向产线,终于有了真正的量产信号。

机器人,让AI从虚拟世界,走进了物理世界。具身机器人的各项能力,跳跃、奔跑、协同,开始碾压普通人。

AI离拥有一具真正的身体,或许只是时间问题。


有意思的是,这六个方向的企业,马上就要在同一场展会上同台。2026 世界人工智能大会定在 7 月 17 日到 20 日落地上海,大模型、智能体、视频生成、自动驾驶、人形机器人,产业链上下游会集中亮相。同一周,全栈国产的"灵晟"超算刚登上 TOP500 榜首,终结了美国在这个位置的长年占据。六大方向各自狂奔了几年,第一次有了在同一个场子里面对面较量、彼此借力的机会。

技术全景:从碎片到拼图

今天的AI,已经有了:

"大脑"(大语言模型)、"感官"(语音/视觉)、"叙事"(视频生成)、"行动"(AI智能体)、"双眼"(自动驾驶)、"身体"(具身机器人)。

但有个问题:这些能力,还分散在不同的技术领域。

7 月的一份 AGI 进展报告,给这种"分散"做了个注脚。顶尖模型在单一基准上已经很能打,研究生级科学题 GPQA 正确率到了 85%,比很多人类还高;可在需要连续多天、自主干完一项知识工作的任务上,表现还不到人类水平。圈内人也开始敢给时间表了,有专家预测,到今年 12 月,AI 或许能独立搞定 39 小时的知识工作。换句话说,AGI 还没真正到来,但那道坎,正在以比三年前任何人预期都快得多的速度被逼近。

大语言模型在服务器里跑,具身机器人在工厂里走,自动驾驶在马路上开。它们各自强大,但互不相通。

如果有一天,这些能力真正合而为一,是不是AGI就真的成了?

这个问题,我们下一篇再来深入探讨。

AGI 不是某一项技术的胜利,而是当大脑、双眼、身体合而为一时,智能才真正醒来。

如果你也好奇 AI 到底走到哪了,转发让更多人看到。你最怕 AI 先抢走哪种工作?评论区聊聊。