乐于分享
好东西不私藏

AI做事已练到77分,给我们剩下的只有真实的生活

AI做事已练到77分,给我们剩下的只有真实的生活
肠胃炎躺了半周,脑子却一直转。
转的是这半年看到的事:AI agent完成真实职场任务,一年从20%涨到77%。

为啥AI今年终于上路,知道光学推理不够,必须训练真实行动?

然后想到自己。毕业前实习,单位人际关系复杂,我的第一反应是回图书馆借《红顶商人胡雪岩》。

学校学了十几年,为啥没让我学会"在真实混乱里行动"?

躺着重温《士兵突击》,许三多的“好好活”提醒了我:
AI已经学会在数字世界里做事。留下能给自己和孩子的,还剩什么?
下面是这两周写的四篇日记。从一个数字77%开始,绕了一大圈。

5月2号,周六,阵雨,刚暖和点又降温!


早上刷推,刷到斯坦福的2026AI指数报告。
看到这张图:AI Agent在电脑上独立完成真实任务的成功率,从2025年2月的20%,到2026年2月的77.3%
整一年,从基本没戏,到基本能用。我去。
去查一下它怎么测试的。
哦,它找了小一百个职场白领,拿自己日常工作,编软件、分析数据、文件管理、行政助理、编辑视频……改造成测试任务,让AI做。
举俩例子。
一个是行政助理,帮几个领导协调开会时间。读取日历,找空闲时段,还要顾及领导们的感受:谁不乐意周一,谁习惯上午开会。
另一个做数据爬虫,爬一个互联网书店,一页页翻过去,把书名、作者、年份、评分、价格都抓下来,存成CSV文件。不能有错。
这就是咱职场人每天都在干的活啊。

哎,近半年玩Vibe coding,感觉AI编程进步很大。但没想到,其他职场任务也开始被agent感染。
感染率一年从20%涨到77%。
再联想到红杉资本前一阵给AGI下的新定义:能独立把事做完的AI就叫AGI,不在乎是不是比人聪明。
从数字看,AGI好像正在发生?
(资本家,你们就瞎下定义吧!先射箭,再画靶子,总有故事可讲。煽动焦虑。)

5月5号,星期二,立夏,晴有大风,吹走毛毛,宜踢球!


今天有人问我,认不认识阿里通义大模型前一阵离职的leader林俊旸,问他是不是文科生。
我说不认识。
人家最年轻P10,带通义拿到开源第一的结果,让阿里股票涨涨涨,就冲这一点,还挑人家是文科理科?
无事搜了一下,林离职后发过一篇推文,讲Agentic Thinking,智能体式思考,值得看看。
意思是说,AI训练的发展方向变了。
以前训练AI,目标是让它"想得更明白"。给它一道题,它先在脑子里推敲,最后交一个答案,看质量评分。这叫推理式思考,Reasoning。
现在目标变了。要AI能跟环境持续交互,把事做完、做对。边做边想,发现错了修正,继续做。这叫智能体式思考,Agentic Thinking。
blablabla……

有点抽象。
找来前天看的斯坦福报告,agent独立完成任务的测试,里边挑个例子来解读:书店爬虫。
任务是爬一个网站,把所有书的书名、作者、价格、评分抓下来,存成CSV。
做成这事需要哪5种能力,处理哪5个问题——
(1)究竟要思考多久,才开始行动?
理论上可以先思考:网站有哪几种类型,不同类型怎么爬。想明白再动手。
但如果链接都给你了,agent不如直接打开看看,网站什么类型,每一页什么结构,先行动再思考。
(2)选择哪些工具,以什么顺序调用?
爬网站有两种工具,轻量级的、重量级的。
根据之前行动了解到的信息,agent选择对口的工具。如果没有对口的,自己造一个。
(3)搜集了许多信息和噪音,要怎么使用?
碰到的数据很乱,有的书没作者,金额格式不统一,页面结构不一样……
信息从来不是干净的,agent得自己决定哪些有用、哪些忽略、怎么统一。
(4)怎么发现失败?失败后怎么调整计划?
应该有87本书,结果只有82条;有3条没有作者、6条价格格式是错的。
agent得主动去查验结果,数一数,判断哪里不对。发现问题,找原因,改,再跑,再看。
(5)一件事要干很久、干很多轮,怎样保证不走偏,维持目标不变?
爬虫任务,从头到尾可能要跑十几轮。每一轮都会冒出新问题。
每一个新问题,都是一个诱惑——诱惑agent钻进去,把这个局部做大做强。
但agent的任务是:抓一张完整的书单,五列,每本书一行。
能达到这个目的就够了。继续往下跑。
不走偏,是靠每一轮都记得:我在干什么,我要的结果是什么,这个问题值得我花多少时间。
就好像两个员工。靠谱的被打断十次,还能维持同一个目标。不靠谱的那个,被打断两次,就忘了原来要干什么了。

从reasoning(Deepseek-R1去年爆红就是因为这个)到现在的agent,全球顶级AI公司,花了一年把这5种能力练出来了。
又突发奇想:我们人类的这5种能力,需要多长时间、用什么方法来训练呢?
(今天凌晨,中国卫冕克鲁斯堡,不枉我这几天熬夜!小将吴宜泽有没有这5种能力?从哪儿训练的呢?)

5月10号,周日,晴,下次换短裤!


今天踢球回来,在路上又想到agent的5种能力。踢足球,不就是跟环境持续交互、用行动来推理吗。
场上球员位置、攻防关系、空间机会不断变化,信息、噪音都很大,留给我思考的时间窗口很短。
两次后场脚下球都被抢断,对手压迫太紧,我试试过顶、打身后?左前队友接长传不行,跟他换个位?
这些能力,在真实世界里很有用,可我们是在哪里训练的?学校教不教呢?

晚上到家,再想想这5件事,好像大部分都…… 都被学校的应试教育完美避开~
(1)究竟要思考多久,才开始行动?
我在学校练过。到点了交卷,想清楚几成就要下笔。
虽然我考试作文总是写不完 o(╥﹏╥)o
(2)选择哪些工具,以什么顺序调用?
这个学校也有练。作文用什么论据,几何题画不画辅助线。
前两件事,学校还过得去。从第三件开始,情况就变了。
(3)搜集了许多信息和噪音,要怎么使用?
考试有阅读理解、材料分析,也练信息整合。
但试卷上的噪音、干扰项,都是出题人设计的。有标准答案等着我。
毕业后的世界不是这样的。
我做个方案,查资料,一半支持A,一半支持B。
我做个产品,用户反馈互相矛盾,有人说太复杂,有人说不够用。
没人知道哪些是干扰项,问出题人——我老板,他也不知道,因为根本没有标准答案。
学校练的技能是识别出题人意图——材料考什么,答案藏在哪,哪些是干扰项。
但这个能力练得越强,在真实世界里,没准越危险。
(4)怎么发现失败?失败后怎么调整计划?
学校有纠错——错题本、卷子讲评。
但最难的那一步是老师替我做的:给我打对错,正确解法写在黑板上,我只要看懂、记住、下次照做。
自己发现错了、诊断哪里错了、出替代方案、验证有没有效,这条链路,从没完整地交给我。
我出了校门才发现,没有对钩和叉叉,没有黑板了,不会诊断和验证,没准我都发现不了错误。
(5)一件事要干很久、干很多轮,怎样保证不走偏,维持目标不变?
这件事学校做得很好,课表、教学进度、月考期中期末、成绩排名……有一套精密的系统维持我的连贯性。
我不需要思考下一步做什么,系统全帮我安排好。
毕业后,没人替我定义"下礼拜做什么",我就傻了。
因为我从没练过一件事:
没有外部系统约束时,自建一套保持连贯的系统,给自己设检查点,在偏离的时候把自己拉回来。

似乎,
应试教育的环境,把这5件事里的3件,系统性地帮我回避了。
学校要在有限时间里,把确定的知识教给很多孩子,就没法让我在真实的混乱里自主试错、花时间、犯错。
记得我毕业前实习,觉得单位人际关系复杂,第一反应居然是:回学校图书馆,借一套《红顶商人胡雪岩》来看。
是不是就像林俊旸说的?
模型纯推理能力很强,在真实环境里部署失败。
可,AI agent都tm训练出来了,我们的学校却不训练这个,我是毕业后趟了20年的坑,那孩子怎么办?
今晚没戏了,先睡。

5月16号,周六,多云,停一周运动


肠胃炎躺了半周。
没力气干别的,重温了十几集《士兵突击》,刚毕业那会看过但没太看懂。
又听到许三多的河南口音说那句话——
"好好活,就是做很多很多有意义的事。"

看剧,又想起了上周自己问的傻问题:agent在练的东西,我们人类学校没在练,怎么办?
我管它怎么办呢。

AI agent独立完成真实任务,1年成功率就提升到77%了。明年、后年呢?我们还要跟它比吗?
那个77%里面是什么?
编程、行政助理、数据爬虫、文件整理、分析数据……都是数字世界里的事。
我们比AI强的地方,不在这里头。
物理世界里,做坏了就是做坏了。没有ctrl+z。
人际世界里,说错了话,关系就变了。系统不会提示"操作失败,是否重试"。
还有跨越几个礼拜、几个月、几年的一个目标,中间没有系统帮你打分。
这些AI够不着。
AI练会了在数字世界里行动。我们只剩真实的生活可以练。
它打了77分,我给自己打几分?

从我自己做起吧,好好活。
先坚持给自己写日记,不用AI写。
吃饭的时候不玩手机,关注碗里的饭,或者对面的人。
……
[Start]