AI做事已练到77分,给我们剩下的只有真实的生活转的是这半年看到的事:AI agent完成真实职场任务,一年从20%涨到77%。为啥AI今年终于上路,知道光学推理不够,必须训练真实行动?
然后想到自己。毕业前实习,单位人际关系复杂,我的第一反应是回图书馆借《红顶商人胡雪岩》。学校学了十几年,为啥没让我学会"在真实混乱里行动"?
躺着重温《士兵突击》,许三多的“好好活”提醒了我:AI已经学会在数字世界里做事。留下能给自己和孩子的,还剩什么?下面是这两周写的四篇日记。从一个数字77%开始,绕了一大圈。
5月2号,周六,阵雨,刚暖和点又降温!
看到这张图:AI Agent在电脑上独立完成真实任务的成功率,从2025年2月的20%,到2026年2月的77.3%。哦,它找了小一百个职场白领,拿自己日常工作,编软件、分析数据、文件管理、行政助理、编辑视频……改造成测试任务,让AI做。一个是行政助理,帮几个领导协调开会时间。读取日历,找空闲时段,还要顾及领导们的感受:谁不乐意周一,谁习惯上午开会。另一个做数据爬虫,爬一个互联网书店,一页页翻过去,把书名、作者、年份、评分、价格都抓下来,存成CSV文件。不能有错。
哎,近半年玩Vibe coding,感觉AI编程进步很大。但没想到,其他职场任务也开始被agent感染。再联想到红杉资本前一阵给AGI下的新定义:能独立把事做完的AI就叫AGI,不在乎是不是比人聪明。(资本家,你们就瞎下定义吧!先射箭,再画靶子,总有故事可讲。煽动焦虑。)
5月5号,星期二,立夏,晴有大风,吹走毛毛,宜踢球!
今天有人问我,认不认识阿里通义大模型前一阵离职的leader林俊旸,问他是不是文科生。人家最年轻P10,带通义拿到开源第一的结果,让阿里股票涨涨涨,就冲这一点,还挑人家是文科理科?无事搜了一下,林离职后发过一篇推文,讲Agentic Thinking,智能体式思考,值得看看。以前训练AI,目标是让它"想得更明白"。给它一道题,它先在脑子里推敲,最后交一个答案,看质量评分。这叫推理式思考,Reasoning。现在目标变了。要AI能跟环境持续交互,把事做完、做对。边做边想,发现错了修正,继续做。这叫智能体式思考,Agentic Thinking。
找来前天看的斯坦福报告,agent独立完成任务的测试,里边挑个例子来解读:书店爬虫。任务是爬一个网站,把所有书的书名、作者、价格、评分抓下来,存成CSV。理论上可以先思考:网站有哪几种类型,不同类型怎么爬。想明白再动手。但如果链接都给你了,agent不如直接打开看看,网站什么类型,每一页什么结构,先行动再思考。根据之前行动了解到的信息,agent选择对口的工具。如果没有对口的,自己造一个。碰到的数据很乱,有的书没作者,金额格式不统一,页面结构不一样……信息从来不是干净的,agent得自己决定哪些有用、哪些忽略、怎么统一。应该有87本书,结果只有82条;有3条没有作者、6条价格格式是错的。agent得主动去查验结果,数一数,判断哪里不对。发现问题,找原因,改,再跑,再看。(5)一件事要干很久、干很多轮,怎样保证不走偏,维持目标不变?爬虫任务,从头到尾可能要跑十几轮。每一轮都会冒出新问题。每一个新问题,都是一个诱惑——诱惑agent钻进去,把这个局部做大做强。但agent的任务是:抓一张完整的书单,五列,每本书一行。不走偏,是靠每一轮都记得:我在干什么,我要的结果是什么,这个问题值得我花多少时间。就好像两个员工。靠谱的被打断十次,还能维持同一个目标。不靠谱的那个,被打断两次,就忘了原来要干什么了。
从reasoning(Deepseek-R1去年爆红就是因为这个)到现在的agent,全球顶级AI公司,花了一年把这5种能力练出来了。又突发奇想:我们人类的这5种能力,需要多长时间、用什么方法来训练呢?(今天凌晨,中国卫冕克鲁斯堡,不枉我这几天熬夜!小将吴宜泽有没有这5种能力?从哪儿训练的呢?)
5月10号,周日,晴,下次换短裤!
今天踢球回来,在路上又想到agent的5种能力。踢足球,不就是跟环境持续交互、用行动来推理吗。场上球员位置、攻防关系、空间机会不断变化,信息、噪音都很大,留给我思考的时间窗口很短。两次后场脚下球都被抢断,对手压迫太紧,我试试过顶、打身后?左前队友接长传不行,跟他换个位?这些能力,在真实世界里很有用,可我们是在哪里训练的?学校教不教呢?
晚上到家,再想想这5件事,好像大部分都…… 都被学校的应试教育完美避开~这个学校也有练。作文用什么论据,几何题画不画辅助线。前两件事,学校还过得去。从第三件开始,情况就变了。但试卷上的噪音、干扰项,都是出题人设计的。有标准答案等着我。我做个产品,用户反馈互相矛盾,有人说太复杂,有人说不够用。没人知道哪些是干扰项,问出题人——我老板,他也不知道,因为根本没有标准答案。学校练的技能是识别出题人意图——材料考什么,答案藏在哪,哪些是干扰项。但最难的那一步是老师替我做的:给我打对错,正确解法写在黑板上,我只要看懂、记住、下次照做。自己发现错了、诊断哪里错了、出替代方案、验证有没有效,这条链路,从没完整地交给我。我出了校门才发现,没有对钩和叉叉,没有黑板了,不会诊断和验证,没准我都发现不了错误。(5)一件事要干很久、干很多轮,怎样保证不走偏,维持目标不变?这件事学校做得很好,课表、教学进度、月考期中期末、成绩排名……有一套精密的系统维持我的连贯性。没有外部系统约束时,自建一套保持连贯的系统,给自己设检查点,在偏离的时候把自己拉回来。
应试教育的环境,把这5件事里的3件,系统性地帮我回避了。学校要在有限时间里,把确定的知识教给很多孩子,就没法让我在真实的混乱里自主试错、花时间、犯错。记得我毕业前实习,觉得单位人际关系复杂,第一反应居然是:回学校图书馆,借一套《红顶商人胡雪岩》来看。可,AI agent都tm训练出来了,我们的学校却不训练这个,我是毕业后趟了20年的坑,那孩子怎么办?
5月16号,周六,多云,停一周运动
没力气干别的,重温了十几集《士兵突击》,刚毕业那会看过但没太看懂。
看剧,又想起了上周自己问的傻问题:agent在练的东西,我们人类学校没在练,怎么办?
AI agent独立完成真实任务,1年成功率就提升到77%了。明年、后年呢?我们还要跟它比吗?编程、行政助理、数据爬虫、文件整理、分析数据……都是数字世界里的事。人际世界里,说错了话,关系就变了。系统不会提示"操作失败,是否重试"。还有跨越几个礼拜、几个月、几年的一个目标,中间没有系统帮你打分。AI练会了在数字世界里行动。我们只剩真实的生活可以练。