乐于分享
好东西不私藏

华尔街给8个AI助理办了场考试,第一名你绝对想不到

华尔街给8个AI助理办了场考试,第一名你绝对想不到

华尔街投行杰富瑞给8个AI助理办了场考试,干的全是打工人每天的活。第一名你绝对想不到。

👇 每天一个AI干货,戳这里

华尔街投行杰富瑞,8月19号干了件有意思的事

他们把中美两国的8个AI助理拉到一起,办了一场考试。不是跑分刷题那种,是实打实干活。给一堆文件写年报摘要,每条数据必须标明出处,不同文件数字打架的地方还得主动指出来。上网查数据做对比表。操作浏览器找资料做文档。根据数据做英文PPT。看着参考图做营销海报。

全是打工人每天真实在干的活

选手来头都不小。美国队三个,Anthropic的Claude Cowork、OpenAI的Codex、谷歌的Gemini Spark。中国队五个,阿里的千问办公、字节的豆包、月之暗面的Kimi Work、MiniMax的Code、腾讯的Workbuddy。

按大多数人的直觉,第一名不是Claude就是Codex。这俩背后的模型,是目前公认最聪明的

结果呢?

千问办公,95分,第一。Claude Cowork,94分,第二。Codex,92分,第三。后面是Kimi Work 86分、豆包77分、MiniMax 71分,腾讯Workbuddy和谷歌Gemini Spark并列垫底,都是66分。

杰富瑞8款AI助理综合评分排名

千问办公?这名字你大概率没听过。一个中国选手,跑赢了硅谷最亮的两颗星

95和94,差1分。你可能会说,这也算赢?

别急,杰富瑞还爆了第二个炸弹

脑子排第四,活却干得最好

他们不只测了助理总分,还单独测了每个助理背后「大脑」的智商。千问办公的底层模型叫Qwen 3.8 Max,智商56分,排第四。Claude背后的Opus 5,61分,第一。Codex背后的GPT-5.6,59分,第二。

翻译成人话,千问的脑子比Claude笨了5分,但干起活来反而比Claude多1分。

这不正常。智商高的人考试应该考得更好才对。

Harness才是关键。决定AI助理好坏的,不只是脑子聪不聪明,还有一套叫「Harness」的东西——你可以理解成一个助理的「工作方法」。怎么领任务、怎么拆步骤、什么时候该上网查、什么时候该翻文件、出了错怎么自己纠回来。脑子再聪明,不会安排工作,干起活来照样乱七八糟。

管理比脑子更管用

杰富瑞把Harness拆成了六层,指令、上下文、工具、边界、反馈、治理。你想想看,这六层正好对应了公司雇一个员工之后要做的事。交代任务、给信息、给工具、划权限、给反馈、做管理。模型就是那个新来的聪明人,Harness就是这套管理机制。聪明人再厉害,扔进一个没有管理的公司,也干不好活。

打个比方。俩人同时去面试,一个清华毕业智商180,但不会用Excel不会做PPT,领导说去查个数据他能查三天。另一个普通一本智商130,但什么工具都溜,领导说做啥他半天就交,还自己检查了一遍。

你猜老板选谁?

📊 控制变量实验

• 同一个Claude模型,套上不同Harness → 得分从58%到76.4%,差了18.4个百分点

• 同一个Gemini模型,换个Harness → 得分从56%到69.4%,差了13.4个百分点

脑子没换,只换了工作方法,成绩差了将近20分。

这比换个更聪明的模型管用多了。

杰富瑞把助理总分拆成两块来算,脑子占60%,工作方法占40%,反推出每个人的「隐含Harness分」。结果千问办公的工作方法分最高,超过了Claude和Codex。而且它是8个选手里唯一一个每一科都拿到90分以上的,不偏科,啥活都能干。

更狠的是价格

千问的底层模型调用价格大约1.1美元处理一百万字,比GPT-5.6和Opus 5便宜了70%到80%。脑子没人家聪明,干活比人家好,还比人家便宜这么多。

千问办公现在已经打通了钉钉,企业员工直接用它就能干群聊总结、建文档表格、发消息发邮件这些事。你用得越久,它越懂你的工作习惯,你越离不开它。

我自己之前也一直在追谁的模型更聪明。每次新模型发布,第一件事就是去看跑分排行榜,谁排第一就觉得谁最牛,赶紧去试。但杰富瑞这份报告让我重新想了想这件事。

我自己的感受是,有些模型跑分很高,但你真让它帮你干一件具体的活,它要么理解不了你要什么,要么干到一半跑偏了,要么做出来的东西看着行但细节全是坑。反倒是那些跑分不是最高、但产品打磨得好的,用起来顺手得多。

这也解释了为什么谷歌这次并列垫底。谷歌的模型不差,但它的助理产品力确实拉胯。跟前几天「谷歌要求AI核心员工全部搬回硅谷坐班」那个新闻串起来看,谷歌在AI上的焦虑,不是脑子不够聪明,是产品不够好用。

千问办公已打通钉钉,支持群聊总结/文档创建/邮件收发

拼智商的阶段过去了

所以这个故事真正有意思的地方在于,AI的竞争可能真的过了「拼智商」的阶段了。

过去一年多,大家都在卷谁的参数更大、谁的跑分更高、谁的智商分更牛。但杰富瑞用一组实打实的数据说了句大实话,别再只盯着脑子买了。AI助理真正值钱的,是那套工作方法,因为它会跟你的数据、你的工作流、你的习惯长在一起,换都换不掉。

接下来拼的是「谁更会干活」。

而这一轮,中国企业好像确实跑在了前面。

推荐阅读

出道两月报价25万,AI演员说美瞳舒服,可你连眼球都没有

给它5秒你的声音,它能用中英日韩粤说出你写下的任何话

微信新增16个AI入口,朋友圈AI点评来了

腾讯这个开源视频模型效果超过了Runway——但你大概率跑不起来

微信新增16个AI入口,朋友圈AI点评来了

AI竞争进入新阶段,想看更多AI落地干货,戳这里 👇

觉得不错,随手点个在看转发三连吧 ✨