夜雨聆风学习资料网

ARTICLE · 1120695

算法题全对、写软件翻车:选 AI 模型,别只看它「聪明」

算法题全对、写软件翻车:选 AI 模型,别只看它「聪明」
有个做技术评测的博主,最近做了件挺较真的事。
他拿了三个顶级的 AI 模型,出了几道题,想看看谁更厉害。结果出来之后,他自己都愣住了。
其中一个模型,数学题两道全对,还都是一次就做出来,碾压另外两个。可一到"写软件"的题,它却翻车了——一个思维导图网页,做了半天连界面都没跑出来;一个让程序自己玩游戏的小程序,它写出来的代码要么上来就撞,要么直接冲上天。
这个结果,跟"聪明 = 能干"的直觉,完全对不上。
今天这篇文章,我想借这场评测,跟你聊一个被很多人忽略的真相:"聪明"和"能干",是两码事。 这个道理,不只适用于选 AI 模型,更适用于你招人、带团队、做决策的每一个场景。
会做难题的人,未必会干活
先看这个反直觉的结果是怎么来的。
评测分两类题:算法题(本质是数学题,考验推理能力)和工程题(写一个软件、写一个游戏,考验的是对编程语言、各种第三方库的熟悉程度)。
那个"数学全对"的模型,叫 o4-mini-high,是 OpenAI 出的推理模型,思考能力极强。数学题它确实强,两道 LeetCode 困难题,一次通过。
但一写软件,它露馅了。
它给你写的代码,依赖库的版本号是错的;它让你用 CDN 引一个 CSS,那个地址是它"记错"的、根本打不开;你让它改,它越改越糟,最后连程序都跑不起来。
而另一个数学题一道都没做出来的模型,写软件却一次就跑通,界面还做得挺漂亮。
你发现没有,这里藏着一条特别朴素、却被"榜单分数"长期掩盖的规律:
做难题,考的是"智商";做工程,考的是"经验"。 一个是能不能在抽象世界里推演,一个是能不能在真实世界里把一堆乱七八糟的依赖、版本、报错,一个个理顺。这俩,压根不是同一种能力。
选 AI,别被"榜单"骗了
这两年,AI 圈有个风气:动不动就甩一张"跑分榜单",这个模型数学多少分、那个模型编程多少分,然后得出结论"谁更强"。
但这场评测,恰好给了这种风气一记耳光。
数学榜第一的模型,工程题翻车;数学垫底的模型,工程题反而最稳。如果光看数学榜单,你大概率会选错。
这背后的问题,是很多人在选 AI 工具时都容易踩的一个坑:把"跑分高"当成了"适合我"。
可你的实际工作,是解奥数题吗?大概率不是。你更多是在写业务代码、调第三方接口、处理各种版本冲突和报错。而"跑分"跑出来的,恰恰是离你日常工作最远的那种能力。
所以,选 AI 模型,真正该问的问题从来不是"它厉不厉害",而是:
我每天要干的活,它到底干得怎么样?
这个道理,换个场景,你就更熟悉了。
你招的人,是不是也在被"榜单"筛选
想象一下你招程序员。
一份简历写着"ACM 竞赛金牌",另一份写着"独立做过三个上线项目"。你更想要哪个?
如果你的答案是"那要看岗位"——恭喜你,你已经懂了。因为"竞赛金牌"考的是算法智商,"做过上线项目"考的是工程落地能力。你要招一个做业务的工程师,后者往往更靠谱;你要招一个做底层算法的研究员,前者才更合适。
但现实中,很多老板招人,恰恰被"竞赛金牌""名校光环"这类"榜单"吸引,而忽略了岗位真正需要的能力。结果人进来了,干不了活,还贵。
这跟选 AI 模型,犯的是同一个错:把"聪明"当成了"能干",把"光环"当成了"匹配"。
别问"谁更强",问"谁最合适"
回到开头那场评测,我觉得比任何榜单都实在:
你的工作需要大量数学和推理,选那个推理更强的;
你的工作涉及大量工程代码、外部依赖,选那个工程更稳的;
你要是还想要性价比,选那个综合够用、还免费的。
你看,没有"谁更强"的绝对答案,只有"谁最合适"的场景答案。
这个思路,是 AI 时代最该刻进脑子里的一个认知。因为工具会一直出新的,榜单会一直刷新,你今天追的这个"更强",明天就会被另一个"更强"取代。但"先想清楚我要干什么,再选工具"这个动作,永远不会过时。
所以,下次你再看 AI 评测、看模型跑分、甚至看招聘简历,别急着问"谁更强"。先问一句:
我要解决的,到底是什么问题?
想清楚这个问题,"选谁"的答案,往往自己就浮出来了。
而一个人真正拉开差距的,往往也不是他多聪明,而是他有没有这份"看场景、做匹配"的判断力。

相关学习资料