当前时间: 2026-07-05 06:49:08
分类:办公文件
评论(0)
AI 的新拐点用目前三个比较顶的模型:GPT 5.5、Claude Opus 4.8、GLM 5.2,同时扔了同一道在我专业领域比较难的问题,让同事盲选谁是谁写的 这真不是眼瞎,那种一眼就能看出「这个明显比那个聪明」的时代已经过去了。 一、90分的平权 我记得特别清楚,2023年初的时候,我第一次用GPT-4。当时拿国内的一个模型做了个对比,那个差距,怎么说呢,就像一个清华博士在跟一个刚学会说话的小孩聊天。你都不需要看内容,光看逻辑的连贯性、语言的质感,就是两个物种。 现在2026年,把三份不同模型的答案混在一起,已经很难有人能分辨谁是谁了。 中外模型的能力差距,正在以一种超乎想象的速度被抹平。 我有时候觉得,我们可能正站在一个非常特殊的节点上。就是那种,大模型的核心能力,从「参差不齐」走向「大家都差不多」的节点。 如果用打分来比喻的话,就是中国的模型,第一梯队差不多已经到了一个90分左右的水平线。 90分,不是100分,确实整体还是有一些差距。但说实话,可能已经不足以构成决定性的优势了。 当国内模型都到了90分的时候,当「聪明」不再是稀缺资源的时候,比拼的是什么? 这个问题我想了挺久的。也不是我一个人在想,我身边很多做AI的朋友,最近聊天都会聊到这块。大家都有一种感觉,就是那个靠「模型能力碾压」就能赢的时代,在慢慢过去。 我记得2012年那会儿,小米1代发布,跑分是所有发布会的高潮。雷军在台上喊跑分,底下的人嗷嗷叫。因为那时候处理器的差距是真的大,你跑分高就是真的快,真的好用。 但后来呢?后来所有旗舰机的处理器都到了一个「足够用」的水平。这时候你再看手机发布会,没人特别强调跑分了。大家开始卷拍照,卷屏幕,卷快充,卷系统体验,卷生态。 因为当核心硬件不再是瓶颈的时候,真正决定用户体验的,变成了包裹在那个硬件外面的一切。 模型也是一样的道理。我自己这些年的感受是特别深的。 2023年我用GPT-4的时候,觉得这玩意简直是降维打击。那个时候我同时也在用Claude 2,跟GPT-4的差距是肉眼可见的。国内的模型那会儿还在追赶GPT-3.5,中间还隔着GPT-4一整代。 2024年,Claude 3 Opus出来了,第一次让我觉得,哦,好像不只OpenAI一家能做顶级模型了。那一年年底DeepSeek V3炸出来,价格屠夫,整个行业都震了一下。 2025年,差距进一步缩小。GPT-5发布,确实强,但DeepSeek、GLM和Qwen也跟上了,至少在中文场景下,很多时候你真的分不清谁是谁。 这种感觉很奇妙。一方面,作为中国用户,看到国产模型追上来了,当然是很爽的。但另一方面,作为一个天天跟AI打交道的人,我也在想,当所有人都是90分左右的时候,这事儿,到底比的是什么? 二、AI的头脑与效率之争 这个其实不用我多说,DeepSeek从V3开始就是价格屠夫,V4更狠。你想想,当一个90分的模型,API价格只有另一个90分模型的十分之一甚至更少的时候,这事就没得选了。 我跟你说,对于小团队和个人来说,这个差距是致命的。 我自己每个月在API上的花费,从最早全用 Claude 的时候几千块,到现在混用之后降到了几百块。不是因为我用的少了,而是因为大部分活儿,国产模型已经干得够了。只有少数特别需要顶级能力的场景,才会切到GPT或者Claude的最新模型。 而且那些特别需要顶级的场景,说实话,国产模型也慢慢都能做了。 当能力差不多的时候,为什么不选便宜的?这也不是什么爱国不爱国的问题,就是纯粹的钱袋子生意。 你可能觉得聊价格太low了,但我想说的是,价格从来不是单纯的便宜不便宜的问题,价格反映的是「背后的效率」。 DeepSeek之所以能卖这么便宜,是因为他们的工程能力、训练效率、推理优化,都做到了极致。这种效率本身就是一种核心竞争力。 当模型能力都在90分的时候,谁能在90分的基础上把成本打到最低,谁就拥有最大的市场。 你用GPT-5-Thinking的时候,它确实聪明,但你想没想过,它一个回答要想一两分钟。一两分钟啊朋友们。你如果跟一个真人聊天,他每说一句话要先沉默一两分钟,你不得疯掉? 再叠加agent的任务链,这个时间差距会被几倍几十倍的放大 但你看国内一些主打快速的模型,很多场景下几秒钟就出结果了,质量也没差太多。 这个事情其实很多人是有体感的。你用GPT或者Claude的时候,那个等待时间,有时候真的会让你怀疑人生。。。特别是一些简单的任务,你明明知道这个答案不需要想那么久,但它就是要给你转一两分钟。 我就经常吐槽这个,我说你一个90分的选手,做一个70分的题,为什么要用100分的时间??? 速度这件事在未来会越来越重要。因为模型的使用场景,正在从「坐在电脑前等答案」变成「在真实工作流中实时协作」。你写代码的时候需要AI实时补全,你做设计的时候需要AI实时给建议,你跟客户聊天的时候需要AI实时帮你分析。 这些场景,AI需要在那个瞬间给你反馈,而不是让你等2分钟。 这块我觉得国产模型其实是有优势的。因为国内厂商在工程优化、推理加速这块,卷得很凶。飞书和钉钉里集成的AI,响应速度已经比ChatGPT快不少了。 三、AI的生态战场 怎么说呢,生态这个事,可能反而是中美差距最大的一块。 你看OpenAI,从ChatGPT到GPTs商店,再到现在的Codex,它已经不只是一个模型了,它是一个平台。你在这个平台上有无数的工具、无数的插件、无数的skill。 Claude那边也不差,Claude Code几乎成了一些大厂程序员的标准工具,整个开发者生态非常成熟。 国内呢?DeepSeek开源是做得很不错的,社区也很大。但说实话,在生态的完整度和成熟度上,跟OpenAI和Anthropic比,还是有差距的。 但有意思的是,生态这个东西,恰恰是最难用「砸钱」来追的。模型你可以靠更多算力、更好的算法来追,但生态需要时间,需要开发者社区,需要无数人在上面建东西。 你想想看,Android当年追iOS,在系统流畅度上很快就追上了,但生态追了多少年?到现在在某些方面还是有差距。 不过反过来说,生态也是最容易形成「本土优势」的地方。中国的开发者社区足够大,中国的应用场景足够丰富,如果国产模型能把国内的开发者生态做起来,这个壁垒会比模型本身更牢固。 四、AI的文化战场 说到这个,我还想聊一个我觉得特别被低估的东西,就是模型的文化理解。 我之前让几个模型写过一篇关于春节的文章。GPT-5写得很好,结构清晰,用词准确,但你看完就觉得,这是一个非常聪明的外国人写的关于中国春节的作文。DeepSeek写的呢,文笔可能粗糙一点,但里面会自然地提到抢红包手速、提到七大姑八大姨催婚、提到那个永远热气腾腾挤满人的厨房,这些东西,是长在骨头里的。 我一直觉得,模型的90分里面,可能有一部分是「文化分」。一个模型如果连你的文化都不懂,它智商再高,用起来也是隔靴搔痒。 这个事儿在中文场景下特别明显。中文可能是世界上最美但也最难的语言之一,我们有无数的语境、隐喻、双关、网络用语,这些东西不是靠多读几篇论文就能学会的。你得到中国互联网的泥土里去滚,你得吃透那些弹幕文化、评论区文化、段子文化。 回到刚才那个手机处理器的类比。当所有处理器都到了「足够用」的水平之后,真正让用户选iPhone而不是安卓的,不是处理器跑分,而是iOS的那套体验,是App Store的生态,是AirDrop的丝滑,是iMessage的社交粘性。 模型也是一样。当所有模型都90分的时候,用户选择你的原因,不再是「你更聪明」,而是「你更好用」,「你更懂我」,「你更快」,「你更便宜」,「你的生态更丰富」。 五、AI的安全隐忧 你看看Claude前几天的暗门事件,隐秘后门狙击中国大陆,这次能被发现,下次人家用fable5写个更隐蔽的你发现不了又怎么办呢? 很多企业是真的不敢把数据扔给海外模型的。特别是今年,数据安全这根弦绷得越来越紧。你一个做金融的,敢把客户数据扔给GPT?你一个做医疗的,敢把病历扔给Claude? 这块国产模型有天然的优势。数据不出境,合规,本地化部署,这些东西在to B市场是刚需。当模型能力都到90分的时候,这个信任优势就会被放大。 我自己的感受是,to B市场的竞争,可能比to C更早进入「90分之后的竞争」。因为B端客户对模型能力的敏感度本来就低一些,90分对他们来说完全够了,但对安全、合规、稳定性的要求极高。 当通用能力都到90分的时候,真正拉开差距的可能是「你在某个特定领域是不是能做到99分」。比如法律领域的模型,你能不能通过法考、能不能做合同审查、能不能做案例分析。比如医疗领域的模型,你能不能看懂CT片、能不能做初步诊断。 通用模型是90分,但垂直场景需要99分。谁能从90分提到99分,在特定领域,谁就赢。 我自己在做AI影视工业化尝试的过程中,对这个感受特别深。通用模型在创意、剧本这些方面已经很强了,但在具体的视频生成、特效制作、后期调色这些环节,还差得远。这些垂直场景,需要的不只是「聪明」,还需要专业的行业知识、专门的训练数据、定制的工具链。 五、当AI变成电力 就是当核心能力不再是瓶颈的时候,竞争的重心,会从「内核」往「外围」迁移。从模型本身,迁移到价格、速度、生态、文化理解、信任、垂直深度这些「包裹在模型外面」的东西上。 我前段时间看了一本书,讲的是电力革命的历史。1880年代,电力刚开始在美国普及的时候,最赚钱的是造发电机的人。 后来所有公司都能造发电机了,发电机的效率都差不多的时候,最赚钱的是谁? 是造电器的。是福特,是通用电气,是无数用电力来做产品的公司。 因为当电力本身不再是稀缺资源的时候,真正值钱的变成了「你能用电力做什么」。 当模型能力都到90分的时候,模型本身就变成了基础设施。就像你今天不会去关心你家用的电是哪个发电厂发的一样,未来你可能也不会太关心你用的AI是哪个模型。 你关心的会是,这个产品好不好用,这个服务理不理解我的需求,这个工具能不能帮我解决问题。 我有时候觉得,这可能才是AI行业真正走向成熟的标志。就是大家不再聊「哪个模型更强」,而是聊「哪个产品更好用」,「哪个场景做得更透」。 因为当模型能力不再是壁垒的时候,所有人都有了入场的机会。你不需要是OpenAI,不需要有10万张卡,你只要有好的产品想法,有对用户的理解,有在某个垂直领域的深耕,你就能用90分的模型,做出好的产品。 当「聪明」变得廉价的时候,创造力就成了最贵的那个东西。 六、结语 知道怎么把AI的输出变成真正有价值的东西。是有自己的判断,有自己的品味,有自己的审美。 当所有模型都90分的时候,可能最后比拼的,反而是那个用模型的人。 以上,既然看到这里了,如果觉得不错,随手点个赞、在看、转发三连吧,如果想第一时间收到推送,也可以给我个星标⭐~
上一篇孩子,亲子研学课程万能模板送给你
下一篇单次个案咨询说明
基本
文件
流程
错误
SQL
调试
请求信息 : 2026-07-05 07:09:32 HTTP/1.1 GET : https://www.yeyulingfeng.com/a/836697.html 运行时间 : 0.123781s [ 吞吐率:8.08req/s ] 内存消耗:4,789.23kb 文件加载:145 缓存信息 : 0 reads,0 writes 会话信息 : SESSION_ID=e8886e6670ec0ed30b2dfc0b4ef8e63a
CONNECT:[ UseTime:0.000619s ] mysql:host=127.0.0.1;port=3306;dbname=wenku;charset=utf8mb4 SHOW FULL COLUMNS FROM `fenlei` [ RunTime:0.000848s ] SELECT * FROM `fenlei` WHERE `fid` = 0 [ RunTime:0.000328s ] SELECT * FROM `fenlei` WHERE `fid` = 63 [ RunTime:0.000291s ] SHOW FULL COLUMNS FROM `set` [ RunTime:0.000532s ] SELECT * FROM `set` [ RunTime:0.000201s ] SHOW FULL COLUMNS FROM `article` [ RunTime:0.000511s ] SELECT * FROM `article` WHERE `id` = 836697 LIMIT 1 [ RunTime:0.000904s ] UPDATE `article` SET `lasttime` = 1783206572 WHERE `id` = 836697 [ RunTime:0.025400s ] SELECT * FROM `fenlei` WHERE `id` = 64 LIMIT 1 [ RunTime:0.000444s ] SELECT * FROM `article` WHERE `id` < 836697 ORDER BY `id` DESC LIMIT 1 [ RunTime:0.000629s ] SELECT * FROM `article` WHERE `id` > 836697 ORDER BY `id` ASC LIMIT 1 [ RunTime:0.000473s ] SELECT * FROM `article` WHERE `id` < 836697 ORDER BY `id` DESC LIMIT 10 [ RunTime:0.000996s ] SELECT * FROM `article` WHERE `id` < 836697 ORDER BY `id` DESC LIMIT 10,10 [ RunTime:0.001216s ] SELECT * FROM `article` WHERE `id` < 836697 ORDER BY `id` DESC LIMIT 20,10 [ RunTime:0.001217s ]
0.127831s