乐于分享
好东西不私藏

这些年我翻过的AI牌子

这些年我翻过的AI牌子

好久不见。

想不到吧,我还在加班

只是claude的用量达到上限了,需要缓一缓。顺便说说AI。

最近有几个词挺火的,token出海、算力出海。大概就是中国的AI厂商们卷完国内市场,开始把API接口往海外卖,token按分钱论斤称,比白菜还便宜。DeepSeek的API定价是OpenAI的三十分之一,字节跳动的豆包直接免费,恨不得倒贴钱请你用。其实我也是最近vscode上扩展claude后调用deepseek模型,才大概搞懂这些东西,太过琐碎和专业,就不多说了。出海能不能成功,我dont care,是不是商机,屁of my business,听我说不如直接去AI问,反正都是扯淡

然而我确是一个AI重度使用者,翻过的AI牌子也不少,仅谈谈使用各种AI的感受吧。

第一个要说的是豆包。我写这篇文章的直接动机就来源于这个玩意最近支撑的项目,那个傻逼领导,每次让我干活的时候,就掏出个豆包,然后叽里呱啦说一段话,豆包那个逗逼用过的都懂,不管啥不靠谱消息都往外蹦,然后领导就开始按豆包显示的内容来要求我干活,无论我怎么跟她说都没用。搞得我极度反感,但是又无可奈何

豆包:字节跳动的亲儿子,背靠着抖音和头条那套推荐算法起家。字节做AI的风格跟做产品一样,先不管三七二十一,上线再说,迭代快得离谱。网上的宣传口径是"更懂中文的AI助手",实际上呢,这货最大特点是嘴碎。像个刚学会讲段子的实习生,你问它一个问题,它不光回答你,还要附赠一大堆,但是都是笑话。字节系一贯的"逗逼"人设,从抖音到豆包,企业文化一脉相承。但它有一个好处,能画“可编辑”的PPT,这对我一个ppt苦主来说简直就是福音。但是,但是,但是,重要的事情说三遍,你如果是把在其他AI处编辑好的html或者pdf给他,他总得把里面的内容改成他想要的模式,而且找的图片跟内容完全对不上,让她改?她比生气的女人还难哄最近貌似刮了一阵“卸载豆包风”,说明大家也都看清了它。不过就凭PPT可编辑,我忍了。哦对,豆包目前免费。字节还是有钱,烧得起。

Kimi,月之暗面。这个算我用的第一款AI了,应该是在23年底,偶然碰到(同时使用的还有阿里的通义千问)。当时一是觉得新奇,二是这款AI的名字,中二里透露出的暗黑系风格很有感觉去年广告打得特别凶,小红书、B站、微信朋友圈全方位轰炸,"长上下文"是它的核心卖点——号称能一次处理几百万字的文档。宣传语都很高大上,"你的AI知识伙伴"、"重新定义信息处理"。实际用下来,长倒是真的长,但长不代表对。这玩意是我见过最离谱的,胡说八道还敢收钱就像一个江湖郎中,墙上挂满了各种学术证书,给你开了个方子,你敢吃?反正我是不敢。月之暗面拿了阿里和腾讯的投资,估值一度冲到200亿,但用户口碑这个东西,光靠广告砸不出来

然后要说的是DeepSeek。2025年初最炸裂的国产AI,没有之一。V3出来的时候整个科技圈都疯了——号称用OpenAI十分之一的训练成本,跑出了接近GPT-4的水平。那段时间网上的文章铺天盖地,"中国AI弯道超车"、"硅谷震动"、"OpenAI连夜开会",连马斯克都转推了。我承认我当时也跟着激动了。使用的时候觉得很牛逼,回答问题那股学院派的气息扑面而来,有框架有逻辑,觉得光看他的思考过程都是一种享受直到后来有一次,我做项目需要翻译一个词user flow,我用的“用户操作流”,局方要求我给一个官方背书,deepseek给我的是:

说的这么信誓旦旦,我就没管,等交上去了,局方说有问题,我让豆包给我检查了一番,又交上去,又被打回来。最后,我把他推荐的国标、行标以及参考文件一个个都下下来,按照他的指示,翻到相应的页面,发现根本没有这句话,三份文件都没有我愤怒的问豆包和deepseek,为什么骗我?豆包果断给我道了歉,但Deepseek还是死鸭子嘴硬的坚持他的,于是,我发现DeepSeek真的特别擅长"装"。表面上最正经,引经据典,数据精确到小数点后两位,就是全都对不上。你稍微往深了一问,它就开始编,你追问来源,它再给你编一个来源总之,这对卧龙凤雏再没得到过我全部的信任。后来科技媒体也开始降温了,最近几个月已经没多少人提DeepSeek了,那股"国产之光"的热乎劲过去了,留下了一个尴尬的事实:它在某些基准测试上确实强,但作为一个日常工具,它不够诚实。最近上了V4,好了一些,至少知道在瞎掰之前先跟你说一句"这个我不太确定"。诚实,是一种美德。但不是每个AI都有

ChatGPT。这个不能不说。OpenAI的当家产品,微软在后面拿着几百亿美元撑腰。GPT-4o出来之后,语音对话、图像识别、联网搜索全栈拉满,"改变世界"的话术玩得飞起。我用的不多,可能是觉得OpenAI越来越像一个商业公司而不是研究机构。但客观说,ChatGPT至今仍然是综合能力最均衡的选手。

Gemini。Google的产品,背靠谷歌的搜索帝国和TPU算力。这也是我第一款付费的AI,去年有大半年时间当主力在用。专业度确实高,尤其是技术类的问题,总能给到你没想到的角度,框架性的东西极强,就算你给一些很离谱的要求,他也能很有逻辑的给你一套答案谷歌在AI领域积累了几十年,底子厚,Gemini像一个靠谱的高级工程师、架构师、咨询师,给你的东西基本都是直接拿来就可以用,如果你提出了比较可靠的建议,他给的情绪价值反馈能让你脸红今年新推出的版本还支持图片输出了。以下是我帮儿子做作业的一个案例:

以“心有山河。笔铸风华”为主题,鼓励青少年感知时代脉搏、本届比赛以社会的温度和文明的深度,在层叠的历史、丰饶的现实中思考感悟、创作表达。以作品为媒,用少年笔粒铸就独特风华。

请以上述为主要思路,给出5个不同风格的参考方案

同样的问题,你去问豆包或者ds,都会给你5个文字方案,然后你再拿着这些方案和其他AI联动,再出图片,而Gemini直接上图,言简意赅。

去年买的Gemini pro是155rmb一年,今年直接去了一个零头:55rmb一年,是的,他的零头去的是左边强推。有一点不好的就是,单个会话chat如果太长,就开始胡说八道,不过这应该也是所有AI的通病。除了下面这款:

Claude。

Claude,Anthropic出品,这家公司的创始团队是从OpenAI出走的,因为不认同OpenAI商业化太激进。他们的理念是"安全第一",做负责任的AI。

用了之后我是真的起鸡皮疙瘩。尤其在VSCode里接了Claude Code之后——编程、写文档、画PPT(对,也是先写HTML再转PDF,没法直接编辑,这点不如豆包),但这些都还好,最吓人的是它居然能直接改写Windows的配置第一次看到它操作我电脑的时候,我有种把家里钥匙交给陌生人的感觉。因为claude太贵,网上看到说可以调用deepseek的API,于是我就这么提了一嘴,他开始自己搜索我的电脑,把环境变量改了,然后自己写了个脚本放在桌面上,告诉我以后点这个就可以直接启动了卧槽,简直赛博朋克极了。老子四十多年没搞明白的环境变量和编程,它三十秒配完了,我甚至来不及点根烟

唯一的毛病——贵,PRO版是140一个月,像我这样用的频繁的,经常会陷入等待,等待下一次token发放比较好的是,他每次都会计算这个对话有没有超过上限,如果超过了他会提示你,而不是像其他AI那样,即使超过上限了还要继续跟你掰扯,然后开始各种胡说八道

除了因为单个chat回答超过上限后AI开始犯糊涂,各个AI的回答机制也不一样,因为被骗过,所以我之前也小研究了一下几个典型AI的回答机制。科普一下当然,AI回答后我总结的,也不一定对

为什么豆包喜欢胡说八道?因为字节给它做的系统指令是"永远要有答案",宁可错也不能冷场。这是产品思维——用户问了你不回,体验差;用户问了你回个错的,至少用户不会觉得你在摆烂。所以你问豆包一个它完全不知道的东西,它会硬编。像一个刚入职的实习生被领导问了一个不懂的问题,不敢说不会,只能硬着头皮编,编着编着自己都快信了。

为什么Claude相对来说更靠谱?因为Anthropic花了大价钱做RLHF(基于人类反馈的强化学习),专门训练模型在不确定的时候说"不"。他们的核心理念是:一个AI的可靠性不在于它什么都能回答,而在于它知道什么时候不该回答。这背后是训练策略的根本分歧——OpenAI和字节选择了"高召回"(尽量回答所有问题),Anthropic选择了"高精确"(不确定的就拒绝)。所以,Claude经常会说"这个我不确定"、"我需要更多信息"、"让我搜索一下",这不是它能力不行,恰恰相反,这是它被刻意训练出来的品格。

DeepSeek和Kimi的毛病又是什么。是数据质量和训练策略的问题。国产大模型普遍面临高质量训练数据不足的问题——中文互联网上,优质的、经过验证的知识内容占比远低于英文互联网。用知乎、贴吧、公众号的内容训练出来的模型,天然自带"营销号气质",就是那种为了凑字数什么都敢写的调性。所以DeepSeek的回答,像极了一个看了太多百度百科和知乎高赞回答的人,写出来的东西形式感拉满,内容经不起推敲。

具体怎么拿数据和训练,也不是我该关心的,就不多说了,我想说的是:用AI时间长了,发现了一个悖论

如果你脑子里没有框架,AI给你的框架就成了你的框架。你会觉得它说得头头是道,逻辑严密,无懈可击——因为你没有反驳它的武器。就像不会喝酒的人第一次喝茅台,喝不出来好坏,只会觉得辣。你没读过某个领域的经典,AI给你几段煞有介事的总结,你就被说服了。因为你不知道它漏掉了什么,美化了什么,甚至曲解了什么,没办法,怀疑的种子已经种下了

如果你已经有了自己的框架,你让AI按你的框架来写,它又变成了一个纯文字工具。你需要什么章节它给什么章节,跟填表机一样,完全没有惊喜。就像你已经画好了施工图,工人只需要按图搬砖——这事AI能干,干得还很快,但这种"干活"跟你预期的"创造"是两码事。

这就很尴尬了。两头都是死路

更麻烦的是,我发现自己正在不知不觉中发生一种变化。以前读一篇文章,我会先自己想一想:作者的观点对吗?论证充分吗?现在呢,我把文章扔给AI:"帮我总结这篇文章并分析其逻辑漏洞"。十秒钟后AI给我一份漂亮的报告。我看完,觉得很有道理,然后就当作自己已经理解了。就像我吃了别人嚼过的馒头,咽下去了,但我没尝到味道。而且这个"别人"还是个AI,它嚼的时候可能加了自己的口水——它可能漏掉了关键段落,可能误读了作者的意思,可能把反讽当成正经话理解了。但我不回去看原文,我就永远不会知道,而大多数情况,我不会去看原文

说白了,AI是个很好的参谋,但是个糟糕的将军。当参谋的时候它给你提供情报、分析对手、推演方案;当将军的时候它只会按兵书打仗,打赢了不知道是怎么赢的,打输了更不知道是怎么输的。你让它替你写一份文档,写得漂漂亮亮,但你想改其中一段的逻辑走向,你就会发现它根本不理解你想干什么——它只是把文字排列得像那么回事而已。

所以你说我变聪明了吗?感觉上是可以做更多事了。你说我变蠢了吗?感觉是把大脑外包了就像以前走路的时候,你认识每一条路,知道哪条路通哪里,知道走哪条巷子可以抄近路。后来开车了,你的活动半径大了十倍,你去了更多的地方。但让你不看导航走回去,你可能连东南西北都分不清了。你从一个"认路的人"变成了一个"会用导航的人"。

更扎心的是,感觉自己更牛马了以前有些东西不会,可以理直气壮地说"我就是没学过"。这是一种体面的无知。现在有了AI,你不会的借口没了AI什么都会,你为什么不会?不会你就去问AI啊但你其实还是不会。你只是会指挥AI帮你做。由此衍生出一种新的生存状态:你看起来什么都会,实际上什么都不会,但结果上你确实又做出来了

这个问题,我已经不打算想清楚了。就像我现在也不知道自己是做什么工作的,可能只是一个在AI的扶持下看起来还能战的四旬老汉

又放token了,继续搬砖