夜雨聆风学习资料网

ARTICLE · 1038038

我买了最强AI模型,官方却劝我别用

我买了最强AI模型,官方却劝我别用

Anthropic 最近发布了新的 Claude Fable 5.1,说是能应对最艰巨任务的旗舰机。但这次最耐人寻味的是官方自己的表态——普通任务用 Opus 5 就够了,只有真正需要最大功率处理复杂多步骤任务的时候,才建议你上 Fable 5.1。

一家公司劝你别随便用自家最贵的产品,这在 AI 圈里真不多见。

坦白讲,这种话术背后其实藏着定价逻辑:每百万输入代币 10 美元,输出 50 美元。不便宜。所以官方先把门槛划清楚,免得你用错了地方回头骂娘烧钱。

我花钱订阅之后,决定把它拉到真实场景里试试,看看它到底配不配这个价格。

🧮 算账 日本旅行那一道算术题

我给它出了个难题:两人 7 天日本游,预算 3000 美元含机票,一个想看动漫一个想进森林,要真实航班、三家酒店、逐小时路线。

这种题是 AI 最容易翻车的。因为大多数聊天机器人会给你一份漂亮的行程,再附上几个听起来合理的数字。但你仔细一算,账根本对不上。

这次我特意开了思考模式,想看它到底怎么处理。

结果很有意思——它没有急着端出方案,而是先把地理位置搞清楚了。东京的动漫区、山区的温泉,按地理分组,而不是让两个人为了礼貌在火车上浪费 4 个小时。

算术部分也没糊弄。机票、酒店、食物、交通加起来没超 3000,而且机票明确标注是预估价格,而不是假装已经预定了。

这个细节让我刮目相看。至少它说实话。当然并非完美,某些地方的每小时时间安排过于乐观,在东京这种体量的城市里几乎不可能用那个速度穿城。但思路是对的:先解决约束条件,然后再制定计划。

📝 读图 我画了一堆鬼画符给它看

真正让我吃惊的是它对图像的判断力。

我随手在纸上画了个应用流程图,故意画得乱七八糟——方框没对齐,箭头交叉,有个屏幕还因为没空间了被塞进角落。然后用手机拍下来扔给它,提了三个要求:整理潦草字迹、找出流程错误、告诉我缺了哪一步。

坦白讲,绝大多数 AI 模型做完第一步就交差了。它们会给你一份整洁的图,然后就没然后了。

但这家伙不是。

它读懂了交叉的箭头,判断出哪个箭头连哪个方框。然后标记出了流程中真正的问题——用户点击支付后就无路可走了,没有订单确认;结账时也无法返回购物车。

最让我意外的是,它补充了我完全没有画的东西。比如支付失败状态、订单确认步骤。这些我根本没画,但它知道一个完整的应用需要这些。

这已经不是在读图了,是在做产品思考。

🏰 建模 一张平面图变出三座城堡

前面那些还算小打小闹,接下来这个测试才真的把我震住了。

我画了一张中世纪城堡房间的二维平面图:一面墙有壁炉,两侧有窗,中间是长餐桌,还有柱子、高台和宝座。然后我要求它基于这张平面图,做出三个完整的 3D 交互模型。风格分别是哥特式、荒凉、皇家。

这中间的信息差有多大,你仔细品一品。

平面图只告诉你东西放在哪里,但墙要多高、窗户挖多深、柱子多粗、壁炉怎么嵌入、高台怎么融入空间——这些全要模型自己决定。而且家具不能像娃娃屋玩具一样比例失调,也不能悬浮在地板上。

它做出了三个版本。哥特式的阴暗沉重,石墙木梁配暖火光。废弃版保留了同一个房间,但墙壁开裂、家具损坏、积满灰尘。皇家版用抛光木材、挂毯和更暖的灯光把空间恢复原貌。

在三个版本之间切换,几何体完全没有移动。房间还是那个房间,只是材质和氛围变了。这个能力已经开始触碰真正的工作流了。

🎮 代码 它给我写了个能玩的游戏

最后一个测试,我用纯代码验证它的编程能力。

不许用任何图形库,纯 JavaScript 从零开始,写一个北极光模拟器。三个可调滑块:移动速度、颜色亮度、星星密度。一次提示,一次尝试,没有修改机会。

我想大多数人跟我一样,以为滑块肯定要出问题。因为一个模型如果只能部分理解自己的代码,滑块就是照妖镜。

但实测下来,速度滑块只改变漂移方向不改变颜色。星密度滑块是增加星星数量而不是重绘天空。

只有在最大密度时画面出现卡顿——这是整个系统唯一翻车的地方。

更离谱的是,它还在一个提示内做出了一个完整的第一人称射击游戏。霓虹竞技场、WASD 移动、鼠标瞄准、激光枪过热机制、生命值、击杀计数、难度递增——全都有了。

当然有瑕疵。外星人的尸体看起来像粘着触手的球体,敌人之间几乎没有碰撞检测所以会堆叠。但你要知道,这是从一个提示里一次生成的,没有任何参考模型可以下载。

💡 省钱 七个反常识的使用技巧

用了一圈下来,我总结了一些真心有用的经验。顺手也翻了一下之前收藏的一个 GitHub 项目 system_prompts_leaks(https://github.com/asgeirtj/system_prompts_leaks),里面收集了不少 AI 模型的系统提示词,对理解模型行为挺有帮助的。

第一条:努力程度从低往高调,别反着来。

大多数人第一天到手就把努力程度拉到最大,因为"最大"听上去更好。但我实测下来,低档审查反而比高档多发现问题,胜率 61% 对 57%,还快 3 分钟。

第二条:告诉它没人看着。

这模型默认表现得像有人坐在旁边一样,长时间干活到一半会停下来请求允许做你已经批准过的事。直接告诉它"假设这里没有人,只要可撤销就继续执行",它就不废话了。

第三条:一次把需求整个喂给它,别拆。

复杂任务别拆成八个零碎提示。描述你想要的最终结果,然后让它自己跑到底。对于难任务,它的完成速度比旧型号快约 40%,成本还低。

第四条:让它去掉写作文艺病。

Fable 5.1 的句子变长了,段落间停顿变少,长篇回复读着比原本该有的更费劲。一句"摒弃所有矫揉造作的文风"就能让它清爽不少。

第五条:清理旧指令。

你为了修复旧模型行为而加进 claude.md 的那些规则,现在已经变成包袱了。新模型会浪费精力去修复根本不存在的旧问题。逐条删掉,没变化就说明那条没用。

第六条:明确列出不能碰的东西。

这模型有个毛病,会做超预期的事。你让它加个功能,它顺手把隔壁测试文件重写了。所以要在提示里列清楚:这些文件别动,发现问题最后说,别自己动手解决。

第七条:只编辑别重写。

如果不加约束,即使实际只改四行,它也会重新生成整个文件。几百个文件的项目里,这就是真金白银的浪费。一句话就能解决:"只编辑需要编辑的部分"。

⚖️ 算账 到底值不值这个钱

经过这一通折腾,我的结论很明确:Fable 5.1 确实是次大进步。

但让我恼火的还是它的定价逻辑。

你花高价买了一款产品,制造商却告诉你大多数时候别用它。

这笔账最后怎么算,其实取决于你的活儿到底属于哪一边。简单任务用旧型号反而更好,只有真正需要多步骤复杂处理的场景,它才体现出不可替代的价值。说到实际工作中的任务分配,这完全是判断力问题。

反正我是把信用卡收起来了。

📌 本文为个人观点,仅供参考

相关学习资料