ARTICLE · 1098039
中曜鼎丰 AI 日报|9 月 29 日:Claude Sonnet 5.5 发布:快 30%、便宜 30%,编码榜反超旗舰
中曜鼎丰 AI 日报|9 月 29 日:Claude Sonnet 5.5 发布:快 30%、便宜 30%,编码榜反超旗舰
本期主线是"降价与重写":AI coding 侧,Anthropic 发布 Sonnet 5.5,中端模型在编码榜反超自家长旗舰且价格仅约一半,DHH 与 Chollet 喊出"手写代码已结束",模型正从被写的对象变成被指挥的控制面;具身智能侧,焦点从"大脑"转向"皮肤与本体感觉",东京大学让机器人手指长出了活人皮肤。

一、核心动态
1. Claude Sonnet 5.5 发布:中端模型在编码榜反超旗舰,价格仅约一半
事件:Anthropic 于 9 月 28 日发布 Claude 5.5 家族的第二款模型 Sonnet 5.5。它维持与 Sonnet 5 相同的定价——每百万输入 $2、输出 $10、缓存读取 $0.20(是 Opus 5.5 的一半),但运行快 30%+,并把每任务成本压低最多 30%(靠更少 token 与更频繁的工具调用批处理)。最刺眼的数字在 Terminal-Bench 4.0:Sonnet 5.5 拿下 70.6%,高于 Opus 5.5 的 66.4%;独立评测机构 Artificial Analysis 也确认它领先(63.6% vs Opus 5.5 的 59.6% vs GPT-6 Astra 的 59.1%)。它支持 1M 上下文、128K 最大输出,并首次在 Sonnet 系列引入与 Opus/Fable 同级的安全护栏。Claude Code CLI 2.1.284 已默认切到 Sonnet 5.5。
为什么值得关注:这是"默认档位"再一次被改写的信号。一个中端模型在编码榜上超过自家长旗舰,而价格只有一半——对绝大多数"长程、边界清晰、走量"的 Agent 任务,理性的选择已经变了。需要补一句冷静:这些分数多为 Anthropic 自报(Artificial Analysis 测的是发布前版本),且 Opus 5.5 在 CursorBench、Chartography、GDPval 上仍略胜或打平,开放式长推理仍是 Opus 的领地。但对日常编码、修 bug、做文档演示,Sonnet 5.5 把"性价比"这条线拉到了一个新位置,任何在用编码智能体的团队都该本周重跑一遍自己的 eval。
2. "手写代码已结束":模型从被写对象变成控制面
事件:在 Rails World 大会上,DHH 面对约 1200 名开发者抛出了"手写代码已结束"的判断;Keras 创建者 François Chollet 也公开说,自己不再读写代码,只向 LRM(语言推理模型)下达指令——因为测试、组件审计、可视化、红队已经快到让手写代码的投入产出不再成立。与此同时,Alex Ewerlöf 那篇《Coding Is Not Solved》登上 Hacker News 首页,专门反驳"编程问题已被解决"的过度乐观;Fireship 则做视频讨论"哪些技能还保值"。
为什么值得关注:两派其实在同一件事上相遇:编程作为"逐行写"的职业正在被重写,但作为"编排与上下文工程"的 discipline 没有消失。trq212 那句"展示 prompt 毫无意义,真正的资产是上下文工程"点得很准——参考仓库、技能、示例、联网搜索、跨模型 API 的组织能力,才是新人值钱的地方。对工程师个人,可执行的提醒是:别再卷"谁敲键盘快",去卷"谁把任务拆得好、把护栏设得稳";对企业,培训重点要从语法转到验收与审计——因为模型写得越快,人工收尾的成本越集中在少数人身上。
3. Opus 5.5 的极限用例群:一句话造出"万行级"应用
事件:随着 Opus 5.5 普及,一批"单 prompt 生成数万行代码级应用"的实证开始涌现:有人用它把 Pokémon Red 重制成约 25,000 行 JS,耗时 3 天、全程实时绘制;一个非程序员用 Claude + DeepSeek + ChatGPT 组合 5 天做出含 40 台卡丁车、6 条赛道的 Sloppy Kart;还有人交付约 28,000 行 TypeScript 的 2D 平台游戏、带 V.A.T.S./Pip-Boy 的浏览器版 Fallout:New York。最硬核的是一台 72 小时造出的 SolidWorks 级 CAD 应用——纯 JS 内核、零外部依赖,作者估手工要 2 年、模型估 8–12 周;发布五天后,社区已交出 10 款可玩游戏(含 MMO、Splatoon 类、Zelda 类)。
为什么值得关注:这些不是玩具 demo 的又一次堆砌,而是"一人工作室"能力的实证跃迁——一个 prompt 起头,模型负责体系结构、实现、调试与多轮修正,人退到方向与验收。结合第 2 条的范式信号,它回答了"手写代码结束后人做什么":人定方向、定品味、定验收,模型干内环。但也要看清边界:这些产物多半仍靠作者反复纠偏才成型,且"能生成"与"能维护"是两回事——5 万行由模型写的应用,出 bug 时谁来读、谁来修,目前仍没有好答案。
4. AMD 82 亿美元收购 World Labs,李飞飞出任首席科学家
事件:9 月 28 日,AMD 宣布以约 82 亿美元(约 550 亿元人民币)全股票交易收购李飞飞联合创办的 AI 实验室 World Labs,预计 2026 年底前完成,是 AMD 史上第二大收购(仅次于 2022 年约 500 亿美元的 Xilinx)。World Labs 主攻"世界模型 / 空间智能"——让 AI 理解并生成三维世界,首款产品 Marble 可凭提示造交互式 3D 场景,9 月 1 日又发布新一代 Atlas。交易后,李飞飞将加入 AMD 任执行副总裁兼首席科学家,直接向 CEO 苏姿丰汇报,World Labs 团队继续做模型研究。
为什么值得关注:这是"芯片厂向上游模型延伸"的标志性一跃。苏姿丰的提法很直白:"你对端到端流程了解得越多,就越能构建更好的系统。"当世界模型被普遍视为机器人、自动驾驶等物理 AI的训练与仿真底座,AMD 买下的不是一款产品,而是"未来芯片要为哪种模型服务"的话语权——它要拿 Nvidia 的不只是显卡性能,而是"模型 + 软件 + 系统"的整条生态。对从业者,这条线值得持续跟踪:空间智能正在从论文概念变成硬件战略资产。
5. 具身智能焦点转向"本体感觉"与"少数据迁移"
事件:在"大模型当机器人大脑"的热度之后,一批研究把注意力拉回了更底层的身体。前 OpenAI 研究员 Aran Komatsuzaki 抛出论点:"看见才能伸手,靠感觉才能抓握"——相机应只停在手掌附近,真正的抓取靠盲手反射锁住;他认为本体感觉而非视觉才是抓取瓶颈。东京大学 Takeuchi 实验室则让机器人手指"长出活人皮肤"(2022 年 Matter 论文,近日在讨论中被重提):把机械手指浸入胶原与真皮成纤维细胞溶液,再覆表皮角质形成细胞,皮肤可弯折、可自愈,团队称这是"赋予机器人生物外观与触感的终极方案"。在数据侧,InternW0-Δ 联合学习视觉动态与机器人动作并开源(含 20K+ 小时混合数据);东京大学 SAIL 则从冻结的基础模型提取机器人知识、靠 in-context imitation 不收集 demo 就迁移新策略。
为什么值得关注:这几条合起来,正好接住前两天的判断——通用大模型接管了机器人的"脑",但"手与皮肤"仍是短板。Komatsuzaki 给的是控制层的洞察,Takeuchi 给的是仿生材料的方向,InternW0-Δ/SAIL 给的是"少数据也能迁移"的路径。当行业从"秀大脑"转向"补身体",真正决定机器人能不能干精细活的,恰恰是这些不喧哗、却更贴近物理世界的环节。
二、速览
·OpenAI DevDay 预热:Altman 发文 "We have found a new thing"、官方喊 "Get ready",传将推常驻助手 Aeon 对标 Muse / Grok Bot / OpenClaw。
·NVIDIA 开放代理安全平台:联合 100+ 伙伴推出 OpenShell 限制访问、基础设施级监控;Jensen Huang 称 "responsible optimist"。
·Manus 2.0:脱离 Meta 后首个大版本,Cascade 框架让 token 减 23.2%、完成时间减 28.2%、成本减 32%;桌面端 Studio + Cloud Computer 关盖继续跑。
·Shopify 开放 WebMCP 结账:浏览器 Agent 经用户授权后可完成支付;Instinct 称 35% 用户已通过它购物,Stripe 建验证层。
·ElevenLabs Eleven v4:登 Artificial Analysis 语音榜第一,号称最快最具表现力;Gemini 3.8 Flash TTS 用 30 秒音频克隆。
·形式数学与 AI 科研:Hamilton–Perelman Poincaré 证明被全 Lean 形式化约 4.7M 行、耗时 2 周(DARPA expMath);Hinton/Bengio 等联名《智能爆炸》论文呼吁政策可见性。
·开源模型群:阿里 Qwen-Image-2.1(7B 视觉生成,RTX 3090 可跑)、Z.ai GLM-5.2、Bonsai 2 把 Qwen3.8 27B 三元量化压至 5.9GB(保 98% 能力)、小米 MiMo-V2.6。
·QA 环节被 Agent 重构:Mo 用 100+ 代理并行测应用,称 3.8× 更多 bug、9× bug/小时、每 bug 半成本;VibeDefend 提供 `npx` 一键给 Claude Code/Cursor/Codex 加危险动作拦截。
本期覆盖 9 月 28 日至 29 日。Sonnet 5.5 发布数据来自 Anthropic 及 Artificial Analysis 独立评测;AMD 收购 World Labs 由 CNBC/Bloomberg/多家媒体确认;东京大学活体皮肤机器人手指为 2022 年 Matter 论文(Takeuchi 实验室),近日在具身讨论中被重提,非 9 月新发。