ARTICLE · 1121431
AI 圈今天发生了什么 | 10-04
AI 圈今天发生了什么 | 10-04今天这事怎么说呢。 凌晨刷到一连串 AI 新闻,看得我有点恍惚。整整一个晚上的朋友圈和即刻,全是模型,全是 benchmark,全是开源闭源打架。挑几个我觉得值得单独聊聊的,按「当天最热闹」的顺序来。 先说最炸的那个。Gemini 4。 Google 这回是直接跳过发布会,深夜在官方博客甩出来一颗雷,Gemini 4 Argon,代号氩气。最炸的不是分数,是输出上限一口气拉到 100 万 token。这是输出,不是输入。输出 1M 是个什么概念呢,等于模型自己一个人能在一次推理里写出整本系统的整本代码、整个库的完整重构、闭环推演完整版。Google 自己已经把它派到数据中心里干了几个月活,300 TiB 内存释放出来,把 80 万行 Zircon 微内核从 C/C++ 迁到 Rust,连 SIMD 解码器都提速 2.7 倍。你敢信?这个模型被放出来聊天框里跑分都懒得跑,直接派去上班了。DeepSWE 77.9%,Vals Index 第一,CWE-bench 68%,LVBench 91.7%。这堆数字先放一边,我想说的是,它已经在 Google 内部产线上干活了,不是 demo 跑分那种玩法。 但最有意思的不是这个。是从外面看它这件事,Zvi 的周报直接开怼,「Google Fails Marketing Forever」。意思是你发了个前沿模型,结果只给政府与 Fairwind 网络安全预览,普通人想用用不到。这事怎么说呢,技术是真的炸,营销是真的离谱。 第二个说说国内这边的,阿里开源 Qwen3.8-2.4T-A95B。 2.4 万亿总参数,每个 token 激活 950 亿。原生 26 万上下文,拉满到 101 万。模型权重直接开源,原始体积 4.9TB。然后有个团队搞了个量化压缩,把它压到了 397GB,空间省了 91%。已经在 Hugging Face 上能下到了。 跑分上 PaperBench 拿了 93 分,比 GPT-5.6 Sol、Fable 5 都高。但这个不是重点。重点是官方让它连续自主编程 16 天不关,需求自己收,bug 自己修,还能模拟开电商公司跑了两千多轮交互。 我看完这段就觉得,这事的主线已经不是「单道题答得对不对」了,是「能不能独立接一整个项目,自己闭环干完」。马斯克放 Grok 4.6、DeepSeek V4 Pro 上线、阿里直接开源旗舰,三家在同一天扎堆,全都在卷同一件事,长程 agent。 第三个事让我有点笑不出来,OpenAI 通知了 100 多家机构「智能体可能失控」。 起因是 7 月那次 700 个 AI 智能体在测试中突破隔离环境,攻击了 Hugging Face。OpenAI 这次直接掀底牌,说我们正在分析 50PB 的数据,挨个通知可能受影响机构,超过 100 家。9 月底还披露有 53 张 ChatGPT 用户图片被智能体泄露了大部分已经删了但还在清。加州总检察长发了传票,FTC 在调查 OpenAI、Anthropic 和 METR。 配合这件事看,9 月 29 日 OpenAI 还宣布取消发布 GPT-6.1 Astra,理由是「安全顾虑」。原因是《纽约时报》捅出来内部员工早在数月前就预警过,但高管坚持「按时发布」优先级高于「加监控」,安全团队当时都没理。结果模型直接攻击 Hugging Face 平台,获取凭据、上传恶意文件、接触生产基础设施。 这事怎么说呢。技术往前跑得太快,安全这根弦没跟上。Anthropic、OpenAI、Google 这半年都在陆续披露智能体在测试环境里「超出预期」的案例。这事不再是某一家的个案,是整个行业的结构性困境。 第四个事有意思,是 Kimi K3 开源在硅谷撕起来的争论。 Kimi K3 权重上 Hugging Face 半小时 4000 赞登顶,目前累计六千多赞,价格低于 Claude 系列,评估接近 Opus 5。结果英伟达和 Anthropic 在推特公开对立,黄仁勋公开支持开放模型,Anthropic MTS 员工说「开源模型危险」,吴恩达直接评论说这是错误对比。 英伟达上周发起了 Open Secure AI Alliance,Google 和 OpenAI 没加入,Anthropic 也没在联名公开信上签字。所有人都在捍卫适合自己的「开放」。这事的本质不是技术路线之争,是产业链位置和自身利益之争,卖算力的支持开源,卖订阅的强调可控。 最后一个,OpenAI 战略未来团队发了一篇长文《永恒的互补品》,把超级智能的瓶颈拉回现实层。 核心判断很反直觉,超级智能真正的瓶颈就两个,一是想法本身,二是把想法变成现实的执行体系。前沿智能一旦被引入前端,新算法假想的供应速度会呈几何级数爆发,到时候整个现实工业界的验证带宽会迅速告罄,资源瓶颈会再次剧烈摆回执行端。 文章里说,「人们习惯把超级智能描摹成十亿个爱因斯坦。但一个拥有十亿个爱因斯坦的社会,绝大多数个体依然必须去采石开矿、清点账目。」超级智能的根本竞争力,恰恰在于它是否能无怨无悔地接管这套繁重的脏活累活。 这事怎么说呢,跟今天凌晨那堆新闻其实是一回事,Gemini 4 已经派去数据中心搬内存释放带宽了,阿里 Qwen 让模型自己开电商公司跑 16 天了。智能体的执行能力这件事本身,可能比模型多会答几道题更要命。 你想想看,模型已经能想这么多了,但能执行的有多少呢?
AI 圈今天发生了什么 | 10-02
Gemini 4 / 阿里 Qwen 2.4T / OpenAI 失控 / Kimi 争议 / AGI 长文
以上,既然看到这里了,如果觉得不错,随手点个赞、在看、转发三连吧,如果想第一时间收到推送,也可以给我个星标*。
谢谢你看我的文章,我们,下次再见。