乐于分享
好东西不私藏

AI开始自己造工具了:Qwen3.8 从空文件夹跑16天,交出一份开源作业

AI开始自己造工具了:Qwen3.8 从空文件夹跑16天,交出一份开源作业

锋言笔记 · AI 周观察

AI开始自己造工具了:Qwen3.8 从空文件夹跑16天,交出一份开源作业

咱们以前说"AI 是工具",意思是它帮咱干活。8月3日阿里发的新模型 Qwen3.8-Max,把这个说法搅浑了——他们让模型从一个彻底空着的文件夹出发,自己写代码、自己测试、自己读报错日志,连跑 16 天,最后交出一个能用的"智能体框架"还开源了全过程。翻译成人话:AI 开始给自己造工具了。

这事儿比"写段代码"吓人多了。写代码是一次性交付,造框架是搭一套能自己转的系统。我后背有点发凉,但仔细看,又觉得没那么玄——下面掰开说。

 先看清这模型啥来头

Qwen3.8-Max 是阿里目前最大的旗舰,8月3日上线。架构用的是稀疏混合专家(MoE),总参数 2.4 万亿,但每次只激活 950 亿,配混合注意力;上下文窗口拉到 100 万 token,原生支持看图,编程和办公能力都做了大升级。这批数字本身不稀奇,真正让人盯住的是那个"空文件夹演示"。

▎【硬核数据】据阿里巴巴云官方发布与公开报道(2026-08-03):① 总参数 2.4 万亿,每 token 仅激活 950 亿,1M 上下文、原生视觉;② 第三方榜单排名:Text Arena 第 5、Vision Arena 第 2、CodeArena 第 4、PaperBench 93.0(对比同档 Fable 5 的 88.8);③ 国内定价约 ¥12 / 百万输入 token、¥36 / 百万输出,缓存命中低至 ¥1.5;国际价约为 Opus 5 的 40% 与 24%;④ 权重计划下周开源,同步放出 Qwen3.8-Max 与 27B 版本。

 "自己造工具"到底造了啥

那个演示里,模型接到的活儿是"从零搭一个能自我进化的智能体框架"。它没有真人手把手教,而是自己跑起一套工程循环:生成代码 → 跑测试 → 预览效果 → 读日志 → 把用户反馈和社区做法吃进去迭代。16 天后产出名叫 oh-my-cli 的框架,连同完整操作历史一起扔到 GitHub 开源。注意"完整历史"这四个字——意思是它每一步怎么试错、怎么改,全留痕了,不是只给个成品。

▎【长程自主 · 不只是造框架】· 同一模型还跑了一次 125 小时的自主科研:复现已发表论文,把 AIME24 成绩又抬了 2.7 分;· 量化工作流里,它协调约 330 个子代理、跑完约 6000 次因子回测;· 这些都不是"一次问答",而是跨天数、多角色协作的长任务闭环。

 泼盆冷水:没那么"觉醒"

先按捺一下兴奋。第一,16 天是精心设计的演示,不是模型日常自发这么干;启动循环、定目标、兜底安全,还是人 scaffold 的。第二,耗了 16 天算力 + 125 小时自主科研,这电费跟"低功耗"那篇恰好相反,别拿它当绿色样板。第三,开源不等于可控——权重放出来,谁能拿来干啥,平台方也难全程盯。第四,它造的框架到底多能打、会不会留隐患,还得社区真用一阵才知道,现在下"AI 取代工程师"的结论太早。

▎【老板视角·别上头】"自进化"是能力演示,不是已交付的同事。它能熬 16 天不抱怨,但目标、验收、兜底仍得人把着。把它当"能加班不喊累的实习生",比当"替代你的老板"靠谱。

 普通人能白嫖到啥

对咱这种不写大模型的人,这波最实在的是"开源 + 便宜":

① 下周就能本地玩:Qwen3.8-Max 与 27B 权重计划开源,中小团队可自部署,试长程自主任务。

② 办公 agent 同日上线:阿里同步推 QwenWork,PC 客户端 + 钉钉里直接调模型,小白也能用。

③ 价格碾压闭源:国际价约为 Opus 5 的 24%~40%,同样活儿成本省一大截,AI 创业门槛又低了。

 最后说一句

"AI 是工具"这句老话,得改改口了。工具自己不会造工具,而现在它开始会了——哪怕还被人扶着走。对老板来说,这波真正的信号不是"又要失业",而是"雇一个能熬 16 天、还开源交作业的不喊累实习生"正在变便宜。至于它是福是祸,看咱怎么把那根"验收的绳"攥紧。

— 锋言笔记

数据来源:阿里巴巴云官方 Qwen3.8-Max 发布(2026-08-03)、The Paper(澎湃)报道、dev.to AI Daily Digest(2026-08-04)等公开报道。