乐于分享
好东西不私藏

AI 自己编程 16 天,造出了一款真能用的软件

AI 自己编程 16 天,造出了一款真能用的软件
AI冲浪社 · AIsurfing
在AI浪潮里冲浪
2026年08月08日 · AI冲浪社 · 编辑部

想象一下:一个程序员,不领工资、不用休息,从空文件夹开始连干 16 天,交出 265 次代码提交,最后交付一个能用的软件框架——全程没人盯着。

这不是段子。8月3日,阿里发布的旗舰模型 Qwen3.8-Max 就干了这么一件事。以前我们管 AI 叫"答题机器",这回,它直接上岗当起了"全职工程师"。

16 天,AI 独立交付了一个真项目

故事的开头只有一句话指令:"创建一个自进化的智能体 Harness"

接下来,Qwen3.8-Max 像资深工程师一样,从零开始搭循环工程框架,自己编排智能体领取任务、执行任务,人类工程师还能通过钉钉随时给它派新活。就这么独立跑了约 16 天,它做出一个真实可用的自进化智能体框架 "oh-my-cli"——据官方介绍,这是 Hermes Agent 级别的东西。项目已完全开源,全过程公开放在 GitHub 上,谁都可以去检查。

注意这个细节:16 天,不是几小时的评测题,而是接近真实工程师冲刺周期的工作长度。更关键的是,它全程无人干预

2.4 万亿参数只是入场券

这次的"超大杯" Qwen3.8-Max,总参数 2.4 万亿、激活参数 95B,稀疏 MoE 架构配混合注意力,上下文拉到 1M Tokens。在 Arena 权威榜单上,阿里 Qwen 整体仅次于 Anthropic 的 Claude 系列,CodeArena 全球第四、VisionArena 全球第二。

但参数和榜单,只是证明它"聪明"。真正让人头皮发麻的是两个真实的干活案例:

法务场景:数百份法律文档、上千条条款的标注,一支法务助理团队要干一周,Qwen3.8 一小时完成。

体育分析:160 小时以上的篮球比赛录像、8400 多个攻防回合,它数十分钟拆解完毕,还输出球员战术画像和教练报告。

它还能读懂 200 页的财报 PDF、看懂超 100 小时的长视频,并把"所学"反馈到工作全流程。说句公道话:这些是官方给的示例,真实水位还得等第三方验证,但方向已经摆在那了。

从"答得对"到"干得完",行业换赛道了

Qwen3.8 真正值得琢磨的,不是它比上一代大了多少,而是它把"从对话到交付"的闭环做实了。

过去两年,大模型比拼的是"聊天智能"——考的是讲台上的博学,靠堆参数、刷榜单就能证明。而现在,竞争正在切换到"交付智能"——考的是工位上的靠谱,必须让模型在真实任务的复杂、模糊和长周期里站稳。从"答得对"到"干得完",一字之差,训练目标整个变了。

阿里这步棋显然不是单点的。同一天,企业级 Agent 产品"千问办公"开启公测——它整合了阿里体系内 QoderWork、MuleRun、悟空三款 Agent 产品,是业内首款同时支持桌面端、云端、企业协同的 Agent 产品,还初步打通了钉钉。模型打底、办公产品上桌,目标很明确:让 AI 从"辅助思考"走向"替代执行"

价格也值得说一句:国内输入 12 元/百万 tokens、输出 36 元,海外价格仅为 Opus5 的 40% 和 24%。性价比拉满,摆明了要"以价换规模",把开发者和企业吸进千问生态。

对普通人意味着什么?

说三句实在话:

第一,AI 的工作单位变了。以前是按"回答"算,现在开始按"项目"算。下次它说"我能干活",先问它能不能自己跑完一个完整周期。

第二,重复性脑力劳动,真的要重新定价了。文档标注、录像拆解这类活儿,团队一周 vs 模型一小时,这个差距会逼着很多岗位重新定义自己。

第三,别慌,先上手。Qwen3.8-Max 下周就要开源,还会带上 27B 的小版本。开源的意义在于:你不用等任何一家公司赏饭,本地部署、自己调教,都是可能的。

当模型能稳定交付生产级成果,AI 才真正从"辅助思考"跨入"替代执行"。这一天来得比大多数人想象的快——它已经自己写了 16 天代码了。

💡 核心总结
当模型能稳定交付生产级成果,AI 才真正从"辅助思考"跨入"替代执行"。大模型的下半场,比的不是谁更会聊天,而是谁更靠得住。

💬 互动引导

如果 AI 能自己完成一个 16 天的真实项目,

你最想让它帮你搞定什么?评论区聊聊

转发+推荐,让更多人看到

🚀关注我们

AI冲浪社 · AIsurfing

在AI浪潮里冲浪