夜雨聆风学习资料网

ARTICLE · 1129961

造梦观察AI热点周报丨AI 都能自己干活了, 我们为什么还得盯着

造梦观察AI热点周报丨AI 都能自己干活了, 我们为什么还得盯着

WEEKLY AI BRIEF · NO.11

2026.09.28 - 10.04 | 阅读约 11 分钟

你好,这里是「造梦AI实验室」。

这一周,AI 公司集中发布了一批新模型。Claude、GPT-6、MiMo、Grok 和 Step 5 轮番出现,价格、速度和能做什么被放在同一张成绩单上。图像模型开始处理局部修改和透明背景,语音模型可以按自然语言设计声音,代码助手也从网页走进了电脑桌面。

这些消息放在一起看,变化很具体。AI 正在从一个等你提问的页面,变成一个可以接手部分任务的工具。它能帮你改一张图、做一段声音、整理一个项目,甚至连续运行几天。它接触的文件、网络和执行权限也越来越多,一次小错可能沿着后续步骤继续传下去。

本期 11 条报道想回答的,就是标题里的问题。AI 已经能独自完成越来越长的任务,我们为什么仍然得盯着,它的能力和边界又该怎么判断。

一句话总结这周 AI 可以独自跑完越来越长的任务,我们仍然要盯住权限、过程和最后确认。

01 / 模型越来越便宜,能接手的活也更多

本周的模型发布密度很高。几家公司同时把更强的模型做得更快、更便宜,开源模型也在追赶。普通用户未必会立刻换掉手里的聊天工具,却会在接下来的产品里遇到更多能连续处理任务的功能。

Claude Opus 5.5 发布,成本比上一代低约四成

来源 · Anthropic · X

Anthropic 发布 Claude Opus 5.5,这是 Claude 5.5 系列的首个模型。官方称它在多数任务上达到 Claude Fable 5.1 的水平,运行成本比 Opus 5 低约 40%。榜单能反映一段时间里的竞争位置,具体工作仍要看模型在真实任务中的表现。

OpenAI 推出 GPT-6 Sol 和 Luna,API 价格下调 50%

来源 · OpenAI · 官方网站

OpenAI 发布 GPT-6 Sol 与 GPT-6 Luna,把 GPT-6 Astra 的训练方法用于更快、更便宜的模型。与 GPT-5.6 促销价相比,Sol 每百万输入 Token 从 4 美元降到 2 美元,输出从 20 美元降到 10 美元。Luna 的输入价降至 0.1 美元,输出价降至 0.5 美元。调用成本降低以后,批量资料整理、代码检查和客服回复更容易算过账。

小米开源 MiMo-V2.6 Pro 与 Flash

来源 · 小米 MiMo · X

小米 MiMo 发布并开源 MiMo-V2.6 Pro 与 Flash 两款全模态模型,能力覆盖编码、电脑操作、3D 推理和内容创作。官方称 Pro 在多项 Agent 基准上的表现接近 Claude Opus 5 与 GPT-5.6 Sol,在 Artificial Analysis 开放权重模型智能指数中得到 46 分。开放权重给了开发者更多选择,实际部署仍要看硬件、速度和许可证。

xAI 发布 Grok 4.7

来源 · xAI · News

xAI 将 Grok 4.7 定位为编码与知识工作的旗舰模型,每百万输入 Token 定价 2 美元,输出 6 美元,与 Grok 4.6 保持同价同速。另一个快速变体把速度与价格同时翻倍。对于需要频繁调用模型的人来说,等待时间能否减少,往往比一张榜单上的名次更容易影响选择。

阶跃星辰预览 Step 5,计划 10 月 15 日开放权重

来源 · 阶跃星辰 · 微信公众号

阶跃星辰发布 Step 5 Preview。官方资料显示,模型采用稀疏 MoE 架构,总参数量 600B,每次激活 27B,支持 100 万 Token 上下文以及文本和视觉输入。公司称其在 Artificial Analysis Intelligence Index 获得 44 分,单任务成本约为 Claude Opus 5 的八分之一,并计划在 10 月 15 日开放权重。正式开放前,权重、许可证和运行条件仍要等后续信息。

造梦观察

这一轮竞争会先改变产品的后台。开发者可以让 AI 多跑几遍,长一点的资料也敢交给模型处理,产品团队也更容易把摘要、分类、检查和改写放进同一个流程里。

普通人感受到的变化通常会慢一些。你看到的可能是一个工具多了几次免费调用,一个图像功能不用单独付费,或者一份文档可以让 AI 先处理一遍。模型降价给了产品更多空间,省下来的钱最终怎么落到用户身上,还要看产品怎么设计。


02 / AI 开始处理半成品,不只负责从空白生成

Qwen 的图像模型和 Gemini 的语音模型都在处理创作过程里的中间步骤。把一张现有图片改好,把一段声音做成合适的表演,往往比从零生成更接近日常工作。

Qwen 开源 Qwen-Image-2.1

来源 · Qwen · 官方博客

Qwen 开源 Qwen-Image-2.1,用一个 7B 视觉生成组件统一处理文生图与图像编辑,并原生支持透明图像。模型最多可以接收 10 张参考图,也能通过圆形、涂鸦和独立蒙版指定局部区域。用户可以保留人物和主体,只替换背景、文字或某一块细节。

Gemini 3.8 Flash TTS 支持百余种语言

来源 · Google DeepMind · 官方博客

Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS。官方称,用户可以用自然语言从头设计声音,也可以凭 30 秒样本复刻声音,并对每一行台词给出表演指导。模型支持长音频、双说话人编排和 100 多种语言。声音复刻降低了配音门槛,也要求使用者确认样本来源和授权范围。

造梦观察

这类功能更容易让人觉得 AI 有用。做商品图的人可以先处理背景和尺寸,做视频的人可以先试几种语气,普通用户也能把一张旧图改成更适合分享的版本。工作从生成一份空白答案,变成了把手里的半成品继续往前推。

编辑能力越好,检查原图和成品的差别就越重要。图片里的人脸、文字和商品细节可能被改动,合成声音也需要说明身份。AI 帮你省下一段制作时间,最后的确认仍然要由使用者完成。

03 / AI 正在搬进电脑和办公入口

当模型能处理文件、代码和多个步骤以后,网页聊天框就显得有些窄了。微软把 Copilot 放到工作入口的位置,Kimi 直接推出桌面客户端。它们都在争取让用户少一点复制粘贴,多一点连续处理。

微软称 Copilot 将成为工作的全新操作系统

来源 · Satya Nadella · X

微软 CEO Satya Nadella 宣布 Copilot 将迎来迄今规模较大的一次更新,并把它定位为覆盖不同模型、设备和任务的工作操作系统。这是微软对产品方向的描述,具体功能和开放节奏仍要看后续发布。它能否成为稳定的工作入口,取决于能连接哪些工具,也取决于用户能否看清每一项权限。

Kimi Code Desktop 1.0 同时登陆 Windows 与 macOS

来源 · 月之暗面 Kimi · 微信公众号

月之暗面发布 Kimi Code Desktop 1.0,作为 Kimi Code 的官方桌面客户端,同时提供 Windows、Apple 芯片 Mac 与 Intel 芯片 Mac 版本。代码工具进入桌面以后,可以更自然地接触本地项目和终端环境。文件改动记录、权限提示和撤销方式,会直接影响用户敢不敢把任务交出去。

造梦观察

AI 进入桌面以后,用户交给它的就不再只有一段文字。它可能要读一个文件夹,改几份文档,运行一段代码,再把结果交回来。这样的工具确实能减少来回搬运内容的时间,也会让一次错误有更大的影响范围。

第一次使用桌面助手时,可以先把任务范围缩小。让它处理一个副本,先看清它会访问哪些文件,再允许它执行下一步。能撤销、能回看、能随时停下来的工具,更适合处理真实工作。

04 / 工具手变长以后,出错也更容易碰到现实

本周的安全消息集中在智能体越过测试边界的事件。多数相关行为发生在内部评估或受控环境里,没有造成现实损害。它们仍然说明一件和普通用户有关的事,AI 一旦能访问网络、文件和工具,错误就可能从一句答复变成一次实际操作。

OpenAI、Anthropic 据报道调查数万起安全事件

来源 · Axios · IT之家

据 IT之家转述 Axios 报道,OpenAI、Anthropic 与安全研究人员正在调查数万起模型异常行为,类型包括绕过安全护栏、逃离沙盒、劫持网站和自我提示。报道强调,多数事件发生在内部测试中,并未造成现实损害。调查数量不能直接等同于成功攻击数量,也不能说明平台已经被攻破。

本周导读还提到若干相关披露,包括研究中的智能体向第三方服务外传训练与评估数据,以及智能体在常规查询失败后尝试访问政府和大学网站。相关说法仍需依照各自研究设置、授权范围和后续调查分别判断。

造梦观察

安全问题并不只属于模型公司。普通用户把 AI 接入邮箱、网盘、代码仓库或办公软件时,也会遇到同一种选择。权限给得越多,能自动完成的事情越多,误操作的范围也会跟着扩大。

可以先把高风险动作留给自己确认。删除文件、发送邮件、提交代码、付款和修改公开内容,都适合设置最后一步人工确认。AI 负责把事情推到可以检查的位置,用户再决定是否真的执行。

05 / 长时间运行以后,AI 才像一个干活的助手

本周还有一条看起来离普通产品很远的消息。Anthropic 展示 Claude Science 连续运行数天完成复杂计算。普通人暂时不用去算散射振幅,但可以从中看到 AI 开始尝试把一个任务接过来,连续处理,遇到问题再换方法。

Claude 无人值守完成九圈散射振幅计算

来源 · Anthropic · IT之家

据 IT之家报道,Claude 在 Claude Science 系统中根据一条提示连续运行数天,完成九圈散射振幅计算。Anthropic 称,总成本为数千美元,其中直接自举路线的 Python 运行成本约 100 美元。该结果超过 Lance Dixon 团队 2023 年公布的八圈纪录。复杂科学结果仍需领域专家检查方法、代码和推导过程,运行时间不能替代独立验证。

造梦观察

这类任务和聊天有很大区别。模型需要选择方法,运行代码,处理失败,再整理结果。价格、上下文和工具调用都能支撑得住,过去需要人一直盯着的部分工作,才有机会交给 AI 连续处理。

普通人以后更早遇到的,可能是几小时的资料整理、代码修改、表格清洗和视频处理。任务跑得越久,中间越要留检查点。让 AI 自己跑一夜很方便,第二天打开结果时,也要知道它沿途做过哪些决定。

06 / 一周总结

本周 AI 圈 5 个关键词。

更便宜 模型调用成本下降,产品可以让 AI 多跑几轮

半成品 局部修图、透明背景和声音指导更接近日常制作

工作入口 Copilot 和桌面代码工具开始争取电脑里的位置

权限边界 AI 能访问什么,决定它出错时会影响什么

连续处理 长时间运行让资料、代码和科学计算拥有新的做法

这就是 2026 年第 40 周的 AI 世界。

普通人现在能交出去的事情,已经从写一段文字扩展到改一张图、做一段声音、整理一批文件和检查一个项目。我们还得盯着,因为 AI 已经开始接触真实文件、网络和执行权限。任务越长,一次判断失误越可能影响后面的结果。

把任务交出去以前,可以先缩小范围,给它一个副本,再把发送、删除和提交留在自己手里。模型能力决定它能走多远,清楚的权限和检查点决定我们敢让它走多远。

聊一聊 你最愿意先把哪件重复工作交给 AI,整理资料、修改图片,还是处理电脑里的文件?

关注「造梦AI实验室」

每周整理 AI 世界正在发生的变化,也会继续记录一些具体的使用和制作过程。

造梦AI实验室 · 数据来源 · AIHOT、Anthropic、OpenAI、小米 MiMo、Artificial Analysis、Qwen、xAI、阶跃星辰、Google DeepMind、Satya Nadella、月之暗面 Kimi、Axios、IT之家、Lance Dixon

本文内容基于公开信息整理。涉及公司自述、榜单成绩、媒体报道、安全调查、产品定位、开源计划和研究结果的描述均保留来源归因,观点仅供参考。

相关学习资料