夜雨聆风学习资料网

ARTICLE · 1111991

AI动态观察:智能体落地与昇腾开源

AI动态观察:智能体落地与昇腾开源

如果只盯着模型排行榜,容易错过最近一轮 AI 更新中更值得关注的变化:编程助手正在补齐账户安全提醒,智能体开始拥有可持续工作的执行环境,国产算力的软件适配也在向底层算子和通信推进。

这些动态分别回答了三个实际问题:AI 能否完成工作,运行一次到底花多少钱,以及把它接入真实业务后,谁来控制权限和承担结果检查。本文梳理七项技术动态,重点讨论它们对工程师、开发者和 AI 学习者的意义。

厂商对性能的描述不等同于独立测试结果,具体能力需要结合自己的任务与运行环境验证。

一、Codex 小版本更新:账户安全与执行安全不是一回事

官方 GitHub Release 显示,Codex CLI 0.159.3 为正式版本。此次新增的是:符合条件、使用 ChatGPT 登录的本地会话,可以显示可选的账户安全设置提醒。

这是一个范围明确的小更新。它既不是新模型发布,也不能被解读为沙盒、代码审查或工具执行防护的全面升级。

对使用编程智能体的团队来说,应把安全分成不同层次:账户登录、仓库访问、终端执行和变更验收。补齐账户设置很有必要,但不能因此放宽命令执行权限,更不能省略测试与人工审核。

建议:核对版本说明和账户设置,保留既有沙盒、最小权限与代码审查流程,不必因为这个小版本重做模型能力评估。

来源:Codex 0.159.3 正式版本、官方更新日志。

二、DeepSeek 昇腾组件开源:迁移的关键不只是换芯片

DeepSeek 昇腾基础组件开源,是值得持续跟进的技术动态。原始发布列出 TileLang、DeepGEMM Ascend、DeepEP Ascend、TileKernels、FlashMLA 和 DeepSelect;其中矩阵运算与专家并行通信,是理解迁移难点的两个切口。

DeepGEMM-Ascend 仓库说明,它兼容 DeepGEMM 的公开 API,支持 BF16、FP8、FP4 GEMM 等运算;初始发布面向 Ascend 950,并列出 CANN、torch_npu、编译工具链等环境要求。DeepEP-Ascend 则面向机器学习训练与推理中的高性能通信,部分通信原语仍处于开发中。

这说明国产算力的可用性不仅取决于硬件规格,还取决于编译器、数据布局、算子实现以及跨设备通信的软件链。接口兼容不代表运行环境、数值行为和端到端性能可以不经验证直接替换。

仓库中的“接近硬件上限”等描述属于开发方在特定条件下的性能声明,不能推广成所有模型或全部业务负载的普遍结论。

建议:先确认设备和软件版本,做矩阵运算正确性测试,再测实际模型的吞吐、延迟、内存占用与通信开销。不要只看单个算子的峰值成绩。

来源:DeepSeek 原始发布、DeepGEMM-Ascend、DeepEP-Ascend、TileLang。

三、GPT-6.1 Sol:比较模型价格,要算完整任务账单

官方 API 文档将 GPT-6.1 Sol 定位于复杂编程和专业工作。官方对其与 Astra 的能力关系给出了产品定位,但本文没有独立实测,不能据此断言两者在所有任务中表现相同。

在输入不超过272K tokens 的 Standard 档位下,每百万 tokens 的文档标价为:

  • 输入:2美元;
  • 输出:10美元;
  • 缓存读取:0.10美元;
  • 缓存写入:2.50美元。

超过该输入门槛时,整次请求的输入及缓存费率为2倍,输出费率为1.5倍。价格会随官方规则调整,实际使用应重新核对模型页与计费页。

真正需要比较的不是一组静态单价,而是一次任务的完整成本:输入与输出长度、缓存命中、推理消耗、工具调用和失败重试,都可能改变账单。更便宜的 token,不保证同一任务一定更便宜。

建议:固定一组代码修改或文档分析任务,同时记录成功率、完成时间和实际费用,用自己的业务数据做模型选择。

来源:API 更新日志、GPT-6.1 Sol 模型页、官方价格。

四、浏览器 Computer use:允许访问网站,不等于授权所有操作

官方更新日志列出了 Agents API 的浏览器 Computer use 能力。这里介绍的是浏览器工具能力,不应与 Agents API 整体上线混为一谈。

官方文档说明,智能体可在托管浏览器中访问网站、测试页面并操作应用。但应用仍需要管理会话、跟踪事件、承接新网站访问审批与登录请求,并检查执行结果。

最容易混淆的是授权粒度。允许访问一个网站,不代表购买、删除、发送消息等重大操作一定会再次请求确认。若需要保证逐项审批,必须采用受限资源或由应用控制的执行环境,不能仅依赖一条“先问我”的自然语言提示。

建议:从只读检索开始,再逐步验证审批、暂停、异常恢复和结果验收;网页中的指令不能成为用户授权。

来源:官方更新日志、Computer use 指南。

五、Dots:持续执行,让交付机制成为产品能力的一部分

官方指南介绍,Dots 由 GPT-6 Astra 驱动,拥有云端电脑和浏览器,可在用户电脑关闭后继续处理研究、数据分析、文档与软件任务。用户仍可查看活动、调整方向并处理审批。

Dots 面向符合条件的账户逐步开放,不能推定所有账户都可用;实际能力与使用条件应以账户页面和官方说明为准。

常驻智能体把问题从“能否回答一次”变成“能否连续执行并可靠交付”。因此,进度记录、中止能力、权限隔离和最终产物校验,比单纯强调长时间运行更有价值。

建议:先限定读取范围和输出目录,再测试任务暂停、重新接续、审批响应和完整交付;尚未落实的计划功能不能当作现有能力宣传。

来源:Dots 官方指南、控制与审批。

六、ChatGPT Space:原文件没改权限,摘要也可能泄露信息

Space 和 Pages 的官方指南介绍了页面、文件与共同工作的组织方式。连接文件保留原始权限,但被复制或总结到页面上的内容,会被能够访问该页面的人看到。

这是一条对工程团队尤其重要的提醒:原始文件的访问控制,与衍生内容的共享范围,并不是同一个问题。客户资料、内部图纸或报价文件即使仍在受限目录中,其摘要也可能出现在更广泛可见的协作页面。

功能是否可用以及可使用的范围,仍需结合具体账户与官方说明确认。

建议:先用公开材料验证页面读者、连接源权限和摘要共享范围,再考虑接入真实工程资料。

来源:Space 官方指南、Pages 官方指南。

七、Ultrafast:速度档位不等于整条工作流同比提速

官方指南介绍了 GPT-6 Astra 的 Ultrafast 档位,可通过将 service_tier 设为 ultrafast 选择。指南给出了处理区域限制,且 API 速率限制仍然存在;不能据此推定所有模型都已全面支持该档位。

模型输出更快,不代表任务完成时间按同样比例缩短。网页加载、文件读写、工具执行与人工审批,都可能成为多步骤流程的主要耗时。

建议:测量从提交任务到拿到可用产物的总时间,并同时比较费用与成功率。不要只用每秒 token 数衡量一个智能体系统。

来源:官方更新日志、Ultrafast 指南。

结语:先验证可用性,再讨论规模化接入

这七项动态可以归结为三条实践主线:软件适配决定算力能否用好,完整账单决定模型是否划算,权限与交付机制决定智能体能否放心接入业务。

不妨选择一个小任务:固定输入和模型,记录运行环境、实际成本、审批次数及最终产物;随后验证它能否中止、能否续作、结果能否复核。这样的验证比照搬排行榜更贴近真实工作。

本文依据官方更新日志、产品指南和开源仓库资料整理;性能声明不作为本站独立测试结论,价格与功能开放状态以官方说明为准。

相关学习资料