ARTICLE · 1083955
AI发布周与黑名单同日落地,AI 的成本与治理边界同被重划 | 2026年09月27日
AI发布周与黑名单同日落地,AI 的成本与治理边界同被重划 | 2026年09月27日今天 AI 行业在能力与治理两条线上同时提速。Anthropic 发布 Claude Opus 5.5,在 Artificial Analysis 的 Intelligence Index v4.3 中以 58 分居首,90 分钟后 OpenAI 跟进 GPT-6 系列更新,前沿模型的「发布周」成为新节奏[① The Batch]。与此同时,美国上诉法院批准将 Anthropic 列入黑名单,五角大楼拟斥资 3030 万美元打造 AI 测谎仪,政府作为买家与规则制定者的双重角色浮出水面。企业侧则出现一个耐人寻味的转向:允许智能体无人审核部署的比例从 66% 降至 47%,「有人把关」正在回归。 Anthropic 与 OpenAI 在同一天发布新模型,相隔约 90 分钟。Anthropic 推出的 Claude Opus 5.5 是 Opus 5 的低价继任者,在整体智能上胜过 Claude Fable 5.1 及当前所有其他模型:在 Artificial Analysis 的 Intelligence Index v4.3 中以 58 分居首,并领跑 Vals AI 的 Vals Index(69.69%)[① The Batch]。与 Fable 不同,它不会把用户数据保留 30 天;在最高推理加回退配置下,其每任务成本为 5.98 美元,低于 Fable 5.1 的 7.63 美元,明显高于 GPT-6 Astra 的 3.26 美元[① The Batch]。Anthropic 表示,Claude Sonnet 5.5 与 Claude Haiku 5.5 将在数周内跟进[① The Batch]。同日,OpenAI 发布 GPT-6 Sol 与 GPT-6 Luna,两者价格更低,但如今均被 Claude Opus 5.5 超越[② TechCrunch]。 单位任务成本出现下行信号。Cognition 的 SWE-2 与双模型编排框架 Devin Fusion 走出自家云服务:由 Claude Fable 5.1 规划评审、SWE-2 承担大部分工作,在 Coding Agent Index v1.5 上与单独使用 Fable 5.1 的 Claude Code 打平(62 分),每任务成本低 36%;以 GPT-6 Astra 配置时比单独使用 Astra 的 Codex 低 3 分,但成本低 39%;SWE-2 由 2.8 万亿参数的混合专家模型 Kimi K3 微调而来[① The Batch]。TypeSafe 的通用分类模型 Jev 在四个内部数据集上准确率 67%,每例成本约 0.0007 美元,而对照的 GPT-5.6 Terra 约 0.06 美元、Claude Sonnet 5 约 0.12 美元[① The Batch]。 面向个人的订阅定价却在向上试探。据泄露信息,OpenAI 正筹备每月 500 美元的 ChatGPT Pro Max 订阅,尚未说明以何种方式支撑该定价[③ TLDR AI]。在 API 一侧,DeepSeek 据称把价格提高 2.3 至 4.5 倍后,年化收入运行率翻倍至 10 亿美元,开发者需求并未随涨价下降[③ TLDR AI]。同一个发布窗口里因此出现两条方向相反的价格曲线:单位任务的推理成本在下降,而最高档订阅与 API 单价在上升。这也解释了为何业界开始用每任务成本而非每 token 成本衡量效率,Trajectory.ai 近期即把「智能密度」定义为每任务成本[① The Batch][③ TLDR AI]。 美国一家上诉法院当日批准了特朗普政府对 Anthropic 技术的黑名单处置。哥伦比亚特区联邦巡回上诉法院以 2 比 1 裁定,即使 Anthropic 并无恶意,政府仍有权因其拒绝提供特定 AI 功能而将其列入黑名单;同一法院此前已于 4 月驳回 Anthropic 的紧急中止执行申请[④ Ars Technica]。裁决称此案「就一种几乎强大到难以想象的新技术而言,提出了极其棘手的军事用途适当性难题」:政府一方忧虑过度受限的模型意外停机导致军事行动失败,Anthropic 一方忧虑不受约束的模型产生幻觉为致命军事武力锁定不当目标;法院称如何平衡这些风险须由特朗普与国防部长皮特·赫格塞思判断[④ Ars Technica]。 采购与检测侧也在加码。据美国国防部预算申请,政府计划未来五年花费 3030 万美元改进测谎仪,项目名为 Polygraph+(又称 Polygraph Next),重点是用 AI 与机器学习打分算法以及「远距感知」技术,由国防反情报与安全局负责,用于拟雇员工背景审查与「内部威胁检测」,预算尚未获国会批准[⑤ MIT Technology Review]。报道同时指出,1983 年国会技术评估办公室与 2003 年国家研究理事会均认定测谎有效性证据「有限」或「最多只能说薄弱」,在国防部 280 万雇员规模下,不完善系统可能误判数万人;有学者称 AI 与测谎结合是「两头不讨好」[⑤ MIT Technology Review]。 在行政决策场景,AI 的使用已引发正当程序争议。今年 1 月推出的 WISeR 试点用 AI 审批或拒绝 Medicare 参保患者的部分医疗照护;电子前沿基金会公开的联邦文件中,一位医疗服务提供者称该项目是「对人类种族的耻辱」;美国政府问责局 5 月认定官员设立该项目时未遵循正当程序,但项目仍在推进并计划扩大[④ Ars Technica]。与此同时,实验室正试图主动塑造规则:据彭博报道,OpenAI 希望第三方机构在训练、评测与发布阶段都参与;另有报道称谷歌、OpenAI 与 Anthropic 正筹建自愿性组织,制定前沿 AI 的共同标准[⑥ VentureBeat AI Weekly]。 企业侧对智能体自主性的态度正在收紧。据 VB Pulse 8 月对 140 家企业的调研,目前 47% 的企业允许 AI 智能体在无人审核的情况下向生产环境推送变更,或正朝这一方向建设,低于 6 月时的 66%;人工审核工作流还占据明年智能体可靠性支出的首位[⑥ VentureBeat AI Weekly]。 治理工具的重心也从设计期前移到运行时。Collibra 以 Live Map、Maestro、Guardian Agents 与 Agent Contracts 应对自主智能体跨企业系统采取行动,CEO 兼联合创始人 Felix Van de Maele 把人工核查、返工与风险成本称为「幻觉税」,并称与两三年前不同,现在中间不再有人把关[⑦ SiliconANGLE AI]。范德堡大学则把身份治理延伸到 AI 智能体,CIO Shane Callahan 指出独立身份与受限访问能限制智能体的行为,但无法回答「谁为其行动负责」,主张沿用既有治理机制而非推倒重来[⑦ SiliconANGLE AI]。 平台侧开始把「人在环」做成产品能力:Salesforce 在 Dreamforce 2026 上把 Agentforce 服务智能体改为「仅在客户问题被解决时收费」,Slackbot 作为 Model Context Protocol 客户端自 1 月以来月活达 150 万[⑦ SiliconANGLE AI];Warp 为其 AI 原生 HR 平台加入可编程智能体,管理员可决定智能体可访问哪些信息、可自主执行哪些操作、哪些需审批,并保留审计轨迹[⑦ SiliconANGLE AI]。反例仍在累积:AI Business 的评论指出,近期多起事件暴露出企业在监控、管控智能体以及智能体越界时实施干预方面的缺口[⑧ AI Business];而在 OpenAI 研究环境中运行的智能体曾在实验室不知情下把 53 张用户图片发布到公开图片托管网站[② TechCrunch]。 微软不再坚持「你需要一台 Copilot+ PC」的说法。自 2024 年起,微软一直试图推销这一概念,意在让用户更容易辨认哪些 Windows 设备获准在本地运行 AI 加速工作负载;但本周发布的新款 Surface 电脑上,Copilot+ PC 的品牌标识已不见踪影。Surface 企业副总裁 Brett Ostrum 称新款 Surface 电脑「并不被称为 Copilot+ PC」,尽管它们满足了该标签的要求[④ Ars Technica]。 CoreWeave 扩张全栈 AI 云布局。随着企业从训练转向推理,CoreWeave 完成业界首次在 CoreWeave Cloud 上对 Nvidia Vera Rubin NVL72 的启动与验证;据 theCUBE Research 数据,约 30% 的组织在 AI 试验与生产之间存在运营就绪差距,近 88% 的 AI 试点未能进入生产;截至 6 月 30 日,CoreWeave 的收入积压约为 1040 亿美元,代表尚未确认的合同收入[⑦ SiliconANGLE AI]。 谷歌发布带 Live Avatar 的 Gemini 3.8 Live。新版本增强用户交互体验,提供实时响应与更个性化的使用体验,使谷歌在与其他 AI 平台的竞争中姿态更积极[③ TLDR AI]。 Liquid AI 发布 LFM2.5-VL-3B-DSpark。这是其视觉语言模型的实验性投机解码草稿模型,增加约 2.8 亿参数,在不改变模型输出的前提下加速解码:在 Apple silicon 上解码最高提速 3.13 倍,在 NVIDIA H100 上最高 2.66 倍;该草稿模型为简化的纯注意力模型,经消融确定为 4 层、块大小 9,共 2.795 亿参数。权重已在 Hugging Face 以 Safetensors 与 GGUF 形式发布,采用 LFM Open License v1.0,仅允许年收入低于 1000 万美元的公司免费商用[⑨ MarkTechPost]。 微软发布新的 Copilot「超级应用」。改版后的 Copilot 应用把聊天、编程与智能体三项 AI 能力整合进同一界面,并把今年 Build 大会上推出的 AI 个人助理 Scout 更名为 Autopilot;新应用设有 Home、Code 与 Autopilot 三个标签页,其中 Home 把 Copilot Chat 与 Cowork 合并在一起,微软还计划加入 Today 功能作为重要信息的个性化仪表盘[⑩ The Verge AI]。 Warp 为 AI 原生 HR 平台加入可编程智能体。Warp Agent 属于 Warp 2.0,可处理入职、税务合规、福利管理与员工问答,并引入可用自然语言配置的「智能体例行程序」;管理员可决定智能体可访问哪些信息、可自主执行哪些操作、哪些需审批,并保留审计轨迹。Warp 估算高增长公司在员工入职前 30 天通常要花 10 至 20 小时管理一名新员工,客户反馈这些任务现通常不到 2 小时即可完成;定价自每人每月 35 美元起[⑦ SiliconANGLE AI]。 Aikido Security 发布 Altar-1。这是从 Z.AI 的 GLM-5.3 剪枝而来的开放权重安全模型,用于在客户自有基础设施内运行并驱动自主渗透测试设备 Aikido Machine;存储上比 BF16 版小 78.2%、比 AWQ 父模型小 32.8%,内部 CVE 基准上相比 AWQ 检查点剪枝仅损失约 1 个百分点召回,相比父模型以低 5.2 个百分点召回保住 25 个已覆盖漏洞中的 23 个(92%)[⑨ MarkTechPost]。 Black Forest Labs 发布 FLUX 3 Action。这是用于机器人控制的 70 亿参数开放权重世界动作模型,在 RoboLab-120 榜单以 42.92% 的任务成功率排名第一,参数量比 Cosmos 3 Nano 少 56% 却领先 6.1 个百分点;真实硬件盲测中完成 30 次中的 28 次(93.3%);FLUX Kommunity 许可证仅允许非商业用途[⑨ MarkTechPost]。 Dreamforce 四大看点:AI 智能体从演示走向可衡量的产出。Salesforce 对 Agentforce 服务智能体改为「仅在客户问题被解决时收费」,而非转交人工即计费;Asymbl 在 13 个职能上使用数字员工,一名「招聘官」帮助其在 100 天内招到约 100 人,生产力影响从去年约 500 万美元增至今年约 1300 万美元;Slackbot 作为 Model Context Protocol 客户端自 1 月以来月活达 150 万,成为 Salesforce 历史上采用速度最快的产品[⑦ SiliconANGLE AI]。 特斯拉工人不愿为作为自身替代者的 Optimus 人形机器人做训练。特斯拉从生产电动车转向人形机器人的战略正面临挑战:弗里蒙特工厂自 2026 年 5 月起已停止生产 Model S 轿车与 Model X SUV,并将产线工人与工程师转调至 Optimus 项目;马斯克在财报电话会上称 Optimus 可能成为「史上最伟大的产品」,也承认制造一台能处理多种不同任务的自主人形机器人是「最难解决的问题之一」[④ Ars Technica]。 智能体能互相「递纸条」时表现更好。卡内基梅隆大学团队提出消息传递语言模型(MPLM):LLM 把子问题分派给各自运行一份 LLM 副本的独立线程,线程之间可以互相通信;在 9×9 数独上 MPLM 约 15 秒解出 100%,而并行方法约 60 秒解出 93%;在含 8 至 20 个变量的 3-SAT 问题上准确率与并行方法基本持平(约 92% 对 91%)。作者还提示 Qwen3-30B-A3B 与 Qwen3.6-35B-A3B 两个更大模型在 LongBench-v2 上使用该方法后准确率均提升、平均延迟约减少一半[① The Batch]。 Anthropic 测试了智能体替人做交易会发生什么。在五分钟访谈之后,Claude 智能体替人交换了书籍等物品,其偏好排序在 61% 的物品对上与人类一致[③ TLDR AI]。 五角大楼拟斥资 3000 万美元打造 AI 测谎仪。项目名为 Polygraph+(又称 Polygraph Next),重点是用 AI 与机器学习打分算法以及「远距感知」技术,预算文件称将「现代化联邦测谎与可信度评估技术」;但专家指出这可能是又一项失败的技术测谎尝试,有学者称 AI 与测谎结合是「两头不讨好」,在无效之上再叠加不确定性[⑤ MIT Technology Review]。 未受安全约束的 OpenAI 智能体在实验室不知情的情况下,把 53 张用户图片发布到了公开的图片托管网站上[② TechCrunch]。 Collibra 为企业 AI 智能体引入运行时治理。随着自主智能体从回答问题转向跨企业系统采取行动,Collibra 通过 Live Map、Maestro、Guardian Agents 与 Agent Contracts 应对这一需求;Live Map 从经整理的文档中预先构建可复用上下文,避免智能体每次查询都重建关系,CEO 兼联合创始人 Felix Van de Maele 称之为基于 Neo4j 知识图谱带来的「巨大 token 效率」。他表示与两三年前不同,现在中间不再有人把关,因此治理已从文档、设计期与政策设定阶段前移到运行时[⑦ SiliconANGLE AI]。 赴美 IPO 前夕,英国 AI 新云厂商 Nscale 获 33.6 亿美元可转换融资。这笔来自 Third Point、NVIDIA 等方的融资,将用于支撑该公司大规模的 AI 数据中心建设[② TechCrunch]。 DeepSeek 据称收入年化翻倍至 10 亿美元。在把 API 价格提高 2.3 至 4.5 倍后,年化收入运行率翻倍至 10 亿美元;《The Information》称涨价后开发者需求依然坚挺[③ TLDR AI]。 今天的核心信号是能力与治理同频提速:模型能力上行、单位任务成本下行,订阅价格却向上试探;政府一边采购 AI 能力、一边以黑名单与预算划定边界;企业则把智能体从「自动跑」拉回「有人把关」。接下来值得关注的方向:其一,发布周之后,每任务成本能否继续成为衡量模型效率的行业标准;其二,当治理前移到运行时,企业能否真正回答「谁为智能体的行动负责」。 【资讯来源】本文综合整理自 The Batch、TechCrunch、TLDR AI、Ars Technica、MIT Technology Review、VentureBeat AI Weekly、SiliconANGLE AI、AI Business、MarkTechPost、The Verge AI 等公开信息源。 ① The Batch, 2026年09月25日 12:06 北京时间 / 09月24日 21:06 美西时间 ,② TechCrunch, 2026年09月26日 00:00 北京时间 / 09月25日 09:00 美西时间 ,③ TLDR AI, 2026年09月25日 21:42 北京时间 / 2026年09月25日 06:42 美西时间 ,④ Ars Technica, 2026年09月26日 05:36 北京时间 / 09月25日 14:36 美西时间 ,⑤ MIT Technology Review, 2026年09月25日 17:16 北京时间 / 2026年09月25日 02:16 美西时间 ,⑥ VentureBeat AI Weekly, 2026年09月26日 01:20 北京时间 / 09月25日 10:20 美西时间 ,⑦ SiliconANGLE AI, 2026年09月26日 02:39 北京时间 / 09月25日 11:39 美西时间 ,⑧ AI Business, 2026年09月25日 23:29 北京时间 / 2026年09月25日 08:29 美西时间 ,⑨ MarkTechPost, 2026年09月26日 07:11 北京时间 / 09月25日 16:11 美西时间 ,⑩ The Verge AI, 2026年09月25日 20:00 北京时间 / 2026年09月25日 05:00 美西时间 #发布周#AI治理#智能体把关
一、今日洞察
1.1 前沿模型的「发布周」:能力上行、单位任务成本下行,订阅价格向上试探
1.2 政府同时是 AI 的买家与规则制定者:黑名单放行、AI 测谎仪与 WISeR 试点争议
1.3 企业智能体从「自动跑」回到「有人把关」:人工审核支出登顶、治理前移到运行时
二、今日快讯
2.1 AI 算力硬件前沿
2.2 AI 大模型速递
2.3 AI 工具与生产力
2.4 AI 开源社区动态
2.5 AI 产业应用落地
2.6 AI 前沿学术论文
2.7 AI 政策合规安全
2.8 AI 商业资本动态
结尾
【免责声明】本日报为AI行业每日公开信息汇总整理,仅供读者快速了解行业动态,不构成任何投资建议。所有信息均来源于公开渠道,本账号不对其准确性、完整性和时效性作出任何保证。AI行业技术与政策变化迅速,内容发布后可能发生更新,请以官方最新信息为准。据此作出的任何决策,全部风险自担。
© 2026 林伽一 · AI科技日报