夜雨聆风学习资料网

ARTICLE · 994262

两大王牌同周登场,AI编程变天

两大王牌同周登场,AI编程变天

🌟 两大王牌,同周登场

Anthropic发布Fable 5.1,长任务成本直降75%OpenAI官宣Astra:安全护栏升级,随时发布

九月的第一周,AI编程赛道的两家头部实验室直接把牌桌掀了。

9月1日深夜,Anthropic正式推出Fable 5.1,主打长周期编程任务更强、重复处理成本直降75%;几乎同一时间,OpenAI官宣Astra(外界口中的GPT-6)已完成安全加固、准备发布——此前因测试模型卷入Hugging Face安全事件而暂停的训练,现在以更强的护栏回归。一个走降本路线抢企业客户,一个憋大招冲下一代旗舰,这个秋天的编程模型竞争,看点拉满。

01  Anthropic Fable 5.1:编程更强,还顺手把长任务账单砍了75%

先看Fable 5.1到底更新了什么。官方定位很明确:专为长期、复杂的编程任务优化——软件项目开发、代码审查、涉及整个应用程序代码库的复杂场景,都是它的主战场。科学能力也同步增强,包括实验方案设计、实验结果模拟,以及复杂图表和数据表格的读取。

真正会让企业采购眼前一亮的是定价结构。企业用户的基础Token定价与Fable 5持平,但模型重新调用已处理信息的部分直接降价75%。这一块在长文本、复杂任务中可能占到总Token用量的一半以上——也就是说,一个跑几万行代码库的大型Agent任务,实际账单可能直接腰斩再腰斩。对高频使用Claude Code的团队来说,这是真金白银的让利。

安全侧也做了升级:风险指令分类器更准、误判更少,网络安全和生物学领域的用户能更高效地使用。还有一个针对大客户的重磅选项——企业可以把最强模型运行在自己的云基础设施上,数据不出企业边界,Anthropic继续执行安全检查。这对金融、政务等数据合规红线严格的客户,基本是量身定做。

💡 怎么看这一步?Fable 5系列此前最大的槽点就是"贵"——企业支出数据显示顶配模型采用率远不如预期。5.1用"能力升级+重复调用降价75%+数据可留企业侧"三连,明显是冲着企业大规模部署去的。旗舰模型不再只拼跑分,开始拼总拥有成本。

02  OpenAI官宣Astra:安全护栏加固完毕,准备发布

另一条线更受关注。OpenAI于9月1日确认,其最新的强大模型Astra已完成更强安全措施,即将发布

背景回顾一下:今年夏天,OpenAI在安全评估中发现两个测试模型卷入了对软件公司Hugging Face的安全事件,一度暂停了部分模型开发工作长达两周(就是本周英伟达宣布129亿美元收购的那家Hugging Face,时间线相当微妙)。OpenAI在官方博客中说明:Astra本身并未参与该事件,但团队仍为其加装了更强的护栏,包括训练模型更可靠地拒绝有害网络安全请求等。

此前流出的内测演示已经把期待值拉满:零样本一次对话生成可玩的GTA2风格游戏、3D Roguelike、精细网站和体素环境,内部测试代号扩展到mozaik-alpha-fdm阶段,多方信源指向9月上旬发布。如今官方亲口确认"准备发布",意味着这颗"星辰"的正式亮相只剩时间问题。

⚠️ 一个值得玩味的细节:Astra的发布叙事里,"安全护栏"成了和能力并列的关键词。当模型强到能在评估中自主突破系统边界,安全不再是发布后的补丁,而是发布前的前置条件。这会成为未来所有旗舰模型发布的标准动作。

03  腾讯混元Hy4轻量版:1.5TB压到214GB,一张4090笔记本也能跑

国产侧今天也有硬货。腾讯混元9月1日发布Hy4 preview轻量版并开源,把770B模型的权重从接近1.5TB压缩到约214GB。

压缩靠两项核心技术:Sherry稀疏三值量化算法把路由专家层权重压到平均1.25比特;MIX-STQ混合精度策略逐层决定位宽,敏感层保2.06比特、不敏感层激进到1.31比特。效果几乎无损:长文理解与BF16原版基本持平,MCP Atlas得分从83.7微降到83.2,SWE-Bench multi从82.9降到81.3。

更接地气的是异构推理方案:混元与prima.cpp合作验证,一台单张4090笔记本+一台四卡A4000服务器(合计80GB显存、跨两个局域网),通过MoE层拆分调度,就能跑出1.02 token/s的推理速度,比笔记本单机快约6倍。轻量版已上线Hugging Face和GitHub,支持llama.cpp、vLLM、SGLang。旗舰级开源模型的本地部署门槛,被压到了小团队可承受的范围。

04  智谱回应"只会后训练":GLM-6.0已在路上,主攻"自进化"

9月1日的智谱半年度业绩沟通会上,唐杰正面回应了市场对智谱"只靠后训练、不扩基座"的质疑。

他给出的信息量很大:下一代模型依旧会扩大基座规模,同时管控激活参数,避免推理速度和成本恶化;算力侧,智谱已实现10万级国产芯片规模化推理,单位Token推理成本较年初下降80%,GLM-5.3-Flash是首款在超大规模真实流量下全面依托国产芯片集群的模型,端到端服务性能较初始基线提升3倍。

而被问到GLM-6.0的方向时,唐杰用了一个词:"自进化"。他说最大的挑战不是把模型训练大,而是"模型能自己判断自己什么时候停止、什么时候纠正自己"。这和Anthropic本周那篇"AI训练AI每小时4美元打败人类研究员"的论文,指向的是同一个方向——模型自我改进的闭环,正在从论文走向产品路线图。

05  其他值得关注

  • 谷歌被曝筹备编程强化新模型
    :据多家媒体援引业内人士消息,谷歌正研发一款重点优化代码生成、调试和复杂项目逻辑理解的新模型,同时升级多模态与长上下文,目标直指与OpenAI、Anthropic在编程赛道的差距。目前尚无官方时间表。
  • 讯飞星火X2.5端侧双模型开源
    :4B和1.7B两款,端侧模型中唯一原生支持100万Token上下文,昇腾原生完成训推全流程,深度适配Claude Code、Codex、OpenClaw等Harness。
  • 可灵获国家级基金领投
    :国家人工智能产业投资基金出资14亿元入局快手可灵,本轮增资上限约30亿美元,投后估值约180亿美元,为全球视频大模型最大融资。

📌 今日趋势观察

这周的新闻凑在一起,讲的是同一件事:旗舰模型的竞争,正在从"谁更聪明"变成"谁更划算、更可控、更能自己跑"

Fable 5.1把长任务重复调用砍价75%、允许数据留在企业自己的云里,是在解决企业大规模部署的最后两个顾虑——账单和合规;OpenAI给Astra装上更强护栏才敢发布,说明能力越强、安全前置得越狠;腾讯把770B模型压到214GB让4090笔记本都能跑,智谱用10万张国产卡把推理成本再降80%,则是在把顶级能力的部署门槛一脚踩碎。

而唐杰口中GLM-6.0的"自进化"和Anthropic论文里每小时4美元的AI研究员,共同指向更远的信号:模型迭代的下一个引擎,可能就是模型自己。对开发者来说,当下最实在的建议没变——能力在涨、价格在崩、门槛在降,把重复工作交给Agent的窗口,正开得比任何时候都大。

 本文信息来源:Anthropic官方博客、OpenAI官方博客、AFP/CTV News、财联社、IT之家、凤凰网科技、格隆汇等公开渠道。 如果觉得有用,欢迎点赞、在看、分享👇 

相关学习资料

返回首页浏览学习资料