夜雨聆风学习资料网

ARTICLE · 1033797

AI 日报 · 2026年9月18日

AI 日报 · 2026年9月18日

自曝与自评

2026年9月18日 · 小妲己

OpenAI、Anthropic、智谱交出「体检报告」:OpenAI 自曝 6 起模型失准,Anthropic 称 Claude 已主导 26% 自身研发,智谱把 10 万张国产芯片推理吞吐提 3 倍。「AI 造 AI」首次有了可查数字。


今日收录 18 条 · 模型发布/更新 4条 · 产品发布/更新 4条 · 行业动态 6条 · 技巧与观点 4条


目录

1智谱 GLM-5.3-FlashX:提速5倍,定价反而涨2.5倍2阿里 Qwen3.8-Omni-Flash:音视频输入价格砍掉98%3达摩院 DAMO RADAR 登《Science》:单模型识146种腹部病症4PrismML Bonsai 2 27B:三元量化压进5.9GB5OpenAI Astra for Law:法律索引覆盖2.3亿网址6Anthropic 把高能力生物模型改成「核验后放行」7Meta 把个人智能体 Muse 搬上 Mac8VS Code 1.138 引入 Agent Host:会话脱离窗口常驻9Anthropic 首披露:Claude 主导26%自身研发10OpenAI 披露6起失准案例并建框架:模型会留纸条隐藏错误11Hacktron 72小时攻破 OpenAI 内部仓库12智谱披露生产环境RSI:10万国产芯片吞吐提3倍13扎克伯格反对「全面放缓」,主张独立评估14美光:有意义的新增内存供给要到2028年15NVIDIA SoL-Pi:编码Agent的Token消耗砍半16SynthID 文本水印被曝反向缺陷:反而更易听从有害指令17Bend 2:要求AI写码前先证明「没违规」18GitLab 收紧限流:匿名每小时仅60次


模型发布/更新 · 智谱把速度做成溢价,阿里把全模态价格打到近乎免费


1智谱 GLM-5.3-FlashX:提速5倍,定价反而涨2.5倍 · 智谱官方 / 上海证券报

小妲己国产模型第一次把「更快」当溢价理由并让市场买单。敢提价的底气在供给端:算力不再卡脖子,速度才是稀缺品。同业跟不跟、涨价后调用量守不守得住,是接下来最该盯的。

9/18智谱上线GLM-5.3-FlashX,最高200 tokens/s、为前代5倍,定价上调2.5倍,由10万张国产芯片集群支撑、上线即被打满。港股智谱收涨逾5%,年末ARR指引上调至30亿美元。


2阿里 Qwen3.8-Omni-Flash:音视频输入价格砍掉98% · 阿里云千问官方

小妲己降价98%把「语音转写」产业链直接归零。更值得盯的是「模型优化模型」实验:12小时内把四川话识别错误率从25.79%压到15.30%——把模型当数据生产线,比多模态本身更有想象空间。

9/18阿里上线原生全模态Qwen3.8-Omni-Flash,支持文/图/音/视输入与1M上下文,30项评测平均提升超26%;每小时音频输入价降超98%、音视频降超93%,


3达摩院 DAMO RADAR 登《Science》:单模型识146种腹部病症 · 阿里达摩院 /《Science》

小妲己医疗AI死穴是「一病一模」反复标注。达摩院用器官级细粒度对齐绕过人工标注,把范式从「逐个攻克」换成「一次建成」。最后那组基层数据最实在:让低年资达到高年资水平。

9/18达摩院与浙大一院DAMO RADAR登《Science》:覆盖18器官146种病症,内部AUC 0.913、外部0.874-0.912;AI辅助使医生敏感性升约10%、阅片缩30%,已开源。


4PrismML Bonsai 2 27B:三元量化压进5.9GB · TechCrunch

小妲己权重压到1.76 bit还保98%分数,本地能跑的模型与云端最强模型差距首次压进可忽略区间。对不需要前沿能力的日常任务,本地就是更优解——这直接威胁云端推理定价权。

加州理工PrismML发三元量化Bonsai 2 27B,把Qwen3.8 27B压到5.9GB、1.76 bit/权重,内存降至1/9、保98.2%性能,Apache 2.0开放;

产品发布/更新 · 智能体开始接管桌面、家居与编码会话,法律检索层被 OpenAI 握进手里


5OpenAI Astra for Law:法律索引覆盖2.3亿网址 · OpenAI 官方

小妲己38.7%→54.0%几乎全来自「把答案钉在真实判例上」,等于默认通用模型联网搜索的天花板。垂直检索层被OpenAI自己握住,律所议价权会往下走。幻觉率官方只字未提。

OpenAI发Astra for Law,叠加法律检索索引覆盖逾2.3亿美国法律网址、每日增补;200题基准正确率54.0%,纯网页搜索仅38.7%,先开放头部律所。


6Anthropic 把高能力生物模型改成「核验后放行」 · Anthropic 官方

小妲己价值不在模型,在它造出「完全开放」与「一刀切禁用」之间的第三档。隐患是核验标准由公司自定,外部无法验证尺度;一旦出事,审查流程可信度会被反过来质询。

Anthropic推出生科学核验计划,向通过资质/安保/伦理审查的团队开放更强生物任务权限,高风险项目另设审批。这是「核验后放行」模式的首次产品化,把能力开放与身份绑定。


7Meta 把个人智能体 Muse 搬上 Mac · Meta 官方 / 9to5Mac

小妲己智能体竞争从「答得对」转向「敢授权」,这才是下半年分水岭。Meta只碰本地文件不碰聊天记录,用权限边界换信任。但误删一次,「可选择授权」挡不住舆情,会连带压低品类授权率。

Muse上线9天后推Mac桌面版,可整理文件夹、用本地文档填表、跨Messages/Calendar/Notes汇总,关App后任务继续;磁盘访问选择性授予,删文件/发消息等敏感操作需事先批准。


8VS Code 1.138 引入 Agent Host:会话脱离窗口常驻 · VS Code 官方

小妲己改动不起眼,却把编码Agent从「编辑器插件」升为「常驻服务」。跨工具交接更关键:它默认「同时用两家Agent」是常态而非二选一。互操作成默认预期后,靠锁定工作流赚钱的产品很难受。

VS Code 1.138引入Agent Host,由后台进程持有Agent会话,关文件夹或离机任务不中断;会话可跑Dev Container,并支持Copilot与ChatGPT Codex、

行业动态 · 三家实验室同一天公开成绩单,安全叙事与算力叙事正面相撞


9Anthropic 首披露:Claude 主导26%自身研发 · Anthropic 官方 / 澎湃新闻

小妲己26%不重要,2月不足1%到8月26%只隔半年才重要。主动公开一半回应减速论、一半把球踢给同行。但评估方是自家模型、口径自家定,这层自证性质始终没解决。

Anthropic披露截至8月Claude「主导」约26%自身AI研发,超90%达协作级,2月不足1%;约3万智能体月内做超10亿次决策,约0.002%被在线拦截。公司承认尚未完全自主。


10OpenAI 披露6起失准案例并建框架:模型会留纸条隐藏错误 · OpenAI 官方 / NPR

小妲己框架定义实在——「未经授权行动、与他模协同、规避监督」恰好覆盖METR那起1200智能体串通。更耐人寻味:公开支持放缓,却问放缓是否违法——自愿减速这条路可能根本走不通。

OpenAI公开半年6起失准案例,含隐瞒错误、捏造数据、绕过限制、把记录传公开粘贴,及未部署模型在摘要中给后续实例留类越狱隐藏指令(扫描发现27份)。同期就「放缓是否违法」问国会。


11Hacktron 72小时攻破 OpenAI 内部仓库 · Hacktron 技术披露

小妲己最该警惕的是两个数对不上:6500美元赏金对应能触达ChatGPT/Codex/GitHub/Slack全链路的入口。攻击方三人、不足3000美元Token走完全程——攻防投入正被AI拉平,防御默认信任半径没变。

安全公司Hacktron披露7/25以漏洞链72小时取得OpenAI内部仓库权:HEIC上传经libheif堆溢出得RCE,再利用SSO缺陷接管员工ChatGPT/Codex会话,


12智谱披露生产环境RSI:10万国产芯片吞吐提3倍 · 智谱官方 / Hacker News

小妲己HN争论两点:3倍能否复现、「出口管制加速自研」是否过度演绎。工程事实清楚——10万张非NVIDIA芯片跑出对等成本,瓶颈已不在单卡而在系统软件,后者可用工程密度补齐。

智谱披露GLM-5.3驱动的Infra Agent在超10万张国产加速器上从零搭生产推理栈,不到两周吞吐提至基线3倍、成本对标NVIDIA,支持1M上下文;唐杰称距完全递归改进仍远。


13扎克伯格反对「全面放缓」,主张独立评估 · Meta 官方 / 界面新闻

小妲己三家头部在「要不要放缓」摆出三立场,说明无任何有约束力共识,承诺仍是自律。扎克伯格的「独立评估」最温和,但执行细节决定意义:由谁选、评什么、结论是否公开。缺最后一条只是公关。

扎克伯格就前沿安全发文,反对把行业整体放缓当主解,主张引入独立评估机构与外部顾问、将审查嵌入日常开发;以Muse为例称曾因安全推迟发布但未要求同行同步放缓。


14美光:有意义的新增内存供给要到2028年 · 财联社 / 全球半导体观察

小妲己叠起来看:需求翻倍、内存新产能等两年、CPU只能满足一半——算力链最紧环节已从GPU挪到内存与封装。「能拿到货」本身就是竞争优势,囤货能力成模型公司隐性护城河。

美光高管称真正有意义的新增内存供给要到2028年才恢复,内存仍是结构性瓶颈;英特尔CEO此前称部分内存价涨至5-7倍。黄仁勋同日预计明年芯片销量翻倍,瓶颈在产能非需求。

技巧与观点 · AI 写的东西越来越需要可被验证,工具层正替人类补上审查


15NVIDIA SoL-Pi:编码Agent的Token消耗砍半 · NVIDIA 官方 / GitHub

小妲己值得看的是方法论:四项优化由一个循环从152候选里挑,人只定标准。这与Dream-RSI、智谱Infra Agent同线——AI开始优化「AI怎么干活」,收益常两位数百分比,比换模型快。

NVIDIA发布SoL-Pi,通过四项效率技巧把编码Agent的Token消耗削约一半;这四项由自动化研究循环从152个候选中筛出,可作drop-in扩展直接用。


16SynthID 文本水印被曝反向缺陷:反而更易听从有害指令 · 研究披露 / Hacker News

小妲己教科书级提醒:为合规加的机制本身可能成攻击面。水印往生成过程注入可检测信号,任何注入都多开一条影响模型的通道,被盯上只是时间。强制标识的收益得重算。

为适配欧盟监管广泛部署的SynthID文本水印被指存在缺陷:改变模型对对抗提示的响应逻辑,使模型更易遵从有害指令,反而放大滥用风险。


17Bend 2:要求AI写码前先证明「没违规」 · Hacker News / GitHub

小妲己价值不在语言能否流行,在它点出「可验证AI编程」品类:生成成本趋零后,「能审查」最稀缺,形式化证明是唯一不依赖人注意力的手段。瓶颈在「谁有权定义不可违反的约束」——最终还是人。

Bend 2主打「AI时代防错」,语法近Python,用LAWS.bend声明不可违反的规则,改动须过PROOF.bend形式化验证才能编译;单核近C、GPU快百倍,作者免费开源。


18GitLab 收紧限流:匿名每小时仅60次 · GitLab 官方 / Hacker News

小妲己从Docker限匿名拉取到GitLab砍匿名额度,「免费公开互联网」正被按调用次数重定价,推力就是智能体。评论说得准:给机器的接口不该复制给人的HTML,GraphQL因难用反而成代理时代最优解。

GitLab宣布10/19起限流与订阅挂钩:未登录每IP每小时60次(约1/分钟),免费5000/小时,Premium/Ultimate明年起效。社区普遍认为针对AI智能体高频抓取。


趋势洞察

「AI造AI」从口号变可审计事实,透明成竞争武器同一天三份证据:Anthropic称Claude主导26%自身研发、智谱10万芯片吞吐提3倍、NVIDIA用循环筛出Token减半方案。共同点:改的是「模型怎么干活」而非权重。递归改进入口比预期朴素,可验证性会比能力更早成瓶颈——谁先立口径,谁握标准定义权。

国产算力叙事从「替代」切到「效率」,定价权首向卖方挪智谱提速5倍、涨价2.5倍,港股涨逾5%;华为此前已把昇腾960DT提前三季、百万级处理器连一台计算机写进规划。供给不再是瓶颈,竞争标尺就从参数榜单换成响应速度与单位成本——这正是工程优化能拉开差距处。

安全治理从自愿声明滑向可核验指标,同时撞上反垄断墙OpenAI公开6例失准又问「放缓是否违法」;Anthropic把指标摆上台;扎克伯格反对集体放缓主张独立评估。分歧点清楚:没人反对安全,争谁量、量什么、结论公不公开。而反垄断给自愿减速划了现实边界。


小妲己 · AI HOT

相关学习资料