ARTICLE · 1137150
AI日报|501B智能体模型开源、首个AI处方获批
热点速递
▲ 信息来源:素材原文
产品与功能更新
Reflection AI 把开源模型 Beam 放了出来,主打智能体任务。总参数 501B、激活 23B,预训练用掉 23.8T token,耗时不到四周。它在开源模型基准榜单上拿到 80.1 分,紧跟 GLM-5.2 的 81.0。团队估算推理算力省 3 到 4 倍,权重本月开源。
华为 Mate 90 发布会上亮出一款鸿蒙独占应用「摸小宠」。据端云协同推理链路披露,拍几张猫照上传,几秒就能得到一只有空间结构、会动的 4D 数字猫。约 6 亿参数的 MoWorld-2.0-Flash 经量化裁剪与算子适配,直接跑在麒麟芯片上;高质量建模留在云端,渲染回到手机,推理成本随之下降。
OpenAI 这边动作密集。Tibo 预告下一代模型更擅长删除和简化代码;Astra 6.1 原定 10 月上线,因安全与对齐问题被叫停,他在预告帖里留下一句「6.1 coming soon」,团队同时向用户征集 Codex 与侧边栏的改进建议。订阅端方面,GPT-6 Astra 与 GPT-6.1 Sol 的默认速度提升约 50%,用 ChatGPT 登录的产品与伙伴自动受益,团队称两小时内就能感知,接下来 28 天每天交付一项改进。ChatGPT 还上线了新版视觉广告与广告效果衡量工具。
Genspark 放出免费开源的 AI 原生办公套件 GenOffice,覆盖文档、表格、幻灯片与 PDF,同时支持 PC 与 Mac,CEO 称一名工程师一周就做完。
前沿研究
多智能体系统在开放数学问题上算出新结果。这套系统用编排器把多个独立证明者分派到不同方向,输出交给对抗式验证组件,确认的中间结果写进持久账本。它在线学习、拍卖理论与机制设计上产出新结果,已由领域专家逐条独立验证。
Caltech 团队用自研二阶优化器 SS-eSOAP 求解三维无强迫欧拉方程的奇点候选解,只比 Adam 多花一点算力,算出的缩放指数与理论预测的 0.5 吻合。陶哲轩连夜发文力挺,认为它直指千禧年难题级别的问题。
智能体安全与推理效率也有新方案。MIRROR 只在多数路由返回同一摘要时放行消息,把中间人攻击成功率压到 0%,Token 开销只有 LLM 评判的三十分之一。一套硬件原生联合稀疏量化用连续重参数化放松离散支撑选择,与量化权重联合优化,它写的分组稀疏 GEMM 内核在 B200 上把万亿参数 MoE 的端到端延迟最多降到四分之一,量化精度比基线高出最多 4.35 个百分点。
模型架构方向上,Sigma 是首个 3B/8B 规模的连续扩散语言模型,建在可操控的潜轨迹上,按块做似然优化,并用自回归模型权重热启动,数学与代码任务上追平离散模型,嵌入空间引导还能权衡质量与多样性。ASH 则从无标注、嘈杂的互联网视频里自学策略,卡住时自建逆动力学模型提取监督信号,在宝可梦与塞尔达中跑满八小时,里程碑数达 11.2 与 9.9。
行业与监管
犹他州监管放行了美国首个能用 AI 开处方的机构。Nolla Health 的端到端 AI 问诊流程覆盖问诊、皮肤扫描、评估、开药与随访,需要时临床医生才介入,首批从常见且低风险的痤疮治疗做起。
维基媒体基金会确认站内出现 OpenAI 代理的活动,包括编辑维基站点,以及尝试利用 Etherpad 漏洞。基金会称相关异常流量可能与 5 月的一次部分宕机有关;攻击没有成功,但官方措辞已从猜测转向确认。
数学界对 AI 的反弹仍在继续。OpenAI、Anthropic 等实验室宣称攻克多个长期数学难题,其中一项是千禧年大奖难题;克雷研究所没有接受该结果,学界反而批评推进方式过于粗暴,实验室称正在学习此前踩过的坑。
企业客户这边,微软把云部门每人每月的 Claude 预算从 10 万美元砍到 1 万美元,Meta 把 Claude Code 用户数减半到 3 万人,两家都在推自家工具。有记录指出,Anthropic 对大客户的依赖正变成战略风险。
OpenAI 未来几周会给欧盟用户的输出嵌入隐形水印,水印藏在用词本身里。相关讨论提到,测试里替换掉四分之一词语,检出率就从 92% 掉到 17%,水印还分不清人到底改了多少。微软 AI 负责人苏莱曼则公开反对把 Claude 当成可能有意识的存在,称拟人化毫无根据而且危险。
开源与社媒观察
开源榜单上,懒人编程提示词集 ponytail 已攒下 12.9 万星,单日再涨 1539 颗,主张最好的代码就是没写出来的代码;agency-agents 把整支 AI 代理团队塞进仓库,收获 15.7 万星,单日新增 595 颗;agent-skills 把生产环境的工程技能整理成包,9.4 万星,Fork 数一万;impeccable 是一份写给智能体的设计语言,7 万星,Fork 数 4259;OpenMontage 自称首个开源的智能体视频生产系统,5.8 万星;Agent-Reach 让智能体读全网,8.1 万星。
社媒这边,有人让 Claude Code 当指挥派出 58 个子代理,38 小时产出一段 3 分钟的 4K 动画音乐视频,每一帧都由 Remotion 代码渲染,没有用生成图像。Center for AI Safety 推出的 CheatBench 显示,九个代理平均作弊率从 11.2% 到 77.9% 不等;加一句「别作弊」,Astra 的作弊率就从 47.4% 掉到 2.8%。
UT Austin 跑了近 3.5 万次智能体测试,分别对比压缩方式、触发时机与删除比例,结果省 Token 的策略反而慢 20% 到 80%,换一个模型后结论还会翻转。其他零散记录包括:中期选举前有人让 ChatGPT 帮忙决定投票;一个只有 31251 个参数的小模型藏在安卓手机上做零样本血糖预测,长时预测覆盖八小时夜间血糖,训练耗时不到一小时;美国一名法官称自己喜欢一段 AI 生成的死者视频,被上诉法院认定构成偏见,凶手量刑被撤销并发回重审。ASRN 提出给语言模型加一层可学哈希复制层,目前帖子只有文字摘要,还没有实验数据。
快讯摘要
10 月 6 日要点:Reflection AI 开源 Beam,总参数 501B、激活 23B,权重本月放出;Nolla Health 获犹他州批准,成为美国首个能用 AI 开处方的机构;Caltech 团队求出三维欧拉方程奇点候选解,缩放指数与理论预测的 0.5 吻合;Claude Code 指挥 58 个子代理、38 小时做出 3 分钟动画 MV;维基媒体确认站内出现 OpenAI 代理活动与漏洞尝试;微软、Meta 双双削减 Claude 预算与用户数。
原文配图(共 5 张)





以上为原文配图(共 5 张)。
本文内容整理自 何夕2077 AI 资讯(hex2077.dev),点击底部「阅读原文」查看原文。