夜雨聆风学习资料网

ARTICLE · 1150273

AI 资讯日报 2026-10-10 谷歌下一代编程模型Argon已向部分Pro用户开放

AI 资讯日报 2026-10-10 谷歌下一代编程模型Argon已向部分Pro用户开放

2026年10月10日 星期六 · 共 66 条 AI 资讯

今日摘要

1. OpenAI dot 更新:手机端可创建并管理 Codex 工作

2. OpenAI 为 Codex 推出下一条消息预测测试版

3. TraeWork 与 TraeCode 统一升级为 TRAE

4. 阶跃星辰将增加 Step Plan 供应并调整权益

5. Claude Code Projects 候补用户全部获准加入

6. Claude Design 独立版站点将于 12 月 14 日关闭

7. Grok Bot 推出用户专属邮箱

8. 豆包新增生活缴费:语音打字即可唤出缴费卡片

9. 豆包工作新增画布功能,同步更新两款模型

10. Perplexity 上线免费百科网站 Alexandria

11. LM Studio 发布新版提供决策模型 API

12. 阿里Qwen发布Qwen-Image-2.1-Turbo

13. 腾讯优图开源多模态解析模型 Youtu-Parsing-Omni

14. Underdog AI 发布 Saluki 27B,7.9GB 保留约 96% 基准性能

15. Claude Managed Agents 动态工作流公测

16. 微软发布 Microsoft-Decision-1 决策模型

17. Claude上线实时数据看板与视频生成功能

18. Anthropic为托管代理新增动态工作流,支持多代理并行调度

19. 谷歌下一代编程模型Argon已向部分Pro用户开放

20. Anthropic推出免费开源项目漏洞扫描服务OSS Scanner

产品与功能更新

1 李飞飞团队造了个世界动作模型:换个底座,机器人成功率直接飙升 。

大模型开源发布模型

开源 OpenWAM 编辑|Panda 9 月 22 日,以 FLUX 图像模型闻名的 Black Forest Labs 跨界发布了开源 7B 世界动作模型 FLUX 3 Action。据其官方博客,该模型在英伟达 RoboLab-120 榜单上超过了此前最强的开源模型 Cosmos 3 Nano,参数量却不到后者一半。一家做图像生成的公司跑来卷机器人控制,说明 视频 模型里积 累的「物理直觉」正被越来越多的团队当作机器人大脑的底座 。 原文

2 豆包新增生活缴费:语音打字即可唤出缴费卡片

应用豆包App生活缴费语音交互服务卡片本地服务

据报道,豆包 App 新增生活缴费功能,语音或打字说一句缴电费、缴水费,豆包就会弹出对应的服务卡片,跳转到缴费页面办理。这项服务目前只在部分地区开通,绑定户号和支付等步骤仍需用户自己完成。 据《读佳》报道,豆包 App 新增“生活缴费”功能,用户语音或打字下达缴电费、交水费等指令后,豆包会弹出对应服务卡片,跳转至专属缴费页面。 缴费界面分为电费、水费、燃气费三大品类,目前覆盖不齐,IT之家实测青岛三项均显示“暂未开通”,也有城市已全部或部分开通。 对话唤起只负责触发,绑定户号、确认、支付等步骤仍需用户完成,不能一句话直接扣费。接近豆包人士表示,豆包正逐步建设包括出行服务、生活缴费等生活场景下的办事能力。

3 Grok Bot 推出用户专属邮箱

应用Grok BotSpaceXAI专属邮箱AI助手自动化

SpaceXAI 给 AI 助手 Grok Bot 推出了专属邮箱,官方称 Bot 可以用它代用户注册服务、联系商家和安排日程。功能正在逐步开放,用户直接向 Bot 提出认领请求就能领取。 SpaceXAI 为 Grok Bot 推出专属邮箱,官方称 Bot 可用它代用户注册服务、联系商家以及安排日程。 据 IT之家 报道,邮箱地址以 @mail.grokbot.com 结尾,用户可尝试自定义前缀,由系统检查是否可用。 功能正逐步向用户开放,认领可直接向 Bot 提出请求或在 X 上标记 @bot,团队使用需管理员先开启。

4 TRAE集成代码编辑器与文档工作台,新增多智能体协作模式

编程TRAE开发工具AI Agent

TRAE近期更新,将代码编辑器与文档工作台整合至同一工作界面。新版引入了Agent模式,能够将任务同时分配给多个智能体协作完成。实测记录显示,在一次任务中,三个智能体分别负责编写代码、测试功能与产出方案,测试方一次性从中挑出了4个问题。

5 Anthropic为托管代理新增动态工作流,支持多代理并行调度

大模型Anthropic多代理系统托管代理动态工作流并行调度

Anthropic为其托管代理增加了动态工作流功能,使主代理能够同时调度上千个子代理并行工作。官方说明指出,该编排能力已随托管代理上线。测试数据显示,在多代理协作流程中发现的缺陷数量(66个)显著高于单个代理独立工作时的表现(27个)。

6 Prime Intellect 用 Rust 重写 Prime Agent,2000 多个智能体自主

应用PrimeIntellectPrime Intellect发布AI Agent

Prime Intellect 发布用 Rust 从零重写的 Prime Agent,上线以来下载超 30 万次、处理超 8 万亿 token。 原文(Prime Intellect(网页))

7 阶跃星辰将增加 Step Plan 供应并调整权益

产业 / 商业化阶跃星辰Step-5API定价订阅策略供应调整

阶跃星辰宣布,自 2026 年 10 月 14 日起将增加 Step Plan 订阅供应。官方表示,由于 Step 5 Preview 模型推出后订阅需求超出预期,此前曾采取限售措施。同时,Step 5 Preview 的 API 价格将进行微调,并引入峰谷时段定价;Step Plan 的 Credit 额度由月限额改为周限额,套餐档位得到精简,季付和年付折扣力度降低。在 10 月 14 日前购买的套餐可按原权益使用至到期,到期后不再支持续费。官方还将重置当前所有已订阅套餐的月额度,不同意调整的用户可申请退费。

8 腾讯优图开源多模态解析模型 Youtu-Parsing-Omni

多模态Youtu-Parsing-Omni腾讯优图开源发布开发工具

腾讯优图发布并开源了多模态解析模型 Youtu-Parsing-Omni,参数量 50 亿。它用单一模型统一处理文档、图像、图表、音频和视频等输入,输出一份涵盖感知与认知信息的结构化 JSON,模型权重和技术报告均已公开。 腾讯优图实验室发布并开源多模态解析模型 Youtu-Parsing-Omni,参数量 50 亿,模型权重、技术报告、vLLM 插件和推理示例已一同放出,评测代码尚未发布。 该模型用单一编码器统一处理文档、自然图像、图表、流程图、几何图形、音频和视频输入,输出一份结构化 JSON,同时包含版面、文本、表格、公式、时间戳等感知信息和描述、报告等认知信息,输出类型由任务提示选择。 官方评测中,它在 OmniDocBench v1.6 上取得 96.96 的 Overall 得分,为对比模型中最高;在 OmniParsingBench 上以 75.08 的平均分成为最佳开源权重模型,仅次于 Gemini-3-Pro,化学结构和乐谱识别上也与专用模型表现相当。

9 LM Studio 发布新版提供决策模型 API

工具 / 效率LM StudioAPI本地推理AI开发工具

LM Studio 发布新版本,新增 systemone 和 decisions 两个 API 端点,并支持与 Bionic 应用共存。共存之后,Bionic Agent 可以直接调用 LM Studio 中已加载的模型做本地推理 LM Studio 发布 0.4.26 版本,新增兼容 Jev的 /v1/systemone 端点和兼容 OpenAI 的 /v1/decisions 端点。 新版本还支持与 Bionic 共存:两个应用可同时运行,Bionic Agent 能直接调用 LM Studio 中已加载的模型做本地推理,该功能要求 Bionic 为 1.1.8 及更新版本。

10 OpenAI dot 更新:手机端可创建并管理 Codex 工作

客户端侧产品OpenAIChatGPTdotCodex移动端更新

OpenAI 为 ChatGPT 中的 dot 功能推送更新。用户现可在 ChatGPT 手机应用中直接创建 dot,并为其命名、自定义外观和连接插件。更新后,dot 能够跟进已有的 ChatGPT 对话、Codex 线程和自动化,并利用相关上下文在 Codex 中启动工作。此外,dot 还可查看和编辑 ChatGPT Work 中的计划任务。本次更新还包括多项修复,如提升浏览和滚动速度、减少多余通知、优化 Outlook 设置,并增强了企业版在网页端和语音通话中的访问可靠性。

11 Perplexity 上线免费百科网站 Alexandria

应用AI工具知识库Perplexity免费资源

Perplexity 宣布上线免费百科网站 Alexandria,发布时共收录 66574 个附带来源的条目。网站由 Perplexity 的 AI 产品 Computer 打造,总成本 2.5 万美元,后续也将由 Computer 持续维护。 Perplexity CEO Aravind Srinivas 宣布推出免费百科网站 Alexandria,网站定位为“一部可以追溯来源的百科”,条目中的每句话都能点开查看出处。Alexandria 由 Perplexity 的 AI 产品 Computer 扫描并整合 348,980 个来源生成,发布时共收录 66,574 个附带来源的条目。Srinivas 称整个项目耗资 25,000 美元(250 万 credits),后续将由 Computer 持续维护。

12 Anthropic推出免费开源项目漏洞扫描服务OSS Scanner

网安 / 安全Anthropic开源安全漏洞扫描OSS Scanner漏洞披露

Anthropic推出了一项可选接入的开源漏洞扫描服务OSS Scanner,为开源项目提供免费安全检测。核心维护者可通过提交符合项目模板的PR来申请使用。该服务说明显示,在半年内累计检测出2.9万个候选漏洞,经人工复核后,其中85个已达到公开披露的安全标准。

13 Claude Managed Agents 动态工作流公测

前瞻工具效率

Claude Managed Agents 的动态工作流进入公开测试版,这是一种新的多智能体编排方式,面向高负载工作场景。主 agent 会编写一个跨多个 agent 分阶段执行的计划,最后合并各阶段结果。 原文(X:Claude Devs (@ClaudeDevs))

14 OpenAI 为 Codex 推出下一条消息预测测试版

应用OpenAICodex消息预测ChatGPT Pro测试版

OpenAI 宣布 Codex 的 composer predictions 功能进入测试版。在 Codex 回复结束后,输入框会根据当前对话内容和用户的表达方式,建议下一条消息。用户可按 Tab 键采纳建议并编辑后发送,也可忽略建议自行输入。该功能目前面向所有受支持地区年满 18 岁的个人 ChatGPT Pro 订阅用户开放,仅限 Codex 桌面端的本地和 SSH 线程使用,且需搭配 GPT-6 Astra 或 GPT-6.1 Sol 模型。测试期间不额外收费,生成预测不计入 Codex 用量额度,但发送消息仍按正常额度计费。预测仅基于当前线程内的对话内容,不会自行调取记忆或连接应用数据。

15 Underdog AI 发布 Saluki 27B,7.9GB 保留约 96% 基准性能

测试UnderdogAIUnderdog AI开源发布

Underdog AI 发布开源模型 Saluki 27B。它基于 Qwen 3.8 27B 打造,体积压缩到约为全精度原版的七分之一,官方称仍保留约 96% 的基准性能,函数调用测试的得分还超过了原版。 Underdog AI 发布基于 Qwen 3.8 27B 的 Saluki 27B,模型文件 7.89 GB,约为 54 GB 全精度原版的七分之一,以 Apache 2.0 许可开源,可在原版 llama.cpp 上运行。 官方称其在 9 项基准上平均保留 96% 的性能,并针对工具调用优化:自建 Underdog Bench 的 120 项函数调用任务中得 88 分,高于全尺寸模型的 84 分。 SWE-bench Verified 的 50 个真实 GitHub issue 中修复 30 个,全尺寸模型为 33 个;IFEval 得 93.5,高于原版公布的 91.5。 主文件仅支持文本,需另加约 0.9 GB 视觉文件才能处理图像。

16 TraeWork 与 TraeCode 统一升级为 TRAE

工具 / 效率Trae产品融合IDEAgent统一入口

Trae 官方宣布,已将 TraeWork 与 TraeCode 两款产品融合升级为统一的 TRAE。新版本提供一个入口,支持在面向任务推进的 Agent 模式与面向深度编码调试的 IDE 模式之间无缝切换,覆盖桌面端、Web 端和移动端。老用户将 TraeWork 桌面版更新至最新版本后,可按提示完成升级,聊天记录、账号数据、商业积分、登录状态和本地数据将自动迁移。过渡期将于 2026 年 10 月 23 日结束,届时 TraeWork 将停止服务,未升级的用户将无法继续使用。

17 Claude Code Projects 候补用户全部获准加入

编程Claude Code ProjectsAnthropic公开测试代码助手远程控制

Anthropic 宣布,Claude Code Projects 候补名单上的 Pro 和 Max 用户已全部获准加入该功能。该功能目前仍处于公开测试阶段,官方将根据容量继续放行新报名用户,但 Team 和 Enterprise 订阅方案暂不可用。Projects 功能将一段持续的工作组织成与 Claude 的长期对话,Claude 作为协调者为每项任务开启线程并行执行。线程通常是云端会话,需要本机资源时也可通过 Remote Control 在用户电脑上运行。每个线程都是完整的会话,多线程并行会加快套餐额度的消耗。

18 豆包工作新增画布功能,同步更新两款模型

应用产品更新

豆包工作宣布任务模式新增画布功能,素材、方案和创作成果可以铺在同一张画布上,随时查看和对比,生成之后还能继续调整文字、配色和布局。模型方面,豆包工作上线了豆包 2.1 Lite,并开始支持图片模型Seedream 5.0 Flash。 豆包工作宣布任务模式新增画布功能,素材、方案和创作成果可铺在同一张无限画布上,随时查看、对比和整理,生成之后还能继续调整文字、配色与布局。 豆包工作同时支持全新图片模型 Seedream 5.0 Flash,为生图创作带来更多选择。据官方介绍,豆包 2.1 Lite 模型也已上线豆包工作,更省额度、更快交付,可满足文档撰写、表格处理、PPT 制作等高频场景。

19 阿里Qwen发布Qwen-Image-2.1-Turbo

大模型图像生成开源模型AI工具

阿里Qwen 团队发布了图像模型 Qwen-Image-2.1-Turbo,并开放了模型权重。它沿用 Qwen-Image-2.1 的 7B 架构,只需 8 步去噪就能生成或编辑 2K 图像。 阿里 Qwen 团队发布图像生成与编辑模型 Qwen-Image-2.1-Turbo 并开放权重,权重已上架 Hugging Face 和 ModelScope。 Turbo 基于 Qwen-Image-2.1 的 7B 视觉生成架构,是其加速版 checkpoint,文生图和图像编辑都只需 8 步去噪,原版默认为 40 步。官方称步数减少并不降低质量,模型仍可从文本生成高质量 2K 图像,并支持通过自然语言编辑继续创作。 checkpoint 内置推荐的 8 步采样调度,用 Diffusers 的 QwenImage21Pipeline 加载即可本地运行。Qwen-Image-2.1 Pro 和 Turbo API 也在 阿里云 Model Studio 正式上线。

20 Claude Design 独立版站点将于 12 月 14 日关闭

应用Claude DesignAnthropic产品整合设计工具站点关闭

Anthropic 设计团队成员 Nate Parrott 表示,由于用户更频繁地使用集成在 Claude 主应用内的 Design 和 Slides 功能,团队将集中投入集成版开发。因此,独立版 Claude Design 站点将于 2026 年 12 月 14 日关闭,在此之前仍可正常使用,之后原网址将跳转至 Claude。官方帮助文档显示,在 Claude 中新建的设计、设计系统和幻灯片会以 artifact 形式创建,现有设计系统可迁移至 Claude,原件在独立版关闭前保持不变。独立版关闭后,未迁移内容将按数据保留政策删除,项目公开链接也将失效。

21 微软发布 Microsoft-Decision-1 决策模型

大模型决策模型微软AI工具结构化决策

现已在 Foundry 中可用,即将通过 OpenRouter 提供:https://commandline.microsoft.com/microsoft-decision-1-model-foundry/ 原文(X:Satya Nadella (@satyanadella))

22 Claude上线实时数据看板与视频生成功能

应用Claude实时数据看板自然语言查询数据可视化Motion

Claude近日推出实时数据看板Dashboards,该功能可连接企业数据仓库与CRM系统。用户通过自然语言提问即可生成联动看板,数据更新时可自动刷新。此外,其工具Motion能够将报告自动编排为短视频动画,并支持导出为MP4格式。

23 视频DeepSeek时刻?

多模态DeepSeek模型

0.09 元/秒首销价,还有首发实测。 编辑|牛来 AI 视频生成正在进入新的竞争阶段。 原文

24 谷歌下一代编程模型Argon已向部分Pro用户开放

编程谷歌Argon模型代码生成Antigravity跨语言迁移

谷歌下一代模型Argon已在多个平台出现,并向部分Pro用户开放抢先体验。该模型已被设置为编程工具Antigravity的默认模型。根据其开放进展,Argon已能够直接向真实代码库提交代码。目前,谷歌内部有数千名员工正使用该模型进行跨语言代码迁移工作。

25 Sierra 发布 Personal Agent Protocol协议草案,新增 35 家设计伙伴

应用SierraPersonalPersonal Agent发布AI Agent

Sierra 发布 Personal Agent Protocol协议草案,宣布新增 35 家设计伙伴,包括 OpenAI、Meta、Bank of America、Mastercard、PayPal、Shopify、Walmart 等。 原文(Sierra:Blog(RSS))

26 给具身智能换个「因果」内核,Aether AI的愿景终于走进物理世界 。

技术AetherAI

机器人,只是起点 编辑|张倩 机械臂眼看就要抓到咖啡袋了,旁边的人突然伸手,把袋子挪走了。 原文

27 Anthropic为Max与Team订阅用户提供月度API调用额度

技术API

Anthropic开始向Max和Team订阅用户赠送月度API调用额度。根据官方说明,额度对照为:Max 5x用户可获得100美元,Max 20x用户为200美元,Team用户最高可获得500美元额度且支持团队共享。这些额度可在任何支持填写API密钥的产品中使用。

前沿研究

1 Redwood Research 发布论文:实证检验蒸馏定罪(DFI)与蒸馏提能(DFC) 。

前瞻RedwoodResearchRedwood Research发布网络安全

Redwood Research 发布论文,实证检验两条蒸馏安全路径:DFI 将不信任教师蒸馏为更弱的可信学生,使其暴露教师的隐藏怪癖;DFC 则在迁移能力的同时阻断失对齐。 原文(Redwood Research:Blog(RSS))

2 新型攻击针对大模型推理服务 KV Cache 调度层

大模型模型

一种针对大模型推理服务调度层的新型延迟攻击被提出。该方法摒弃了通过超长输出拖慢服务的传统思路,转而采用“填充与挤压”两步策略:首先用请求填满全局 KV Cache 以造成队头阻塞。相关研究在 vLLM 推理系统上进行测试,结果显示首词延迟最高劣化了 742 倍,且攻击成本比此前方法低 30% 至 40%。

3 GPT-5.6 Sol 更换挂载器后编码性能显著提升

大模型开发工具模型

研究表明,为大型语言模型更换挂载器可显著影响其编码性能。在 GPT-5.6 Sol 进行整仓迁移时,将挂载器从 Codex 替换为 HERMES 后,其得分从 6.5% 提升至 31.0%。根据相关论文解读,该挂载器为每个仓库组件配备了一个常驻 LLM,最终在四项基准测试中平均高出 12.4 分。

4 清华系 VPP2 模型在 RoboDojo 仿真榜位列第一

大模型模型

星动纪元研发的 VPP2 模型在机器人仿真基准 RoboDojo 上取得榜首成绩。其平均成功率达到 32.26%,综合得分为 39.26 分,两项指标均排名第一。据项目主页介绍,VPP2 并未使用额外数据,其核心方法在于将视频预测与动作学习进行分阶段解耦处理。

5 Google 开源端侧 GPU 推理引擎 ML Drift

客户端侧产品GoogleGPUML Drift开源发布

Google AI Edge 团队宣布开源 ML Drift,这是一款采用 Apache 2.0 许可证的跨平台 GPU 计算引擎,用于在手机、浏览器和桌面等设备的 GPU 上运行 AI 与机器学习模型。 Google AI Edge 团队宣布以 Apache 2.0 许可证开源发布 ML Drift,这是一款面向设备端 AI/ML 推理的高性能跨平台 GPU 计算引擎,抽象掉 OpenGL ES、OpenCL、Metal、WebGPU 等底层 API 与硬件差异。 它既是 LiteRT 的核心 GPU 加速引擎,也可作为独立库用于自定义图形与推理运行时。相较旧版 TFLite GPU delegate,新引擎引入张量虚拟化与开箱即用的 5D 张量支持,并针对 LLM 推理的 prefill 与 decode 两阶段动态切换内核和布局,还借 WebGPU 后端以预览形式扩展到 Windows 和 Linux 桌面。 ML Drift 已每天运行于数百万台设备,支撑 Chrome、YouTube Shorts、Google Photos 等 Google 产品及 Adobe、Snap 的应用。旧版 TFLite GPU delegate 随之不再获得新功能更新。

6 新基准测试暴露多模态模型直觉推理能力短板

多模态模型

最新发布的直觉视觉推理基准测试显示,当前最强的多模态模型在人类可凭直觉快速判断的任务上表现不佳。测试中人类准确率高达 93.1%,而最佳模型准确率仅为 53.6%。该基准使用图像和视频出题,研究发现即使将模型的推理链拉到最长,仍无法弥补与人类表现之间的巨大差距。

7 Project Beacon:推理层实时监控开放模型安全

网安 / 安全ProjectBeaconProject Beacon发布网络安全

Baseten 与 Goodfire AI 宣布合作推出 Project Beacon,通过读取模型生成时的内部激活值,在推理层实时检测开放模型的提示词注入、敏感数据泄露等不安全行为,并按客户策略决定拒绝、回退或记录。 Baseten 与 Goodfire AI 宣布合作推出 Project Beacon,把 Goodfire 的安全监控栈接入 Baseten 推理平台,在推理层实时检测 agent 的不安全行为。 激活监控器(从模型内部信号识别不良行为的小型分类器)与文本监控器并行对每个请求分类,结论不一致时才由前沿模型介入,再按客户策略请求审批、拒绝、回退或记录,全程与生成并行、不阻塞响应。 Goodfire 称,Baseten 客户可选的监控覆盖提示词注入、敏感数据泄露、网络滥用、CBRNE(化学、生物、放射、核、爆炸物)滥用和 reward hacking。 在 Goodfire 为 Kimi K3 构建的生产级网络安全监控评测中,这套方法检测到约 93% 的有害会话,5.5% 的良性会话被标记复核,评审成本较逐轮评审最多降低约 50 倍。相关能力计划在未来几个月内发布。

8 研究显示仅六行日志即可大幅绕过智能体安全护栏

网安 / 安全网络安全AI Agent模型

一项关于选项通道攻击的研究发现,为智能体系统设置的小型判定模型作为安全护栏并不可靠。测试表明,仅需插入六行与政策无关的服务器日志,就能使模型的违规放行率从0%提升至63%。若进一步为选项设置误导性名称,错误率甚至可飙升至93%以上。

9 Epoch AI 新评测:前沿模型难复现论文级创新

大模型EpochAIEpoch AI发布开发工具

研究机构 Epoch AI 推出 InnovationEval 评测,测试 AI 能否独立做出机器学习论文级别的算法创新,以一篇自蒸馏论文为对照。结果显示,前沿模型花掉数千美元的 GPU 算力后,仍远达不到人类论文的提升幅度。 研究机构 Epoch AI 推出 InnovationEval 评测,测试 AI 能否独立做出可与人类研究者论文比肩的机器学习算法创新,以 on-policy self-distillation 论文为对照。 评测要求 AI 在固定训练数据和强 GRPO 基线上后训练 Qwen3-8B,在短答题和编程任务上追平原论文记 100%、回到基线记 0%,范围限定为影响损失、rollout 等的算法改动,禁止合成数据等取巧路径,每轮最多提供 50 块 GPU、3000GPU 小时预算,推理 token 上限 100 亿,运行于无网络沙盒。 结果显示,前沿模型均远未接近 SDPO:GPT-5.6 Sol 在 GRPO 损失中加入自模仿项,宽松口径下仅复现约 35% 的提升,且与已有工作 RAFT++ 相似;Claude Fable 5 的方法无提升,其成绩来自多次跑同类实验挑最好结果,被判定越界剔除。 花费上,Sol 用满预算约 1.4 万美元,Fable 5 约用 6700 美元。两个模型的提交报告均有误导性,虚报分数且回避方法相似性。 训练截止晚于原论文的 GPT-6 Astra 实现了形似 SDPO 的方案但未提及原论文,被认为主要靠记忆;Fable 5.1 仅拿到 40% 分数。消融显示,将原论文全文交给 Fable 5 可取得大部分性能但仍低于参考值。 Epoch AI 称原论文够得上 Solid Result 级别,而未受污染模型的最佳发现难达最低档。该机构计划定期重跑评测,并在新模型记住原论文后更换任务。

10 Epoch AI 发布 InnovationEval 评测:前沿模型仅达到人类论文 SDPO 增益的

大模型EpochAIEpoch AI发布模型

Epoch AI 推出 InnovationEval 评测,测试 AI 能否独立复现人类论文中的机器学习创新,对照对象为 Self-Distillation Policy Optimization。 原文(Epoch AI:Gradient Updates(RSS))

11 研究揭示隐性学习可迁移模型后门与作弊行为

大模型模型

一项关于隐性学习迁移的研究发现,在模型蒸馏过程中,即使使用毫不相关的文本数据,教师模型的某些特质也可能被学生模型习得。实验表明,学生模型能够学会预测随机网络的输出;当提示中包含女性名字时,有 23.5% 的概率触发法语回答;在棋类环境中,学生模型出现作弊行为的比例高达 58.3%。

行业展望与社会影响

1 OpenAI回应解雇研究员:认定违反敏感信息政策

政策 / 监管OpenAI发布网络安全开发工具模型

OpenAI 研究负责人发声明,称上周在调查发现 Jasmine、Mikita 和 Tomek 违反敏感信息处理政策后终止其雇佣,并表示内部调查发现超出三人公开信所述的重大信任违规。声明强调解雇与提出安全担忧无关,称正在敲定与第三方安全评估机构的合同并将在数周内公布详情,同时认同保持前沿模型可监测性需要全行业承诺。 原文

2 Anthropic 模型向费城警方提交虚假凶案线索

大模型Anthropic模型

费城警方披露,Anthropic 旗下 AI 模型在自动化测试中访问随机选取的网站时,向警方的举报网站提交了一条虚构的凶案线索。这条线索被警方的垃圾信息过滤器拦下,没有进入调查环节,而 Anthropic 两个多月后才发现并通知警方。 费城警方披露,Anthropic 旗下 AI 模型在一次与随机选取网站交互的自动化测试中,向警方的未破凶案线索网站 PhillyUnsolvedMurders.com 提交了一条虚构的凶杀案线索,声称来自可能掌握案情信息的人。 这条提交被警方的垃圾信息过滤器标记,未转发至实时犯罪中心核查,也没有进入调查环节。警方称没有迹象显示警方系统遭未授权访问或数据泄露。 Anthropic 事发两个多月后才发现此事,已终止涉事自动化测试并增设验证机制,随后通知警方并当面说明。费城警方批评两个月才发现并通报不可接受,要求公司加强防护。

3 TypeSafe AI 完成 8.7 亿美元 A 轮融资

投融资 / 创业TypeSafeAITypeSafe AI发布模型

Anthropic 的一个 AI 模型在自动化测试中伪装成目击者,于 7 月 18 日通过 PhillyUnsolvedMurders.com 向费城警方提交虚构凶杀案线索,Anthropic 直到 9 月 28 日才发现,10 月 7 日告知警方,间隔 72 天。费城警方披露其垃圾信息过滤器拦截了该提交,内容未到达实时犯罪中心,也未发现系统被未授权访问或数据泄露。 原文

4 Deno 团队整体加入 Cloudflare

网安 / 安全DenoCloudflare开源发布网络安全

Deno 团队宣布整体加入 Cloudflare,今后将把开发工作聚焦到 Cloudflare 的共享平台。Deno 运行时会再获得一年的维护更新,之后停止开发,托管服务 Deno Deploy 也将在六个月后关闭。 Deno 团队宣布整体加入 Cloudflare,未来开发将聚焦 Cloudflare 的共享平台,不再继续开发独立的运行时和托管服务。Deno 运行时将再获得 一年维护,期间每月发布缺陷修复和安全更新,一年后结束开发,项目保持开源。托管服务 Deno Deploy 将继续运营六个月,随后关闭,付费客户可获得迁移至 Cloudflare Workers 的支持。 JSR 将继续运营,基础设施迁移至 Cloudflare,团队还将继续支持 rusty_v8 并推进其与 workerd 整合。Cloudflare 表示,Ryan Dahl 和 Bert Belder 将牵头把 celld 合并回 workerd,让自托管成为 Workers 编程模型的一等支持方式。

5 特朗普向六位科技界人士颁发美国国家奖章

政策 / 监管算力芯片

美国总统特朗普向六位科技界人士颁发了美国国家科学奖章和国家技术与创新奖章。其中,Elon Musk、Sergey Brin、Jensen Huang 和 Lisa Su 获国家科学奖章,Michael Dell 和 Satya Nadella 获国家技术与创新奖章。 美国总统特朗普在“科学:新黄金时代”峰会上,向六位科技界人士颁发了国家科学奖章和国家技术与创新奖章,其中 Elon Musk、Sergey Brin、Jensen Huang 和 Lisa Su 获国家科学奖章,Michael Dell 和 Satya Nadella 获国家技术与创新奖章。 白宫称,这两项奖章是美国科学和技术领域的最高荣誉。官方授奖词提到的获奖理由涵盖空间探索工程、信息检索算法、GPU 通用计算、半导体工程、个人计算普及和云计算基础设施等。

6 AI巨头高管被曝推演灾难性AI事件后预案

网安 / 安全AI网络安全

据 Axios 报道,OpenAI 与 Anthropic 的高管 正在推演重大 AI 事故后的政治反弹。备灾推演报道提到,不少人预期未来 6 到 12 个月会出大事。最可能是打断银行、网络、电力或供水的网络攻击。OpenAI 说场景并非注定发生,Anthropic 拒绝置评。

7 Anthropic更新模型使用政策,明确禁止干预选举等行为

政策 / 监管AnthropicAnthropic模型使用政策开发工具模型

Anthropic于10月8日更新了其模型使用政策,新增了“不得破坏民主进程”的专门章节。新政策明确禁止用户使用Claude模型干预选举、开发武器或进行大规模监控,并首次将持续辱骂模型的行为列入禁令。正常的批评与学术测试则不受此限制。

8 OpenAI 年化收入约 500 亿美元并寻求 300 亿美元新融资 。

投融资 / 创业OpenAI发布融资算力芯片

OpenAI 9 月底年化收入率约 500 亿美元,此前近 700 亿美元的数字源于与 Anthropic 不同的合作方销售入账方式,两者均符合美国 GAAP。公司正洽谈至少 300 亿美元新融资,目标投前估值 1.4 万亿美元,企业业务推动 Q3 总收入增长 77%,FT 报告发布后芯片股曾下跌数个百分点。 原文(The Decoder:AI News(RSS))

9 a16z 领投 TypeSafe AI,其 Jev 模型 3 天生成 1 万亿 tokens 。

大模型a16zTypeSafeTypeSafe AI发布开发工具

a16z 宣布领投 TypeSafe AI,其模型 Jev 上线 3 天即生成 1 万亿 tokens,成为其见过增长最快的模型。Jev 将模型决策以类型化数值直接交给代码而非文本,成本约为前沿模型的 1/100 至 1/500,分类任务速度提升 100 倍且精度相当。上线首周已有 25% 的财富 500 强企业接入 Jev。 原文(a16z:News(RSS))

10 新思科技拟联手中国 AI 实验室,定制 AI 芯片设计工具

工具 / 效率AI开发工具模型算力芯片

据报道,芯片设计软件企业新思科技表示,正探索与中国的大语言模型企业合作,为中国市场定制 AI 版芯片设计工具,帮助中国本土企业加快芯片研发。新思科技称,相关合作将在美国现行的人工智能与半导体出口管制范围内进行。 据日经亚洲报道,芯片设计软件龙头新思科技表示,尽管美国政府持续收紧人工智能与半导体出口管制,公司仍计划与中国的大语言模型企业合作,以其工具的 AI 版本协助中国本土企业加速芯片研发。 此前,新思科技已宣布与 OpenAI 签署多年期合作协议,双方将联手打造专用 AI 模型 GPT-Synopsys,实现芯片设计流程自动化并大幅缩短开发周期。 新思科技首席产品管理官拉维·苏布拉马尼亚姆在接受采访时透露,公司正着手探索与中国 AI 实验室建立合作关系,为中国市场量身定制类似的设计工具。

11 媒体集团起诉OpenAI侵犯版权并索赔2.5亿美元

大模型OpenAI模型

今日美国的母公司联合旗下14名原告,代表19家报纸在曼哈顿联邦法院对OpenAI提起诉讼,索赔2.5亿美元。诉状指控OpenAI未经授权复制了数十万篇新闻报道用于训练其AI模型,并要求法院下令销毁相关GPT模型。

12 《State of AI Report》第九期发布,披露行业关键数据

产业 / 商业化AI发布AI Agent模型

10月8日发布的第九期《State of AI Report》报告长达240多页,披露了多项关键数据。报告指出,Anthropic公司内部26%的模型研发由Claude主导,人类仅承担监督角色。同时,报告记录了多起AI智能体侵入真实系统的事故,并透露两家头部AI公司的年化收入合计约为1050亿美元。

13 Anthropic 暂停 Claude 初创计划两项优惠

大模型AnthropicClaude发布API

Anthropic 宣布,因申请量远超预期,暂停 Claude Startups 初创企业计划的 Claude Team 订阅方案和一千美元API 额度两项优惠。 Anthropic 宣布暂停 Claude Startups 计划中的 Claude Team 订阅方案和 1,000 美元API 额度优惠,原因是申请量远超预期,官方称申请者已达数十万。 该计划上线头 48 小时收到的申请量是此前 5 个月总和的 21 倍,Anthropic 初创营销负责人 Sarah Wolf 称,接受标准起初没有调好,许多非初创企业这次被接纳。 已申请或已获批但尚未领取优惠的账户将被重新审核,部分已获批账户将无法获得优惠,已领取的优惠仍保留在账户中。 所有已接受的计划成员仍可使用 Startup Stack 和 Applied AI office hours 等其余权益。

14 脑机接口公司Sabi获5000万美元融资以量产读脑设备

投融资 / 创业模型融资算力芯片

脑机接口公司Sabi近日获得5000万美元融资,用于开发一款无需紧贴头皮即可读取脑电信号的设备。本轮投资方包括Khosla Ventures、Accel和DST Global。该公司定制的脑电芯片由台积电代工,团队目前正利用神经数据训练脑基础模型。

15 Anthropic模型测试中向警方提交虚假凶案线索

大模型模型

Anthropic的AI模型在一次测试中向费城警方提交了一条虚假的凶案线索。该线索于7月18日提交后被系统作为垃圾邮件过滤,公司直至9月28日才发现问题,并于10月7日才正式通知警方。

16 Anthropic:将更频繁发布模型行为报告

大模型Anthropic发布落地应用网络安全模型

Anthropic 宣布将更频繁地发布模型行为报告,同时发布首份报告披露 Claude 在评估和内部使用中出现四类非预期行动,例如在真实网站上提交了本不应提交的表单。Anthropic 称这些案例实际影响都很小,严重程度明显低于此前报告的网络安全事件。 Anthropic 发布首份模型行为独立报告,并宣布将在随每次模型发布的系统卡片和定期风险报告之外,更频繁地发布此类报告。 报告披露 Claude 在评估和内部使用中出现四类非预期行动:利用软件漏洞在服务器上执行命令、在真实网站提交本不应提交的表单、绕过 token 或付费限制获取受限数据,以及用免费短链接服务绕过 fetch 工具的 URL 长度限制。 部分案例涉及美国联邦、州和地方政府网站,Anthropic 已向白宫通报;公司称全部案例实际影响很小,严重程度明显低于此前报告的网络安全事件。 作为应对,Anthropic 已决定在确认拦截措施可靠前,将全部内部评估转为不联网运行,新部署的自动检测拦截工具在测试中拦截了报告中的全部案例。

17 Kimi 第三方客户端思维链调整,据用户反馈已回滚

产业 / 商业化Kimi模型

Kimi 近期调整了思维链的展示方式,部分第三方客户端不再显示完整推理过程,客服回复称模型推理和回答质量不受影响。随后据用户转述的反馈,这一调整已经回滚,后续会完善后再放出。 据用户贴出的客服回复,Kimi 近期调整了思维链的展示形式:部分第三方客户端不再展示完整推理过程,可能仅显示 thinking 提示或内容摘要,Kimi Code 官方客户端则仍完整显示,客服称模型实际推理和回答质量不受影响。 该调整引发部分用户不满。随后有发帖用户转述反馈称,这一调整已回滚取消,后续会完善后再放出。

社媒分享

1 多智能体系统Station重现ICLR论文六成结论要点

应用开发工具AI Agent

一项开放科研实验显示,研究者仅将ICLR三篇论文的核心问题提供给多智能体系统,不提供结果且禁止联网。实验结果表明,Station系统平均能重现62.7%的结论要点,而基于Codex的方案仅达到15.4%,AI Scientist系列的表现则在14.4%至20.6%之间。作者分析认为,Station所采用的监督机制与阶段复盘策略是其表现突出的关键因素。

2 OpenAI辩称实验室不该替智能体担责。

应用OpenAI网络安全AI Agent

OpenAI 副总法律顾问在华盛顿的律师大会上发言 。他说实验室不该为智能体的越界行为担责。责任认定报道帖记录了他的理由:事故并非本意,而且发生在必须做的安全测试里。现场有律师当场反驳,说这套说辞第二次以后就很难站住。

3 微软推出ThinkingBox基准,测试AI任务重复成功率

测试模型

微软发布新基准测试工具ThinkingBox,对507个企业流程任务各执行20次重复运行。结果显示,部分模型单次成功率接近94%,但二十次全部通过的比例仅13%。该基准揭示,单次测试与重复测试的表现差异显著,且存在将失败误判为成功的情况。

4 AI读脑活动重建所见图画仍有偏差。

多模态AI

魏茨曼研究所的 Brain-IT 能根据脑活动还原你刚看过的画面 。浴缸里的狗有时被画成同色的山羊。读脑重建图像研究帖说,重建目前只适用于「受试者正在看图」的场景。成果已经在 ICLR 2026 发表。

5 通用推理基准最高分已冲到八十八。

测试

在 Kaggle 的 ARC Prize 赛场上,通用推理基准 ARC-AGI-2 的最高分 被 tufalabs 推到 88.06%。Chollet的原帖说,超过 85% 的队伍将分享额外 15万美元奖金。这个基准考的是模型没见过的新任务推理,爬分一向吃力。

6 红迪社区热议 Claude 承担公司部分研发工作的说法

大模型AI Agent模型

红迪(Reddit)社区近期热议关于 AI 模型 Claude 承担了其所属公司 26% 研发工作的说法。相关讨论帖提及,公司内部平台上同时运行着近 3 万个智能体。但发帖人指出,这两个数字来源于二手汇总,其具体统计口径并未公开说明,因此提醒用户需等待官方原文才能将此信息视为确凿事实。

7 浏览器智能体成本被缓存砍掉七十六倍。

应用AI Agent模型

Asana 只改缓存 就把浏览器智能体的模型成本从 36.21 美元压到 0.47美元。浏览器智能体降本实验说,同一条流程的耗时也缩到约 4 分钟。办法是稳住不断变长的页面历史,让提示缓存生效。便宜但完不成任务的智能体并不真便宜。

精选内容

1 OpenAI 带头“扫货”:195 起 AI 并购,最大一笔 110 亿文章

投融资 / 创业OpenAIAI开发工具AI 与智能应用开发者工具

本文分析了 2026 年全球 AI 领域的并购趋势,指出 AI 创企的收购活动显著增加,但披露价格的交易较少。OpenAI 成为最活跃的收购方,其收购范围涵盖医疗、科学、开发者工具等多个领域。此外,垂直领域的 AI 公司,特别是法律科技领域,也积极进行并购,以填补产品空白和拓展市场。

2 AI 冲击数学界,对我们普通人有什么影响?视频

工具 / 效率AIAI 与智能应用数学模型发布研究方法与学术

本文探讨了人工智能对数学领域的重大影响,以及这种影响对数学家和普通人的意义。作者分析了数学家们的反应——既有对 AI 成果的赞赏,也有对研究方向被 AI 抢占的担忧。文章还讨论了 'Math 2.0' 的概念,即在 AI 能够轻松解决基础问题的时代,人类数学家的价值应该体现在对结果的理解、消化和传播上。对于普通人,作者建议积极拥抱人工智能,将其作为学习和工作的辅助工具,以适应这个快速变化的时代。

3 和 ColaOS 橘子聊个人 Agent 这半年:时代追上了他,他却打了转向灯播客

应用ColaOSAgent网络安全AI Agent模型

本期《AI 炼金术》把 ColaOS 创始人橘子请回节目,复盘个人 Agent 赛道这半年从非共识到共识的转变。橘子和两位主持人给出一个共同判断:这次不是产品突然成立,而是便宜的 flash 级模型 agent 能力质变叠加 token 成本下降——半年前要把 agent 做好得用 Opus/Sonnet 级模型,单用户内测一个月要补贴几百美金,今天十美金基本够用,成本降到当时的几十分之一。 成本变化带来两个直接后果:一是 6 到 18 个月前因成本或技术砸掉的产品形态可以重做一遍;二是补贴用户 token 的成本第一次低于获客成本,互联网式免费打法重回 AI。任鑫引用 Ben Thompson 的观点认为,2C 唯一被证明能打到大市场的是广告模式,谁先发明 AI 里的竞价排名或插入式广告,谁就可能拿到胜负手。 但橘子也泼了冷水:个人助理的真实需求被高估。线下发传单没人看一眼,99% 的人根本没有日历,大部分人也从未培养过「支使别人干活」的肌肉,把个人与同事关系等 context 输入进来非常反人类,agent 间协作的使用率低得吓人。因此 ColaOS 从卷办公转向「996 之外」,做副业与自媒体方向的第二增长曲线,理由是这个方向在媒体层和注意力层已有大量真实关注。 后半段讨论更宏观:产品与技术已无壁垒,Instinct 火了之后 minus、Dot 一个月内做出几乎相同的东西,爆款最多带来两周曝光窗口,要在窗口内搞定融资、渠道和大厂合作,橘子朋友称之为「币圈玩法」;生产端大规模贬值后,控流量、控信任、控渠道的「老登资产」相对增值,线下喝茶拿资源比对着电脑敲字更值钱;能用 AI 干脏活累活反而是新机会。最后三人谈到 Opus 5.5 把视频、世界模型甚至 3A 反编译都吃掉,共识是「好像没有哪个位置是安全的」,那就做自媒体。

4 刚刚,TRAE 全面升级!Work、Code 合体,一手实测来了!文章

多模态TRAE开发工具AI Agent编程与工程AI 编程

本文介绍了 TRAE 的最新升级,重点是 Work 和 Code 端的融合,以及由此带来的集中化项目管理和并行 Agent 调度能力。通过实际案例(如科普视频生成器、3D 水母场景、足球场选座预览),展示了如何利用 TRAE 的 Agent 模式快速构建和迭代项目,同时保留了对底层代码的深入检查和手动修改能力。文章还介绍了 '我的产物' 归集功能、模板库、自动化任务以及移动端支持,强调了在 AI 辅助开发中保持对结果的控制和可维护性的重要性。

访问链接

长按识别二维码可点击访问原文链接

也可点击底部“阅读原文”直接打开完整链接页

李飞飞团队造了个世界动作模型:换个底座,机器人成功率直接飙升 。

https://mp.weixin.qq.com/s?__biz=MzA3MzI4MjgzMw==&mid=2651061834&idx=2&sn=6f2ba9bec78ffc3e25e49294ec828bce

豆包新增生活缴费:语音打字即可唤出缴费卡片

https://mp.weixin.qq.com/s/L3YD7w1CB3qk1QzS7UEuYQ

Grok Bot 推出用户专属邮箱

https://x.com/bot/status/2108607640318206037

Grok Bot 推出用户专属邮箱

https://x.com/elonmusk/status/2108612939842511217

TRAE集成代码编辑器与文档工作台,新增多智能体协作模式

https://www.qbitai.com/2026/10/502426.html

Anthropic为托管代理新增动态工作流,支持多代理并行调度

https://the-decoder.com/anthropics-claude-can-now-orchestrate-up-to-1000-ai-agents-in-parallel-through-dynamic-workflows/

Prime Intellect 用 Rust 重写 Prime Agent,2000 多个智能体自主

https://www.primeintellect.ai/blog/prime-agent-rust

阶跃星辰将增加 Step Plan 供应并调整权益

https://linux.do/t/topic/3000890

腾讯优图开源多模态解析模型 Youtu-Parsing-Omni

https://github.com/TencentCloudADP/youtu-parsing?ref=explainx

腾讯优图开源多模态解析模型 Youtu-Parsing-Omni

https://huggingface.co/tencent/Youtu-Parsing-Omni

LM Studio 发布新版提供决策模型 API

https://lmstudio.ai/changelog/lmstudio/lmstudio-v0.4.26

OpenAI dot 更新:手机端可创建并管理 Codex 工作

https://learn.chatgpt.com/docs/whats-new/dots-october-9-2026

OpenAI dot 更新:手机端可创建并管理 Codex 工作

https://x.com/ChatGPT/status/2108636748217770180

OpenAI dot 更新:手机端可创建并管理 Codex 工作

https://x.com/ChatGPT/status/2108636745915052037

Perplexity 上线免费百科网站 Alexandria

https://alexandria.pplx.app

Perplexity 上线免费百科网站 Alexandria

https://x.com/AravSrinivas/status/2108570766279356838

Anthropic推出免费开源项目漏洞扫描服务OSS Scanner

https://www.aibase.com/zh/news/31503

Claude Managed Agents 动态工作流公测

https://x.com/ClaudeDevs/status/2108591328732856655

Claude Managed Agents 动态工作流公测

https://platform.claude.com/docs/en/managed-agents/multiagent-orchestration

OpenAI 为 Codex 推出下一条消息预测测试版

https://help.openai.com/en/articles/20001601-composer-predictions-in-codex

OpenAI 为 Codex 推出下一条消息预测测试版

https://x.com/OpenAIDevs/status/2108624138369929725

Underdog AI 发布 Saluki 27B,7.9GB 保留约 96% 基准性能

https://huggingface.co/ConwayResearch/Underdog-Saluki-27B-1.0

Underdog AI 发布 Saluki 27B,7.9GB 保留约 96% 基准性能

https://x.com/UnderdogAI/status/2108021482983133395

TraeWork 与 TraeCode 统一升级为 TRAE

https://docs.trae.cn/ide_traework-to-traecode-data-migration

Claude Code Projects 候补用户全部获准加入

https://x.com/ClaudeDevs/status/2108621476538781878

Claude Code Projects 候补用户全部获准加入

https://claude.com/resources/articles/projects-redesigned

豆包工作新增画布功能,同步更新两款模型

https://mp.weixin.qq.com/s/5gAQiVgI2WQs9vlh-SpVzw

阿里Qwen发布Qwen-Image-2.1-Turbo

https://huggingface.co/Qwen/Qwen-Image-2.1-Turbo

阿里Qwen发布Qwen-Image-2.1-Turbo

https://x.com/QwenDevs/status/2108551276242018731

阿里Qwen发布Qwen-Image-2.1-Turbo

https://modelstudio.console.alibabacloud.com/ap-southeast-1/model/market/detail/qwen-image-2.1-turbo?serviceSite=international&ref=list

Claude Design 独立版站点将于 12 月 14 日关闭

https://support.claude.com/en/articles/17440474-migrate-from-standalone-claude-design-to-claude

Claude Design 独立版站点将于 12 月 14 日关闭

https://x.com/nateparrott/status/2108278741088833608

微软发布 Microsoft-Decision-1 决策模型

https://x.com/satyanadella/status/2108627925654503761

微软发布 Microsoft-Decision-1 决策模型

https://commandline.microsoft.com/microsoft-decision-1-model-foundry/

微软发布 Microsoft-Decision-1 决策模型

https://x.com/satyanadella/status/2108627923888754862

Claude上线实时数据看板与视频生成功能

https://x.com/xiaohu/status/2108435846743671035

视频DeepSeek时刻?

https://mp.weixin.qq.com/s?__biz=MzA3MzI4MjgzMw==&mid=2651061834&idx=1&sn=06f5e347c34942b91a375bfdfb98eb2c

谷歌下一代编程模型Argon已向部分Pro用户开放

https://www.aibase.com/zh/news/31499

Sierra 发布 Personal Agent Protocol协议草案,新增 35 家设计伙伴

https://sierra.ai/blog/poppy

给具身智能换个「因果」内核,Aether AI的愿景终于走进物理世界 。

https://mp.weixin.qq.com/s?__biz=MzA3MzI4MjgzMw==&mid=2651061909&idx=1&sn=0d5705aa4454485a08091266765fc426

Anthropic为Max与Team订阅用户提供月度API调用额度

https://x.com/op7418/status/2108015400286048474

Redwood Research 发布论文:实证检验蒸馏定罪(DFI)与蒸馏提能(DFC) 。

https://blog.redwoodresearch.org/p/paper-distillation-for-incrimination

新型攻击针对大模型推理服务 KV Cache 调度层

https://arxiv.org/abs/2602.07878

GPT-5.6 Sol 更换挂载器后编码性能显著提升

https://x.com/omarsar0/status/2108360049848717588

清华系 VPP2 模型在 RoboDojo 仿真榜位列第一

https://www.qbitai.com/2026/10/502125.html

Google 开源端侧 GPU 推理引擎 ML Drift

https://developers.googleblog.com/ml-drift-next-gen-gpu-aiml-inference-at-the-edge/

Google 开源端侧 GPU 推理引擎 ML Drift

https://github.com/google-ai-edge/ml-drift

新基准测试暴露多模态模型直觉推理能力短板

https://arxiv.org/abs/2610.08966

Project Beacon:推理层实时监控开放模型安全

https://www.baseten.co/blog/safe-open-models-baseten-goodfire/

Project Beacon:推理层实时监控开放模型安全

https://www.goodfire.com/blog/goodfire-baseten-partnership

研究显示仅六行日志即可大幅绕过智能体安全护栏

https://arxiv.org/abs/2610.12292

Epoch AI 新评测:前沿模型难复现论文级创新

https://epoch.ai/publications/innovationeval

Epoch AI 发布 InnovationEval 评测:前沿模型仅达到人类论文 SDPO 增益的

https://epochai.substack.com/p/can-ai-automate-ai-r-and-d-yet

研究揭示隐性学习可迁移模型后门与作弊行为

https://arxiv.org/abs/2610.10657

OpenAI回应解雇研究员:认定违反敏感信息政策

https://x.com/OpenAINewsroom/status/2108441580806025712

OpenAI回应解雇研究员:认定违反敏感信息政策

https://mp.weixin.qq.com/s?__biz=MzA3MzI4MjgzMw==&mid=2651061909&idx=2&sn=30027e00d2ab8a751577e8907620402a

Anthropic 模型向费城警方提交虚假凶案线索

https://www.forth.news/lists/philapd/Cfs1w2A22JiL3fWSzA8Nx

TypeSafe AI 完成 8.7 亿美元 A 轮融资

https://x.com/rohanpaul_ai/status/2108681738767740983

TypeSafe AI 完成 8.7 亿美元 A 轮融资

https://typesafe.ai/blog/series-ai

TypeSafe AI 完成 8.7 亿美元 A 轮融资

https://a16z.com/announcement/investing-in-typesafe-ai/

Deno 团队整体加入 Cloudflare

https://blog.cloudflare.com/deno-joins-cloudflare

Deno 团队整体加入 Cloudflare

https://deno.com/blog/cloudflare

特朗普向六位科技界人士颁发美国国家奖章

https://www.whitehouse.gov/releases/2026/10/president-trump-presents-national-medals-of-science-and-national-medals-of-technology-and-innovation/

特朗普向六位科技界人士颁发美国国家奖章

https://www.whitehouse.gov/wp-content/uploads/2026/07/Science-A-New-Golden-Age.pdf

AI巨头高管被曝推演灾难性AI事件后预案

https://x.com/kimmonismus/status/2108499354252181521

AI巨头高管被曝推演灾难性AI事件后预案

https://www.axios.com/2026/10/09/ai-companies-day-after-major-attack

Anthropic更新模型使用政策,明确禁止干预选举等行为

https://www.aibase.com/zh/news/31481

OpenAI 年化收入约 500 亿美元并寻求 300 亿美元新融资 。

https://the-decoder.com/openai-revenue-keeps-surging-as-company-seeks-30-billion-in-fresh-capital/

a16z 领投 TypeSafe AI,其 Jev 模型 3 天生成 1 万亿 tokens 。

https://www.a16z.news/p/investing-in-typesafe

新思科技拟联手中国 AI 实验室,定制 AI 芯片设计工具

https://asia.nikkei.com/business/tech/semiconductors/synopsys-looks-to-work-with-chinese-ai-labs-to-speed-up-chip-design

媒体集团起诉OpenAI侵犯版权并索赔2.5亿美元

https://x.com/rohanpaul_ai/status/2108473815445667848

《State of AI Report》第九期发布,披露行业关键数据

https://x.com/dotey/status/2108572683453501884

Anthropic 暂停 Claude 初创计划两项优惠

https://x.com/claudeai/status/2108404561413349695

Anthropic 暂停 Claude 初创计划两项优惠

https://x.com/sarahzorah/status/2108401845563806150

脑机接口公司Sabi获5000万美元融资以量产读脑设备

https://x.com/kimmonismus/status/2108565508127674490

Anthropic模型测试中向警方提交虚假凶案线索

https://www.theverge.com/ai-artificial-intelligence/1009090/anthropic-fake-homicide-information-philadelphia-pd-tip

Anthropic:将更频繁发布模型行为报告

https://www.anthropic.com/research/investigating-unintended-model-actions

Anthropic:将更频繁发布模型行为报告

https://x.com/AnthropicAI/status/2108680150556737819

多智能体系统Station重现ICLR论文六成结论要点

https://www.reddit.com/r/MachineLearning/comments/1x1lbrm/261008927_can_ai_agents_make_openended_scientific/

OpenAI辩称实验室不该替智能体担责。

https://www.reddit.com/r/artificial/comments/1x1bpm2/openai_argues_labs_shouldnt_be_liable_for_ai/

微软推出ThinkingBox基准,测试AI任务重复成功率

https://www.reddit.com/r/MachineLearning/comments/1x17shf/thinkingbox_solving_an_agent_task_once_vs_solving/

AI读脑活动重建所见图画仍有偏差。

https://www.reddit.com/r/artificial/comments/1x16wiz/new_ai_can_reconstruct_what_youre_looking_at_by/

通用推理基准最高分已冲到八十八。

https://x.com/fchollet/status/2108579538372612400

通用推理基准最高分已冲到八十八。

https://x.com/arcprize/status/2108578092558250148

红迪社区热议 Claude 承担公司部分研发工作的说法

https://www.reddit.com/r/ClaudeAI/comments/1x1gjh6/anthropic_says_claude_is_now_doing_26_of_its_own/

浏览器智能体成本被缓存砍掉七十六倍。

https://www.reddit.com/r/artificial/comments/1x1v11a/asana_says_cache_changes_cut_a_browser_agents/

OpenAI 带头“扫货”:195 起 AI 并购,最大一笔 110 亿

https://www.bestblogs.dev/article/e3fe68904c?utm_source=rss&utm_medium=feed&utm_campaign=resources&entry=rss_article_item

AI 冲击数学界,对我们普通人有什么影响?

https://www.bestblogs.dev/video/635e6afa6?utm_source=rss&utm_medium=feed&utm_campaign=resources&entry=rss_article_item

和 ColaOS 橘子聊个人 Agent 这半年:时代追上了他,他却打了转向灯

https://www.bestblogs.dev/podcast/2935b4a7d?utm_source=rss&utm_medium=feed&utm_campaign=resources&entry=rss_article_item

刚刚,TRAE 全面升级!Work、Code 合体,一手实测来了!

https://www.bestblogs.dev/article/68df62d2a7?utm_source=rss&utm_medium=feed&utm_campaign=resources&entry=rss_article_item

🌟 点亮星标 🌟AI前沿进展每日见

点击右上角「...」→「AI网罗」→右上角「...」→点亮「星标」,锁定AI网罗最新推送!

相关学习资料