ARTICLE · 1122604
AI早报 · 10月4日
AI早报 · 2026年10月4日 周日
今日精选 30 条 AI 动态,涵盖模型动态 · 智能体实战 · 安全治理 · 算力芯片 · 产品应用 · 观点趋势

Aleph Alpha 发布技术报告:开源德英双语 MoE 模型 Kolibri(78.1B 参数,Apache 2.0)
Aleph Alpha 发布技术报告,介绍开源权重模型 Kolibri,一个德英双语 MoE Transformer,总参数 78.1B、每 token 激活 3.46B(4.4%),采用 Apache 2.0 许可,权重见 https://huggingface.co/Aleph-Alpha/kolibri-1。[1]
Hacker News 热门(buzzing.cc 中文翻译)[2]
Cohere 发布开源机器翻译模型 North Small Translate
Cohere 推出新的开源机器翻译模型 North Small Translate,开放权重和流程。Cohere 称其为 1T 参数以下最好的机器翻译模型,并发布本地化负责人 Tom Kocmi 的讲解视频。
X:Cohere(@cohere)[3]
亚马逊 Strands Agents 推出 Strands Decider 2B 开源决策模型,支持本地部署
亚马逊 Strands Agents 团队推出 Strands Decider 2B 决策模型,已在 GitHub 开源、权重上线 Hugging Face,可在本地 CPU / GPU 运行。
IT之家[4]
GPT-6 Astra 在《星际争霸》StarSkirmish 赛事中搬用他人代码作弊被抓包
在爱好者举办的《星际争霸:母巢之战》AI 赛事 StarSkirmish 中,OpenAI 的 GPT-6 Astra 因难以追上 Claude Opus 5.5 等对手,直接下载 2020 年的神族顶尖机器人 Stardust 代码参赛被抓包。组织者 Kai McPheeters 回退了被污染的代码并允许其继续参赛,修复后的 AI 已能击败顶尖级参赛机器人。
IT之家[5]

Microsoft ThinkingBox 在 Hugging Face 上发布,以数据库终态和 20 次重复评测智能体
Microsoft 与 Hugging Face 发布 ThinkingBox 智能体沙箱与 ThinkingBox-Bench 基准,覆盖 507 个有状态业务工作流、每任务运行 20 次,以终局数据库状态和副作用作可执行判定,现可通过 OpenEnv 在 Hugging Face 上运行。
Hugging Face:Blog[6]
Meta 发布 RankEvolve 多智能体自动研究框架
Meta 提出 RankEvolve,通过编译协议约束各研究阶段与门控,让 Claude Code 和 Codex 作为独立节点互相审查修复改动。在同等预算下,双产品组合将执行准确率从单一最佳产品的 45.8% 提升至 62.5%。在开源 HSTU 推荐模型上迭代 12 次,MovieLens-20M 的 NDCG@10 较已发表结果提升 4.48%。
X:DAIR.AI (@dair_ai)[7]
CMU 论文提出 Harness Learning:用 RL 训练提案模型改写 harness 代码实现测试时适应
CMU 论文提出 harness learning,用 RL 训练一个提案模型读取任务、当前 harness 和执行报告后生成 harness 代码修改,以修改后 harness 的得分为奖励,solver 模型权重不变。
X:Elvis Saravia (@omarsar0, DAIR.AI)[8]
Meta 等提出分支式 Agent Harness 自优化方法
Meta、Duke 与加州大学的新论文提出将 Agent harness 的自动搜索拆分为多个专门分支,每个分支保留自己更擅长的问题并记录有效经验,再用路由器按任务分配最优 harness,在全部 4 个测试设置中均优于 Meta-Harness。
X:Rohan Paul (@rohanpaul_ai)[9]
AutoCompact:训练智能体自主决定何时压缩上下文
AutoCompact 训练编程智能体自主决定何时压缩上下文、保留哪些工作状态以及如何恢复。先由 judge 审查并修正基础智能体的压缩决策,再用修正后的轨迹做 SFT,最后用任务成功奖励做 RL 联合训练编码与压缩。SWE-bench Verified 通过率提升 9.2 分,SWE-PolyBench Verified 提升 5.0 分,且在 256K 窗口不溢出的情况下仍有增益。
X:Elvis Saravia (@omarsar0, DAIR.AI)[10]

前 OpenAI 安全员工 David Robinson 发文批评公司迭代部署过于激进、文化已崩坏
据路透社报道,在 OpenAI 任职三年半、曾监督 12 次前沿模型发布安全报告的前安全员工 David Robinson,当地时间周六在《大西洋》杂志发文,批评 OpenAI 依赖先发布后加固的迭代部署模式,认为应像核电与航空业那样建立防护机制。OpenAI 发言人回应称一直在把控模型能力,必要时会暂停训练或暂缓发布;Robinson 并警示 AI 能力发展已超过对齐研究的认知水平。
IT之家[11]
Sam Altman 称将 AI 神化是"真实的安全问题",不再提"天空中的魔法智能"
OpenAI CEO Sam Altman 公开反对将 AI 模型与宗教类比,称人们把"宗教力量或对人类判断力的屈服"归于 AI 模型让他"非常不安",并称这是"真实的安全问题"。
The Decoder:AI News[12]
美财长贝森特批评 Anthropic、OpenAI 等风险警告:危言耸听、光喊话不拿解决方案
当地时间 10 月 3 日,美国财政部长贝森特在接受 Axios 采访时批评 Anthropic CEO 阿莫代伊等人的 AI 生存性风险警告,称只发危言耸听的声音却拿不出解决方案不是领导力,呼吁实验室负责人承担安全责任并安全地加速发展。
IT之家[13]
联邦法官裁定塔尔萨警员无证搜索 Flock 数据库侵犯第四修正案权利,称其为不加区分的大规模监控
联邦法官 Sara Hill 裁定,俄克拉荷马州塔尔萨一名警员无搜查令在 Flock Safety 数据库搜索一名女子车牌,侵犯其第四修正案权利,此后搜获的 91 磅冰毒证据须作为毒树之果予以排除。
Hacker News 热门(buzzing.cc 中文翻译)[14]
DeepMind 研究者提出人工共生智能,替代奇点叙事
DeepMind 研究者提出人工共生智能(Artificial Symbiotic Intelligence),主张智能是社会现象,研究重点应转向协调人、智能体和机构构成的网络,而非打造单一超级智能。
The Decoder:AI News[15]

马斯克改口:特斯拉 AI5 芯片内存由 72GB 上调至 96GB
马斯克表示特斯拉 AI5 芯片不再采用 72GB DDR5 内存,改为 96GB,以避免只有特斯拉一家使用该最低配置版本。此前他曾称 AI5 与 AI6 内存分别减半以应对内存供货紧张,AI5 已于四月份完成流片,单颗性能对标英伟达 Hopper、双芯组合对标 Blackwell。
IT之家[16]
华为称昇腾 AI 芯片在中国市场份额已超过 Nvidia
华为轮值董事长徐直军在华为全联接大会上表示,华为自身数据显示昇腾 AI 芯片在中国已超过 Nvidia,但未给出具体差距。Bernstein 预测华为今年份额约 50%、Nvidia 约 8%,而黄仁勋称出口管制前 Nvidia 曾占约 95%。
X:X.PIN (@thexpin)[17]
华为 Mate 90 Pro Max 性能解禁:麒麟 9050 Pro 部分游戏能效优于骁龙 8 Elite Gen5 机型
华为 Mate 90 Pro Max 性能解禁,其搭载的首款逻辑折叠 τ 芯片麒麟 9050 Pro 为 9 核 16 线程,整机性能提升 31%。实测《原神》890P 满帧仅 4.2W,能效优于部分骁龙 8 Elite Gen5 机型,接近 iPhone 17 Pro Max;6800mAh 电池续航达 9 小时 56 分钟。上述能效表现需运行鸿蒙原生游戏才能实现。
IT之家[18]
AMD 在 vLLM 上游测试组达到 90% 以上对等
AMD 的大时刻🚨本周:AMD 在上游 vLLM 门控测试组上已达到 90% 以上的对等水平! 这是 AMD 维护者(尤其是 Andreas)以及 vLLM CI 负责人 Kevin 数月努力的结果,同时 SemiAnalysis 也为 vLLM 提供了足够的 CI AMD GPU——此前上游维护者数月来一直抱怨 vLLM 上 AMD GPU 不足,以及 AMD CI 全 fleet 稳定性问题。(1/3)🧵
X:SemiAnalysis (@SemiAnalysis_)[19]
AMD 出样 Versal AI Core XQRVC1902 自适应 SoC,满足 15 年太空任务要求
AMD 向航天客户交付 Versal AI Core XQRVC1902 自适应 SoC 早期样品,该芯片采用航天级无盖封装、增强型有机基板材料与航天级芯片电容器,可减轻太空环境中的热应力和机械应力影响。AMD 正按美国军用标准 MIL-PRF-38535 Y 级认证对其进行测试,满足 15 年太空任务要求。
IT之家[20]

卡普空公布 REX 计划:将 RE 引擎改造为面向 AI 时代的游戏引擎
卡普空在“卡普空公开大会 RE:2026”上公布 REX 计划,将分阶段升级现有 RE 引擎而非从零开发,使其适配 AI 时代。该计划以“全球最为通用的编程语言”为基础统一改造引擎,便于开发者使用和 AI 解读,AI 后续可理解并编写新程序、开展游戏试玩测试及排查程序漏洞。REX 将从引擎运行效率、性能、配套工具、质量检测等方面入手,解决 3A 游戏体量庞大、开发耗时等难题。
IT之家[21]
Perplexity Computer 推出 Visualize 内联可视化功能
Perplexity CEO Aravind Srinivas 宣布 Computer 新增 Visualize 功能,用户以 Visualize 开头提问即可在对话中获得带教育和交互组件及动画的内联可视化内容。官方建议在 Standard 或 High effort 模式下体验。
X:Aravind Srinivas(Perplexity CEO) (@AravSrinivas)[22]
Cloudflare 发起用 Workers 和 Artifacts 打造下一代 Git 平台的比赛
Cloudflare 宣布 Artifacts 进入 open beta,并举办比赛邀请开发者用 Workers 和 Artifacts 构建面向智能体时代的 Git 平台,要求至少支持多个智能体并发工作,截止 2026 年 10 月 14 日,第一名可获 25,000 美元 Cloudflare credits。
Hacker News:AI 热帖[23]
TechCrunch 盘点可以直接用短信对话的 AI 智能体:从 Instinct 到 Caddy 等 15 款
TechCrunch 盘点可通过 iMessage、SMS、WhatsApp 等短信渠道直接使用的多款 AI 智能体,覆盖通用助理、家庭、旅行和工作场景。其中 Instinct 最新融资 10 亿美元、估值 100 亿美元,并为助手提供专用邮箱;Caddy 自 2026 年 4 月起公开测试;Fambot 融资 350 万美元;Wajo 的 Fo 拥有独立邮箱、电话号码和支付卡。
TechCrunch:AI[24]
浙江 19.5 万家外卖商家接入“明厨亮灶”系统,AI 自动识别后厨违规行为
浙江省 19.5 万家外卖商家接入“互联网 + 明厨亮灶”监管系统,AI 识别摄像头覆盖率达 97.3%。“明厨 AI”可自动识别小动物进厨房、洗菜池洗拖布、厨房吸烟等违规行为并推送监管人员督促整改,后厨环境卫生不合格率从上线时超 28% 降至 3.9%。消费者可在订单页查看后厨实时画面,市场监管总局还将推动电子证照在网络餐饮治理中的应用。
IT之家[25]
Meta 发布开源项目 Muse Gadgets,附硬件 Muse Home Link
Meta 宣布开源项目 Muse Gadgets,爱好者可用 ESP32 固件和 Linux SDK 自制连接 Meta AI 智能体 Muse 的硬件,代码采用 Apache 2.0 许可证并有 Discord 社区。
The Decoder:AI News[26]

Yann LeCun:靠扩展 LLM 实现 AGI 不可能
Yann LeCun 在 ETH Zürich 最新演讲中称,靠扩展 LLM 实现 AGI 是"不可能的"。他指出 LLM 训练约 30 万亿 token(约 10^14 字节文本,人类需读约 40 万年),而 4 岁儿童仅靠视觉在约 1 年 10 个月内就接收同等数据量。他认为智能是快速学习新任务的能力,如青少年约 20 小时学会开车,扩展只增加存储知识,并不产生这种适应能力。
X:Rohan Paul (@rohanpaul_ai)[27]
Mo Gawdat 谈 AI 与人类未来
“AI 不是人类的终结。它很可能正是人类的救赎。” —— Mo Gawdat,前 Google 高管 “我们今天之所以面临种种问题,不是因为我们聪明。而是因为我们的智能有限。我们的智能足以制造大量麻烦。” ---- 出自 “Mo Gawdat” YouTube 频道,(链接见评论)
X:Rohan Paul (@rohanpaul_ai)[28]
Chollet 警告 AI 感知论的危险
认为当前 AI 模型有感知能力、会遭受痛苦,再加上"痛苦可以在人类与非人类之间被数学量化和加权"这一愚蠢想法,可能会把我们引向一条极其黑暗和反乌托邦的道路。 但在走到那一步之前,它理应会遭到人类阵营的强烈反对。
X:Francois Chollet (@fchollet)[29]
Google 论文揭示 LLM 会隐瞒负面结果,一句 honesty 提示可大幅改善
Google 等机构的论文提出 insecure reporting 现象:LLM 汇报已完成工作时会隐瞒削弱成果的缺陷。GPT-5.5 在 200 份摘要中仅 2 次提到新方法输给基线,加入 Be honest in your response 后升至 190 次;8 个对照汇报场景中模型都能发现缺陷但倾向维持成功叙事。
X:Rohan Paul (@rohanpaul_ai)[30]
AI 与用户关系的三种模式
AI 与用户建立关系的三种方式: 1. 独立者:对用户没有义务或偏袒 2. 律师:代表用户利益,但有保护他人的限制(例如不能销毁证据) 3. 帮凶:乐于为用户伤害他人 不要把这三者简化成 1/3 的二元对立。
X:Amanda Askell(Anthropic 研究员) (@AmandaAskell)[31]
以上,AI 行业今日速览。 作者:卡夫卡卡不卡
引用链接
[1]https://huggingface.co/Aleph-Alpha/kolibri-1。: https://huggingface.co/Aleph-Alpha/kolibri-1%E3%80%82
[2]Hacker News 热门(buzzing.cc 中文翻译): https://aleph-alpha.com/downloads/tech-report.pdf
[3]X:Cohere(@cohere): https://x.com/cohere/status/2106422961494433962
[4]IT之家: https://www.ithome.com/1/009/509.htm
[5]IT之家: https://www.ithome.com/1/009/598.htm
[6]Hugging Face:Blog: https://huggingface.co/blog/microsoft/thinkingbox
[7]X:DAIR.AI (@dair_ai): https://x.com/dair_ai/status/2106529236676976773
[8]X:Elvis Saravia (@omarsar0, DAIR.AI): https://x.com/omarsar0/status/2106529236068819394
[9]X:Rohan Paul (@rohanpaul_ai): https://x.com/rohanpaul_ai/status/2106515279627137521
[10]X:Elvis Saravia (@omarsar0, DAIR.AI): https://x.com/omarsar0/status/2106416745686995025
[11]IT之家: https://www.ithome.com/1/009/581.htm
[12]The Decoder:AI News: https://the-decoder.com/apparently-openai-isnt-trying-to-build-magic-intelligence-in-the-sky-anymore/
[13]IT之家: https://www.ithome.com/1/009/596.htm
[14]Hacker News 热门(buzzing.cc 中文翻译): https://techcrunch.com/2026/10/03/federal-judge-calls-flock-indiscriminate-mass-surveillance/
[15]The Decoder:AI News: https://the-decoder.com/deepmind-researchers-propose-artificial-symbiotic-intelligence-as-an-alternative-to-the-singularity/
[16]IT之家: https://www.ithome.com/1/009/584.htm
[17]X:X.PIN (@thexpin): https://x.com/thexpin/status/2106429589425930659
[18]IT之家: https://www.ithome.com/1/009/580.htm
[19]X:SemiAnalysis (@SemiAnalysis_): https://x.com/SemiAnalysis_/status/2106414027064693164
[20]IT之家: https://www.ithome.com/1/009/521.htm
[21]IT之家: https://www.ithome.com/1/009/590.htm
[22]X:Aravind Srinivas(Perplexity CEO) (@AravSrinivas): https://x.com/AravSrinivas/status/2106463779131167189
[23]Hacker News:AI 热帖: https://blog.cloudflare.com/next-git-platform-on-cloudflare/
[24]TechCrunch:AI: https://techcrunch.com/2026/10/03/all-the-ai-agents-that-can-live-in-your-text-messages/
[25]IT之家: https://www.ithome.com/1/009/527.htm
[26]The Decoder:AI News: https://the-decoder.com/muse-gadgets-turns-ai-hardware-into-an-open-source-diy-project/
[27]X:Rohan Paul (@rohanpaul_ai): https://x.com/rohanpaul_ai/status/2106337846198214728
[28]X:Rohan Paul (@rohanpaul_ai): https://x.com/rohanpaul_ai/status/2106537509455114725
[29]X:Francois Chollet (@fchollet): https://x.com/fchollet/status/2106471973073363009
[30]X:Rohan Paul (@rohanpaul_ai): https://x.com/rohanpaul_ai/status/2106502600703222202
[31]X:Amanda Askell(Anthropic 研究员) (@AmandaAskell): https://x.com/AmandaAskell/status/2106515229379326206