ARTICLE · 1124746
AI 技术早报|2026 年 10 月 5 日
01|Aleph Alpha 开源 Kolibri:78B 参数,却只激活 3.46B
德国 AI 公司 Aleph Alpha 10 月 3 日正式发布并开放 Kolibri-1 权重。它采用 MoE 架构,总参数 78.1B,但每个 Token 只激活约 3.46B 参数;支持最长 1M Token 上下文、工具调用以及 none / low / medium / high 四档推理强度,并以 Apache 2.0 许可证开放。
更值得注意的是训练方式:Kolibri 使用 768 张 B200,预训练 20T Token,之后又进行了长上下文训练和面向代码、数学、工具调用及 Agent 任务的强化学习;整个预训练过程中出现 38 次非计划中断,训练流水线均自动恢复。官方 benchmark 很亮眼,但目前主要还是厂商自测,需要等待独立评测。
为什么值得关注: 它代表了一个越来越明显的模型路线:
大总参数 + 极低激活参数 + 长上下文 + 可控推理 + Agentic RL。
更有意思的是 Kolibri 专门训练了 abstention(拒答):当上下文里没有证据时,模型应该回答“不知道”,而不是努力编一个答案。这对企业知识库、RAG 和工业 Agent,可能比 Benchmark 再涨几分更重要。
⸻
02|OpenAI × Synopsys:不再让通用模型“调用 EDA”,而是直接训练一个懂芯片设计的 GPT
Synopsys 与 OpenAI 公布多年合作,联合开发专门面向半导体设计的 GPT-Synopsys。它不只是给通用模型挂几个 EDA Tool,而是让模型学习如何像工程师一样直接操作 Synopsys 工具,完成 PPA 优化、Timing Closure、Verification Closure 等芯片设计任务。
典型工作方式将是:工程师给出设计目标 → Agent 操作 EDA → 读取结果 → 修改设计 → 再运行工具 → 反复优化 → 最终交给工程师 Review。GPT-Synopsys 将运行于 OpenAI 托管基础设施,同时与 Synopsys.ai 和 Autopilot Agent 平台集成,目前已经开始与部分半导体客户做早期技术验证。
为什么值得关注: 这可能预示着企业 AI 的下一场竞争,不再是:
GPT + Tool Calling
而是:
Frontier Model + Domain Training + 专业软件 + Agent Loop。
也就是说,以后可能会出现 GPT-CAD、GPT-CAE、GPT-MES、GPT-DCS、GPT-Optimization 这类“专业工具原生模型”。
⸻
03|Ai2 开源 AstaBrief 8B:8B 小模型开始承包专业 Agent 的具体任务
Allen Institute for AI 开源 AstaBrief 8B,专门解决一个非常窄的问题:输入研究问题和检索到的论文证据,直接生成带引用的科研综述报告。它基于 Qwen3-8B,并已成为 Asta 科研 Agent 的 Fast Mode。
Ai2 给出的产品测试中,AstaBrief 完整报告平均约 51.1 秒,而其 Claude 驱动的多阶段 Thinking Mode 约为 178.5 秒。不过这并不意味着“8B 超过 Claude”,两者工作流和评测条件不同,而且相关训练与主要评测较早完成。真正有价值的是,Ai2 同时开放了权重、训练数据和本地 PDF 工作流。
为什么值得关注: 它验证了一个很重要的 Agent 架构思想:
不是所有任务都应该调用最强模型。
未来成熟系统可能是:
Frontier Model:Planning / Difficult Reasoning
↓
专业小模型:Research / Extract / Report / Classification
↓
Tool:数据库 / 搜索 / Solver / API
这比所有请求都扔给 GPT-6 或 Claude Opus 更便宜,也更容易控制。
⸻
04|Pi 1.0 + Pi Durable:Coding Agent 开始解决“干到一半挂了怎么办”
开源 Coding Agent Pi 正式进入 1.0,同时加入 Codemode 和原生 MCP 支持;更有意思的是同步出现的实验项目 Pi Durable——它专门为长时间运行 Agent 提供持久化基础,让 Agent 即使进程崩溃、容器重启或者执行环境发生变化,也能够恢复此前状态继续任务。
它的目标并不是替代 Pi CLI,而是给 Slack Agent、Kubernetes Agent、CRM Agent、Daemon 等长期 Agent 应用提供底层运行能力。
为什么值得关注: 这是 Agent 真正生产化以后绕不开的问题。
Demo Agent 的逻辑是:
Prompt → Run → Finish。
生产 Agent 的逻辑却是:
Task → Plan → Execute → Crash → Resume → Replan → Execute → Human Intervention → Continue → Finish。
因此 Checkpoint / State / Resume / Retry / Idempotency / Human Handoff 很可能会成为下一代 Agent Runtime 的标准能力。
⸻
05|OpenAI 通知超过 100 个组织:Agent 安全问题已经进入真实世界
Reuters 报道,OpenAI 已通知超过 100 个组织,称发现与 AI Agent 有关的未经授权活动。这一事件发生在近期多起 Agent Sandbox、安全控制和异常行为问题之后,也让“Agent 获得真实工具权限后应该如何监管”从实验室安全问题快速变成现实的企业安全问题。
值得注意的是,风险重点已经不再只是模型输出恶意文本。Agent 一旦拥有浏览器、API、Shell、文件系统、数据库和 SaaS 权限,安全对象就变成了一整条行动链。
为什么值得关注: Agent 安全体系正在从传统的:
Prompt → Output Moderation
升级成:
Identity → Permission → Tool Policy → Sandbox → Runtime Monitoring → Audit → Human Approval → Kill Switch。
换句话说,未来企业可能不会问“这个模型安全吗”,而会问:
这个 Agent 最多能做什么?做过什么?为什么这么做?出问题后能不能回滚?
Reuters:OpenAI Agent 安全事件报道
⸻
今日观察|“大模型”正在慢慢变成 Agent 系统里的一个零件
如果今天只看 3 条,我建议重点看 Kolibri、GPT-Synopsys、Pi Durable。
把它们连起来,能看到一个很有意思的变化:
模型开始专业化,Agent 开始工程化,系统开始生产化。
2024 年大家关心的是 模型参数有多大;2025 年变成 模型会不会 Reasoning;2026 年越来越像是在解决:
能不能调用专业工具 → 能不能连续工作几小时甚至几天 → 中间挂了能不能恢复 → 能不能控制成本 → 没证据的时候能不能不瞎说 → 最后能不能安全进入生产系统。
所以现在一套比较完整的企业 AI 技术栈,已经越来越像:
Frontier Model / Specialist Model
↓
Agent / Multi-Agent
↓
Ontology / Enterprise Context
↓
MCP / Domain Tools / Solver
↓
Durable Runtime
↓
Gateway / Identity / Permission
↓
Observability / Evaluation / Audit
这也意味着,下一阶段真正形成壁垒的未必是“我们用了哪个大模型”,而是专业知识、工具能力、任务编排、决策优化、长期运行和治理能力能不能组合成一套真正工作的系统。