夜雨聆风学习资料网

ARTICLE · 1118383

苹果AI突然提速:全面押注「个人Agent」

苹果AI突然提速:全面押注「个人Agent」

苹果突然加速:从 Siri AI 到 SCLATE,Apple 正在为「个人 Agent」铺路

过去两年,围绕 Apple AI 的讨论几乎被同一个问题所垄断:Siri 到底什么时候才能追上 ChatGPT?

但站在 2026 年秋天回看,这个问题的问法或许从一开始就偏了。

今年以来,Apple 在 AI 领域的动作密集得非同寻常:1 月敲定与 Google 的多年深度合作;6 月推出第三代 Apple Foundation Models 及配套开发者框架;9 月,全新 Siri AI 正式进入 Beta 测试。与产品端并行的,是其研发团队在长期记忆(Long-term Memory)、Computer Use、工具调用与持续学习领域的高频产出。

9 月底,Apple 又低调公开了一篇工程纵深极强的核心论文——《SCLATE:用于持续学习 Agent 训练与评估的基础设施》(A Substrate for Continual-Learning Agent Training and Evaluation)。

孤立地看,SCLATE 只是在解决 Agent 的长周期测试与训练问题。但如果把今年所有的技术拼图放在一起,一条清晰的战略主线便浮出水面:

Apple 志不在做一个更健谈的对话机器人,而是在为能够长期驻留、理解个人上下文、穿透应用边界,并最终替用户完成执行闭环的「Personal Agent」,暗中补齐全套基础设施。


一、接受现实:基础大模型不一定非要自己造

今年 Apple AI 战略最大的转折点,始于年初与 Google 达成的合作——下一代 Apple Foundation Models 将直接构建在 Google Gemini 模型与云基础设施之上。

对于一贯坚持全栈封闭控制、软硬芯一体的 Apple 而言,这在两年前难以想象。但进入超大参数模型时代后,Apple 迅速厘清了现实:底层通用模型,可以分工与合作。

6 月亮相的第三代 Apple Foundation Models,已经确立了清晰的端云分工结构:高频、轻量、敏感的任务优先在端侧完成;复杂的长链推理与重度 Tool Use 则进入云端模型。与此同时,Private Cloud Compute(私有云计算)也将算力集群延伸至 Google Cloud 与 NVIDIA GPU。

表面上看,Apple 似乎在向外部大模型巨头让渡核心技术话语权,但它从未把整个产品的控制权拱手让人。

真正被 Apple 牢牢抓在手里的,依然是科技行业壁垒最高的护城河:物理设备、操作系统底层、系统级 API、权限控制、个人上下文(Personal Context),以及最终的执行链条。

这是理解 Apple AI 路线的核心锚点:它无需在基准榜单上争夺第一。只要未来用户发出一句自然语言指令,决定唤醒哪个 App、调取哪份本地数据、如何安全编排工具,并在底层沙盒里完成点击与提交的,永远是操作系统本身。

掌握了系统,就依然掌握着终极入口。


二、新 Siri 的质变:从「语音查表」到「Agent 运行时」

9 月进入 Beta 的 Siri AI,正是这一思路落地的先锋。它的升级重心不再是陪聊,而是对屏幕内容、跨应用私有上下文的理解与行动力。

过去 Siri 的交互逻辑是单向、断裂的:

一句命令 $\rightarrow$ 触发预设的特定功能。

而新版 Siri 试图构建的是一个闭环的 Agent 执行链:

模糊的自然语言 $\rightarrow$ 跨 App 检索上下文 $\rightarrow$ 意图消歧 $\rightarrow$ 编排应用意图 $\rightarrow$ 执行系统动作。

比如,用户不再需要准确记住某条信息存在哪里,只要说一句“导航去我妈前几天发给我的那个餐厅”,系统便会自行检索对话记录、核对时间、提取地址并在地图中发起导航。

在这个过程中,一个真正的Agent Runtime正在操作系统内部成型。

这也让 Apple 过去几年持续推进的App Intents框架迎来了质变时刻。开发者只需使用系统规范对 App 内的核心数据实体与动作进行语义化标注,Agent 就能直接理解并调用底层动作:创建日程、提取凭证、发送转账、批量修改,而不需要像脆弱的早期视觉模型那样在屏幕上模拟鼠标点击。

这也是 Apple 与纯 AI 公司的代际差异:当 OpenAI、Anthropic 还在努力为 Agent 寻找桌面沙盒、浏览器插件和操作权限时,Apple 从第一天起就原生坐在操作系统的核心特权层里。


三、SCLATE 的深意:真正的个人助手,不能每次会话都「失忆」

这就引出了 Apple 9 月底发布的论文SCLATE。这篇论文最大的价值,不是又刷了一个排行榜,而是 Apple 开始严肃攻坚行业内长期回避的问题:

如果一个 Agent 需要持续陪伴、跨 Session 工作一个月,系统该如何运转?

当前主流的 Agent Benchmark 几乎都是“单回合考试”逻辑:给出一个任务,Agent 跑一段推理链路,得出结果,评测打分,会话清空。

但真实的个人助理完全是另一回事:

  • 今天用户提了一个偏好要求;
  • 明天需要基于该要求跟进进度;
  • 三天后外部环境变化需要异步响应;
  • 一周后还有定时触发的后台任务;
  • 期间伴随着设备休眠、多端切换、上下文淘汰与记忆整合。

SCLATE 正是为此构建的底层运行环境。它将用户输入、外部环境突发事件、后台定时任务(Cron)、记忆整理、状态休眠与恢复,统一编排在一条共享的时钟时间线上。

为了避免评测一个 40 天的任务真要耗时 40 天,SCLATE 引入了“混合模拟时钟”:当 Agent 正在工作或后台有任务执行时,时间按真实物理时钟推进;一旦进入空闲等待,系统便瞬间跳跃到下一个事件触发点。在 MetaClaw 实验中,一段跨越40 个日历日、30 个工作日的长程任务场景,被压缩至5.9 小时(中位数)即可评估完成。

换句话说,Apple 已经在搭建工业级基础设施,专门用来度量和打磨一个能够「长期活着」的系统级 Agent。


四、关键突破:教会模型「使用系统」,比盲目做大参数更有效

除了长程评估,SCLATE 展现出的另一个实验结论更具启发性。

研究团队使用一个 40 亿参数的轻量模型(Qwen3.5-4B),将其直接置于未作修改的真实 Agent Harness(如 Claude Code、Codex 等)中进行持续后训练(Post-training)。训练的目标并非灌输更多知识,而是专门规范它的系统交互行为:

  • 何时该调起搜索;
  • 何时读取文件;
  • 何时精简 Context 避免超限;
  • 哪些信息必须固化为长期 Memory,哪些可以直接遗忘。

实验结果非常明显:在 Claude Code 环境下,该模型的 SWE-bench Verified 解决率从9.8% 跃升至 26.5%,执行任务时读取的代码行数下降了6.8 倍,上下文超限率从 97.6% 暴跌至 31.0%。

这验证了一条至关重要的工程路线:Agent 的能力进化,不一定要盲目堆叠参数,通过专项训练让模型学会熟练调度工具与记忆系统,同样能带来质的飞跃。

这对 Apple 而言是天然的战略利好:它不需要在 iPhone 里硬塞几百亿参数的模型。通过“轻量端侧模型 + 垂直云端模型 + 严密的系统 Harness + 精准记忆系统”的组合,足以在极低的算力开销下,实现媲美顶尖大模型的任务执行力。

裸模型评测或许拿不到榜首,但在解决端侧真实问题时,它的效能可能远超预期。


五、拼图完整:Apple 正在补齐的 Agent 工业化链条

如果把 Apple 近期分散发表的学术论文横向对比,会发现它们正高度收敛于同一个技术栈:

  • 选择性长期记忆(Selective Memory): 探讨如何避免垃圾上下文淹没窗口,仅选择性沉淀具备长期复用价值的偏好、流程规范与环境状态;
  • 人机接管与安全性(Human-in-the-Loop): 研究 Computer Use 面对高危动作时的拦截策略、用户意图确权与平滑接管机制;
  • 执行前校验(Pre-execution Reviewer): 在 Tool Calling 产生不可逆副作用(如付款、发送、删除)前引入验证层,前置拦截幻觉错误;
  • 测试与合成(MCP-based Scenarios): 基于标准工具协议自动生成海量 Agent 评测与微调样本;
  • 长程持续底座(SCLATE): 承载跨 Session 运行、模拟时间推进与闭环后训练。

把这些节点串联起来:场景合成 → 环境感知与工具调用 → 执行前校验 → 权限确权 → 记忆提炼 → 跨 Session 演进 → 针对性训练

这已经不是零敲碎打的功能修补,而是一套完整的Agent 工业化链条。论文不等于明天的产品功能,但这种密集的底层投入,准确标定了 Apple 的研发重心所在。


六、范式转移:从比拼智商,到比拼谁拥有「操作系统」

过去两年业界普遍认为 Apple 在 AI 赛道大幅掉队,逻辑很直观:Siri 的理解能力与 GPT、Claude、Gemini 存在代差。

这一判断客观存在。基础智能若达不到及格线,再精妙的工程封装也是空中楼阁。然而,当 AI 的演进焦点从单纯的「对话生成」转向「自主 Agent」时,赛场的度量标准彻底变了。

一个具备实用价值的 Personal Agent,本质是由多维要素构成的系统工程:

Personal Agent = Model + Memory + Context + Tools + Permission + Operating System

除了基础模型本身,剩下的每一个变量,几乎全都是 Apple 的绝对舒适区:从 iPhone、Mac、Watch 到 AirPods 的全天候设备网络;从相册、邮件、日历、备忘录到通讯录沉淀的私密数字资产;以及深嵌在系统底层之上的权限管理机制与系统级 API。

当下,OpenAI 试图通过云端虚拟环境为 Agent 寻找支点,Anthropic 押注像素级的屏幕识别,Google 加速将 Gemini 嵌入 Android 与 Workspace。所有人都在角逐同一个终局:让 AI 从「告诉你怎么做」,走向「直接替你做」。

在这场角逐中,作为硬件与操作系统所有者的 Apple,其天然的生态位优势正在显现。


七、现实挑战:通往终局的四重硬核阻碍

这绝不意味着 Apple 已经胜券在握。相反,系统级 Agent 带来的技术挑战远比聊天机器人苛刻:

  1. 基础智能的不可替代性: 优秀的 Harness、记忆设计与系统集成能够放大模型效能,但无法凭空抹平底层推理能力的差距。Apple 自身的研究同样表明,对于高难度工程任务,过度复杂的调度框架并不一定能战胜纯粹的强模型加基础工具。系统不是万能药,底层智商依然是硬门槛。
  2. 执行动作的「零容错」压力: 聊天机器人给出幻觉回答,用户的代价只是重问一次;但 Agent 若误删工作文件、发错保密邮件或篡改关键日程,后果将是灾难性的。从“输出文本”跨越到“产生系统级副作用”,系统的容错空间被压缩到了极致。
  3. 长期记忆的衰减与污染: 伴随用户数月的 Agent,最大的难点往往不是记不住,而是“忘不掉”。过期的时效信息、临时的口头约定、相互矛盾的历史偏好……如果缺乏极其精密的状态淘汰与去冲突算法,长期记忆很快就会演变成灾难性的上下文污染。
  4. 长链条推理的物理成本: 一次端到端的自主任务,背后可能包含数十次意图对齐、工具检索、步进反思与状态沉淀。如果每一次循环都唤醒顶尖云端大模型,无论对于算力账单还是设备能耗,都是不可承受之重。Apple 推行端云分级架构,很大程度上就是在算清这张长期成本账本。

八、评价指标转移:不要再盯 Siri「会不会聊天」

接下来评判 Apple AI 成败的维度,已经不再是常规的对话流畅度或应试分数,而是更加切实的工程落地指标:

  • 长链穿透力: 一个涉及三四个 App 的复合指令,它能否在无人工干预下从头跑通到尾?
  • 故障恢复力: 在某一步 API 调用超时或参数报错时,系统能否自我修复、退回前置安全状态,而不是直接崩溃?
  • 记忆纯净度: 连续使用三个月后,它是变得越来越默契,还是因历史记忆杂乱而频繁出现意图偏差?
  • 权限确定性: 当用户在隐私设置中切断某项授权时,Agent 是否能在所有子流程中严谨恪守安全红线?
  • 能效经济学: 本地端侧 NPU 能消化多大比例的高频任务?云端路由能否在毫秒级延迟与算力开销之间维持平衡?

这些指标远比发布会 Keynote 上演示一次漂亮的问答沉重得多,也决定性得多。


结语:争夺「用户的下一步」

回头再看 SCLATE 及其背后的密集动作,这并不是一次寻常的学术成果展示,而是 Apple 对 AI 战略重心的明确转向。

未来的个人助手注定不会永远蜷缩在对话框里。它需要感知屏幕前的当下操作,铭记数字生活里的历史脉络,调用系统底层的万千接口,并在极其严苛的隐私边界内替用户完成接下来的每一步。

OpenAI 和 Anthropic 正在不遗余力地教 AI 如何操作一台电脑,而 Apple 手中握着的恰恰是数以亿计用户的电脑与手机。

这场终局竞争最终衡量的,或许不是谁的模型在答辩中更惊艳,而是谁能以最低的延迟、最可靠的安全边界,真正接管用户说出指令之后的那「下一步」。

相关学习资料