浅出
AI是个主动干活的工具吗?把所有触发条件都拔掉试试。论文提出了"自主能动性量表"(AAS),从0到5分七个维度给AI系统打分,分"活跃波段"和"环境波段"两个时段。关键测试叫"空闲间隙测试"是通过把用户的提示、定时任务、环境事件全部拿走,看AI还会不会自己动。 结果很扎心,Claude Code在任务中表现强劲(活跃分2.29),但一旦任务结束就完全沉睡(空闲分0.57)。ChatGPT、Siri也差不多,处于没人喊就不动的状态。六个系统里只有Airi这个专为陪伴设计的架构在空闲时还能自主产生行为。▃
深入
核心观点1:考试满分不一定会自己学
人工风味解读:
现有的AI评估框架只盯着认知能力、任务自动化和灾难性风险三件事。但论文指出了一个盲区,这些指标都不测"自主性"。一个系统可以考满分、能替代整个部门、触发了所有安全阈值,但仍然是完全被动的,你不喊它,它就一动不动。论文举了个例子,Claude Code在活跃时段的环境代理性是Level 4(能自主操作文件、执行代码、协调子Agent),但它的空闲时段环境代理性是Level 0,任务一结束,它就彻底从环境中消失了。一个能力很强的系统可能完全没有自我导向的行为,它只是在你给出指令后表现得很厉害。真正的自主性要看系统在你不在的时候做了什么。▃
核心观点2:拔掉所有触发器
人工风味解读:
怎么判断一个AI系统是真的自主还是在按规则行事?论文的方法简单粗暴,就是把所有触发器全拔掉。不提供用户提示、没有定时任务、没有环境事件,然后看系统还动不动,这就是"空闲间隙测试"。论文用这个测试区分了两种看起来相似但本质不同的行为。Hermes Agent有个"日/夜循环"和Curator进程,空闲时确实会整理记忆、回顾经验。但当你分析它的触发机制时发现,这些行为全部是由时钟触发的。每天固定时间跑一遍,跑什么内容也是预设好的。这就是Level 2"条件化"。真正能过空闲间隙测试的,只有Airi这个架构。Airi有个后台思维引擎,虽然也有一个定时心跳,但心跳只是分配计算资源,产出的内容由内部状态决定,无法从触发规则预测。▃
核心观点3:下班即狗带
人工风味解读:
论文评估了六个系统,分为任务Agent(Claude Code、Manus、Hermes)、消费级助手(ChatGPT、Siri)和陪伴架构(Airi)三类。三个任务Agent的活跃综合分几乎一样,但空闲综合分会断崖式下跌。Claude Code任务结束后几乎不存在。Hermes全是时钟驱动的规则行为。ChatGPT和Siri的产品层是反应式的,ChatGPT的空闲功能都是用户配置的固定周期,Siri的空闲行为基本就是设备级后台索引。▃
核心观点4:空置的Level 5
人工风味解读:
论文的0到5量表里,Level 5叫"主权级",标准是系统能自己设定和修改核心目标、修改自己的认知架构、自主管理核心记忆、主动建立新关系、发明新的创作媒介、甚至为了自我决定的目标推翻分配给它的任务。六个系统没一个摸到Level 5的门槛。最高的Airi在七个维度上也只到Level 4,而且很多维度还停留在Level 3。这意味着我们今天讨论的"AI自主性"其实还停留在很初级的阶段。它能根据上下文调整行为风格,但它不会自己发明一种全新的交互方式。▃

本文分析原文引用自
Samuel Presgraves《Samuel Presgraves: A Behavioral Framework for Measuring Self-Directed Behavior in AI Systems》
夜雨聆风