乐于分享
好东西不私藏

从OpenClaw换Hermes,一个好Agent到底长什么样?

从OpenClaw换Hermes,一个好Agent到底长什么样?

     大约上月中旬,我从OpenClaw切到了Hermes。原因很简单——OpenClaw 7.1版本与llama.cpp存在兼容问题,具体表现为GBNF语法解析报错,导致工具调用直接瘫痪。而Agent的核心优势本就是调用工具,这一问题使得系统几乎无法使用。社区其实早已察觉到这个bug,但后续的beta2、beta5版本均未解决。这让我产生了一个微妙的疑问:既然大模型能力如此之强,为何不直接用大模型修复这些Bug?甚至在问题分析已相当明确的情况下,它依然存在了这么久。这是否说明,所谓的大模型、Agent,并没有宣传中那般神奇?毕竟,编程可是当前大模型最擅长的领域之一。

     这让我联想到航天技术的进步。从媒体宣传,乃至OpenAI或Anthropic偶尔“有意无意”的发言来看,AI似乎已非常接近AGI境界,仿佛指日可待。但实际情况就像航天技术——许多年前人类就已飞入太空,这在更早的人们眼中堪称神话般的进步,但时至今日,星际航行对我们而言仍遥不可及。当然,就像航天技术一样,我们虽无法进行星际航行,但生活已因此改善良多。AI亦是如此,即便AGI尚未到来,现有的AI能力已在编程辅助、内容生成、数据分析等领域带来了效率的显著提升。

      说到这,我又想起十年前低代码和云ERP的浪潮。当时宣传轰轰烈烈,一个号称要“让人人掌握开发”,一个要消灭传统ERP。结果十年过去,传统ERP不仅没死,变化都不大。低代码平台宣称“降低开发门槛”,但换个公司就得重新搭一套,通用性差得离谱,业务部门依然需要把模糊需求精确翻译成机器语言,那个脑力成本一分没少,这导致业务部门仍然很难独自深入使用,可以说低代码本质上牺牲了灵活性,却并没有换来真正的性能或功能增强。而云ERP取代的是本来就不算问题瓶颈的运维工作,且取代的还不彻底,仍然需要安置人员处理网络、设备和其它一些系统。

相比低代码,Agent确实带来了实质性的进步——不完全依靠人来思考,而是能自己理解、自己拆解(至少是一种形式上的思考)。现在市面上的Agent产品非常之多,少说也有几十,大多同质性严重,很多我也没有接触过,现在用的比较多的是飞书的aily(公司有购买)、以及两大开源明星产品——openclaw和hermes。aily在飞书生态里非常好用,这是一种比较克制的路线,只整理飞书里的消息、文档,显然没有格式、功能上的不确定性,这天然就是干净的上下文管理。另外两者定位的场景会更全面,未来最理想的状态就是全天候都接入它们。

      后两者比较,切换到Hermes后,体验确实好了不少。自动总结技能、允许中间打断插入、清晰的运行过程和自发打断死循环,这些在6月的OpenClaw版本里我完全没体会到。功能列表上的“有”和实际体验上的“好用”,是两码事。OpenClaw的最新版本其实也已经有了技能自我生成和主动记忆插件,但这些更像是后期整合的插件,需要用户自己去开启和管理。而Hermes把这些能力深度嵌入了核心运作机制,用起来就是更顺手。

      不过,Hermes也有自己的问题,我怀疑是记忆控制机制加载的内容太多,相似的东西经常搞混。比如SSH密钥对应的主机,明明已经强调过哪个密钥对应哪个主机,竟然还会反复出错,感觉笔记没少记,却并没变聪明,不知道是不是搜索记忆还是哪方面有点问题。而OpenClaw以前用同一个模型时,似乎不太会这样混淆。

      但是回到开始,即便Agent比低代码强得多,大多数人对于大模型的关注方向依然需要调整。此前,不少人因相信模型进步将取代一切,而对所谓的“AI脚手架”颇为不屑。大家曾天真地以为,只要模型足够强大,这些“拐杖”终将被淘汰。现实却给出了不同的答案。即便大模型能力日新月异,但当涉及到具体落地、与各种环境集成、处理长尾异常时,我们依然需要这些“脚手架”。现在的Agent在实现更长期的目标时还非常吃力,或者说Agent本身就缺乏这个认识,这是它和人的很大区别。这段时间以来,飞书Aily每天都会自动总结工作进度、问题分析给我,但对于我的工作有帮助吗?说实在,还是相当有限,我曾看过飞书的AI课程,里面也提及了一种非常理想的状态——开会的过程中AI就把问题解决了。最大的分歧还是在于工作的内容到底是由什么组成,如果本身就是整理文字、分析数据,那确实AI已经是合格的员工,但是实际工作中面临的难题往往是问题几乎都分析清楚了, 还是受限于成本、人力、时间、设备、制度甚至天气等难以解决,一个问题解决到90%就和没解决差不多。换言之,对于已经明确的问题,分析本身已经没有那么重要了,在过去没有AI时,这部分工作就已经不是大多数公司的瓶颈了。

     为避免重蹈覆辙,反向思考,什么样的Agent才是真正的革命性产品呢?目前看来最紧要的一点是:上下文管理或者说是记忆系统,个人认为最好不要追求所谓的全能,应该要形成一种友好的配置方式,方便注入通识知识和专业知识,并且这个Agent能形成一种循环来自发调整,比如围绕中长期的目标。这样才能让AI像人一样从更加实际的角度思考问题并且深入解析问题。而不只是被动的接受使用者的信息提供,对于问题的处理能主动反思、主动寻求专业可靠的依据、主动提出疑虑,打破分析怪象——分析的问题其实早已一清二楚,真正的问题视而不见。