乐于分享
好东西不私藏

90% 的人用 AI Agent 都坚持不下去,它找到了真正的原因

90% 的人用 AI Agent 都坚持不下去,它找到了真正的原因

昨天在 ProductHunt 上看到一款产品,叫 OpenHuman,已蹿到 GitHub 热门排行榜第一了。

又是一款全新的 AI Agent。初看跟我们熟悉的 OpenClaw 和 Hermes 很像。

但在 PH 的介绍页里有这么一句话:90% 的人尝试 AI Agent 之后都放弃了。

其实这句话是说到了目前很多普通人玩流行 AI Agent 的痛点。

在之前,我的交流群里就有很多人说:"OpenClaw 还没搞明白呢,又出了个 Hermes Agent。";"龙虾我都快放弃了!"

过去一年,有多少人在网上看完教程,兴冲冲地搭好了自己的 AI 助手,然后用了两个星期之后,新鲜劲儿一过就再也没打开过了。

不是因为这些 AI Agent 不好用,而是因为:

、还是有门槛儿的,有些人用着用着就放弃了,不想再折腾了。特别是像 OpenClaw 这种,动不动每次升级后就带来一堆问题,让人崩溃。

、能坚持下来的少数人,会发现自己每次打开还都要重新解释一遍自己是谁,重新交代一遍背景上下文,就像跟一个永远失忆的"人"再交流,心累。

OpenHuman 告诉你的是,他们找到了这件事儿的真正原因。不是 AI 不够聪明,而是因为有"三堵墙"摆在那里。

第一堵墙是记忆

现有的 AI Agent,不管看起来有多强大,本质上都是无状态的。你跟它说的话,对话一结束就蒸发了,下次见面它又是一张白纸。

就算是那些号称有「记忆」功能的产品,存的也不过是几条关键词,远称不上真正的了解。

第二堵墙是数据主权

你用来让 AI 了解你的那些信息,比如文章、邮件、日历、聊天记录等各种资料吧,全部存在别人的服务器上,你看不见,改不了,哪天服务一停,什么都没了。

特别是针对那些用云端龙虾的朋友们。

第三堵墙是上手门槛

我认为这个才是最重要的痛点。人都是懒的,喜欢简单的,能开箱即用的。

现在很多 AI Agent 工具的第一步都是打开终端、输个命令、填个 API key、编辑个配置文件。

这明摆着都是门槛儿。

对普通用户来来讲,说它是一道真实的筛选墙,一点儿都没错,只要进不去就会放弃了。

而 OpenHuman 的切入点,就是把这三个问题都当成首要问题来解。

先说记忆这块儿

有个背景故事先提一下。AI 领域的大牛 Andrej Karpathy,相信很多人都有所了解。

他是前特斯拉 AI 总监、OpenAI 的早期创始成员之一。一直在用一套自己搭建的个人工作流来解决这个问题。

他的做法是把文章、论文、代码、图片这些原始资料收进一个 raw 文件夹,然后用 LLM 自动把它们编译成一个不断生长的 Markdown 格式个人 Wiki,Wiki 里有双向链接、有摘要、有分类、有索引。

等这个 Wiki 积累到一定体量之后,他就可以对着整个知识库问任何复杂的问题,AI 会先去 Wiki 里检索、推理、输出答案,甚至把新的探索结果再反哺回 Wiki 中,让你个人的整个知识库越来越完整。

他形容这套东西的核心逻辑是:原始数据进来,LLM 把它编译成 Wiki,然后通过各种工具在 Wiki 上持续做问答和增强。

这套 SOP 的终点,他认为是把模型本身微调成「真正知道并掌握了这些知识」,而不只是在上下文里提供检索功能。

想法很好、也很专业,但想搭建 Karpathy 的这么一套工作流是需要一定的技术能力才能搭建起来的。

同时,还需要养成持续积累资料的习惯。并且你还得会用 Obsidian,会偶尔写个脚本,会配合 CLI 工具,会把各个部分串联起来。

OpenHuman 就是按照这个解决问题的思路,把它产品化了。

他把 Karpathy 的工作流封装进了一个可以一键安装的桌面应用,几分钟内就能让 AI 开始真正了解你这个人。

另外,OpenHuman 把它的记忆系统做成了一个叫做「Memory Tree」的东西,也就是记忆树。

所有记忆都存在你的本地电脑上,格式是 SQLite 数据库加一个 Markdown 文件夹。而且这个文件夹里面的文件可以直接用 Obsidian 打开阅读和编辑,结构和 Karpathy 用的那套几乎一模一样。

OpenHuman 说 Memory Tree 可以扩展到十亿级 token 的记忆容量。

你跟它聊过的每件事儿,它从你的邮件和日历里抓取到的每条信息,都会被切分成小块儿,存进这个本地数据库中,打上来源标签,建立双向链接,再被汇总成三种摘要树:

◆ 按时间线整理的全局摘要◆ 按来源平台整理的源摘要◆ 按人物和话题整理的主题摘要

下次比如你问它"上周和张总谈的那件事儿最后有结论了吗?",它会自己先去 Memory Tree 里进行检索,不是凭空捏造。

而为了解决「记忆越多,调用越贵」这个矛盾问题,OpenHuman 还内置了一个叫「TokenJuice」的压缩系统。

它每次把大量信息塞进 AI 上下文之前,会先做语义压缩,保留关键内容,去掉冗余,让 token 消耗保持在可控范围之内。

关于数据安全与隐私方面

OpenHuman 的设计原则是:Memory Tree 的 SQLite 数据库和 Markdown 文件夹 100% 留在本地,OpenHuman 的后端服务器永远接触不到你的原始数据。

走后端的部分只有 LLM 调用、网络搜索代理、第三方服务的 OAuth 授权代理和语音合成流媒体。

明文数据不上云,这一点是架构设计就决定的,不是可以随便更改的策略。

关于上手门槛

OpenHuman 给出的最优答案就是一个 GUI 优先的策略。

但在安装之前,先看一下系统要求。

平台:MacOS、Linux、Windows,跨平台都支持内存:4GB+ 推荐;如果使用本地模型或处理比较大的代码库,建议 16GB+

下载也很方便。无论你是 Mac/Linux 系统的用户,还是 Windows 系统的用户,进入 OpenHuman 的官网,点击页面中的「Download」按钮,它会帮你判断你的操作系统并提供可直接下载的操作。

官网下载地址:https://tinyhumans.ai/openhuman?utm_source=github&utm_medium=readme

或者你也可以直接到项目仓库的 releases 页面中选择自己需要下载的独立安装包。

下载地址:https://github.com/tinyhumansai/openhuman/releases/tag/v0.53.43

截止发稿前,最新版本是 v0.53.43

当然,OpenHuman 也给喜欢在终端里操作的朋友提供了便捷的一键安装指令。

MacOS 或 Linux x64

curl -fsSL https://raw.githubusercontent.com/tinyhumansai/openhuman/main/scripts/install.sh | bash

Windows

irm https://raw.githubusercontent.com/tinyhumansai/openhuman/main/scripts/install.ps1 | iex

安装完成后启动,你看到的第一个图形界面就是下面这个:

说白了是让你登录。然后先让你选择一下核心运行的模式,你是准备本地运行?还是采取基于云端方式的运行?

如果选择云端方式,我看了一下,需要两个输入参数,一个是 Core RPC URL,另一个是 Auth token。因为我也不太理解,我感觉应该是基于服务器端的配置信息。也就是当你把 OpenHuman 安装到了云端服务器上,然后需要填写的信息。

总之,咱们普通用户就选择官方推荐的「Local」本地运行即可。直接点击「Continue」进入下一步。

然后他会要求你登录,支持 Google、GitHub,还有 Twitter 三种方式。不用管那个 Configure RPC URL 选项(这就是刚才上面说的基于云端的方式)。

所以,你能成功登录的前提就是,你的电脑要支持科学上网,否则就不用往下走了!

成功登录之后,会自动来到下面这个页面,点击「Let's Star」直接开始。

会让你先连接 Gmail,如果你不需要,你也可以直接选择「Skip for Now」进行跳过。

设置完这个 Gmail 之后,就正式进入了 Agent 的功能引导页面,我这里就不截图了,一共 10 项,你可以挨个看,或者直接「Skip」跳过。

首次使用,就像上图里我说明的,会给新人一个促销积分,不过有点儿少 $0.94。如果体验下来觉得还不错,支持订阅,订阅给 10 倍积分。 前 1,000 名用户还能享受 6 折优惠,它给了每个人一个优惠码。

OpenHuman 的主要核心功能都集中在底部中央区域,也就是下面这个放大的图。

下面分别简单介绍并展示一下:

Human 人类这也是 OpenHuman 的差异化之一。可以与非常可爱的吉祥物用语音进行实时交流,吉祥物还会根据你们聊天的话题或结果,自带情绪变化。你用语音跟它交流,它也用语音跟你回复,很有意思!

不过你可别把它只当做一个会聊天的电子宠物看。它其实跟下面要说到的 Memory 里的会议智能体有着紧密的联系。它可以真的作为一个有名字、有脸、有摄像头位置的参会者加入到你绑定的 Google Meet 会议中。

它在会议中可以做的事就包括实时转录所有人的发言,把笔记写进 Memory Tree,按人名和话题分类;在有人问它问题的时候直接回答,可以在会议中现查 Memory Tree、历史会议记录、Slack 线程、邮件、GitHub issue;它说话用的是内置的 TTS 合成语音,画面是动画口型同步,不是会议录制机器人那种只能记录的角色,而是真正能在会议里参与讨论、调取资料的智能体。

普通会议记录工具只能告诉你说了什么,而 OpenHuman 的吉祥物是可以在会议进行中就直接回答其他参会者的问题,比如"上个月我们在哪次会议上决定了要将产品上线时间推迟到 Q3的"。

Chat 聊天点 Home 主页上的「Message OpenHuman」可快速发起消息。界面就长下面这样儿,乍一看有点儿像 Telegram 的意思。在 Human 那页的问候消息,这里也能看到。左边是个消息列表,可以快速删除某条聊天会话消息,上面也带分类,点「+」可以新建会话。

Connecting 连接你可以连接各种各样内置的应用。也可以为 Agent 连接第三方消息渠道,就跟你为 OpenClaw 或者 Hermes Agent 连接的方式一样,只不过 OpenHuman 的 GUI 界面,更符合普通人来使用。但现在还不支持飞书及微信。此外,它还能自动识别出你用户目录下所有已安装的 Skills,点击直接查看或者直接卸载,成为了你管理 Skills 的好帮手。就跟你用 CC Switch 管理你用户目录下的全局 Skills 是一样的方便。

Memory 记忆我认为这是 OpenHuman 与 OpenClaw 或 Hermes 之间最大的差异化,也是最有特色的功能。

它分为了记忆、潜意识、通话以及梦境,目前梦境还没有正式推出。当你停止使用应用的时候,它会进入一个叫做「做梦」的状态,把当天积累的碎片信息做离线整合形成索引,蒸馏成长周期记忆,下次你打开它的时候,它已经把白天发生的事情全部消化完了。不过这个功能 OpenClaw 和 Hermes 也都有。

在记忆这个选项卡中,我之前已经连接上了 Gmail,这已经算是它对我的一个记忆源了,随着你使用 OpenHuman 的时间越长,它就会越来越了解你。同时,你还可以直接在 Obsidian 中直接查看并编辑记忆,甚至是构建自己的记忆树。

此外,这个 Subconscious 是潜意识循环,也就是会自我反思。它是一个后台运行的任务系统,每隔五分钟触发一次心跳,在你不跟它说话的时候,它仍然在后台工作。比如检查已连接的服务有没有新信息、审视新进来的记忆更新、执行你预设的定时任务等等。按照官方数据披露的,它的潜意识系统每天触发的记忆回溯超过一万次,而成本才不到一美元。

还有一个是 OpenClaw 或者 Hermes 中没有的功能,OpenHuman 给加入进来了。它是个会议智能体,允许你绑定一个 Google Meet 会议(前面在宠物环节也说到过)。你可以直接输入会议链接让你的宠物加入会议,然后它就可以实时记录你会议中的所有内容,还能在会议过程中直接回复参会人的问题(有 Memory Tree 的加持,可以随意检索)。就算你不能参加也没有关系,它会帮你全程记忆,你回来了也可以让它帮你总结和再次回顾。

其实咱们的飞书会议、腾讯会议里早已含了这个功能,老外还是迟钝一些。

Alerts 警报这个模块其实没什么,主要就是你通过 Chat 模块中的「+」操作,添加并关联的其他账户收到的消息或者通知,或者来自 OpenHuman 本身系统的事件都会放在这个整合功能模块下来进行统一的查看与操作。

Rewards 奖励这个标签页里面的功能主要是跟奖励有关的,比如推荐其他人订阅 OpenHuman 后可以拿到一定的奖励,如果看完我这个介绍并且使用后觉得体验不错,订阅的时候可以使用我的推荐码:4YVUKALK,你和我都会获得奖励。

另外,OpenHuman 看来是与 Discord 做了深度绑定,除了解锁消息通道外,还可以获得支持者徽章并解锁其他相关奖励。如果你玩儿 Discord 的话,不要错过!

还有一个就是兑换页面,这页就没什么可说的了,你有优惠码就来这页操作兑换就行。作为新人加入系统直接派发的 $0.94 信用额度也会在这页看到。

Setting 设置这是最后一个标签功能了。所有 OpenHuman 相关的设置选项都集中在这个页面中,包括什么账户设置、吉祥物设置、AI 提供商、订阅管理、奖励、高级开发模式及退出登录等。

比如我将吉祥物的颜色调整为绿色,回到 Human 页面就能看到我的吉祥物已经变成了墨绿色。

如果你想使用自己已订阅的套餐,就可以在设置页面中,找到「AI & Models」选项,在里面进行设置,就跟你在 CC Swith 中设置的差不多,也是 BaseURL、API Key、几种类型的模型名称。

上面就是关于 OpenHuman 的一切,基本上已经很全了,足够让你有一个初步了解。

那与 OpenClaw、Herms Agent 之间到底有啥明显区别,我们再来简单说说。

龙虾 OpenClaw 我就不用再详细介绍了,只要你经历过龙虾洗礼那波儿风潮,应该对它会有一定认知了。

这个被誉为历史上蹿星最快的开源项目,它的定位是一个「通用 AI Agent」,你把它安装在自己电脑或者服务器上都行,可以把飞书、微信作为消息渠道与之随时通话。它还可以帮你编程、跑脚本、操控浏览器、管理文件等等都可以。强的是它的生态发展速度,技能库里有超过一万三千多个社区开发的技能。但唯独对「记忆」这件事儿没有特别深的设计。你今天让它做的事儿,可能第二天就已经忘光了,更别提还要把之前的几件事儿给联系起来。

而 Hermes Agent 是今年二月份由 Nous Research 实验室推出的另一款开源 AI Agent,上升速度也是贼快,GitHub 星数也来到了 153K,基本上每周发布一个主要版本。

它的特点是「三层记忆系统 + 自我进化技能」。它会从你每次完成的任务里自动提炼出可复用的技能文件,越用越熟、越用越顺,同样的类型任务完成效率会随着使用时间而增长。它也支持飞书和微信,扫码就能连接。但 Hermes 的记忆系统可比 OpenClaw 下的功夫要大,也做的更专更深。但记忆本身仍然算是任务执行的辅助,不是核心产品。此外,Hermes 的记忆内容目前没有办法方便地导出成人类可读的文件,不像 OpenHuman 支持你在 Obsidian 中直接查看并编辑你自己的记忆文件。在 Hermes 中对于想自己掌控数据的用户来说就没戏了。

所以说:

◆ OpenClaw 更像是给 AI 配了一双手,帮你把事情做完;◆ Hermes Agent 是给 AI 做了一套学习机制,越用越顺手;◆ OpenHuman 则是给 AI 一个真正的长期记忆,还能随时编辑,建立关系图谱,让它真的记住了你。

三者不完全是竞争关系,而是在 AI Agent 这个方向上选择了不同的核心问题去解决。

既然连 Karpathy 自己都在手工搭建 LLM Wiki 工作流,这说明需求肯定是存在的,只是没有现成且好用的工具。

而 OpenHuman 会不会成为解决这个问题的最佳工具呢,可能现在说还为时过早。

毕竟它也是个新鲜物种,产品仍处于早期阶段,还需要等待用户与时间的考验。

但把「AI 的长期记忆」当成核心产品来做,是一个不错的方向。

所以,如果你也希望拥有一个能长期记住你,记住你交代的事儿的 AI Agent,不妨试试 OpenHuman。

仓库地址:https://github.com/tinyhumansai/openhuman

官网地址:https://tinyhumans.ai

既然看到这儿了,如果觉得还不错,帮忙随手点个「赞」、「在看」、「转发」三连;如果想第一时间收到推送,也可给我加个星标★,非常感谢!