夜雨聆风学习资料网

ARTICLE · 1116679

a16z 深度对谈:测试了122款 AI 助理后,发现大众根本不在乎「效率提升 」

a16z 深度对谈:测试了122款 AI 助理后,发现大众根本不在乎「效率提升 」
(左:a16z合伙人阿尼什·阿查里亚;右:Assistant Benchmark创始人戴维·鲍兰)

编者按

过去一个月,个人 AI 助理已经从极客的玩具,变成了发展和普及最快的消费级 AI 赛道。Instinct、Muse、Grokbot 接连把整个科技圈点燃,不太知名的 AI 助理更是一下子冒出来几十款。

热闹归热闹,但这些 AI 助理到底能替人们做什么?普通用户会为它付钱吗?它会活在 iMessage 里、活在一个独立的 App 里,还是长在你的胸口上?

本期对谈的两位嘉宾,一位是 a16z 消费科技合伙人阿尼什·阿查里亚,另一位是 Assistant Benchmark 的创办者戴维·鲍兰,戴维亲手测过 26 款个人 AI 助理,并把市面上能找到的 122 款 AI 助理做成了一个公开的横向对比评测网站,上线 16 天,超过 10 万人访问,几乎每一家被收录的创业公司创始人都主动发来了邮件。

两人给出的判断,和当下「AI 会让每个人都效率翻倍」的乐观叙事几乎相反:大众根本不在乎效率提升 10%;你雇一个助理,肯定希望它是隐形的,因为最好的员工是那个自己把事情做完、然后跑来告诉你「我做了这些」的人——你不会因为喜欢管人而雇人。

他们还谈了很多产品人会关心的东西:为什么旅行是传播榜第一名、真实讨论热度却只排第四;为什么「省钱」会爆发而「赚钱」不会;为什么真正的护城河是「主动性」而不是「人格」;以及当所有智能体都开始互相下单时,电商、订座和广告会变成什么样子。

以下为精选对话实录。

本期精彩观点

  • 「大众根本不在乎自己效率提高 10%。」最好的员工,是自己把事做完、然后跑来告诉你「我做了这些」的人。「你不会因为喜欢管人而去雇人。」

  • 真正的赢家不是「帮你赚钱」的助理,而是「帮你省钱」的助理。翻出过去一整年的收据去补办 HSA 报销、机票跌价后找航司把差价要成旅行积分、有朋友把 Grokbot 接到自家洒水系统和天气系统上、水费直接降了一半。「没人想听省钱,但所有人都想听白捡的钱。」

  • 旅行是传播榜第一,却是真实讨论热度第四。被自动值机、成功订到机票,是传播量第一名的内容;但人们不是天天出门的,所以它更像一个噱头、一个注意力抓手。真正排在前三的用例是:日常行政、智能体编排、开发。

  • 「主动性」才是护城河,「人格」不是。人格太容易配置了,你跟它说一句「我希望你这样回复」,它写进记忆就变了。但「有多主动」很难:那个能在你还没开口之前就替你动手的助理,才是能拉开身位的东西。

  • 主动性有一条不能越的线。帮你草拟一封邮件、帮你拿回一笔旅行积分,不需要你确认就是加分;擅自把你的保险换掉就是越界。「这条线你越过去一次,就立刻失去了用户对你的全部信任。」他们内部开玩笑说,离「助理发现你没那么喜欢她,就替你把分手办了」只剩几天。

  • 硬件之争不是重点。戴维对 Muse charm 的判断是,它不是为了做硬件而做硬件,而是为了在现实世界里采集数据,「它有一枚摄像头和多个麦克风……我并不觉得它会成为大众普及的东西。它会先被科技圈那批人用起来,然后给 Meta 喂进海量数据,去支撑扎克伯格未来那个把真实世界整个测绘出来的元宇宙。」

  • 语音是这一轮第二个「魔法时刻」。ChatGPT Voice 支持接入连接器之后,戴维骑车上班的 30 分钟里把邮件分类打标签、回复邮件、发出日历邀请,到工位时收件箱已经是零。助理在你最忙、腾不出手的时候最有用,而不是在你坐在沙发上、盯着屏幕的时候。

  • 未来不会是「一个助理打天下」,而是一批窄赛道的助理。你可以做一个只服务「三岁以下孩子的单亲妈妈」的助理,它对这个群体日常生活的了解深到「像在读心」。而窄赛道成立的前提是:人们已经愿意为软件每月付 200、250、300 美元。

这个行业已经「看见过三次上帝」

问:我们两三周前刚聊过,这两周又发生了太多事。我想先从一个说法开始——我觉得这个行业已经「看见过三次上帝」了。

阿尼什:第一次是 ChatGPT。对很多人来说,那是 2022 年 11 月到 2023 年上半年的那段时间。你能让它写邮件、写诗,还能一来一回地对话,感觉像在和一个合成出来的人说话。那是大爆炸的起点。

第二次是编码智能体。开发者为之疯狂,Claude Code、Codex 这些东西让「凭空造出一个软件」变得几乎不需要成本。

第三次,就是最近这一波个人智能体。Instinct、Muse、ChatGPT 语音——消费者的热情被彻底点燃了。我们今天就来把「个人助理」这件事聊透。我打算把它做成一系列对话的第一期。

问:戴维,先拉开来看。过去几个月,你在个人助理这条赛道看到的是什么?

戴维:这个赛道的爆发,集中在过去四周。往回倒一倒:我是 Poke 的早期用户。Poke 大概是最早真正打进市场的消费级 AI 助理之一,我记得它是 9 月 8 日上线的,我 9 月 11 日就开始用了——就三天之后。我至今记得那种感觉,因为体验实在难以置信。它当时的噱头是:你可以和助理「谈判」你究竟愿意付多少钱。这完全把我震住了。

然后是 11 月底,OpenClaw 发布,整个真实世界都被卷了进来,大家的感受是「有东西要来了」。中间零星冒出过一些产品,但最近真正炸掉科技圈 Twitter 的是 Instinct——它一路狂奔,彻底疯了。接着就是多米诺骨牌:Grokbot、Muse,还有一批长尾的,比如 Caddy、Ollie、Pally。看着整个科技圈被「这些助理到底能替我们做什么」这个问题点燃,真的非常精彩。

但我觉得现在所有人都在同一条船上:没有人真正知道答案。这就是一片狂野西部,我们都在里面玩。

对AI助理进行测评

问:我们得花点时间聊聊 Assistant Benchmark,这是你做的,最近被讨论得非常多。你先介绍一下它到底是什么。

戴维:Assistant Benchmark 本质上是一个网站,把这些 AI 助理按用例一个一个对比。我们会给所有助理同一个提示词,比如「帮我订一张去芝加哥的机票」「在我当前位置五个街区以内找一家素食餐厅」,然后比较它们一次性完成的结果:它到底做成了没有?它会追问吗?它在 16 个不同维度上表现如何?我们把这些也横向对比出来。

我们用了「benchmark」这个词,但你可以把它理解成一个面向消费者的评测,不是那种技术后台的跑分。核心问题只有一个:如果我想订一张机票,我到底该用哪一个?谁做得最好?谁回得最快?

起因其实是我自己在做市场调研,想知道这些产品彼此之间到底差在哪、缺口在哪,就把一部分结果发了出来。到今天正好 16 天,它彻底爆了:网站有超过 10 万访客,基本上每一家创始人都主动找过来了。我觉得这说明大家都很好奇,大家都在找这个行业要往哪儿走的答案。

问:这确实很让人兴奋。而且挺有意思的是,评测这件事本身已经变成了这场对话的一部分——因为发布太密集了,你根本不可能把每一个都试一遍。

122 款 AI 助理的全景图

问:除了 Instinct 和 Muse,还有谁在做有意思的事?你看到的专业化方向有哪些?

戴维:市面上有一大堆长尾方案,我大致会分成两组。

一组是面向消费者的通用型助理。就是 Instinct、Muse 这一类,长尾里还有 Caddy、Ollie、Season。光「通用」这一档,现在网站上就有 64 款。这一档还能再往下分:有旅行专用的,比如 SOAR、MISO;有邮件专用的。

另一组是偏 B2B 工作流的助理,走行政助理这个方向,比如 Town、Catch、Vellum。它们本质上在做同一件事——你的助理,但更像一个行政助理,不是消费级那一套。

目前我掌握的、跨所有类别的产品,一共 122 款。

问:太夸张了。那竞争最集中的地方在哪?

戴维:现在所有人、基本上都在做通用型、横向的。就一件事:什么都想干。

问:拿旅行举个例子。旅行是一个低频、高价值的行为。你觉得这个类别最后会被组织成一个接进通用助理的连接器,还是它们自己也有资格成为独立的通用助理?

戴维:我觉得最后可能会有某一个赢家跑成独立助理,但总体上,我认为它更可能是一个连接器。

我自己现在有七八个群聊,里面全是痴迷于助理的人在聊,加起来 1200 多人,一直在聊。旅行是第四大被讨论的用例——这很有意思,因为如果看传播量,它往往是第一名:「我的助理帮我自动值机了」「我成功订到机票了」。但就像你说的,人不是天天出门,所以它更像一个噱头,一个注意力抓手。

问:那排在前三的用例是什么?

戴维:第一名是日常行政那一类:清空收件箱、帮你填表,那些真的烦人的事。第二是智能体编排——大家聊得非常多的一个话题:怎么找到最高效的那个智能体,或者怎么让你的智能体彼此对话。第三是开发向的:这些编码能力怎么搬到手机上,比如从短信里调用 Claude Code,甚至再往前一步——如果我是一个设计师,我能不能就靠给我的助理发几条消息,直接对设计文件做小的迭代修改。

当然,这几个群聊都是有偏的,里面都是科技圈 Twitter 的人,不一定代表整个世界的真实情况。

金融是最有趣,也最不实用的一类

戴维:剩下的一个大类就是金融。我个人认为这是最值得看的一类,因为在我看来它也是最不实用的那一类。

这里有太多决策了。如果真能有一个助理替你把十亿美元赚出来,那所有对冲基金早就在干了。它不是一个每个人拿自己的手机就能做成的事。但它同时最有趣——因为你把一个强有力的工具交到一个人手里,他第一个念头就是:「你打算怎么帮我赚到一百万美元?」

问:这里有一个批评很值得注意。本·汤普森前几天说,大多数消费者在生活中并不是在寻找生产力,他们想的是花掉时间,而不是省下时间。我同意这句话。但金融确实是一个行政负担极重的地方。而且如果你去看有多少金融市场、多少利润池,是靠消费者的「漠不关心」和「信息不对称」赚出来的——那里面能还给消费者的钱是极多的。

阿尼什:对。所以我基本同意本的观点——大多数消费者想要的是娱乐、是花掉时间。但美国消费者生活里有几个定义性的部分,是高度行政化的,这些助理可以真的在那里带来突破。

大众根本不在乎「效率提升 10%」

戴维:这也正好是我说的「赢家会坐在哪里」。就本的那个观点,我同意。我认为大众根本不在乎自己效率提高 10%。

你雇一个助理,肯定希望它是隐形的。我见过的最好的员工,是那种自己把事情做完、然后跑来跟你说「我做了这些」的人——你会说「哇,太棒了」。你不会因为喜欢管人而去雇人。

而我看过的最主动、最好用的用例,恰恰都落在金融这一类。我认为会爆发的是一个「省钱」的世界,不是「赚钱」。

我见过一些很酷的用法:有人翻出过去一整年的收据,去补办 HSA 报销。我自己常做的一个是:每次订机票之后,如果票价跌了,我就让助理去找航司,把差价换成旅行积分回来。我还有个朋友——这是我看过最喜欢的用例——他把 Grokbot 接到了自家院子的洒水系统上,又接上了天气系统,现在洒水完全跟着天气走,水费直接降了一半。

所以我说的这一类「隐形助理」,做的是省钱的活,都归在金融这个大筐里,但它真正押注的是「省钱」——它会造出一个对消费者友好得多的世界。

阿尼什:这会很有意思。美国消费者有个特点,没人想听省钱。人们想听的是花钱,和白捡的钱。我其实觉得最能把人拉进来的钩子,就是它会感觉像白捡的钱。翻回去补办 HSA 退款,那感觉就是白捡钱;机票跌价之后航司退你差价,那也是白捡钱。这个钩子的力量非常大。

而且它很特别,因为这是「低频但高价值」的行为。所以我的直觉是:旅行和金融这两件事,很可能是很强大的、十亿美元级的生意,但它们依然是垂直的连接器,而不是横向的通用助理。

你会和 AI 在哪里说话,iMessage、App,还是硬件?

问:那我们就聊到「形态」了。AI 能做什么是一回事,你究竟在哪里和它说话,是另一回事。我们两个都活在 iMessage 里,但你说你太太和她朋友更喜欢独立的 App。你觉得这个市场会怎么走?会同时存在多个赢家,还是最后收敛到一条主线?

阿尼什:好问题。这里会非常取决于消费者的偏好。我听过一种说法:Z 世代更愿意「发短信」,而千禧一代和 X 世代更喜欢 App 界面。所以它可能会按代际分裂,某种程度上也可能按性别分裂,我在做的事和我太太在做的事不太一样。她喜欢做「梦想板」,去追她的一年目标和人生目标,所以她非常需要视觉界面,旅行对她来说也高度视觉化。而对我来说,事情更功能化:我关心的是「我怎么从 X 到 Y,最好飞机上还有星链」。

我觉得 iMessage 这个位置更「珍贵」,它让互动感觉更私人。当然,如果每隔一条对话都是和一个助理,那感觉会变。但至少现在,它活在我手机上很特殊的一个位置里,App 图标格里的那个做不到。你觉得呢?

戴维:我完全同意。iMessage 自带的那层个人化——因为我本来就住在那里——让我觉得它已经和我连在一起了,不像是一个额外多出来的工作流。

不过我目前看到的形态,基本上只有两种:iMessage,或者一个独立 App。我确实看到第三种:一家创业公司 Sky,他们在做一个 iPhone 小组件,把小组件当成第三种界面,挺有意思。

但就在昨天,扎克伯格和 Muse 团队发布了 Muse charm。这完全是另一种「怎么和助理互动」的用例了。

Muse charm,不是为了做硬件而做硬件

问:你怎么看硬件?

阿尼什:我觉得非常有意思。有个聪明人说过一句话,每一个做硬件的人,都认为自己做的那块硬件是终极形态——吊坠是终极形态,表带是终极形态。我觉得这不对。

我认为这依然会是非常个人偏好驱动的东西,就像首饰一样。有人喜欢戴项链,有人喜欢戴耳环。这个形态最终会长成什么样,会非常因人而异。

但「有一样东西一直跟着你、是环境式的、能捕捉一整天的接触、请求、承诺和约定」——这件事本身是有价值的。至于隐私预期和社会接受度,我们得一起摸索出来。你去华盛顿的餐厅,他们会把你的手机收走;也许以后他们要把你的手机和你的吊坠一起收走。

不过我确实觉得硬件这件事里有很多东西值得思考。我很喜欢大家开始在这个方向上变得有野心。过去十年创业公司被劝退了硬件创业,现在又有了一批有意思的新消费硬件尝试。

问:我有一个热辣的观点,Muse charm 这件事,与其说是在赢硬件这场仗,不如说是在现实世界里采集数据,为了 Meta 团队搞清楚真实世界到底是怎么运转的。它有一枚摄像头和多个麦克风……我并不觉得它会真的成为大众普及的东西。我觉得它会先被科技圈 Twitter 那批人用起来,他们会在哪儿都用它,然后它会给 Meta 喂进海量的数据,去支撑扎克伯格未来那个把真实世界整个测绘出来的元宇宙。

问:但你不觉得眼镜已经在给他们这个了吗?

戴维:某种程度上是。但我不确定——如果我错了你纠正我——眼镜会像这个 charm 一样「一直戴着」吗?我不这么觉得。

阿尼什:这个点很好。我认为 charm 更像你说的,是一个 7×24 的环境式伙伴,而眼镜更偏向「行动导向」。

语音是这一轮第二个「魔法时刻」

戴维:我还试了一下那版 VR 发布,挺有意思。但我其实觉得「纯音频的眼镜」可能会是一匹黑马。

这里有些非常有说服力的东西。我是说,《安德的游戏》里 Jane 那个形象,本质就是一个全知的、只有声音的伙伴。我觉得有一类人愿意在脸上戴一个摄像头,但另一些人会意识到那会让别人不舒服,于是他们想要技术上的连接,但不想要摄像头带来的社交尴尬。音频太强了。我对语音和音频是相当看多的。

就在昨天,ChatGPT Voice 开放了连接器接入。你可以接到你的 Gmail 和日历上。我今天早上玩了一下,对我来说,这是我在这整个 AI 助理领域里第二个「魔法时刻」。

我骑车去上班,手是腾不出来的,但我想把事情做掉。我就打开一个会话,开始跟 ChatGPT Voice 说话。骑车的这 30 分钟里,我把邮件分了类、打了标签、回复了几封、发出了日历邀请——到工位的时候,收件箱已经是零。那种感觉太来电了。

问:这太厉害了。所以是 ChatGPT Voice,不是 Muse 的语音。

戴维:对,是 ChatGPT Voice。

阿尼什:哦,我理解错了,我以为你说的是 Muse 的语音。我完全同意。ChatGPT 那个基于 GPT-Live-1,是全双工语音,而且它能看到你所有的会话线索。所以你可以问它:「我最近开的那三个项目是什么?现在到哪一步了?我卡在哪里?」我认为这是一个非凡的能力,是 Muse 和 Instinct 今天都没有的。不过扎克伯格确实宣布了全双工语音,所以可能很快就会到 Muse 上。

戴维:肯定会来。但我确实认为,对普通消费者来说,助理在「你最忙的时候」最有用。不是说你坐在沙发上,把所有时间都花在让助理替你做事。它最有用的时候是你在园艺、在做饭——做那些手腾不出来的事情的时候,你没法跟一个界面交互。

这就又回到那个「隐形助理」:你只要说一句话,它就去后台跑起来、把事办了。我认为这个科技圈——那种长期在线、一直拿着手机、一直坐在电脑前的人——是一个和普通大众非常不同的环境。

所以我非常想看到它真的走向大众普及时会是什么样,普通人到底会怎么想这个助理,它是不是真的能解决他们真实的痛点,是不是那种「这事太痛苦了我不想做、所以我才用它」的场景。比如你收到一张交通罚单,你得去把它交了——太好了,拍张照,让你的助理去办。

把智能体拉进群聊,为什么让人觉得别扭

问:下一件事我想聊社交。我们聊过「多人模式」。我们说过 iMessage 是一个特殊位置,这也是 Instinct 比较酷的地方之一。但以我的经验,做一个「被你拉进群聊」的智能体,总觉得有点冒犯,或者说会消耗社交资本。你看到过什么做得好的?你对「智能体怎么走到多人模式」有什么理论?

戴维:很多人试过。我大概见过三种路径。

第一种是传统的:把它加进群聊,它就是群里的第四个伙伴。

第二种是 Instinct 的做法:你有一个智能体网络,你邀请另一个人的智能体进来,它们在幕后代表你们对话,然后把进展同步给你。

第三种是我觉得最有意思的,是一个叫 Doc 的新产品——做它的人是 Shane Mack,公司是 XMTP,也是 a16z 投的。他们的做法更像 Granola:你把一个智能体加进群聊,但它是沉默的、纯粹是个听众,在给人们在聊什么做笔记。如果它发现有行动项,它会自己单独私信那个人,另开一条线索。如果你想知道大家聊了什么,你可以进到 Doc 里看它的笔记。这样一来,它更像那个「隐形的助理」——你甚至不知道它在。它把你要的多人功能里那些杂活全做了,而且如果需要行动项,它不会去打扰群里的大多数人。这个方法真的很酷。

阿尼什:我要去试试。我很喜欢。当然,我也很喜欢它已经是一家 a16z 的公司了。

我的理论是这样的——Nir 说过一句话,我认为他说得对:模型在「可验证领域」(比如写代码)上的进步当然是指数级的;但在「文字质量」上,甚至在「待人接物的分寸」上,进步可能已经停滞,甚至还在变差。

所以我认为,以今天这些模型的样子,以及我们自己的预期来看,在这些社交动态上,我不认为智能体有多少空间可以去贡献、去增强一个群体的社交连接性。

反过来,我觉得非常「工具化」的智能体是有空间的。我最近在做的一个实验是:我是个收藏者,我收藏黑胶唱片和一堆别的东西。我会把一个智能体加进我和收藏同好朋友的聊天里,试着把我们各自的收藏和口味编成目录。我还没完全做成,但至少它感觉上是在给这个群体做真正的增量,而不是一个低情商的机器人,在我们不想要它说话的时候一直在说。

戴维:完全同意。你应该试试 Doc,我觉得你会着迷的。

阿尼什:我会的。

戴维:这周我还听到另一个有意思的说法:消息这件事本身,可能就不适合智能体介入。因为在消息里,好像「麦克风只有一个人拿着」,而把麦克风交给一个智能体,会让人不舒服。但如果你看更接近 Discord、甚至传统网页表单的形态,那反而适合智能体去发一条帖——你可以回也可以不回,像 Reddit 一样。不知道为什么,它感觉就没有群聊那么冒犯。

阿尼什:这很有意思。这几乎就像……我们把智能体拟人化得太过了。

戴维:对。这就引到另一件事:如果你去看这些智能体「人格」的设计,我看到有的公司想把它做成一个 AI 生成的「人」,也有一些公司像 Muse,就是一只可爱的雪人(yeti)。看着全世界爱上这只雪人非常有意思——它就是太可爱了。而 AI 生成的人,就像你说的,会让人有点不舒服。在你自己的私人空间里,把助理拟人化到那个程度,感觉很怪。

护城河不在人格,在「主动性」

问:那有个相关的问题。你觉得这个市场会按「人格」或「原型」切分吗?我们散步的时候聊过:有些人喜欢一个严肃、粗粝、权威的医生;有些人喜欢一个温暖的、像同伴一样的医生。这是两种不同的原型,而且显然没有哪个医生同时是这两种,它们是相反的。你觉得智能体也会这样吗?

戴维:我认为每个人喜欢的沟通风格当然不一样。Poke 一出来就很猛,它的人格非常鲜明。我有一些朋友——我自己是拒绝给 Poke 任何个人信息的,因为它太「毒舌」了,和它对话真的让我不舒服。

但我不认为「人格」是一个真正可防守的壁垒,因为它太容易配置了。作为消费者,你可以给你的助理发条消息,说「我希望你这样回复」,它把这个写进记忆、或者它的 soul 文件里,然后就搞定了,它就变了。我认为我们最后会走到一个状态:不管最后是谁当上通用助理的老大,它都会高度可配置,每个人都可以把助理调成让自己最舒服的样子。

问:这个有意思,我同意。但让我替「人格」做一次辩护——不只是人格,也许用「宪法」这个词更合适。举个例子,一个定义性的特征是「专断」。我们聊过一点:有些活你希望助理高度专断,你宁愿它有 10% 的时候出错,只要它经常能把事做成;而另一些助理——比如我们的金融助理——你希望它高度谨慎。

所以我在想,这些我们现在称之为「人格」的东西,会不会往下沉、变成「能力」,变成它在模糊情境下怎么取舍。而在那里面,也许可防守性更强一些。

戴维:我认为围绕「主动性」,可防守性是巨大的。我认为这恰恰是会把赢家和一堆陪跑者区分开的东西:那个最能主动、最能当「隐形助理」、能在你还没开口之前就开始替你动手的智能体。

我认为到目前为止我们看到的最好的「酷炫瞬间」,就是它替你自动值机。

但就像你说的,这最终会分成两类。有一类工作流,你希望自己保留控制权,不希望助理太主动地代表你行动。我认为那些是需要「你这边改变行为」的工作流。比如,助理发现你在用的保险收得太贵,认为你该换一家——那它大概应该先征得你同意,因为这是直接代表你、并且影响到你的行动。

但另一种主动是:「我帮你把邮件草拟好了」,或者「我帮你把机票的 travel credit 要回来了」——这类不需要你做任何事,只是替你省了钱、省了时间。

所以我认为看这些行为怎么被分类、被拆解会很有意思。但这会是一条非常细的线,因为一旦你越过去一次,你就会立刻失去用户对你的全部信任。

阿尼什:这会很有意思。我们内部开玩笑说,我们离「一个助理发消息给人说『我注意到你没那么喜欢她,所以我替你把分手办了』」只有几天了。

戴维:我看到过那条了。

阿尼什:它一定会发生。但我认为,很多魔力恰恰来自这种「专断」。而且我认为,如果没人发帖说「我的助理干了这个、干了那个」,那反而说明这些助理在这个方向上推得不够狠。

问:我其实有点怀疑那个「Bong Chang」的帖子是不是真的。给不知道的人解释一下:有个人发帖说 Instinct 替他值了机,还把他的中间名幻觉成了「Bong Chang」,导致他没上成飞机。所以我不确定这是不是在编段子,还是真发生了。但我很好奇,那个人还在用 Instinct 吗?我猜还在。

戴维:我也这么猜。就凭那条帖子的传播量,他大概还会为了更多内容继续喂。至少它是个喜剧素材来源。

从 OpenClaw 到窄赛道创业公司

阿尼什:也许可以这么说:最近发生的一件大事是,OpenClaw 时期发展出来的那些原语,终于被产品化到了大众消费者能消化、能欣赏的程度。还有 Poke,你提过几次——Poke 太了不起了,我觉得他们做得非常聪明。我认为如果他们晚六个月出发,可能最后赢的就是他们。那个团队非常有才华。我很好奇他们接下来会拿出什么,因为我确信他们加入 Cognition 之后没有停下这件事。

我很好奇,在 OpenClaw 那个时代,你注意到哪些能力或教训,会告诉我们消费级智能体的下一步是什么?

戴维:说实话,我现在看到的消费级智能体,基本上就是把 OpenClaw 复制了一遍,只不过预先配置好了。在个人助理这个领域,我没有看到什么 OpenClaw 或者 Hermes 做不到的事。区别只是你不用什么都自己配,不会每七个小时就弹一个报错,它很好用,界面很简单。所以我们就看接下来会怎样。

我认为这个赛道的方向会继续走向生产力,也会继续看到更强的「超专业化」——这就是你关于「窄赛道创业公司」的论点。随着更多长尾机会出现,会是什么样子?比如放弃做通才,把全部时间都用来把一个助理做成「三岁以下孩子的单亲妈妈」的专家。它对这个母亲怎么过一天、孩子的发育,什么都懂,你会觉得它真的在读她的心。这可能是一个可以插进通才助理的插件。但既然这是你的论点,我想先听你说:对你来说「窄赛道创业公司」是什么,你看到它会怎么演?

阿尼什:窄赛道创业公司的理论是,你现在可以做出极其有野心、对极少数人极其有价值的软件。而且我们已经有先例——人们愿意每月付 200、250、300 美元。所以你可以只靠几万人,做出一家百亿美元年收入规模的公司,这在过去从来没有真正存在过。很大一部分原因还在于,能力可以被专业化到令人难以置信的程度。

对你说的这件事,我完全同意。我认为会出现这种比较优势,而且它会是「品味」和「专有知识」的组合。就像你会有一位助产士(doula),她可能信奉某一套帮助女性生产的方式;你可能也会有一个个人助理,它信奉某一套思想、风格,甚至一套没有那么被广泛理解的经验,你雇它来给你提供这项服务。

然后是专有数据。你提到过可能有一个专门服务纽约市的个人助理。我认为就像可能有一个「品味 A+、难以复制」的礼宾,他知道所有你会喜欢的好地方;也可能另外有十几个礼宾,服务另外十几个不同的人或原型。我确实认为会出现这种「主观上的客观专业化」。

「助理」和「智能体」不是一回事

戴维:我也很好奇,从你的角度来看——就在我们这场对话里,我们一直在「助理」和「智能体」之间来回切。这在推特上也是一个持续不断的争论。这个生态的未来,到底是一个「个人助理」还是一个「个人智能体」?对你来说这两个词是什么意思?

阿尼什:这问题太好了。对我来说,「助理」是比「智能体」低一档的东西。对我来说,智能体是那种你能想象它成为一个社交群体里的同伴的角色。也许我们需要一个比「智能体」更好的词。

但助理,按定义,只能做你让它做的事。它只能在你已经指示的方向上协助你。而智能体有能动性,它可以自己去世界上把事情做成。

这也许和企业在用 AI 的那条路径有点像:它们一开始是实习生,通过干活和智能的提升,被「升职」去做企业里更高阶的工作。那么对一个助理、后来是一个智能体来说,在消费者的生活里被「升职」去做更专门、更精细的工作,意味着什么?

戴维:我非常认同。我也很好奇它对人类社会的社交层会有什么影响:用「智能体」这个词,是不是让我们没有把 AI 拟人化得足够?而「助理」这个词,是不是往这个体验里加了太多「人」的成分,让社会感觉不舒服?

这会很有意思,因为——我们都活在泡泡里,你在更大的泡泡里,你在旧金山,你在世界科技中心。我会说纽约比旧金山落后一点,然后世界其他地方再往后追。所以我很想看看人们到底会怎么理解这个领域的说法。

阿尼什:我觉得这不是泡泡,我觉得这就是未来。我们是在「近未来」里。

五年之后,AI 会让我们更幸福吗

戴维:对。我认为它也会给世界带来很多显著的正面影响。你怎么看 AI 的影响?如果往后看五年,这些智能体、这些助理到底会把我们带向哪里?它们怎么让我们变成更幸福的人?

阿尼什:这问题很好。我认为这才是我们真正在追求的根本问题。

我们聊过生产力,聊过金融和健康,有很多很琐碎的事。我昨天查了一个数字,这个国家每年有 150 万人拿到 DUI(酒后驾驶指控)。你想想那背后意味着多大的行政负担,其中又有多少人请得起律师。所以我确实认为,有一种「官僚压力」是压在普通消费者身上的。

所以第一步是,怎么把这种官僚压力卸掉,让人们财务上被优化、健康上被优化,让他们能拥有和有钱人一样的东西——不管是律师,还是某种家族办公室。

然后我觉得更大的问题是——我妈妈从小就对我说,最难的部分是「知道自己想要什么」。我们所有人真正追求的到底是什么?这些助理能以什么方式真正地和我们互动?我不认为它简单到只是「目标」。我不知道有多少人真的有目标。我觉得很多人的状态是:他们在试着搞清楚自己是谁,然后变成那个最好、最真实的自己。

而我们自身的成长、我们在世界里的主观体验,和这些机器之间的这种互动,对我们来说可能是一个非常美的未来。

戴维:完全同意。我想象过这样一个世界:我未来的孩子会看着我们这一代人的老视频——走在街上,低着头盯着手机——他们会说:「你在干什么?外面是个很美的世界啊,你为什么把所有时间都花在盯屏幕上?」因为,希望它能让我们把很多这样的事自动化掉。作为父母,你可以真的花更多时间和孩子在一起;二十多岁的成年人,可以真的花更多时间和朋友聊天。

我非常好奇它会怎么以那么多方式让生活变得更好——把那些你真的很讨厌做、但又是「生活行政」的事减掉。

阿尼什:对。这也是为什么我认为,很多时候编码智能体并不是在和人类程序员竞争——因为它们在做人不会做的事。比如我这个荒唐的副业项目:我在做一个能走进去的虚拟唱片店。做完我把链接发你。

十年前我不可能雇一个程序员来做这个——我不可能为我的人生搭进去那一年。所以这些东西,是那些「本来根本不会发生」的事。

我认为这项技术在我们生活里有很多这样的版本:我们只是终于可以去探索那些我们本来根本不会去探索的东西。它不是关于降低成本,它是关于「扩展可能性」。

戴维:对。让生活更好玩,更有意思。

智能体原生基础设施与「三个网」

阿尼什:说回近期。我最近在想一件很想听你看法的事:上一波开源智能体浪潮留下的经验是什么?我们需要建造哪些真正「智能体原生」的系统?也许 Instinct 的「instinct-to-instinct」网络就是其中一部分。但我确实感觉,会出现一些基础设施和产品,它们是只为了「智能体和智能体之间的交互」而存在的,而今天还不存在。你怎么看?

戴维:会是一整个新范式。我觉得这话题本身就能聊 10 个小时。

你会有智能体的邮箱,有智能体的电话号码。当这个世界不再是人向人预订,也不再是智能体向人预订,而是智能体向智能体预订的时候,整个服务业会被重新定义成什么样?

然后还有一整套网络安全的部分:互联网先来,然后来了网络安全。智能体先来了,现在来的就是智能体的安全。这会催生出什么行业?

但最美妙的地方在于有太多机会、太多问题可以用这些智能体去解决。我认为不可避免地会有大量创业公司冒出来,去解决这些细分问题,去真正搭起这一波新的互联网、新的数字连接。

阿尼什:一定会很酷,尤其是电商。我总把 Web 想象成「三个网」——就像我心里住着两只狼一样。这三个网是:电商网、应用网、内容网。内容网已经麻烦了很久;电商网其实做得很好;应用网从编码智能体发布之后,明显在猛涨。

但电商网非常有意思。你这周看到了:Shopify 拥抱了 Muse,亚马逊封杀了 Muse。我猜其中的算计是:当流量的「新前门」出现时,谁会赢、谁会输。你对亚马逊和 Shopify 到底发生了什么,以及更广泛地谁赢谁输,有看法吗?

当所有人都有智能体,订座会变成竞价吗

戴维:首先,Shopify 和亚马逊是完全两种商业模式。Shopify 高度专注于「让电商更民主化」;亚马逊的全部利润来自广告收入。所以在整个广告结构上,这会非常值得看——因为当你把人的眼球拿掉,「广告」这件事本身就失去了它全部的意义。我认为这就是亚马逊的出发点:如果让 Muse 这些智能体在没有给它们带来任何广告收入的情况下开始下单,那会把它利润的一大块从这个体验里拿走。

所以我认为,很可能必须出现某种新的范式,让它们在这个「智能体替人下单」的世界里还能赚钱——而 Shopify 是另一回事,它是让每个普通人尽可能多地去卖,智能体把这件事进一步民主化,所以对它来说是难以置信的利好。

我觉得更有意思的是那些还没被碰到的行业。比如餐厅。你看订座这件事:我们看到 Resy 开始封掉用户账号,因为他们用了浏览器自动化,Resy 不想要机器人。因为如果让智能体瞬间把这些位子都订走,那这个平台「以人为中心的订座体验」这件事本身就被废掉了。

但当每个人都有智能体之后会怎样?所有人都在同一个起跑线上,所有人可以同时去订。那我们会进入这样一个世界吗:第一,权力回到餐厅手里,餐厅可以根据忠诚度、人均消费、或者别的什么,自己决定把位子给谁;第二,我们进入一个「竞价」的世界,一切都变成智能体之间的竞价战。

我对这个未来很好奇。

阿尼什:我觉得你说得完全对。这里会分成两类:一类是供给受限的,比如很热门的餐厅;一类是需求受限的,比如「我想明天飞去旧金山」。

餐厅的话,如果信息完全透明,他们想要谁?就像你说的,是 AOV(客单价)最高、LTV 最高(也就是多次到店的人均消费)的客人,同时他们还想尽可能保证接近 100% 的上座率。所以这其实是一个更复杂的计算,我不太清楚他们要怎么做;但我相信「专有供给」会越来越重要——同时依靠终端消费者那点「摩擦力」和「动机」,来充当阻止这种 DDoS 的东西。所以供给受限的那一面会很有意思。

而需求受限的那一面会完全不同:你几乎会有一种「团购」体验——有一群买家愿意买某个产品、服务或体验,然后供给端、那些能满足这个需求的商家进来竞价,看谁能用最好的体验、也许是最低的价格做到。

所以我们一直有「需求的聚合」,但从来没有真正有过同等的「供给聚合」,更没有在一个拍卖系统里让消费者受益。所以我觉得这很有意思。

还有亚马逊和 Shopify 这件事,我认为亚马逊大概是正确地在下注:它不想被「去中介化」,它不只担心失去广告收入,还担心失去冲动消费。我很好奇智能体本身会不会在某种程度上也是「冲动购物者」——因为「主动性」这个点意味着智能体会试着做出让人惊喜的猜测。而有什么比一个惊喜、一份礼物更让人愉悦呢?

所以我猜,一个非常有意思的动态会是:这些智能体并不是它们主人的完美映射,也不是完全理性的。它们会以全新的方式「非理性」。我不认为营销、冲动消费、广告这些事会变得不重要,我只是认为它们需要被改造。

戴维:完全同意。而且这也打开了一个新话题:在这个「智能体电商」时代,推荐引擎长什么样?因为 AI 和大模型似乎已经破坏了互联网在「搜索质量」上的东西。但如果你用一个智能体说「给我买些白袜子」,市面上有两万种白袜子,它其实并不知道你偏好哪一种。

所以我觉得这会非常有意思。Muse 可能在这个上面有先发优势,而这正是扎克伯格「进攻一切电商」的论点——他们手里有你的 Instagram 数据、Facebook 数据,所以他们大概更懂你真正偏好什么。但在这个电商世界里,这个推荐层会长什么样,会非常值得期待。

阿尼什:我觉得它在长尾上会很好玩。就拿你说白袜子这个例子:我可以去亚马逊买白袜子,但也许我的助理回来说:「嘿,我在 Etsy 上找到一个很棒的人,能给你手工织这双袜子——内布拉斯加的一位老奶奶。」她织的袜子特别好,但要三周。你愿意吗?我说:「行啊,听起来挺有意思。」

所以我在想,它会不会带来更多的「意外之喜」。因为它当然可以检视所有选项、把这些东西完美地贴合你,而且没有不利的激励——背后没有广告分成在推它。

戴维:我很喜欢。会很好玩。

阿尼什:它肯定会给今天这种平淡的购物生活加点味道。

戴维:没错。

阿尼什:对我来说平淡——作为一个从「买袜子」里得不到任何快乐的人。

戴维:兄弟,你再往未来一点想:它开始催化现实世界里的东西。也许不是那个在 Etsy 上卖白袜子的老奶奶,而是它给「一个老奶奶的智能体」发消息说:「嘿,你愿不愿意做这个?」所以我认为这就是「智能体和智能体」这个空间真正有意思的地方——它们都在代表自己的人行动,有的提供产品、服务、知识,有的为了赚钱。

也许会出现一个「次级经济」,它更动态、更高频、也比我们今天这个有意思得多。

阿尼什:我现在能想象一个内布拉斯加的老奶奶收到一条短信:「嘿,旧金山有个人想让你给他织白袜子。为什么不呢?你想做吗?」为什么不呢?

戴维:为什么不呢。会很棒的。

阿尼什:所以我其实非常乐观。它还能把激励机制摆到对的位置上:如果智能体在做对的事,它们在基于产品品质去选好的产品,而且它们可以自己评估产品品质,而不是选那个营销最好、品牌最响的。

顺便说,如果它们真的按品牌来选,那至少也是用户明确签过字的:「我就是想要耐克,因为我爱耐克」——而不是营销在消费者心里制造了认知失调、让他做了对自己并不最优的事。

戴维:对。它打开了一扇门,通向一个真正「与消费者对齐」的互联网——我认为我们已经缺失这个东西很久了。

阿尼什:我同意。

智能体经济学:122 款里 65 款在收费

戴维:我们聊到了智能体的经济学。我看过的 122 款里,我自己亲手测了 26 款。122 款里,65 款是收费的:35 款是完全付费,30 款是免费增值(到了一定额度就要付费),只有 13 款是真的免费。

现在 Muse 和 Instinct 都是免费的,而且恰恰是其中最强势的两个;然后 OpenAI 据说下周会放出一个很酷的东西,谁知道呢。

那一个长尾创业公司到底怎么才能赢下这个空间?为什么在大厂免费送的时候,它们还要收费?

阿尼什:说实话,这会非常难。按我们的估算,用真正有野心的方式做这件事,大概要花每人每天 20 美元,对一家创业公司来说可能一年就是几亿美元。

我认为可以押注的两个正面趋势是:浏览器使用成本应该会通缩,会非常快地变得便宜得多。当然,如果你是今天融资的创业公司,赌它六个月内发生,这有点像一场胆小鬼博弈;但我们确实看到 token 价格大幅下滑,而那些新出现的能力,价格也在下滑。所以我认为浏览器使用变得足够便宜、让更多产品能免费提供,是非常可能的。

但反过来,我不喜欢「补贴用户」成为核心价值主张这件事。我更想看到那个每月收 1000 美元、而消费者兴奋到愿意付的助理。人们在很多不一定是必需品、而是欲望的东西上,一个月花 1000 美元。

所以,那个「足够令人兴奋、让你愿意付这个价」的助理是什么?而它一旦存在,就会同时吃到极端的PMF和一路下滑的成本。

戴维:是,会很有意思。

阿尼什:非常有意思。戴维,来自 Assistant Benchmark 的这位,大家一定要去看看。非常感谢你来。我们会持续追踪这个话题。

戴维:我感觉我们可以每周聊一次,兄弟。事情每天都在发生。所以请大家在 X 上关注他,也关注我。我们会在 X 社群一起跟上节奏、一起学习。祝你和你的智能体过得愉快。

阿尼什:谢谢。你也一样。

戴维:这个很好玩。

阿尼什:好的,兄弟。谢谢。

资料来源:The a16z Show 播客《The Personal Agent Race Is Here | Anish Acharya & David Pawlan》,2026 年 9 月 29 日发布,为方便阅读,AI原声对原文做了一定编辑。

相关学习资料