夜雨聆风学习资料网

ARTICLE · 1075177

一个人管400个AI任务:硅谷创业者津晶的Agent工作法

一个人管400个AI任务:硅谷创业者津晶的Agent工作法

开五个 Claude Code 窗口就忙不过来的你,有没有想过一件事——

有人同时在管四百多个 AI 任务。

不是同时开四百个窗口,是四百个不同的 feature、不同的工作流,在各自的 Agent 群里往前走。人只负责设定目标、做关键决定、最后验收。

这个人叫津晶,Orca 的联合创始人。她和她的四人小团队,正在用一种大多数人还没见过的方式工作——每天发布一个稳定版本,每版上百个 PR。GitHub 七万星,几乎零市场投入。

上周跟她聊了一个多小时。聊完最大的感受不是"AI 好厉害",而是——

AI 时代真正的效率差距,不在模型能力,在人怎么管理 AI。

— 01 —

四百个任务,怎么管得过来

很多人第一次听到"同时跑几百个 Agent",第一反应都是:那不乱套了吗。

你试试在 Terminal 里开五个 Claude Code 会话就知道了。过半小时,你已经分不清哪个在干什么、哪个卡壳了、哪个产出了什么。

津晶和她的重度用户们,解法不是"盯得更紧",而是换一种工作方式。

第一件事,把验收标准定义清楚。

不是把任务丢给 AI 就完事了。你要告诉它——什么是好的,什么是不好的,做到什么程度算完成。Agent 才能自己判断进度,你也才能在最后快速验收。

第二件事,靠搜索而不是靠记忆。

几百个会话同时跑,不可能每个都盯。这时候搜索能力就是你的第二大脑。津晶说,现在 Claude Code 和 Codex 的原生搜索"其实不是很好用","我想搜索什么东西还是搜不出来的,我不是很 trust"。

Orca 的搜索针对这个场景做了很多优化——把很多"之前大家不会想到放到搜索结果里的信息"都放进去了。你不用记哪个会话在哪,搜关键词就能定位。

第三件事,也是最关键的——

人从"监工"变成"指挥官"。

津晶描述了她身边一个工程师的日常:

每天上班打开一看,哦我今天有二十个活,然后就找一个 agent,把这二十个活丢到那个 agent 里边,看二十个 subworker。下班的时候喝咖啡,看看是不是都干完了,干完了叫一下,今天的活就干完了。

人负责什么?

设定目标。做关键决定。最终验收。

其他的,交给 Agent。

— 02 —

ADE 不是 Harness,别再搞混了

聊到 Orca 的定位,津晶花了挺长时间讲清楚一个概念——

ADE 和 Harness 不是一回事。

Harness 是什么?你可以把它想成一个 loop。给 AI 一个 input,它产出一个 output,然后不断循环。中间可以调用各种工具——读 bash、搜网页、写代码。

Claude Code、Codex、Devin、OpenCode、SWE-agent……这些都是 Harness。

ADE 呢?

它在 Harness 的上面一层。它不做 loop,也不绑模型。它把 loop 交给各种现有的 Harness 去做,自己专注在一件事上——

人与上百个 Agent 协作的工作流。

怎么看到一百个 Agent 的中途结果?人需要介入时怎么快速反馈?怎么 review 最终结果?怎么把 GitHub、Linear、测试、代码审查这些工具串成一条线?

打个比方:Harness 是工人,ADE 是工厂调度系统。工人负责干活,调度系统负责让几百个工人协同不出错。

所以 Orca 不做自己的 Harness。用户可以直接在里面用 Claude Code、Codex、Devin,想用什么用什么。

— 03 —

为什么不怕被大厂"顺手做掉"

这是每一个 AI 工具创业者都要面对的灵魂拷问。

津晶的回答挺有层次,我帮大家整理成了四点:

第一,中立性。

Orca 可以同时用 Claude Code 和 Codex,跨平台。这是大厂不会做的事——Anthropic 不会集成 OpenAI 的产品,反过来也一样。但用户需要的就是"不管哪家的工具我都能用"。

第二,产品设计哲学不一样。

大厂的思路是"我有一个模型,怎么把它用好"。Orca 是从"用户有几百个 Agent 要管理"这个真实痛点出发的。产品设计从根上就不同。

第三,迭代速度。

四人小团队,没有大公司的层级和流程,决策快、执行快。很多腾讯美团的人跟她说,他们惊讶于 Anthropic 的迭代速度,但 Orca 其实比 Anthropic 更快。

第四,对场景的理解深度。

Orca 自己就是重度用户。每天用自己的产品管理上百个 Agent,对痛点的理解是第一手的。大厂的产品团队未必有这样的深度使用经验。

说穿了,大厂做的是"我的模型怎么更好用",创业公司做的是"用户的问题怎么被解决"。切入点不一样,最后的产品形态自然也不一样。

— 04 —

AI 没有填平那条鸿沟只是把你更快地带到了沟边上

聊到产品细节的时候,津晶说了一句话,我印象特别深:

AI 可以把你更快地带到鸿沟边上,但你想跨过鸿沟,还是需要很多的时间精力和水平。

什么鸿沟?

从 Prototype 到 Production 之间的那条。

很多人以为有了大模型,做产品就容易了。做个 Demo 确实快,快到你会产生"产品也很容易"的错觉。但从一个能跑的 Demo 到一个真正可用的产品,中间的难度一点没变少。

AI 只是让你更快地站到了鸿沟面前。

跨过去靠什么?靠很强的软件工程能力,靠对细节的极致追求,靠愿意花时间把小事做对。

举个很小的例子:Agent 运行状态的指示。听上去就是个小功能,但做对做细很难。而这种细节积累多了,就是产品之间的差距。

— 05 —

95% 的时间做产品增长从哪里来

Orca 四万星的时候几乎没做过 marketing。七万星了,还是几乎全靠口碑。

"我们可能百分之九十五的时间都在做产品。"津晶说。

那增长呢?

留存是产品决定的,产品好到一定程度,就自带传播指数。一传二,二传三,一个人会推荐几个人。

这句话听起来简单,但做过的人都知道有多难。同赛道那么多人在做同样的事,为什么只有少数几个能跑出来?

津晶的答案是:产品能力的差距。

Great 和 Good 之间的差距,比大多数人想象的要大得多。从 Google 出来的人很多,但不是每个人都能做出好产品。

好的技术加上好的产品品味(taste),才是真正的护城河。

— 06 —

访谈一百个用户怎么问出真正的需求

聊到产品方法论,津晶分享了她的用户研究心法。我整理成了三条:

第一,量要够。

访谈一百个用户,这是起步量。量不够,你看不到真问题,也分辨不出哪些是个别情况、哪些是普遍痛点。

第二,问行为,不问意愿。

不要问"你愿不愿意为我的产品花钱",要问"你在类似产品上花了多少钱"。

看行为,不听意愿。这是用户研究的黄金法则。人们对自己未来行为的预测极其不准,但他们过去的行为是真实的。

第三,不停追问,挖到最底层。

"Develop 对于用户的一个 true understanding,而且这个 true understanding 其实比大家想象中的要深很多。很多时候大家以为是用了,其实还是表面的。在这里边要一定不停的问下去。"

访谈一百个客户,问他们非常具体的问题,然后在这里边不断地去寻找真实的那个痛点是什么。

— 07 —

数据只能告诉你 20-30%剩下的靠品味

收集了用户反馈,然后呢?

不是所有反馈都要听。很多时候你听到的是 vocal minority——声音很大,但不代表大多数真实用户。

那怎么分辨?

津晶的答案是:靠产品感觉,product sense,或者说——taste。

我自己是做数据科学的,对这点特别有共鸣。数据能告诉你的东西可能就百分之二三十,剩下的你要看你的 mental model,看你的判断。

那品味怎么建立?

津晶提到了两个"开悟瞬间"——一个是突然理解了用户,一个是突然理解了产品。在那之前,你可能做了很久但都没摸到门道;在那之后,很多事情豁然开朗。

这是一种很玄妙的感觉,但每个做产品的人都懂。

— 08 —

她为什么不焦虑

AI 圈这么卷,大厂迭代这么快,到处都是"AI 泡沫"的论调。

津晶给人的感觉,是出奇的松弛。

她的回答挺有深度:

我觉得人确实是不可替代的。AI 再怎么训练,它和人都是有区别的。但问题是,我们在教育的过程中过度强调了那些可以被 AI 取代的东西,而人的真正的独特的东西是没有强调的。

工业革命之后,我们把人尽量打造成"标准件"——标准化的技能、标准化的思维方式、标准化的工作流程。

而这些"标准件"的能力,恰恰是最容易被 AI 取代的。

津晶反而对未来很乐观:

我很看好下一代人。他们真的在一个 AI native 的世界里边,他们会反过来强调人性独特的东西——不管是你的 craft 呀,还是你的 taste 啊,还是你的 creativity 或者等等 mystery。

AI 越强大,人的独特性反而越珍贵。

这不是零和博弈,是水涨船高。

当所有标准化的工作都被 AI 接手,人类才能真正回归到那些只有人才能做的事情上——创造、审美、共情、意义。

— 09 —

接下来的 AI 创业机会她看好这三类

最后,津晶分享了她看好的三个方向:

一、To C 产品

AI 大大降低了开发成本,以前需要大团队才能做的产品,现在小团队就能做。虽然市场上的应用多了一百倍,但好产品依然能脱颖而出。

二、软硬件结合

AI 从数字世界走向物理世界。空间智能、机器人、IoT——"从文字到世界"是下一个大趋势。

三、算力优化层

在芯片和模型之间,还有一层优化空间。以前这一层是 CUDA 一统天下,但 AI 时代模型和芯片的多样性增加,中间的优化空间也变大了。

具体包括算力集成、hosting、serving,以及从芯片到产生 token 之间的各种优化——推理加速、模型压缩、算力调度。

另外她也提到了服务方向——用 AI 直接服务一个公司,帮企业落地 AI。类似传统的 FDE(前端开发外包),但现在做的是 AI 落地服务。有需求,但要找到好的商业模式。

— —

一个多小时的对话,津晶给我的印象是——

极度理性,又极度松弛。

对产品细节的追求近乎苛刻,但对竞争和焦虑又看得很淡。相信 AI 的力量,但更相信人的独特性。

四百个 Agent 同时跑着,她喝咖啡,看结果,然后决定下一步去哪里。

这可能就是 AI 时代最好的工作状态——

不是被 AI 追着跑,而是驾驭着 AI,去做那些真正重要的事。

嘉宾:梁津晶,Orca 联合创始人。连续创业者,曾供职于 Google,两次创业均进入 Y Combinator。

来源:课代表立正播客 · 对话 319 期

相关链接:Orca · github.com/stablyai/orca

本文由音频转写后整理发布,内容有删减和重组。完整访谈请关注"课代表立正"播客。

相关学习资料