乐于分享
好东西不私藏

他用AI工具卖了$6.5亿,只靠这3个别人都在跳过的选品原则

他用AI工具卖了$6.5亿,只靠这3个别人都在跳过的选品原则
2023年6月,汤森路透集团(Thomson Reuters)以6.5亿美元现金收购了一家叫Casetext的AI法律公司。
这家公司成立于2013年,比ChatGPT早了整整十年。
本篇介绍的是Casetext的联合创始人兼CEO Jake Heller在YC的AI Startup School上做的一次演讲分享,没有PPT废话,没有成功学,就是把他10年踩过的坑和走通的路,非常具体的拆解开来。
我看完之后想了一段时间,觉得里面有几个内容值得分享,不是因为它们听起来很厉害,而是因为大多数人根本没在做。

Part.01

|选赛道:不是“能不能做”,而是“你能不能赢”;重点关注“人们在付钱请人做的事”
Jake分享的第一个框架,AI创业公司的类型判断
大多数人选赛道的逻辑是:这个需求存在吗?AI能解决吗?技术上可行吗?
但这三个问题,都是必要条件,不是充分条件
Jake真正问的问题是:在这个赛道,你的团队是否有独特的赢的理由?
The right idea isn't just a good problem to solve — it's a problem you're uniquely positioned to solve."
好的创业方向,不只是一个好问题,而是你独特有资格去解决的问题。
Casetext选择法律AI,不是因为法律是大市场(虽然确实是),而是因为联合创始人团队里有斯坦福法学院背景,能够真正理解律师的工作流程,这才是让他们在产品判断上有天然领先优势。
除此之外,需要重点关注的是什么?
Jake一开始就说了一句让我觉得挺实在的话:
"What do people want? Things they're paying for right now."

人们想要什么?就是他们现在正在付钱买的东西。

YC的口号是"Make Something People Want",但问题是你怎么知道人们想要什么。Jake说他的答案很简单:看他们在付钱请人做什么。比如,客服、保险理赔员、助理律师、财务分析师、私人教练...,这些人拿工资做的事,就是你的选品/选赛道清单方向。
这个逻辑我觉得比"找痛点"更落地,因为找痛点是模糊的,但"谁在付多少钱请人做什么"是有数的,是具体的。
他把AI创业方向分成三类:
类型
逻辑
定价天花板
Assist(辅助人类)
专业人士还在做,但AI帮他做得更快更好(例如 面向律师的AI助手CoCounsel等)
比现有工具贵,比人工便宜
Replace(完全替代)
原本雇人做,现在直接AI来做这件事(比如,全自动的AI会计师或AI律所等)
接近人工成本,比SaaS贵1-2个量级
Unthinkable(原本不可能)
以前因为成本太高或太耗时根本不做,AI让它变得可行
没有参照物,由客户价值决定
Casetext当时走的是Assist路线,但Jake说现在最有意思的机会在Replace和Unthinkable。他举了一个例子:律所有数亿份文件,以前没有人会想着逐一分类归纳,现在用AI可以跑一遍,这件事以前不存在预算,也不太想花钱去做,但放在今天客户是愿意付费的,因为这个结果对他们有难以估算的实际价值。
对出海意味着:
  • 如果你在考虑进入一个AI垂直赛道,先问自己:我对这个行业的理解,是否比同类竞争者至少深一个数量级?
  • 出海B2B工具的选品逻辑不是"欧美市场大",而是"我是否有接近目标客户的信息优势",比如你本身就是那个行业的从业者,或者你有长期服务某类客户的数据积累。
  • 外贸从业者注意:你对供应链/采购/合规的第一手知识,本身就是AI工具赛道里罕见的护城河。
  • 如果你在做的AI工具,定价还是按SaaS逻辑来($20/月),说明你还在用Assist逻辑,但你可能已经在做Replace的事情了,说明你的定价严重低估了
  • Replace类产品的定价参照物是"这件事原来请人做要多少钱",而不是竞品报价

Part.02

|怎么建产品:先问最好的人会怎么做
这部分Jake讲得很具体,有个方法我觉得出海工具创业者可以直接抄。
第一步:把这个职业的工作拆成最小步骤
不是泛泛地说"帮用户做法律研究",而是:他们先接到请求,然后想清楚问题,然后列搜索计划,然后执行几十个搜索,然后逐一阅读结果、筛掉无关的,做好笔记,最后写成文章,还要核查引用。Jake说这些步骤他亲自经历过,因为他本人就是律师。
第二步:每个步骤变成一个prompt或一段代码
Jake说,大多数"需要人类判断力"的步骤,现在都可以变成提示词(prompt);不需要的,就用普通代码。因为Tokens既慢又贵,如能用确定性逻辑解决的,就不要用AI模型。
他还说了一句话我觉得挺反直觉的,就是如果每次做这个任务都是固定流程,别搞什么agent框架,就用Python顺序调用几个函数就够了。很多人为了"显得技术厉害"搞过度设计,反而让系统更脆弱更复杂。

Part.03

|产品质量:演示好看不等于产品可靠
这是Jake讲得最重、也是最多AI创业者忽视的一点。
他明确说:AI创业最大的陷阱,是把"Demo效果好"误认为"产品完成了"。
法律行业对错误的容忍度接近零。一条引用错误的案例,可能让律师输掉官司。正是这个残酷的标准,迫使Casetext建立了极其严格的测试体系。
"A cool demo is easy. A reliable product is hard. And for enterprise customers, only reliability matters."
做个炫酷的demo很容易,但要打造一款可靠的产品却很难。而对企业客户来说,唯有可靠性才最重要。
他们自己的做法是:在向客户承诺任何功能前,必须先在内部通过大量真实案例测试,确保准确率达到可接受水平。不是90%,而是律师敢用在真实案件上的水平
【出海场景】
  • 在出海AI工具赛道,"演示视频火"≠产品可以卖。你的客户买的是结果,不是可能性。
  • 建立你自己的测试基准:在你的垂直场景里,什么叫"足够好"?是99%准确率?还是响应时间低于3秒?把这个标准写下来,在达到前不主推。
  • DTC/电商卖家:如果你用AI做客服或商品描述生成,错误输出的成本是客诉和退货,不要在没测试清楚前大规模铺开。

Part.04

|客户信任:你的产品定价,就是你对质量的承诺
Jake谈到一个反直觉的发现:定价太低,反而会损害客户信任。
在Casetext早期,他们曾经尝试用低价快速拉用户。但律师事务所的反馈是:价格太低让他们怀疑这个工具的专业性。
这跟大多数出海创业者的直觉完全相反,我们通常认为价格是获客障碍,越低越好拉量。
但在专业服务B2B赛道,定价传递的是信号:你是否有足够的信心为自己的输出质量负责。
"Price is a signal of trust. If you price too low, you're telling your customer you don't fully believe in your own product."
价格是信任的信号。如果定价过低,就等于在告诉客户,你对自己的产品并不完全有信心。”
最终Casetext选择了偏高的定价策略,反而帮助他们进入头部律所。
【出海应用】
  • 在出海SaaS或AI服务定价时,不要因为"怕贵"就压价。先锚定你的目标客户愿意为同类问题付多少钱,然后定价在合理范围的上沿
  • 高定价需要配套"高服务承诺":比如,清晰的退款保障、响应SLA(Service Level Agreement(服务等级协议))、案例背书,让客户感到"贵得有道理"
  • 外贸B2B注意:如果你的AI报价/询盘工具定价低于同类人工服务的20%,客户可能会觉得"这东西靠不住",反而拿不到大单

Part.05

|定价:他们客户说"宁愿多付,求你别按量收"
Jake说了一件出海SaaS创始人会感兴趣的发现,他们一开始以为客户会喜欢按使用量付费(用多少付多少),结果去问了,客户说:
"I'd rather pay more, but make it consistent throughout the year."
我宁愿多付点钱,但我需要全年价格稳定保持一致。
最后Casetext定的是每席位6000美元/年,500美元/月。这不是他们算出来的,是客户说出来的。
他讲定价讲了三件事,我觉得第三件最被低估:不要只做产品,要做信任建设。
他举例的方法是"head-to-head对比":让客户同时用你的产品和原来的方式(原来的律师/会计/工具),并排比较结果。这个方法之所以有效,是因为它把风险从客户身上转移走了:你不是在说"我们更好",你是在说"我们愿意接受现场对比"。

Part.06

|Evals(模型性能的评估测试):这是大多数人在60%的时候放弃的地方
这部分是我觉得含金量最高的部分。
Jake说他见过太多创始人,产品跑到60-70%准确率就觉得"AI做不到这件事",然后放弃了。他的经验是:如果你真的愿意花两周时间死磕一个prompt,你能从60%磨到97%。这不是神话,是他自己和团队做过的事。
具体怎么做:
  1. 把每个步骤的"好结果"定义清楚:不是主观说"回答得好",而是能客观打分的标准,比如"相关性0-7分"
  2. 用PromptFoo这类工具(开源,命令行运行),把每个prompt对应一组测试用例
  3. 从12个测试用例开始,先做到全过,再扩到50个,再到100个。上线beta之前,每个关键prompt要有100个测试,整体任务也要有100个
  4. 每次客户反馈一个错误,那就是一个新测试用例。Casetext现在积累的测试用例,来自真实客户的比他们自己设计的多
"The biggest qualification for success here is whether you're willing to spend two weeks sleeplessly working on a single prompt."
能不能在这里成功,最大的判断标准是:你是否愿意花两周不眠不休死磕一个prompt。
他说AI出错是有规律可循的,不是随机的,你会发现prompt里哪里表述模糊了,AI会在哪个方向反复犯错。这时候,你需要做的是给它清晰指令、加反例,一个百分点一个百分点地往上爬,这是才是你们真正的技术壁垒,而不是什么模型架构。
另外一个细节:新模型一出来就跑一遍你的eval套件,PromptFoo可以直接对比不同模型的通过率。这让换模型的决策变得有据可查,而不是凭感觉。
出海AI工具应用:
  • 如果你的产品现在没有eval体系,等于不知道自己产品的准确率是多少,这在面对企业客户的时候是致命的,因为他们会问,所以你要提前准备好问题的答案和数据
  • 从今天起,把每个客户反馈的错误或是用意想不到的奇怪方式使用产品服务的都存档起来,这将会是你最贵最有价值的测试数据集

Part.07

|创始人焦点:快速增长有时候是慢性毒药
Jake分享了一个让很多人意外的决策:在CoCounsel(一款面向律师的AI助手产品稳定前,他们主动放弃了一些增长机会
不是没钱做,而是刻意不做。
他的逻辑是:如果产品还不够稳定,获客越快,口碑崩塌越快;在B2B专业服务市场,一次坏口碑传播的速度,是好口碑的10倍,做品牌的深知这个道理。
这就是为什么他们在有机会大规模进入市场前,花了大量时间打磨"一个核心工作流",而不是铺满所有功能。
"Do fewer things, but do them so well that customers have no reason to look elsewhere."
做更少的事,但做到让客户完全没有理由去找别家。
【出海应用】
  • 如果你同时在做3个以上AI功能模块,把它们排序,把90%的资源压在第1名
  • 出海平台卖家尤其要注意:铺品逻辑和AI工具精品逻辑完全不同。AI工具靠的是深度信任,不是SKU数量
  • 在进入新海外市场前,先在1个细分场景做到"行业最好",再横向扩张

Part.08

|产品不只是屏幕上的像素
演讲结束前,Jake说了句心里话:
"Your product isn't just the pixels on the screen. It's the human interactions with your support, customer success, with the founder — it's training, it's everything around it."

你的产品不仅仅是屏幕上的像素。它还包括支持团队、客户成功团队以及创始人本人与客户的所有互动,包含培训,以及围绕产品的一切。

他提到Satya Nadella在同一场活动上说,现在创业公司增长最快的职位是"Deployed Engineer":就是那种会直接坐在客户旁边、帮客户真正用起来产品的人。
这个观察我觉得对出海B2B(外贸同理)尤其重要。你要知道,签单只是开始:客户支付的早期试点 (Pilot) 费用并不是真正的经常性收入,签了pilot(早期试点)之后,你的工作才刚开始。因此,你必须投入大量精力做入职培训 (Onboarding)、客服支持,(Onsite)客户代表、甚至派遣工程师驻场等,确保客户真正把产品用起来;完整的服务体验才是你的产品,而不只是屏幕上的软件界面。很多出海SaaS死在"试了但没用起来"上,不是产品不好,而是没人帮客户把它嵌进工作流。

Part.09

|Q&A里三个值钱的问答(供参考)
Q:有竞争对手的赛道还要不要进?
Jake说:完全不用管。大多数赛道大到不可能只有一个赢家,而且你去建了之后,会发现竞争对手比你想象的差很多。他额外说了一个选市场的角度看哪些工作是企业愿意外包到海外的或外包公司;愿意外包代表他们不觉得这是核心业务,AI替代的阻力会小很多。
Q:从种子轮到C轮,你每个阶段该聚焦什么?
他说"该做的"和"我实际做的"是两回事。该做的:每个阶段都应该聚焦在"做出好产品、达到产品市场契合(PMF)"。他实际做的:被各种HR、融资、营销议题分散了精力。他说那些事本身没错,但都应该是服务于"做出好产品"这一件事的手段,而不是目的本身。
Q:基于通用模型的产品,怎么建护城河,不沦为GPT wrapper(套壳)?
他的回答只有一句话:不要害怕成为“GPT Wrapper(GPT套壳)”,去建就好了,建完后你就知道为什么别人很难复制。因为真正的护城河在于你构建它所付出的苦活。当你跑通了复杂的工作流、海量的数据整合、极度精细的 Prompt 打磨、流程验证、以及数千次的 Evals 测试后,你会发现这其中极高的壁垒,竞争对手根本无法轻易短时间内复制你的成果。

Part.10

|出海三视角
  • 外贸B2B
如果你在做报价、询盘处理、合规文件相关的AI工具,Jake的"Replace定价逻辑"直接可参考:你的竞争对手不是同类软件,而是"原来这件事雇人做的成本"。把定价参照物换掉,很多时候定价空间可以高5-10倍。
  • 跨境电商/DTC
AI客服、产品描述生成、评论分析..., 这些都是高频接触消费者的节点。没有eval体系就上线,等于在消费者端做公开测试,每一次错误输出都在消耗品牌信任。在流量贵的欧美市场,这个成本很难算清楚。
  • 企业出海/SaaS
Jake说的"pilot不等于ARR",是现在出海SaaS最真实的危险信号。如果你的收入里有大量6个月以内的pilot,要认真问一个问题:这些客户在pilot结束后,有多少个真正把你的工具嵌进了日常工作流?没有答案,就说明你现在做的不是续签,是在赌运气。

Part.11

|五个自问自答
发布前,不如先问自己这几件事:
  1. 我在做的是Assist、Replace还是Unthinkable?定价逻辑对应上了吗?
  2. 我有没有真正写下来"这个职业的人是怎么一步步完成这个任务的"?
  3. 我的核心prompt,有没有100个测试用例?通过率是多少?
  4. 我问过客户"你希望怎么付费"吗?还是自己猜的?
  5. pilot阶段,我有没有人负责坐下来帮客户真正用起来,不是发邮件,而是真的在客户身边(Onsite)?

留言互动交流:
你现在做的产品,属于Jake说的哪一类:Assist、Replace还是Unthinkable?如果你觉得自己做的是Replace,定价逻辑用的是哪个参照物?欢迎评论区留言交流。

【版权与转载声明:本文内容基于Jake Heller在YC的AI创业课上的演讲分享并结合个人判断和出海场景的公开数据整理。观点归属原作者。欢迎转发朋友圈与社群。封面图来源于网络,如有侵权请联系删除。】