ARTICLE · 1078115
刘勇 AI 创业投资课程(北大)
PPT 文字提取
来源链接:https://www.xiaohongshu.com/discovery/item/6ab4b7120000000018010515
第1页
互联网大年:1995;移动互联网大年:2010
问题:为什么比尔·盖茨和乔布斯都生于 1955 年?
SEQUOIA CAPITAL
“Bet on the racetrack, not the jockey.”
《孙子兵法》:善战者,求之于势,不责于人。
选择大于努力:赛道选择 > 个人能力
一流赛道 + 三流创业者,成功概率高于二流创业者 + 三流赛道
势,先于人。
赛道为王
红杉资本的投资真言
第2页
How 的通用框架需要满足什么标准?
一个真正有用的框架,必须同时经得起几项标准的检验。
01 第一性原理
不能只讲故事,必须要用经济学基本原理,回到底层生产要素:资本、能源与劳动力。
(解释变量)
02 能量化、能验证
能落到可比较的变量、阈值与数据,而不是模糊叙述。
(检验关系)
03 跨时代可移植
既能解释历史,也能指导今天的选择,并允许未来证据推翻。
(指导决策)
第3页
Agenda
最终产出是回答:在哪里、为什么现在、下一步做什么。
01 宏观变化
什么能力或生产要素正在快速变便宜?
02 战场优先
同一任务,机器 + 能源何时低于劳动力?哪个地区先跨线?
03 Why Now
哪个模型能力拐点,刚刚改变了成功率、成本?
04 下一步行动
用一项 30 天实验验证最关键假设;提前写下否决条件。
个人简介:Patrick 硅谷 AI,AI 投资人|14 年连续创业者|解读硅谷 AI [无法辨认]
第4页
CHAPTER 01 · MACRO · EXTERNALIZING CAPABILITY
技术史的主线,是人类能力不断延伸的历史
Progress
• transforming material• Stone tools• Bronze tools• Iron tools• 2,000,000 BC—1200 BC• transforming energy• Water power• Steam power• Electric power• Combustion power• 1780—1895• transforming information• Communicating & storing information• Computing information• 1940—2008
被外部化的能力
• 工具 → 改变物质• 能源 → 持续做功• 信息 → 存储、传输、计算• AI → 生成、推理、规划、调用工具、执行动作
技术消灭稀缺;但商业价值的本质是稀缺。
第5页
CHAPTER 01 · KONDRATIEV · SYSTEM DIFFUSION
康波周期:技术只有穿过基础设施和组织,才会成为经济浪潮
历史上的五轮康波周期
• 纺织和蒸汽机技术(63 年)• 钢铁和铁路(47 年)• 电气和重化工业(56 年)• 汽车和电子计算机(43 年)• 信息技术:?
每轮技术体系的共同扩散链:
核心技术 → 基础设施 → 组织/制度重构 → 大规模市场与利润池
AI:信息技术的延伸,还是新周期的起点?
第6页
CHAPTER 01 · FOUR CYCLES
每轮康波周期都是一个 50 年的长周期
三个大特征
本质是能源转换效率,生产力百倍提升 新的大市场出现,生产关系逐渐变化 复苏和繁荣阶段是最好的创业阶段;金融泡沫和崩盘
繁荣 → 衰退 → 萧条 → 复苏
每一次技术革命,都是一次大规模的重新发牌。
第7页
CHAPTER 01 · THREE MECHANISMS
技术革命通过三种机制让普通人离财富更近
增量市场红利内容:消除稀缺后增加了新用户/任务误判:把 TAM 当收入 经验清零效应内容:便宜导致新稀缺(渠道/流量/数据)误判:年轻即正确 资本壁垒降低内容:投入结构分化(原型/获客/算力)误判:以为 AI 创业更轻
结构性创业窗口 = 新需求被创造 × 旧资产失配 × 新投入结构
新公司源于三种经济机制制造的“空位”。
第8页
CHAPTER 01 · DELEGATED TASKS
问题:AI 的增量市场是什么?还是没有增量?
PC核心要素/能力:计算新增单位:计算机商业模式:软件许可
互联网核心要素/能力:分发与连接新增单位:上网用户商业模式:广告/平台/电商
移动核心要素/能力:随时随地连接新增单位:手机商业模式:App/O2O/订阅
AI核心要素/能力:智力新增单位:Agent商业模式:按调用/任务/结果
第9页
CHAPTER 01 · COMPLEMENTS REVALUATION
要素降价不会消灭稀缺,只会重估新的稀缺
机械动力互补资产/新稀缺:能源/机器设计结果:规模化生产
电力互补资产/新稀缺:电网/电机结果:重构工厂
计算互补资产/新稀缺:软件/数据结果:问题定义更重要
互联网分发互补资产/新稀缺:注意力/搜索/支付结果:筛选与履约稀缺
AI 生成与执行互补资产/新稀缺:判断/预测/权限/责任结果:???
关键要素降价 → 新稀缺资产需求上升 → 利润池重组 → 进入战场选择
第10页
CHAPTER 02 · BATTLEFIELD
通用战场优先框架:规模化替代取决于三种生产要素的微观经济
完成同样的任务:
资本(机器)+ 能源 ≤ 劳动力价格(工资)
谁的工资最高 → 最有动力“少用劳动力” → 最容易“多用机器”
当成本差显著且持续 → 规模化 PMF 最先在该战场爆发
技术革命不会平均发生;它先发生在要素价格最先让“技术替人”算账经济的地方。
第11页
CHAPTER 02 · BATTLEFIELD
把通用框架翻译成 AI 创投的两个问题——VC 问的三大经典问题
先判断哪里会跨过规模化阈值,再判断自己能否站在价值发生的位置。
01 · What
规模化 PMF 最先会在哪个战场发生?
比较任务、工资、模型、算力与接管成本。
02 · Why Now — Timing
而我,又该如何切入痛点?
比较切入点、入口、客户关系、数据。
• 战场决定赔率• Timing 决定胜率
第12页
COST COLLAPSE
AI 的宏观拐点:AI 摩尔定律每 12 个月成本下降 10—30 倍,能力翻倍
达到 GPT-3.5 水平(MMLU 64.8)的推理价格:
• $20(2022.11)• $0.07(2024.10)• >280×(约 18 个月)• 对数口径:固定 benchmark 能力
调用价 ≠ 合格结果成本
底层价格下降只是第一步。谁能把下降传导到合格结果成本,谁才有商业窗口。
成本构成:数据 + 工具 + 集成 + 重试 + 接管 + 风险
TOKEN|数据|工具/集成|重试|人工接管|错误/全损
问题:模型接近免费后,利润留给你,还是被客户要求降价?
8 / 45
第13页
CHAPTER 02 · BATTLEFIELD
AI 时代的战场优先框架
完成同样任务,当“模型 + 算力”的真实成本低于“人”的成本,规模化 PMF 才会跨线。
模型 + 算力 + 失败接管成本 < 人的全成本
AI 的规模化 PMF 不是平均发生的,而是先发生在最先跨过“机器 < 人”阈值的任务与地区。
美国 · 第一波
• 高价值白领更贵• 资本、算力与企业软件生态更密集
结论
当前最先跨线:美国的高价值、数字化、可验证任务
AI 创业不是找最大的市场,是首先找最先跨过阈值的市场。
17 / 45
第14页
CHAPTER 02 · BATTLEFIELD
推算过程 1:等式右边——人有多贵?
AI 最先替代的不是“所有工作”,而是程序员、分析师、法务、研究员等高价值数字劳动。
• 美国:$60—150/小时• 中国:$10—40/小时• 同一复杂任务的人类成本:美国约为中国的 3—5 倍
官方锚点 · 美国
• 软件开发者中位工资 $133,080/年 ≈ $64/h• 律师中位工资 ≈ $72.67/h
官方锚点 · 中国
• 信息软件 IT 非私营平均 238,966 元/年• 约 115 元/h ≈ $16/h(2080h、汇率近似)
采纳阈值:美国机器成本压低到约 $60/h 即可触发;中国往往要接近 $20/h,才出现相似 ROI。
18 / 45
第15页
CHAPTER 02 · BATTLEFIELD
等式左边:机器完成复杂任务的真实成本
AI 成本不是 Token 单价,而是完成一个可验收任务的总成本。
总成本 =〔算力成本 + 失败时人工介入成本 ×(1 − 成功率)〕÷ 成功率
一次尝试 → 成功;或失败 → 人工介入/重试 → 合格结果
单位合格结果成本示例
90%成本:2.2×
50%成本:12×
20%成本:45×
10%成本:100×
示例假设:算力成本 = 1,人工介入成本 = 10。成功率从 50% 降到 20%,真实成本从 12× 升到 45×。
20 / 45
第16页
CHAPTER 02 · BATTLEFIELD
同一公式,两套要素价格:软件先看美国,物理自动化再看中国
把同一个任务分别代入两国的工资、机器、能源与部署成本。
人工成本美国:高价值知识劳动更贵中国:工程与交付人力更可得对阈值影响:右边:替代价值
模型/资本美国:私人资本、云与模型生态密集中国:开源、成本工程与快速追赶对阈值影响:左边:机器价格
制造/部署美国:高 ARPU、软件采购成熟中国:机器人、硬件、工厂与服务网络对阈值影响:左边:部署成本
市场/规则美国:责任成本高,预算明确中国:产业场景密集,价格竞争强对阈值影响:风险与规模速度
当前判断:美国更容易先跨过“数字白领”阈值;中国更容易在受控制造任务中降低“机器 + 部署”成本。
21 / 45
第17页
CHAPTER 02 · BATTLEFIELD
“国运”不是赛道答案,而是改变战场的要素
国家条件不替代任务判断;它通过要素价格、基础设施与规则,改变哪类任务最先跨线。
人工成本 → 资本/算力 → 能源与基础设施 → 客户与采购 → 监管与责任
国家条件 → 改变机器成本与劳动力成本 → 改变 PMF 阈值 → 改变创业窗口
美国 · 数字劳动的第一波
• $285.9B(2025 私人 AI 投资)• 5,427 个数据中心;高价值白领工资高
中国 · 物理部署的要素优势
• 54%(2024 全球工业机器人安装量)• 295,000 台;制造密度与供应链完整
第18页
CHAPTER 02 · BATTLEFIELD
成本阈值成立,还要:新……大……快
01 新市场
增量市场
02 TAM 大
Addressable 市场大
03 快速起规模
跨客户复制
任一项不过线:不是“再讲一个叙事”,算账和传统判断标准的结合。
22 / 45
第19页
CHAPTER 03 · WHY NOW
战场优先框架 Timing 版:Why Now
寻找 Driver——真正推动创业窗口打开的驱动力。
供给与需求,看什么?
• 需求:旧而贵的问题一直存在(需求常在,窗口偶开。)• 供给 = 技术:AI 时代,大模型能力是最大的 Driver
所以,创业最佳时机不是由热度决定,而是由大模型能力拐点决定。
Timing 的本质,是等到技术成熟,但不要等到市场成熟。
25 / 45
第20页
CHAPTER 03 · WHY NOW
基于推理步数的能力拐点模型
单步能力的小幅提高,会在长链任务上产生非线性跃迁。
完整任务成功率 = 单步成功率 p 的 n 次方:P(success) = pⁿ
1p = 95%:95%p = 99%:99%
5p = 95%:77%p = 99%:95%
10p = 95%:60%p = 99%:90%
20p = 95%:36%p = 99%:82%
50p = 95%:8%p = 99%:61%
结论:10 步任务,单步从 95% 提升到 99%,端到端成功率从 60% 跃升到 90%。
来源:课程模型;独立步数假设用于数学,实际任务需端到端测评校准。
27 / 45
第21页
CHAPTER 03 · WHY NOW
Claude Code:能力拐点前等了三年,窗口打开后 87 天 Preview → GA
能力拐点可能等待多年,但一旦任务与产品形态跨线,产业反馈会以月为单位压缩决策时间;领先来自预先准备好的任务、产品与重测机制。
2022事件:Anthropic 内部尝试 Claude Code [无法辨认]时机含义:需求和 Idea 已在,能力钟未过线
2024事件:Sonnet 在开发者中成为重要模型,[无法辨认]时机含义:用户、任务和反馈门[无法辨认]
2025-02-24事件:Claude Code 以 limited research [无法辨认]时机含义:Task/Workflow 证据公开收集
2025-05-22事件:Claude Code 随 Claude 4 正式 GA时机含义:Preview → GA:87 天
CASE
如果团队在 2022 年只记录“代码 Agent 没需求”,2025 年仍然不会重启。正确记录应是:需求存在,但哪些能力导致失败?当模型在代码库理解、工具调用和测试闭环上改变时,任务量是否跨[无法辨认]
课堂问题
如果你的战场窗口也只给 87 天,你今天是否已经准备好任务集、设计伙伴、入口和产品形态?还是模型跨线以后才开始研究用户?
CLAUDE CODE|87 days|Anthropic
35 / 45
第22页
CHAPTER 03 · WHY NOW
Coding 率先跨线,不是因为程序员最容易被替代
Coding 同时具备高人工价值、数字化环境、自动 grader、快速反馈、现成 reviewer 与结构性入口,因此比许多知识工作更早跨过[无法辨认]阈值。
V 人工价值Coding 的条件:美国软件开发者 2024 中位年薪 $133,080对规模化的影响:自动化价值上限高
输入/环境Coding 的条件:代码库、issue、terminal、CI 数字化对规模化的影响:[无法辨认]
GraderCoding 的条件:编译、测试、lint、benchmark对规模化的影响:自动验收与重试
反馈速度Coding 的条件:秒到小时对规模化的影响:快速迭代和数据复利
CASE
代码补全只是 Feature;理解代码库、修改多个文件、调用终端、运行测试并进入 review loop,才是更完整的任务战场。模型能力上升时,价值会从“生成代码”向[无法辨认]、评测与工作流控制[无法辨认]
课堂问题
Coding 的六项结构性优势中,你的战场拥有哪几项?缺失项能靠产品设计补齐,还是属于无法绕过的结构性缺口?
MARKET DATA
01 US developer median:$133,08002 2024—34 employment:+16%03 BLS · May 2024
U.S. Bureau of Labor Statistics, Software Developers, 2024 median pay, [无法辨认]
30 / 45
第23页
CHAPTER 04 · APPLICATION
AI 产品经理:可验证性是一个战场结构
可验证性同时降低验收、接管与错误发现成本,并把每次交付转化为结构化反馈;在其他条件相近时,grader 更强的任务是更好的创业战场。
Coding patch主要 grader:编译、unit test、CI、review反馈时间:秒—小时错误可见性:较强
发票/理赔字段主要 grader:规则、对账、后续拒付反馈时间:小时—周错误可见性:中强
法律检索主要 grader:引用存在性、覆盖率、律师复核反馈时间:小时—天错误可见性:中
品牌文案主要 grader:人类偏好、投放结果反馈时间:天—周错误可见性:弱到中
CASE
一个 coding agent 写完 patch 后可以运行 unit tests;失败就重试,通过后再由 reviewer 检查。这使团队能够同时降低交付失败和积累结构化失败样本。相反,[无法辨认]
课堂问题
你的任务今天最接近哪一种 grader:规则、测试、专家复核、延迟业务结果,还是几乎没有?你能否通过改写任务,把反馈从一周缩短到一小时?
31 / 45
第24页
CHAPTER 04 · APPLICATION
AI 产品经理做 Eval:20 个真实失败任务,比 Benchmark 更接近你的战场
创业公司的第一条 AI 资产不是提示词,而是一组能稳定复现客户任务、环境和失败的评测集。
必须记录
• Task:用户目标、输入、限制、合格标准• Environment:工具、权限、状态、版本、异常• Grader:规则、单元测试、模型、专家、业务结果• Failure taxonomy:能力失败、工具失败、权限失败、状态失败、风险违规
CASE
法律合同 Agent 的任务集不能只放十份标准合同,还应包含扫描质量差、条款冲突、权限不足、附件缺失、跨语言和必须展开专家级失败样本。否则高分只证明在闭环场景优化。
课堂问题
如果今天必须判断这个战场是否可运营,你会用哪 20 个任务测量?其中哪三个失败会直接否决上线?
33 / 45
第25页
CHAPTER 04 · APPLICATION
AI 产品经理:如果代码环节快 4×,组织吞吐为什么可能只快 1.43×
AI 每解决一个局部瓶颈,价值就向没有同步提速的相邻环节迁移;创业者不仅要看模型刚刚替代了什么,更要计算它在系统里新制造了什么稀缺。
CodingAI 前:40AI 后(相对时间):10AI 后占比:14%
其他非并行环节AI 前:60AI 后(相对时间):60AI 后占比:86%
总周期AI 前:100AI 后(相对时间):70AI 后占比:—
被 AI 加速的供给|新暴露的瓶颈|可能形成的 AI-native 战场
CASE
如果创业者只看到“代码更便宜”,最直觉的反应是再做一个代码生成器;但系统利润池可能已经转向更难的相邻环节:该定义正确规格,该证明 patch 安全,该管理 Agent 权限,该清理 AI [无法辨认]
课堂问题
如果你的产品真的把目标环节提速五倍,客户流程中哪一个环节会先被压垮?谁为这个新瓶颈负责,预算又会从哪里迁过来?
32 / 45
第26页
CHAPTER 04 · APPLICATION
AI 产品经理之冲浪三天法
为下一代模型做产品
测量今天,重估昨天,预测明天
P 太低/长链失败新模型可能改变吗:高触发事件:新模型、工具、context、harness重测方法:固定任务集多次 trials
推理或延迟太贵新模型可能改变吗:高触发事件:降价、缓存、本地部署、量化重测方法:重算 R 与 Cq
[无法辨认]太重新模型可能改变吗:中触发事件:新 UI、自动恢复、低置信路由重测方法:影子测试测 H
AI 产品经理的核心是需求曲线和能力曲线的交点。
36 / 45
第27页
CHAPTER 04 · APPLICATION
Cursor 证明了 Coding 战场,“复制 Cursor”呢?
Cursor 的增长证明开发预算大规模迁移到 AI,但其从编辑器到 Agent、模型与算力整合的路径说明:后来者不能只复制功能,必须选择仍可控制的任务入口或结果责任。
2025-01可核实事件:Cursor 官方称 recurring revenue [无法辨认]它证明什么:Coding 用户开始大规模付费它不证明什么:收入为审计 ARR
2025-06可核实事件:官方称 ARR 超过 $500M,覆盖超过半数 Fortune 500 [无法辨认]它证明什么:企业预算与分发显现跨线它不证明什么:任意代码助手都可复制增长
2026-03可核实事件:Bloomberg 报道 annual sales [无法辨认]它证明什么:品类进入高速规模期它不证明什么:严格可比的年度账面收入
2026-08可核实事件:Cursor 官方宣布被 SpaceX 收购它证明什么:模型、算力、产品入口进一步垂直整合它不证明什么:独立创业入口已经消失殆尽
CASE
一个团队准备做“面向所有开发者、支持所有语言、比 Cursor 更懂上下文”的新编辑器。如果没有独占分发、专有代码环境、结果责任或结构性成本优势,那么 Cursor 的增长不是它的利好,而[无法辨认]
课堂问题
如果 Cursor、基础模型和现有 IDE 明天都免费加入你的核心功能,客户仍然必须购买你的三个理由是什么?其中哪个理由已经有证据?
MARKET SIGNAL
01 Jan 2025:>$100M ARR02 Jun 2025:>$500M ARR03 >50% of Fortune 500
38 / 45
第28页
CHAPTER 04 · APPLICATION
Abridge:医疗 Vertical AI 的壁垒在证据、入口与责任闭环
医疗文书的价值来自“可签字结果 + 医生复核 + EHR 入口”,但专科异质性说明不能用总体平均值替代任务选择;深工作流是壁垒,也是责任与实施成本。
每次就诊 notes 时间使用前:6.2 min使用后:5.3 min结论:调整后约减少 0.91 分钟
写文书 mental demand使用前:12.2使用后:8.3结论:认知负荷显著下降
hurried/rushed pace使用前:13.2使用后:8.4结论:时间压力显著下降
写文书 effort使用前:12.5使用后:7.4结论:努力程度显著下降
CASE
同一套 ambient AI 在全科医生那里可能显著减少文书压力,在神经科却因专科体格检查格式不匹配增加修改。若团队只看总体平均值,会把专科差异误判成销售执行问题;真正的战场选择是把任务、模[无法辨认]
课堂问题
如果把任务从“整理笔记”扩展到“建议 order 或临床行动”时,哪一条原来成立的假设必须重新验证?谁拥有否决权与最终责任?
CLINICIANS
Clinically Useful and CompliantAI Notes—In Real Time
ABRIDGE
03 47% capacity for 1 more visit
39 / 45
第29页
FIVE VARIABLES
中美 AI 竞争,0—1 vs 1—10,五个变量的组合
FRONTIER MODELS美国/硅谷:顶尖模型、数据中心与资本领先中国:能力差距快速收窄,开源活跃
AI TALENT美国/硅谷:全球顶尖人才与研究网络中国:大规模工程人才与产业人才
RISK CAPITAL美国/硅谷:超大额私人资本、并购与美元退出中国:私人资本较弱,政府与产业资本更重要
MARKET美国/硅谷:高 ARPU · 全球 SaaS 开发者生态中国:超大市场 · 强竞争、多行业场景
PHYSICAL WORLD美国/硅谷:软件 · 云 · 芯片设计强中国:制造 · 供应链、机器人部署强
2025 美中私人 AI 投资
$285.9B vs $12.4B|模型性能差距已基本收敛
08 / 24