乐于分享
好东西不私藏

软件的出路在哪?为什么钱"死死"地锁在硬件里?

软件的出路在哪?为什么钱"死死"地锁在硬件里?

hi,我是Jacqueline

AI 的价值如何沿产业链分布、当前卡在哪一环、以及最终谁能在这场竞争里活得更久更好?

贯穿主线越往上游越确定、越被垄断;越往下游越弹性、越不确定。整条繁荣目前都押在同一个尚未兑现的赌注上——应用层能否把 AI 变成可持续赚钱的生意。技术只提供可能性,能否兑现,取决于组织本身愿不愿、且有没有能力被重塑。

一、AI 产业链的三层结构

可以把 AI 技术栈大致分为三层。一个关键的经济学规律贯穿其中:确定性与弹性成反比——越上游越确定、越集中、越垄断;越下游越弹性、越分散、越不确定。

层级

代表

特征

竞争格局

上游:算力/芯片

英伟达、台积电、自研芯片

资本密集、技术壁垒极高

高度垄断,玩家极少

中游:基础模型/云

OpenAI、Anthropic、Google;AWS/Azure/GCP

训练成本动辄上亿美元

快速收敛到少数几家

下游:应用层

法律、客服、编程、设计……

门槛低、场景碎片化

百花齐放,最繁荣也最残酷

背后的经济学原因:上游是重资产 + 规模经济 + 赢家通吃(谁的芯片/模型领先一代,需求就向他集中);应用层是轻资产 + 场景碎片化(每个细分需求都不同,容得下很多小玩家)。

应用层「扎堆」恰恰意味着「不安全」

应用层创业多,不等于好赚。正因门槛低,它两头受挤压:

上面被模型厂商「顺手做掉」:模型每升级一代,就可能吃掉一批套壳应用的生存空间(所谓「被下一代模型干掉」的焦虑)。

下面被同质竞争拖入价格战:无数相似产品互相压价。

关键真正能活下来的应用层公司,往往不是赢在 AI 本身,而是赢在 AI 之外的东西——独家数据、行业 know-how、客户关系、工作流嵌入。AI 降本是门票,不是奖金。

软件定价被冲击:老软件的护城河变浅

传统 SaaS 的定价逻辑(按席位/按月订阅)正在被 AI 冲击,原因有二:

1.价值锚被打乱:过去软件按「多少人用」收费,AI 做的是「替代人干活」。若一个 AI 顶 10 个人,该按席位还是按「省下的人力」收费?定价基准从「工具使用权」变成「工作成果」,商业模式的锚都在重定——这就是「软件定价非常难」的根源。

2.护城河变浅:很多老软件的价值在于把某业务流程的模块固化了。AI 让「重做一个这样的模块」的成本骤降,于是涌现一批创业公司专门用 AI 平替老软件最赚钱的模块。存量厂商有客户、数据、渠道但背历史包袱;新厂商轻快、AI 原生但缺信任与规模。鹿死谁手,现在下不了结论。

二、算力的两种需求:训练 vs 推理

模型厂的算力需求分为训练和推理两类,二者的经济学性质截然不同。

一个贴切的类比:训练是「建厂买设备」(资本开支 CapEx),推理是「工厂开工的电费与原料」,同时也是收入的发生点(运营开支 OpEx)。

维度

训练(Training)

推理(Inference)

类比

生产工具 / 建厂买设备

生产力 / 开工运营

成本性质

一次性、前置、有界的资本开支

持续、随用量线性增长的运营开支

与成功的关系

花掉就花掉了(沉没成本)

产品越成功、用户越多,烧得越多

收入关联

不直接产生收入

价值实现/变现的环节

关键的不对称这与传统软件相反。传统软件造好后,多一个用户的边际成本几乎为零;但 AI 多一次调用就实打实多烧一份推理算力。所以 AI 的「生产力」端不是免费规模化的——用得越狠越烧钱。这是理解模型层困境的核心。

需求主体已经反转:推理超过训练

最近一年最重要的结构性变化,是推理已经反超训练,成为算力需求的主体:

2026 年,推理约占全部 AI 算力需求的三分之二,而 2023 年只占三分之一——这个反转是 2026 年 GPU 需求的决定性驱动力。

推理市场预计 2026 年超过 500 亿美元,首次比训练算力市场增长更快。

更激进的预测:2026 年推理需求将超过训练 118 倍;到 2030 年推理可能占总 AI 算力的约 75%。

含义:训练需求是一次性、集中的(主要是模型厂训下一代);推理需求才是细水长流、可持续的,而它只能来自应用层的真实使用。

三、关键价格数据与「背离」

把 token 价格(下游产品)和算力价格(中游成本)放在一起看,2026 年出现了一个关键背离,它是理解整盘棋的钥匙。

Token 价格:断崖式下跌(数据截至 2026 年中)

档位

代表模型

价格(每百万 token,输入/输出)

前沿推理

GPT-5.4 Pro 等

最高约 $30 输入

主流生产

GPT-5.4

$2.50 / $15

主流生产

Claude Sonnet 4.6

$3 / $15

低成本

DeepSeek V3.2

$0.14 / $0.28

极低成本

GPT-4.1 Nano

$0.10 / $0.40

整体跨度从 $0.10 到 $30,差约 150 倍。趋势上:

2025 年初到 2026 年初,LLM API 价格约下跌 80%(GPT-4o 输入从 $5 降到 $2.50)。

拉长看,GPT-4 在 2023 年初是 $30/百万输入 token,等效能力现在约 $2.50,不到三年降 12 倍

最尖锐的口径(a16z「LLMflation」):同等性能推理成本每年降约 10 倍,三年降约 1000 倍($60 → $0.06 / 百万 token)。

算力价格:长期暴跌,但近一年反涨

GPU 租赁单价的曲线,出现了和 token 价格不同的走向:

长期暴跌:H100 从 2022 年的 $7–10/小时以上,到 2025 年底在非超大规模厂商处普遍跌到 $2–4/小时。

近一年反涨:H100 一年期合约租金从低点 $1.70 涨到 2026 年 3 月约 $2.35/小时,自 2025 年 10 月涨了近 40%。

新一代分流:B200 租赁指数 2026 年 3 月单月涨 24%,而 H100 几乎没动。

云厂商提价:AWS 在 2026 年初把 GPU 实例(实际用于 ML 的 Capacity Block)价格上调约 15%,打破云资源二十年来的通缩规律。

背离的含义Token 价格(产品)在暴跌,但算力(成本)近期在涨——这说明 token 降价不是因为成本降了,而是模型厂在用价格战抢市场、靠效率优化硬扛。

换句话说:单位推理价格 ↓↓↓,推理总开支 ↑↑↑,推理硬件租金 ↑。

这是非常反常识的,按常理新卡出来、老卡(H100)该降价,但H100租金不跌反涨——因为整个算力供给盘子被需求和基础设施瓶颈绷紧了,老卡的富余产能也被吸收掉了

租金反涨 = 需求端三股力量(真实推理 + 训练竞赛 + 预期性囤货)同时拉动 × 供给端被基础设施物理瓶颈(电力、数据中心、配套)卡住,两头收紧的结果。

陷阱:推理暴涨 ≠ 应用层在赚钱

一个极易踩的推论是「推理算力暴涨 = 应用层开始付费了」。

方向有理,但中间断了一环,这一环正是整个泡沫争论的核心。

「推理用量暴涨」只证明「有人在大量调用」,没说明「调用者自己赚不赚钱、付的钱够不够覆盖成本」。

事实上,对任何有真实生产流量的团队,推理成本会在上线几周内就超过训练成本——推理暴涨很可能恰恰是应用层在「烧钱」而非「赚钱」。

更要命的机制:cost-per-token 取代 FLOPS 成了决定 AI 公司生死的 KPI。

若推理成本 $1、收 $2,毛利 50%;成本降到 $0.40,同样定价毛利 80%,或者把降出来的空间用于降价换用户

于是所有人都在「降价换用户」,推理单价暴跌带来的利润空间又被价格战吃回去了。

正确判读推理算力暴涨证明的是「AI 被大规模使用」(usage),不直接证明「AI 在可持续赚钱」(monetization)。usage 是必要条件,不是充分条件。

真信号不在算力价格,而在应用层公司的毛利率转正且可持续、续费率、客户愿不愿涨价、单位经济(LTV/CAC)是否健康。

四、算力的三条成本曲线

「算力成本」其实不是一条曲线,而是三条走向不同、甚至相反的曲线。

把它们分开,才能解释上一节那个核心背离——为什么模型厂能一边付着上涨的租金、一边把 token 价格砍掉 80%。

曲线①:GPU 租赁/采购单价(供需驱动,U 型)

这是大多数人说「算力成本」时默认指的那条——租一张卡、买一张卡多少钱。它的形状是 U 型右半段:长期暴跌、近期被需求顶回去,驱动力是供需而非技术。

H100 租赁:发布初期(2022–2023)每小时 $7–10 以上,一度超 $12;2025 年底跌到 $2–4;2026 年近一年反涨,一年期合约从低点 $1.70 涨到约 $2.35,自 2025 年 10 月涨近 40%。

H100 采购:新卡 $25,000–40,000/张;二手从 2023 年峰值的约 $40,000 跌到 $6,000–22,000,跌了约 85%

新一代分流:B200 租赁指数 2026 年 3 月单月涨 24%,H100 几乎没动;AWS 把 ML 用的 Capacity Block 提价约 15%。需求在往新卡迁移,同时整体趋紧。

曲线②:单位有效算力成本(换代驱动,陡降无反弹)

同一张卡的租金可能在涨,但「每单位真实计算能力」的成本一直在降——因为新芯片每瓦、每美元能干的活越来越多。

这条曲线没有反弹,因为它由技术换代驱动,而技术只往前走。

锚点:在 H100 上跑推理,比在 B300 上贵约 11 倍。同样的推理任务,换代硬件让单位成本掉一个数量级——这正是「H100 在某些推理任务上经济性过时」的原因。

曲线③:每百万 token 成本(三重叠加,最陡)

这是终端最关心的「算一次要花多少钱」,也是降得最猛的一条。

锚点:GPT-4 等效性能,2022 年底每百万 token 约 $20,2026 年约 $0.40;a16z「LLMflation」口径为每年降约 10 倍、三年约 1000 倍($60 → $0.06)。

它为什么比前两条都陡:因为它 = 硬件效率提升(曲线②)× 软件/推理优化 × 模型架构改进,三重下降叠加的结果。

三条曲线的关系:背离的根源

曲线

驱动力

近一年走向

形状

① 租赁/采购单价

供需

反涨(H100 +40%)

U 型(长跌近涨)

② 单位有效算力成本

技术换代

持续陡降

单调下行

③ 每百万 token 成本

换代×软件×架构

持续最陡降

最陡下行

结论租金(①)近期在涨,但单位算力成本(②)和每 token 成本(③)仍在陡降。所以模型厂能一边付着上涨的租金、一边把 token 价格砍 80%——靠的是②③的陡降在补贴①的上涨。

脆弱点也在这里:一旦技术换代的降本速度(②③)追不上需求推高租金的速度(①),价格战就撑不住,繁荣就面临重新定价。

五、谁最难受,与「卖铲子」逻辑

模型层:两头烧钱,利润难兑现

模型层被两件事同时挤压:一头训练是停不下来的军备竞赛(不烧就被甩开),另一头推理在打价格战(赔本降价抢市场)。

那是不是「算力的利润没兑现」

校正算力的利润正在兑现,而且兑现得很好,只是兑现给了上游(英伟达卖卡)和中游(云厂商租算力),不是模型层自己。

模型层是唯一「把别人的利润当成自己成本」的环节:向上游/中游付钱买算力(成本),向下游收 token 费(收入),而付出 > 收回。

它最危险,但不一定最「难受」。

而且模型层不是铁板一块:头部(OpenAI、Anthropic、Google)是「主动的、构筑护城河式的烧钱」,有规模、有最强模型、有云巨头深度绑定甚至注资,烧得起还在挤死对手;中小模型公司是「被动的、追赶式的烧钱」,才是最难受、最可能出局的。

模型厂「利润可能一直无法兑现」成立吗?

可能成立:若 AI 应用始终找不到「用户愿持续付高价」的模式,模型层收入永远追不上「训练+推理」成本,而推理还随用量线性增长,就是「越成功越亏钱」的死结,靠资本输血直到输不动。

不能跑出可持续的真实付费需求,模型层就是下一个烧光钱的共享经济

可能不成立:历史上重资本新技术(电力、铁路、云计算本身)都经历过「先疯狂烧钱、利润延迟兑现、中间一地鸡毛、最终少数赢家通吃」。

AWS 早期也亏了多年,后来成了利润奶牛。若 AI 重走此路,现在只是兑现前的必经阶段。

结论:模型层当前烧钱不盈利,本身不能证明它「一直无法兑现」——重资本行业早期都这样。胜负手仍是应用层能否跑出可持续的真实付费需求。

资本的「卖铲子」逻辑:钱锁向硬件

「大部分资金宁愿把钱锁死在硬件上,越不愿押注中下游」——这个判断被数据强烈支持,是聪明钱逻辑:

硬件需求是确定的、当下兑现的:无论哪个应用/模型赢,只要 AI 在被使用,推理就要消耗算力。这是经典「卖铲子」——淘金者谁赢不知道,卖铲子的稳赚。

中下游回报是不确定的、押未来的:谁能跑出可持续模式,现在没人知道。

是租?是买 ?是公有?是私有?是混合?是垂直?是通用?

但有一个风险前提「卖铲子稳赚」的前提是「淘金热本身得持续」。

若应用层最终大面积证明赚不到钱,淘金者撤退,连铲子需求都会断崖。

硬件的「确定性」是相对的——它在淘金热里最确定、最后才倒下,但不能独立于淘金热而存在。

铲子需求的尽头,仍连着应用层能否赚钱这个总开关。

六、AI 替代与公司存续

多人对AI 的认识都停留在软件层面上,我个人认为如果AI 一定要从计算机行业的角度来定义,是一种更接近软件跟操作系统之间东西,但是训练+推理本质上是一种学习能力,是计算机无法天然习得的。

理论上来说AI 可以替代大部分的白领工作,如果物理AI 大面积应用后,也可也替代很多蓝领工作。

这在历史上是可以约等于甚至超过蒸汽机时代的benchmark。

现代意义上的科层制大公司(职业经理人、多事业部制、有限责任公司的大规模运用),主要是19世纪中后期铁路公司、之后20世纪初通用汽车那套"事业部制"成型的,满打满算150年左右。

从历史尺度看,这其实是个相当年轻、且和特定技术条件绑定的制度——它是为"信息靠纸质文件和电报传递、决策必须集中、协调成本极高"那个时代设计的。

一旦底层信息技术变了(先是计算机和互联网,现在是AI),这套上层建筑没有理由永远不变。

所以大公司组织形态会被AI技术重塑,因为AI 会完全改变信息/决策/执行整套科级流程,AI的底层逻辑是扁平化的,垂直的。

传统公司是科层的,两者根本张力。

应用层的爆发取决于公司有没有勇气和组织能力真正重构工作流程,而非把 AI 当装饰。敢替代=敢动组织结构(压缩部门、重画汇报线、让 AI 接管整段流程)。

在存量竞争里,成本结构的代差就是生存能力的代差。当然替代不是大面积盲目的裁员。

若 AI 工具人人买得到,降本会被竞争迅速传导成降价,好处流向消费者而非利润。你砍一半、对手也砍一半,在更低价格上继续厮杀,行业价格中枢被打下去,谁也没多赚。可被复制的替代动作只是入场券,不是超额利润。

替代执行层问题不大;但若把积累 know-how、培养判断力、孕育创新的人也替代了,可能赢了这轮成本战却失去下一轮创新能力。AI 擅长「已知问题的高效执行」,不擅长「定义新问题、做反共识判断」。

替代什么、保留什么,才是真功夫。

能精准判断哪些环节该被 AI 替代、并有组织能力真正完成重构、同时守住 AI 之外护城河的公司,会活得更久更好。

「愿意替代」只不过是第一步

胜负手

问的是什么

做不到的后果

判断力

该替代什么、该保留什么

替代错环节,掏空能力或砸业务

执行力

重构能否在真实业务落地

demo 很美,上线即崩,被迫回退

护城河

降本之外还剩什么别人拿不到

陷入通缩陷阱,全行业卷没利润

四类公司的分化

A.愿替代 + 做对:真正赢家。降本是门票,护城河是奖金。

B.愿替代 + 做错:最危险的激进者,可能死得比观望者更快。

C.不愿替代 + 有壁垒:靠 AI 之外的护城河暂时苟住,长期温水煮青蛙。

D.不愿替代 + 无壁垒:大概率缓慢衰落。

即使公司用了AI 之后,是不是还有别人复制不了的东西。

AI 替代是这一轮竞争的地板(不做就掉下去),不是天花板(做了就飞起来)。

写在最后

把五部分串起来,是一条完整的因果链:

上游(英伟达) 确定性最强、已兑现;中游(云) 靠训练需求+军备竞赛预期先爆发、收入已兑现,但可持续性悬在下游头上;下游(应用) 最热闹、创业最多,却是唯一还没兑现、却决定全链成败的一环。

现在软件定常难,因为大面积AI应用层抢着取代原有软件老登股的应用模块,这里面的生意会打的昏天黑地

不只是短期价格战,是商业模式、定价逻辑、市场份额的全面洗牌。

token 价格暴跌(约 80%)与算力价格近期反涨(H100 涨约 40%)的背离,精确暴露了矛盾:模型厂在赔本降价拼命刺激下游用量,而支撑它们的算力成本却在涨。

这种状态不可持续——要么应用层尽快跑出可持续付费需求,要么这波建立在预期上的繁荣面临重新定价。

一句话这盘棋的胜负手在应用层能不能「打赢」;而「打赢」不是某个应用打败老软件,而是应用层整体能否把 AI 变成可持续赚钱的生意,从而把上中游的巨额投资从「预期」兑现成「现实」。技术只提供可能性——能否兑现,取决于公司制度本身愿不愿、且有没有能力被重塑。

免责声明

本文件为宏观研究讨论记录,不构成任何形式的投资建议。所有持仓分析、情景模拟及价格数据均为讨论参考,

投资决策请结合自身风险承受能力并咨询专业持牌顾问。

以上仅仅基于自我持仓的常规审查

亮【赞和在】,让爱流向你

关于我

关注自身成长与发展的30+女性,定期分享干货和小故事,不卖课,不卖货,持续更新,你的点赞关注是我的最大动力