ARTICLE · 1050370
AI基本面的右脚:从能力进步到ARR兑现
🎯 8月底《基本面的左脚已经伸出来了》讲的是I(投入),这篇讲R(回报):模型侧的进展连起来看,收入的形成概率、规模与兑现速度正在变得具体——最终的确认,是ARR数字。
▍核心结论
•RSI抬高能力斜率:Anthropic研发自动化指数从3月的1%升至8月的26%,5月起加速;人均日代码合并量2026年Q1/Q2达此前均值的5.8倍/8.0倍。
•复杂任务追平简单任务:开放式任务成功率从2025年8月约26%升至2026年9月初约91%——这是用户敢把完整任务交出去的基础。
•场景在coding之外扩散:金融(OpenAI/Anthropic/Kimi三连发)、法律(专业配置正确率54.0% vs 通用38.7%)、3D(代码操纵场景+渲染反馈)提供新的渗透路径。
•Jev决定任务边界:强模型管复杂推理、专门模型管重复判断(TypeSafe输入0.042美元/百万token),交付成本下降才让长尾任务算得过账。
•Muse把持续委托推向C端:Meta给个人Agent配云端环境与记忆,推理需求的观察单位从月活转向"每用户有效任务数"。
•ARR放缓不等于逻辑破坏:目前ARR主要反映coding渗透,8-9月放缓是单一场景渗透率的体现;模型进步传导到行情存在时间差,下一个锚定物是新场景的财务兑现。
一、从左脚到右脚:R的路径正在成形
左脚确认的是未来投入,右脚要回答的是这些投入最终能做成什么。最近把模型侧的进展连起来看,未来R的路径变得更具体了。目前看到的是前瞻指标,最终的确认要落实到ARR数字上。
最近的变化串起来:RSI提高后续智能进步的可能速度 → 金融、法律、3D扩大可交付的工作 → Jev改善部分任务的经济性 → Muse尝试把持续委托推向C端。模型能力、任务渗透和商业转化,正在沿着不同环节往前走。
二、RSI:AI研发AI,能力斜率可能改变
RSI影响的是未来模型进步的斜率。AI参与研发AI,意味着"模型更强 → 承担更多研究与工程任务 → 有效实验更多、迭代更快 → 帮助下一代模型进步"的反馈链可能形成。对投资来说,如果这个反馈持续成立,就需要重新评估未来能力出现的时间,以及能力兑现到R的速度。
Anthropic周五的文章给了几组关键数字:
•研发自动化指数:AI主导、人在旁监督的工作占比,3月至8月依次为1%、3%、12%、14%、22%、26%——很显然从5月开始加速。
•人均产出:人均日代码合并量2025年以前较平稳,2025年以后抬升,2026年Q1、Q2观测值达到此前均值的5.8倍、8.0倍。代码数量不等于有效研究成果,但这提示人的工作正在转向提出目标、检查结果和组织并行任务。
•复杂任务成功率:开放式任务成功率从2025年8月约26%,升至2026年9月初约91%;未成功比例从74%降到9%,下降约88%。这解释了为什么用户敢把更完整的任务交出去。



OpenAI一侧看使用强度:每位研发员工每日估计Agent输出从2月1日约4.08万token升至8月15日约72.28万,约17.7倍;7月单月增加约31.47万(6月仅约4.98万),后段绝对增量明显放大。但同期人均实验数量只从1月初的0.72倍升至8月中旬的1.60倍——"使用更多"到"产出更多"之间仍有转化环节。

国产一侧看硬件效率:智谱披露,GLM-5.3驱动的Infra Agent参与GLM-5.3-Flash在十万卡以上国产芯片集群的适配和推理系统优化,不到两周达到生产可用,吞吐达初始基线约3倍。经济意义在于:同一批硬件可以承载更多有效任务,国产算力的软件适配与使用效率更快改善。
三、场景扩散:金融、法律、3D
模型能力正在寻找coding以外的兑现路径。三个方向性质不同:金融和法律更接近已有专业预算里的任务渗透,3D更多是交付物扩展与新生产流程的探索——都增加R的可能性,但商业成熟度和兑现时间不同。
金融产品九月中旬三连发:9月10日OpenAI发布金融服务版,先面向投行与股票研究;9月14日Anthropic推出财富顾问产品,把托管、组合、CRM和会议工作连接起来;9月17日Kimi发布金融行业解决方案。切口不同,共同点是把数据、工具和交付放进日常工作,场景从研究扩展到客户服务。
金融和法律有一笔容易算的账:专业劳动贵、重复准备工作多、交付物明确。数据整理、底稿、合同初审、会议准备既耗时间,又有资料和规则可辅助检查。AI不必一次完成整个职业,先稳定承担其中一段就有付费价值;错误成本高意味着复核不能省,应衡量包含返工和人工检查的总成本。
专业环境开始补齐:OpenAI法律版在200道美国法律研究问题的内部评测中,同样使用Astra,专业配置正确率54.0%、通用搜索方案38.7%,提升15.3个百分点——能力兑现还可以来自配套环境改善;54%也提示了当前的适用范围和复核要求。
3D的重点是编码+视觉反馈服务新交付物:OpenAI展示了Astra配合Blender、Unreal Engine创建并修改建筑场景;Gemini 3.8 Flash展示了3D游戏和交互式三维内容。模型借助代码操纵场景、再根据渲染结果继续修改,已有的编程与工具能力有了新的应用出口。
各家重视3D,有直观展示能力与对应付费生产活动(游戏、美术、建筑可视化)两层原因,更长远看它是空间内容与交互的入口。但操作3D软件、原生3D生成、理解物理规律的世界模型是不同层次——好看的演示,仍需经过可编辑性、稳定性和生产精度的检验。
四、Jev:成本结构决定任务边界
模型变强决定能做什么,任务成本下降决定多少工作值得交给它。金融、法律、3D的工作流里并非每步都需要最强模型:复杂推理之外,还有大量分类、字段提取、路由、评分和检查,这些步骤能否便宜、快速地完成,决定整条工作流能否算得过账。
TypeSafe的Jev提供了一条分工路线:面向结构明确的决策任务,输出预设类型的结果与置信信息,输入价格每百万token 0.042美元、输出免费。类型正确不等于判断正确,价格可持续性也需验证,但启发清晰:强模型承担复杂问题,专门模型承担大量重复判断,不确定的问题升级处理。
要注意,客户的账是包含调用、工具、失败重试、数据授权和人工复核的交付成本。成本降低可能让低频客户、小机构和长尾任务开始采用AI;竞争也可能把节省的价值让给客户。因此使用量增长、模型收入增长和利润增长,要分别判断。
对算力投资也要多问一句:新增任务量能否超过单位消耗的下降。Jev路线若有效,可能改变不同模型、不同硬件的需求结构;应用经济性改善会扩大需求空间,但总算力需求与各环节利润还取决于需求弹性、价格、利用率和竞争——不能从效率提高直接推到所有硬件都受益。
五、C端Muse:持续委托走向普通人
Meta的Muse给个人Agent配置持续运行的云端环境、记忆和账户连接,用户离开对话后任务仍能继续推进,重要操作保留授权。值得观察的是:普通用户能否把每天的真实事务反复交给AI。
C端空间来自人群和频次,难点是信任、留存与付费。专业用户容易计算节省的工时,普通人更在意是否省心、是否可靠。Muse若能降低使用门槛,可能扩大委托任务数量;若经常需要接管,用户又会退回聊天。要看连续使用、成功完成任务、人工介入和付费转化,才知道后台运行的成本能否换来足够价值。
这也让推理需求的观察单位发生变化:以后除了月活,还要看每个用户委托多少有效任务、每项任务运行多久、完成结果创造多少价值。Jev式的分工与降本,也可能帮助这类长时间运行的系统改善经济性。
六、如何理解加速与ARR放缓
复盘对投资影响最大的两次模型进步:第一次是GPT的O1,24Q3发布;第二次是Anthropic的Opus 4.5,25年11月发布,行情在26年3月启动。一个模型对产业的影响,需要给产业时间去尝试,这里存在时间差。
目前的ARR反映的还是coding,所以8月、9月的放缓,是coding渗透率的体现。新模型、新场景、新能力,甚至产业链上的价值重新分配,都需要时间验证。接下来会有新的锚定物来体现新的影响。
把变化串起来:右脚对应的是未来R的形成概率、规模和兑现速度——RSI让我们重新评估能力进步;金融、法律、3D提供新的任务与渗透路径;Jev探索更低的交付成本;Muse扩大个人委托的可能人群。这几条线相互影响,后续模型升级也有机会通过已经接好的数据和工具,更快进入产品。
右脚已经伸出来,后面要看踩得有多实——就是逐步在ARR等财务数据上体现出来。
⚠️ 免责声明:本文为公开研报及网络资料的整理与个人笔记,仅供参考,不构成任何投资建议。市场有风险,投资需谨慎。