当每个人都能做软件:一家小公司的 AI 实践,和我们看到的大模型终局
一边是一个人用 10 小时做完一个8语言的公司动态官网,一边是 2859 亿美元涌入美国 AI 产业。应用软件正在变便宜,底层模型正在变贵。
两件事同时发生,企业真正需要积累的东西也在改变。

去年 11 月,有一天我一直干到凌晨3点。第二天,我又做了五六个小时。前后算下来,实际投入大约 10 个小时,消耗了约 150 美元的 token,公司官网的就做出来了。
有一个随时可以自定义内容的官网,曾经是一个让我头痛了很久的问题。
现在我们公司的官网支持 8 种语言,带数据库,也有动态更新的内容管理系统CMS。
需要增加新的 Portfolio 时,只需要提供一个项目方的链接,系统可以先从目标网站抓取资料,全程自动写进portfolio页面。文字和板块内容也能直接在后台修改,自动翻译成所有的语言。
以前我们的网站来自一套模板。能用,可它看上去和很多公司没有太大区别。
想改一处内容,要重新找人、沟通、排期,每次还有各种繁琐的调试。
一个小调整背后,经常拖着一串技术问题。
这一次,我用 Manus 按自己的要求重新做了一遍。
它没有一次自动解决所有工程问题,页面、数据和上线过程仍然需要HITL(Human in the Loop)。
但这次经历第一次让我具体感受到,一家规模不大的公司,已经可以承担过去很难独立完成的软件开发工作。

图 1:火凤资本当前公开官网 huofengcap.com 。多语言、Portfolio、Products、BP Agent 等入口已经可以在页面上看到。
但我没想到的是,我们的官网上线以后,真正让我受冲击的事情才刚刚开始。
做软件的成本一旦下降,公司里很多过去“不值得开发”的问题,突然都有了被解决的机会。
官网只是第一块多米诺骨牌
最初,我只是想解决官网问题。
网站做完以后,它成了公司内部的一次能力证明。
既然一个人可以在十小时左右做出在过去需要外包和反复沟通才能完成的东西,其他工作是不是也可以重新设计?

图 2:从提出要求到上线迭代。工时、费用和语言数量需公司发布前最终确认。
我们随后开始做 BP Agent。这个想法来自投资行业里一个非常具体的低效场景。
一个 CEO 为了见投资人,来回坐一个小时的车,再聊至少一个小时。两小时过去,他可能获得一些有效信息,也可能只是完成了一次彼此都不满意的会面。
VC们总是当面非常热情地说:“我们后续有反馈会告诉你!”,但实际创始人/CEO经常感受到冷落和石沉大海。
创业者并不喜欢这种低效率沟通,只是融资、行业信息和外部判断又让他们无法完全绕开它。
所以我们开始想,项目能不能先在线上提交信息,和 Agent 完成一轮结构化交流,再决定双方有没有必要见面。
这就是我们的BP Agent,现在它可以完成基础的、第一次基于 BP 的反馈工作和七个维度的评分工作,而且非常详细。
官网后来又增加了 Products板块。公开页面上现在已经可以看到 AI Bubble Watch、Sci-Fi Future Archive 这些工具。
前者每周跟踪 6 类、23 个 AI 泡沫指标,后者把 82 部科幻作品按照技术主题和社会模型重新整理,期待能够给它的观众提供一些关于未来科技发展和社会演进的启示。

图 3:火凤资本公开 Products 页面。真实页面截图比概念图更能证明公司正在做什么。
我们基金现在的自动交易系统也完成了,最近一段时间跑下来,每周能比较稳定地跑1%的收益,期望复利能够在长期让我们变富。
我们现在也能进入更多的市场,除了传统我们做的市场外、股票、期权和其他衍生品,以及一些新兴的交易市场逐步都会开始自动化交易。
公司内部也出现了更多工具。投后信息需要定期收集,财报需要分析,投资人需要管理,视频内容需要生产。包括你现在看到的这篇文章。(虽然最后的精精精精修是由我本人完成的。)
过去,这些任务散落在表格、文档、聊天记录和不同人的脑子里。
现在,我们开始把其中一部分变成可以自动反复运行的系统。
团队成员也陆续使用 OpenClaw、Claude Code CLI、Codex 等工具,自己做页面、改脚本、接数据、跑自动任务。
一个投资人、研究员或者内容同事,不必先把自己训练成传统程序员。
他可以从业务问题出发,让 Agent 把想法变成一个可运行的版本,再通过检查和反馈慢慢修到能用。

图 4:一个官网如何逐渐扩散到 BP Agent、Products、投后管理和内容生产。
这件事带来的价值,已经超过“把原来的任务做快一点”。
以前,公司要先判断一个问题值不值得进入软件排期。
现在,很多细小、具体、只服务少数人的问题也能被做成工具。
软件供给增加以后,公司开始有机会重新设计自己的工作方式。
更重要的是,你不再需要程序员,你们公司也不需要是一家软件公司,就可以做上述这些事情。
应用软件变便宜,模型竞争却越来越贵
火凤的经历当然不是现在整个市场都正在发生的,它和一组行业数据可以两相对比,可能结论值得玩味。
Stanford HAI 的《2026 AI Index Report》显示,2025 年已有 88% 的受访组织使用 AI,70% 在至少一个业务职能里使用生成式 AI。到了 Agent 层,多数业务职能中的实际部署比例仍然只有个位数。[1]

图 5:会使用 AI 的公司已经很多,真正把任务交给 Agent 的公司仍然很少。
这组数据和我们的体感很接近。声称“用”AI的人很多,但实际能够大部分流程自动化的公司凤毛菱角。
聊天框已经进入办公室,但能够操作文件、调用工具、连接系统并持续执行任务的 Agent,还没有进入多数公司的日常流程。
我们自己感觉,AI的使用门槛下降得很快,可靠性可以保持不变甚至略有提升。
任务越清楚、结果越容易检查,Agent 越容易带来真实生产率。
Stanford 汇总的一项软件开发研究显示,AI 工具对应约 26% 的产出增益,效果会随任务和团队变化。[1]
应用这一侧,我们预判,过去没有开发资源的人开始制造工具。
模型这一侧,竞争正在走向另一个极端。
2025 年,美国私人 AI 投资达到 2859 亿美元,中国为 124 亿美元,前者约为后者的 23 倍。这个口径没有包含中国全部政府引导资金,不能直接理解成两国 AI 总投入的差距,但私人资本的量级已经足够惊人。[2]

图 6:2025 年中美私人 AI 投资规模对比。
同一份报告显示,2025 年超过 90% 的重要前沿模型来自产业界。全球 AI 算力容量从 2022 年起年均增长约 3.3 倍,达到 1710 万张 H100 等效算力。[3]
训练前沿模型需要芯片、数据中心、电力、网络和持续的大额投入,也需要极少数顶尖研究人员和工程师。
能力更强的模型还会获得更多复杂任务,暴露更多失败方式,推动新的评测、产品反馈和训练方法。
用户数据能否用于训练取决于授权和数据政策,数据飞轮依然存在。
当资本、算力和人才同时向少数组织集中,竞争自然会超过了“公司”这种形态的组织,可以覆盖的边界。
2025 年,美国产出了 59 个重要模型,中国为 35 个。与此同时,中国在论文数量、引用和专利授权等指标上保持很强的规模。到 2026 年 3 月,中美头部模型的性能差距仅仅约为 2.7%。[3][4]
我的判断是,前沿模型竞争正在进入国家资源配置层面。
芯片、能源、人才和长期资本,越来越难只靠一家公司的商业模式解决。
所以最终这将是中美两个国家政府调动资源能力的竞争。
这不代表公共资金一定能训练出最好的模型。产品、工程效率和真实用户依然还对结果有影响。
真正的变化发生在参赛门槛上,门槛不断提高,世界上最强的公司,诸如META和马斯克都开始想要打退堂鼓,退出LLM的Capex竞争;Google的Gemini已经在最近6个月的LLM发布中败下阵来。
普通的创业公司就更难独立承担一场完整的前沿模型竞赛。
最烧钱的模型,为什么越来越像一度电
这里出现了一个很有意思的反差。
模型越来越贵,用户调用模型却越来越便宜。
Stanford 2025 AI Index 统计,达到 GPT-3.5 等效水平的推理价格,从 2022 年 11 月每百万 token 20 美元,降到 2024 年 10 月的 0.07 美元。大约 18 个月,降到了原来的 280分之一。[5]

图 7:达到同等能力水平所需的推理价格快速下降。
模型之间的表现也在接近。到 2026 年 3 月,Anthropic、xAI、Google 和 OpenAI 四家公司在 Arena Elo 上只相差 22 点。
头部闭源和开源模型仍有约 3.3% 的差距,但对大量日常工作来说,用户已经有了多个可用选择。[4]
我们自己的使用经历很直接。
过去几个月,团队会在 Claude、GPT、Gemini 以及不同 Agent 产品之间迁移。
哪个模型更适合当前任务,哪个服务更稳定,哪个价格更合适,任务就可能很快迁移过去。
而且模型之间的迁移,一点都不费事,往往就是Agent Harness框架中一句prompt的事情。
LLM的调用很像电和宽带流量,这个比喻在用户侧越来越成立。
建一座电厂有很高的壁垒,但普通用户面对的是插座。他只关心电有没有送到、是否稳定、价格是否合理。他并不关心电是哪个电厂提供的,只要不要差异太大;直到用户发现千兆带宽实际上只能承载百兆流量,用户才会抗议,在那之前用户大部分时间用不到,就不会关心到底实际是千兆还是百兆。
LLM的调用也在靠近这种状态。企业最终愿意付费的是一段推理、一次调用和一个被完成的任务,跟具体是哪个模型没关系,跟到底是用了100个tool call还是90个tool call也没关系,跟任务成功率是90%还是95%也没关系。

图 8:任务和上下文留在公司,底层模型按能力、价格和稳定性切换。
LLM的蒸馏又加快了部分LLM能力的追赶。
蒸馏并非 中国模型厂 的发明,Hinton、Vinyals 和 Dean 在 2015 年已经系统讨论过如何把大型模型或模型组合的知识压缩到小模型中。[6] DeepSeek-R1 的意义,在于它公开展示了如何把推理能力蒸馏到基于 Qwen 和 Llama 的多种小模型里。[7]
蒸馏无法让预训练消失,也不能完整复制训练数据、世界知识、可靠性和长尾表现。
但是它改变的是追赶部分能力的成本。
领先者用巨额投入开出一条路,后来者有机会用极少资源学会其中的大部分,只留下很小的距离需要自行研发追赶。
好像我们永远需要也希望用上最好的模型,但是用户可选的模型其实很多,其他的替代品也不差。
真正难迁移的,是 Agent 对你的理解
如果模型可以切换,用户最终会被什么留下来?
我认为是 Agent Harness。
这个观点和现在整个市场对于Foundation Model的大规模投入完全背道而驰,但我是真的这么觉得。
模型负责理解和推理。Harness 把模型放进一个可以做事的系统里,负责任务循环、文件、浏览器、工具、权限、记忆、重试和结果交付。
Anthropic 在介绍可信 Agent 时,也把 Agent 拆成模型、Harness、工具和环境四层。
其工程团队明确地公开提到,Harness 设计可以把长任务和应用开发表现推到基础模型之上。[8]

图 9:模型负责推理,Harness 和组织上下文决定它怎样完成工作。
Harness 再往上,还有一层组织上下文。
我们在日常工具中沉淀了任务历史、Markdown 文件、个人偏好、权限和验收规则。
现在的情况是:底层模型可能可以一键更换,这些东西却很难一键搬走。
这才是“千人千面”有价值的地方。它不只是换一个头像或调整说话语气。一个真正有用的 Agent,要知道你正在做什么,公司有哪些数据,一个结果要满足什么标准,哪些动作可以自动完成,哪些动作必须让人确认。
这在每个公司、每个公司的不同场景/职能、甚至同一个部门的同事之间都不同。
当这些东西持续沉淀,Agent 会慢慢变成工作入口。
而就像之前所有年代的软件产品一样,最终用户会形成使用习惯,这些使用习惯定义工作流,工作流定义公司和组织形态,极难改变。
用户更换底层模型依然容易,放弃整套工作方式会越来越难。
相关产品的增长也在说明这个方向。OpenAI 在 2026 年 6 月公布,Codex 每周用户超过 500 万,非 程序员/开发者 约占其中 20%,这部分用户的增长速度超过开发者群体三倍以上。[9] Anthropic 则称,Claude Code 上线六个月后达到 10 亿美元年化收入。[10] 两组数字都是公司自报数据,仍然可以看出 Agent 已经在离开传统编程边界,进入研究、分析、运营和其他知识工作。
一家公司现在可以先做什么
模型变化太快,企业很难提前押中长期赢家。
更实际的做法,是让模型层保持可替换。
不同任务可以调用不同模型,关键流程也应准备备用方案。
更重要的是,把公司的知识和上下文掌握在自己手里。
任务历史、提示规则、权限、数据和验收标准一旦形成可管理的资产,未来更换模型时仍然可以继续使用。
还有一件事正在变得可能:让最了解业务的人直接参与制造工具。
业务人员知道哪里浪费时间,也知道什么结果才算合格。
Agent 把做软件的门槛降下来以后,他们可以更早进入设计和迭代。
工程与安全团队依然重要,他们负责架构、权限、审计和高风险操作。

图 10:模型保持可替换、上下文留在公司、让业务人员参与制造工具。
风险也不能被省略。Stanford 2026 AI Index 显示,Agent 在 OSWorld 等结构化基准上的成功率已经上升到 66.3%,进步很快,同时仍有大约三分之一任务失败。[4]
现阶段更有效的组织方式,仍然是人负责判断,Agent 承担越来越多执行步骤。
任务越明确、结果越容易检查,Agent 越适合先进入。
涉及资金、隐私、客户和不可逆操作时,权限、沙箱、日志和人工确认依然必不可少。
回头看,那个花了约 10 小时做出来的官网,只是火凤的AI尝试的最早的一件成品。
更大的变化,是一家规模不大的公司开始让更多人制造工具。
官网、Products、BP Agent 和内部系统是外面能看到的结果。
真正留在公司里的,是大家提出问题、设计流程、检查结果和分享经验的方式。
大模型公司还会继续投入巨额资本,国家会继续争夺芯片、人才和算力,底层模型也会继续降价、收敛和更换。
当软件越来越便宜,判断会变得更贵。
什么问题值得解决,什么结果可以交付,哪些经验应该留在公司里,这些问题最终仍然要由人回答。

数据与信源
[1] Stanford HAI, Economy, 2026 AI Index Report
[2] Stanford HAI, 2026 AI Index Report Overview
[3] Stanford HAI, Research and Development, 2026 AI Index Report
[4] Stanford HAI, Technical Performance, 2026 AI Index Report
[5] Stanford HAI, 2025 AI Index: State of AI in 10 Charts
[6] Hinton, Vinyals, Dean, Distilling the Knowledge in a Neural Network
[7] DeepSeek-R1 Technical Report
[8] Anthropic, Trustworthy agents in practice;Harness design for long-running application development
[9] OpenAI, Codex for every role, tool, and workflow
[10] Anthropic, Claude Code reaches $1B milestone
夜雨聆风