ARTICLE · 1095913
AI 原生应用的费用测算: 成本构成、测算方法与审计要求
2025年8月,国务院印发《关于深入实施“人工智能+”行动的意见》(国发〔2025〕11号),人工智能应用密集进入政务与企事业单位的建设清单。本文所称“AI原生项目”,指以大语言模型、智能体(Agent)、检索增强生成(RAG)为核心能力、且普遍借助AI辅助编程实施的项目。这类项目在立项、评审与审计环节面临同一个新问题:钱花在哪儿、怎么算、怎么审,传统软件造价口径给不出完整答案。
2026年9月,中国软件行业协会软件造价分会等发布《中国软件行业基准数据报告(SSM-BK-202609)》,同期举办的第十一届中国软件成本度量大会披露了AI原生开发的工作量分布与成本全景观察。本文依据上述来源与已发布标准给出参考指引。需要说明:AI原生项目的行业数据目前样本有限,大会亦明示其“应用范围局限于实验室环境、国外参考文献数据”,文中相关数据作观察参照使用,不作直接计价依据。
全文围绕五个问题展开:成本由什么构成、工作量如何分布、全生命周期投资结构如何变化、测算方法如何选择、测算结果如何做到客观量化与可审计。
判定看两个特征:其一,系统核心能力是模型与数据——对话交互、知识库问答、智能体编排完成任务,而非传统系统外挂一个AI插件;其二,实施过程普遍使用智能编程工具和智能开发平台,编码效率已非传统人月逻辑。
这一界定直接决定测算路径:这类项目的工作量核心载体已从代码转向数据与评估,继续套用“按代码量计量”的传统口径,会系统性低估数据准备、知识库构建与效果评估的工作量。立项评审时先判定项目类型,再选测算方法——类型判定错误,测算方法必然选错。
AI原生项目不只是“多用了一种技术”——在工程活动、成本科目、效果效益评估三个层面,都出现了传统软件开发没有、或以往占比极低的新内容。理解这些区别,是选对测算方法的前提。
(一)工程活动:从“写代码”扩展到“喂数据、调模型、盯效果”
(二)成本科目:出现按用量持续计费的新科目。模型推理与向量存储费(每次模型调用的推理算力消耗及知识库向量存储,按“目录单价×用量”持续发生)、训练数据与数据服务费、私有模型授权费、GPU算力租赁、监控告警平台年费——这些科目在传统软件项目中不存在或占比极低,且多为运营期变量费用,不能套用一次性建设费的测算思路。
(三)效果效益评估:从确定性验收转向概率化评估。传统软件验收回答“功能对不对”,结果是确定的;AI原生应用要回答“答得好不好”,结果是概率分布,须靠评测集、评估记录与持续监控共同支撑。效益不再取决于一次性交付质量,而取决于运营期持续迭代的质量——这正是运维阶段占比上涨(详见第五节)的根本原因。
依据行业大会披露的成本全景观察,AI原生应用成本分三层,各层归口规则不同:
三条归口原则需在测算文件中书面声明,防止重复计取:①Token调用费按政务云服务目录价格及计费规则计取,目录未列明的按市场询价,属变量费用,按“单价×用量”据实结算;②GPU等基础算力租赁归入云资源租赁类科目,不混入开发费;③训练数据(含高质量数据集)按数据资源购置类科目另行计取,不重复计入模型搭建或开发工作量。
与传统软件开发对比(传统软件数据出自SSM-BK-202609;AI原生数据取自大会披露的实验室及国外文献观察,样本有限,作参照比例使用):
两点解读:其一,结构反转——“需求建模+数据治理+模型评估调优”合计约73%,编码类工作(提示词工程、Agent编排、开发集成)仅约20%;大量工作是提示词、工具调用、记忆与编排逻辑,代码量反而不大,这正是AI辅助编程条件下的典型形态。其二,评审含义直接:若AI原生项目申报的工作量以编码为主,结构即失真;数据治理与知识库构建(文档解析、切片、向量化、清洗、评估集构建)是工作量最密集环节,评审应重点核查。
传统口径:SSM-BK-202609给出的应用软件运维费与软件投资费比例按投资规模分档——1000万以下为10%~15%,1000万~3000万为9%~12%,3000万~5000万为6%~10%,5000万以上为3%~6%(以一年免费维保期结束后为起始计算)。
AI原生项目的运维显著更重:行业观察显示,上线后持续迭代运维(知识库更新、模型漂移监控、提示词迭代)通常占项目全生命周期总工作量的30%~50%;年度运维人力成本一般占建设费的15%~30%,高于传统软件。原因在于AI项目“上线只是起点”——数据回流、持续评估、模型迭代是常态化工程活动,而非传统软件的一次性交付。
量价背离须警惕:Stanford HAI《AI Index Report 2025》记载,GPT-3.5级模型推理成本从2022年11月的20美元/百万Token降至2024年10月的0.07美元,降幅逾280倍;但Menlo Ventures《2025年企业生成式AI现状报告》显示,企业GenAI支出从2024年约115亿美元增至2025年约370亿美元(测算约为上年的3.2倍)。单价骤降、用量上升更快——运维期费用测算必须按“目录单价×实际用量”动态建模并逐年复核,不能沿用传统运维“工作量恒定”的假设。
实施阶段——两类活动分开算。对话交互、知识库管理、接口集成、后台管理等功能性需求,处理逻辑与传统业务软件相当,可按GB/T 36964-2018及NESMA/IFPUG方法以功能点计数;SSM-BK-202609应用类型调整因子新增“智能应用”档(取值1.5),可作因子口径参考。模型微调、提示词工程、智能体编排、知识库构建、AI专项评估等AI核心活动无法以功能点计量,应按人月工作量法分项列支,参照本文第四节的五类工程活动逐项分解;横向校核可参照重庆市软件行业协会T/CQSI 6010-2026《政务数字化应用费用测算规范》(2026年8月19日发布实施):智能体开发按简单2人月、一般4人月、复杂8人月分级定额并乘综合调整因子,技能(Skills)编制按类型设定额。
关于行业基准生产率数据的使用尺度:现有AI类生产率基准系有限样本的观察结果,建议在测算中仅作校核参照,不作直接计价依据;引用时注明报告编号与年度版本,基准年度滚动更新后先复核口径再沿用。
运行阶段——变量费用据实结算。Token调用按政务云服务目录价×实际用量计取并留存台账;GPU等基础算力按云资源租赁口径;运维人力按工作量法逐年测算,随知识库规模与迭代频率动态调整。
结合FinOps基金会“FinOps for AI”实践与上述标准要求,测算文件应满足六条:
1.工作量分解到工程活动并留存底稿——按五类工程活动逐项分解,每环节给出工作量、测算依据与交付物清单,评审人员可按底稿复算,杜绝“一口价”。
2.单价三渠道可溯源——政务云服务目录价、三家以上同级别服务商询价报价单(含品牌、规格参数、报价有效期)、行业基准数据(注明报告编号与年度版本),三者取其一并留痕,禁止无出处单价。
3.科目边界书面声明——训练数据、统一平台已购工具调用、GPU算力的归口逐项声明,防止同一费用在开发费、数据费、云资源费中重复计取。
4.变量费用动态结算——Token调用等按目录单价×实际用量据实结算,留存调用日志与用量台账,审计可按台账逐月核对。
5.AI专项评估留痕——幻觉、鲁棒性、边界用例等“概率化效果评估”须留存评测集版本与评估记录;相关测评费在国家及行业标准发布前可参照软件测评费口径计取(T/CQSI 6010-2026已有此过渡规定)。
6.基准版本管理——引用的基准与定额须注明版本与生效日期;年度滚动更新后,系数与费率口径先复核再引用,避免使用过期数据。
AI原生应用费用测算的本质,是把“黑盒报价”拆成“可复核的工程活动×可溯源的单价”。给评审与造价人员一句行动建议:立项评审时先判定项目是不是AI原生口径,再把功能性需求与AI核心活动分开选测算路径;口径错配,是当前AI项目造价失真最常见的根源。
软件造价观察 | 数据以各来源原文为准
