夜雨聆风学习资料网

ARTICLE · 1095913

AI 原生应用的费用测算: 成本构成、测算方法与审计要求

AI 原生应用的费用测算: 成本构成、测算方法与审计要求
软件造价 · 行业洞察
AI 原生应用的费用测算:成本构成、测算方法与审计要求
——基于行业观察与已发布标准的参考指引

2025年8月,国务院印发《关于深入实施“人工智能+”行动的意见》(国发〔2025〕11号),人工智能应用密集进入政务与企事业单位的建设清单。本文所称“AI原生项目”,指以大语言模型、智能体(Agent)、检索增强生成(RAG)为核心能力、且普遍借助AI辅助编程实施的项目。这类项目在立项、评审与审计环节面临同一个新问题:钱花在哪儿、怎么算、怎么审,传统软件造价口径给不出完整答案。

2026年9月,中国软件行业协会软件造价分会等发布《中国软件行业基准数据报告(SSM-BK-202609)》,同期举办的第十一届中国软件成本度量大会披露了AI原生开发的工作量分布与成本全景观察。本文依据上述来源与已发布标准给出参考指引。需要说明:AI原生项目的行业数据目前样本有限,大会亦明示其“应用范围局限于实验室环境、国外参考文献数据”,文中相关数据作观察参照使用,不作直接计价依据。

功能归功能点,智能归工作量,调用归目录价,全程留痕可审计

全文围绕五个问题展开:成本由什么构成、工作量如何分布、全生命周期投资结构如何变化、测算方法如何选择、测算结果如何做到客观量化与可审计。

■ 核心观察速览
编码占比
AI原生项目编码类工作仅约20%,需求+数据+评估合计约73%(行业观察)
运维占比
持续运维约占全生命周期总工作量30%~50%,明显高于传统软件
量价背离
GPT-3.5级推理成本18个月下降逾280倍,企业GenAI总支出同年反而增至约3.2倍
测算路径
功能性需求用功能点法,AI核心活动用人月工作量法,调用类费用按目录价×用量
一、先界定:什么样的项目按AI原生口径测算

判定看两个特征:其一,系统核心能力是模型与数据——对话交互、知识库问答、智能体编排完成任务,而非传统系统外挂一个AI插件;其二,实施过程普遍使用智能编程工具和智能开发平台,编码效率已非传统人月逻辑。

这一界定直接决定测算路径:这类项目的工作量核心载体已从代码转向数据与评估,继续套用“按代码量计量”的传统口径,会系统性低估数据准备、知识库构建与效果评估的工作量。立项评审时先判定项目类型,再选测算方法——类型判定错误,测算方法必然选错。

二、与传统软件项目的三个区别

AI原生项目不只是“多用了一种技术”——在工程活动、成本科目、效果效益评估三个层面,都出现了传统软件开发没有、或以往占比极低的新内容。理解这些区别,是选对测算方法的前提。

(一)工程活动:从“写代码”扩展到“喂数据、调模型、盯效果”

新增/加重的活动
是什么
目的
提示词工程
设计并反复调试输入模型的提示词模板与调用参数
让模型输出稳定符合业务口径
Agent编排
设计智能体的任务分解、工具调用与多智能体协作流程
把多环节业务流程交给模型自动完成
知识库构建与持续迭代
文档解析、切片、向量化、清洗、评估集构建,上线后持续更新
让回答基于最新权威知识,防止知识过期失真
AI效果评估
用评测集对幻觉、命中率、鲁棒性、边界用例做概率化测试
量化“答得好不好”,而不仅是“功能有没有”
模型漂移监控
持续监测线上输出分布与效果指标的变化
及时发现效果退化并触发调优
效果运维与提示词迭代
依据线上反馈持续优化提示词、知识库与编排配置
维持并提升服务质量,属常态化运维

(二)成本科目:出现按用量持续计费的新科目。模型推理与向量存储费(每次模型调用的推理算力消耗及知识库向量存储,按“目录单价×用量”持续发生)、训练数据与数据服务费、私有模型授权费、GPU算力租赁、监控告警平台年费——这些科目在传统软件项目中不存在或占比极低,且多为运营期变量费用,不能套用一次性建设费的测算思路。

(三)效果效益评估:从确定性验收转向概率化评估。传统软件验收回答“功能对不对”,结果是确定的;AI原生应用要回答“答得好不好”,结果是概率分布,须靠评测集、评估记录与持续监控共同支撑。效益不再取决于一次性交付质量,而取决于运营期持续迭代的质量——这正是运维阶段占比上涨(详见第五节)的根本原因。

三、成本构成:建设成本、持续运营成本与可选成本

依据行业大会披露的成本全景观察,AI原生应用成本分三层,各层归口规则不同:

成本层
主要构成
测算归口
一次性建设成本
建设方人力(直接人力+间接分摊);第三方平台/服务(公有模型Token调用费、私有模型授权费、数据服务费);算力与基础设施(GPU服务器、向量数据库许可、网络与安全组件)
人力按工作量法;Token按目录价×用量;授权与数据按询价
持续运营成本
模型推理与向量存储费;平台/授权年费;人力运维(知识库持续迭代、效果运维、模型监控运维);监控告警平台年费
按运维期费用科目逐年测算,据实结算
可选成本
模型微调(仅定制领域模型)、多模态能力、第三方知识库版权授权费、高可用灾备建设
按需单列,逐项举证必要性

三条归口原则需在测算文件中书面声明,防止重复计取:①Token调用费按政务云服务目录价格及计费规则计取,目录未列明的按市场询价,属变量费用,按“单价×用量”据实结算;②GPU等基础算力租赁归入云资源租赁类科目,不混入开发费;③训练数据(含高质量数据集)按数据资源购置类科目另行计取,不重复计入模型搭建或开发工作量。

四、工程活动分布:编码只占约两成

与传统软件开发对比(传统软件数据出自SSM-BK-202609;AI原生数据取自大会披露的实验室及国外文献观察,样本有限,作参照比例使用):

工程活动
传统软件开发(参照)
AI原生项目(行业观察)
需求与设计
27.75%(测算)需求14.84%+设计12.91%
30%
数据准备与知识库
—(未单列)
25%
编码与集成
38.16%
约20%
测试与AI评估
24.07%
18%(AI专项评估)
实施与部署
10.02%
7%(含漂移监控)

两点解读:其一,结构反转——“需求建模+数据治理+模型评估调优”合计约73%,编码类工作(提示词工程、Agent编排、开发集成)仅约20%;大量工作是提示词、工具调用、记忆与编排逻辑,代码量反而不大,这正是AI辅助编程条件下的典型形态。其二,评审含义直接:若AI原生项目申报的工作量以编码为主,结构即失真;数据治理与知识库构建(文档解析、切片、向量化、清洗、评估集构建)是工作量最密集环节,评审应重点核查。

五、全生命周期投资分布:运维阶段占比明显上涨

传统口径:SSM-BK-202609给出的应用软件运维费与软件投资费比例按投资规模分档——1000万以下为10%~15%,1000万~3000万为9%~12%,3000万~5000万为6%~10%,5000万以上为3%~6%(以一年免费维保期结束后为起始计算)。

AI原生项目的运维显著更重:行业观察显示,上线后持续迭代运维(知识库更新、模型漂移监控、提示词迭代)通常占项目全生命周期总工作量的30%~50%;年度运维人力成本一般占建设费的15%~30%,高于传统软件。原因在于AI项目“上线只是起点”——数据回流、持续评估、模型迭代是常态化工程活动,而非传统软件的一次性交付。

量价背离须警惕:Stanford HAI《AI Index Report 2025》记载,GPT-3.5级模型推理成本从2022年11月的20美元/百万Token降至2024年10月的0.07美元,降幅逾280倍;但Menlo Ventures《2025年企业生成式AI现状报告》显示,企业GenAI支出从2024年约115亿美元增至2025年约370亿美元(测算约为上年的3.2倍)。单价骤降、用量上升更快——运维期费用测算必须按“目录单价×实际用量”动态建模并逐年复核,不能沿用传统运维“工作量恒定”的假设。

六、测算方法:分阶段各用各的尺

实施阶段——两类活动分开算。对话交互、知识库管理、接口集成、后台管理等功能性需求,处理逻辑与传统业务软件相当,可按GB/T 36964-2018及NESMA/IFPUG方法以功能点计数;SSM-BK-202609应用类型调整因子新增“智能应用”档(取值1.5),可作因子口径参考。模型微调、提示词工程、智能体编排、知识库构建、AI专项评估等AI核心活动无法以功能点计量,应按人月工作量法分项列支,参照本文第四节的五类工程活动逐项分解;横向校核可参照重庆市软件行业协会T/CQSI 6010-2026《政务数字化应用费用测算规范》(2026年8月19日发布实施):智能体开发按简单2人月、一般4人月、复杂8人月分级定额并乘综合调整因子,技能(Skills)编制按类型设定额。

关于行业基准生产率数据的使用尺度:现有AI类生产率基准系有限样本的观察结果,建议在测算中仅作校核参照,不作直接计价依据;引用时注明报告编号与年度版本,基准年度滚动更新后先复核口径再沿用。

运行阶段——变量费用据实结算。Token调用按政务云服务目录价×实际用量计取并留存台账;GPU等基础算力按云资源租赁口径;运维人力按工作量法逐年测算,随知识库规模与迭代频率动态调整。

工具提示:功能点计数与工作量分解可用「软件造价喵」辅助——内置功能点法与多因子调整模型,测算底稿自动留存,评审复算与审计追溯有据。
七、测算要求:客观量化、可追溯、可审计

结合FinOps基金会“FinOps for AI”实践与上述标准要求,测算文件应满足六条:

1.工作量分解到工程活动并留存底稿——按五类工程活动逐项分解,每环节给出工作量、测算依据与交付物清单,评审人员可按底稿复算,杜绝“一口价”。

2.单价三渠道可溯源——政务云服务目录价、三家以上同级别服务商询价报价单(含品牌、规格参数、报价有效期)、行业基准数据(注明报告编号与年度版本),三者取其一并留痕,禁止无出处单价。

3.科目边界书面声明——训练数据、统一平台已购工具调用、GPU算力的归口逐项声明,防止同一费用在开发费、数据费、云资源费中重复计取。

4.变量费用动态结算——Token调用等按目录单价×实际用量据实结算,留存调用日志与用量台账,审计可按台账逐月核对。

5.AI专项评估留痕——幻觉、鲁棒性、边界用例等“概率化效果评估”须留存评测集版本与评估记录;相关测评费在国家及行业标准发布前可参照软件测评费口径计取(T/CQSI 6010-2026已有此过渡规定)。

6.基准版本管理——引用的基准与定额须注明版本与生效日期;年度滚动更新后,系数与费率口径先复核再引用,避免使用过期数据。

结语

AI原生应用费用测算的本质,是把“黑盒报价”拆成“可复核的工程活动×可溯源的单价”。给评审与造价人员一句行动建议:立项评审时先判定项目是不是AI原生口径,再把功能性需求与AI核心活动分开选测算路径;口径错配,是当前AI项目造价失真最常见的根源。


软件造价观察 | 数据以各来源原文为准

相关学习资料