ARTICLE · 1112921
AI 工具怎么选,第一个问题就不该是"哪家强"
全文约 3591 字 · 阅读约需 9 分钟
先说一个很常见的场面。
某单位开会讨论上 AI。会议室里坐了业务部门、信息中心、采购。主持人开场,第一个问题通常是:"那咱们用哪家的模型?"
接着就是一轮报价和参数的比较。有人说某某模型跑分第一,有人说某某模型参数最大,有人说某某家给的价格最低。会开完了,方向定了——选那个跑分第一的。
这个会从一开始就开错了。
不是选错了模型,是问错了第一个问题。顺序反了。
一、顺序为什么比结果重要
一个工具好不好,取决于它要解决的那个问题。问题还没定清楚,就开始比较工具,比较出来的结论是没有根子的。
政务和国企的场景尤其明显。同样叫"上 AI",窗口要解决的是"群众问的事答不准",办公室要解决的是"公文起草慢",办公室之外的部门可能想解决"材料找不着"。
这三个问题,对应的根本不是同一种工具。
所以正确的顺序是四步:先定场景,再查合规,然后定形态,最后实测。
一步都不能跳。下面拆开讲。
二、第一步:先定场景,不是先定模型
这一步有现成的官方依据,而且写得非常直白。
《政务领域人工智能大模型部署应用指引》里,把实施路径按场景分成了两类:
对于智能问答、辅助文书起草等通用性较强、数据资源丰富的场景,需采用市场上成熟,并已完成网信部门备案的模型产品和服务。对于辅助执法监管、市场风险预测等专业性较强、业务逻辑复杂的场景,可利用领域专家知识和专业数据进行针对性训练,打造垂直模型。
这段话的分量在于,它给了你一把刀,可以把手里一堆需求切开。
切开的动作很简单,问一句话就够了:这个场景,外面有没有已经做熟的?
"公文格式对不对""政策文件怎么表述"——这些是通用问题,全国几万家单位都在问同一件事,市场上早就有成熟产品。
"我们单位的报销口径怎么解释""这批历史档案怎么分类"——这些是你们独有的,通用产品答不了,得用你们自己的制度和数据喂。
大部分单位的需求,落在前一类。
这一点很关键,因为它直接决定了要花多少钱。前一类,用成熟产品就行,买来就能用;后一类,才需要专项投入去做针对性训练。把大量通用需求当成专业需求去做定制,是选型里最贵的错误之一。
大连市数据局在答复政协提案时,把这件事做得更细。他们把 15 个试点场景拆成两类:公文生成、政策解答等通用类 7 个,环境影响评价报告评估、消防行政处罚案卷评查等特色类 8 个,覆盖 13 个市级部门。
通用场景由市数据局统一开发,特色场景由部门自主建设、市级统一提供智算资源支撑。
这个分法比《指引》又往前走了一步:不光分了场景类型,还分了谁来建。通用的统一建,一次投入多家复用;特色的部门自己建,市级给算力和模型资源。
这一点值得直接抄。定了场景之后,紧接着要问的就是"这个场景谁建、算力谁出"。
还有一件事要在这一步做完:把需求写成能验证的样子。
选型失败的另一个常见原因,是需求书写得没法验收。比如"实现智能问答功能"——这句话没法验收,因为"智能"不是标准。
改成能验证的写法:群众问得最多的 50 个问题,答案要能定位到具体的政策文件条款。
两句话的差别在于,后者写清楚了测什么、拿什么测、怎么算通过。这三样定下来,后面的实测才有尺子,验收才有依据,供应商也没法含糊过去。
三、第二步:查合规,这是一票否决项
场景定完,先别比参数,先查一件事:这个模型备案了没有。
《指引》的要求是"已完成网信部门备案的模型产品和服务"。这不是建议,是条件。
备案号是可以自己查的,不用听供应商说。
官方路径是:到国家网信办官网,搜"生成式人工智能服务已备案信息的公告",下载公告附件。附件里逐条列明属地、模型名称、备案单位、备案号、备案时间。也可以在国家网信办的备案系统里直接检索。
数量上可以有个概念:截至 2025 年 11 月 1 日,累计已有 611 款生成式人工智能服务完成备案,另有 306 款生成式人工智能应用或功能完成登记。
这里有个容易被忽略的区别:备案和登记是两件事。
模型本身要做备案。如果某家厂商是拿别人已备案的模型,包装成自己的产品对外提供,那它要做的是"应用或功能登记"。
所以碰上这种情况,要查到两个号:底层的模型备案号,加上这家的应用登记号。只有前者没有后者,或者两个都拿不出来,就要问清楚了。
还有一条更少有人提。《指引》要求规范人工智能大模型选型、部署、训练、使用、废止全流程的保密管理。
注意最后两个字——废止。它在提醒一件事:选型的时候就要想到将来怎么退。这个话题放到第六节讲。
四、第三步:定形态,四种选法各有各的门槛
合规过了,再定工具是什么形态。大体四种,各有各的适用条件。
第一种,公有云 API。不用买硬件,注册就能用,最便宜最快。代价是数据出了内网。所以它只适合处理公开信息、非敏感场景,或者前期做原型验证。
第二种,私有化部署。模型装在单位自己的服务器上,数据不出内网。这是政务和国企最常选的形态,成本也最高——要有算力、要有运维的人。
第三种,一体机。软硬件打包好了,搬进来插上电就能用。适合没有机房、也没有专职运维的单位。
这个品类这两年出得很多。像人民网联合上海信投推出的"信芯一体机",用的是国产处理器加国产推理卡,数据本地部署、全程不出机;人民网与豫资控股联合推出的"深言未来"智能政务一体机,从芯片层到应用层全面国产化。这类产品的共同点是,把"安全"和"省事"打包卖给你。
第四种,垂直模型。用领域专家知识和专业数据做针对性训练。成本最高,只在通用产品确实解决不了的时候才值得做。
形态选完,还有一个判断要做:别把宝押在一个模型上。
白银市的做法可以参照。他们建了全市统一的 AI 基础能力平台,算力上是国产算力一体机 2 台加政务云主机 20 台;模型上部署了 DeepSeek R1、通义千问、星汉政务大模型等 7 类模型,对外提供标准化接口服务。
注意是"7 类",不是"1 个"。他们没有选出一个"最好的",而是同时接了几个,按场景调。
这背后是《指引》的另一条要求:统筹集约开展部署,防止形成"模型孤岛"。
这两条看起来矛盾,其实不矛盾。"不搞孤岛"说的是别各自为政重复建设,"多模型并存"说的是别把系统焊死在某一个模型上。
模型是这十年变化最快的东西之一。今年最强的,明年未必。把应用和数据建在"可替换的模型"之上,比选对一个模型更重要。
五、第四步:实测,必须用自己的数据
前面三步都是纸面上的。第四步必须上手。
榜单可以看,但不能当决策依据。榜单测的是通用能力——知识广度、推理、代码。你的场景要的是另一些能力:能不能读懂几千字的政策文件、能不能理解条款式的表达、能不能在你们的历史材料上答对。
这些,榜单测不出来。
《指引》对上线前测试的要求写得很具体:对模型算法、生成内容、应用功能、配置环境、挂接数据、漏洞风险等进行充分测试验证,发现问题要整改加固。
实操上,可以这么做:挑一到两个真实场景,拿本单位真实材料——不是厂商提供的公开样例——跑一到两周。
测的时候换一个问题问,结果会完全不同。别问"它回答得像不像人",要问:在你们的材料上,它答对了多少。
举个例子。公文场景可以这样测:拿 20 份已经定稿的公文,让工具起草同类文种,再和定稿逐条对照,看差在哪里。
还有一个指标,很少被写进评估表,但实际影响最大:改起来费不费劲。
AI 生成的东西不可能一次就对,人要改。如果改一遍比自己写一遍还慢,这个工具对你们就是负收益,哪怕它答得更"聪明"。同样,响应速度也是——等 30 秒和等 3 秒,用起来是两种感受,直接决定这个东西最后会不会有人用。
六、三个常见误区
误区一:参数越大越好。
参数量不等于效果。更大的模型需要更多算力和更慢的响应,而在处理简单任务时,多出来的能力用不上。对绝大多数政务和办公场景,选"够用且跑得动"的,比选最大的更实际。
误区二:只看榜单。
榜单测的是平均能力,你的场景要的是特定能力。而且同一件事,用你们的材料测和用公开样例测,结论经常不一样。
误区三:想一步到位。
一次买齐、一次建好、一次覆盖所有场景,这是最常见的期待,也是最容易落空的。《指引》里有一句提醒写得很重:统筹减负和赋能,避免盲目追求技术领先、概念创新,切实防范"数字形式主义"。
分场景、小步走、先做出一个能看的,比一次铺开更稳。
七、还有一种选法:不买断,按使用付费
前面讲的四种形态,都是"买"。预算紧张、或者效果还不确定的单位,可以再看看第三种方式。
《指引》在经费保障部分提了一条:引入市场化的产品和服务竞争机制,探索企业建设运营、政府购买服务、按使用情况结算费用的运作模式。
翻成业务语言就是:不一次买断,用多少付多少。
这种方式的适用条件很清楚。场景还在验证期、效果还不确定、预算一时批不下来,或者用量本身波动大——这几种情况下,按使用付费比一次性投入更合适。前期投入小,试错成本低,不合适也能停。
但它有两个问题要想在前面。
一是数据归属和退出机制。你们的材料喂进去,沉淀在谁那儿?将来不合作了,能不能完整拿走?这些要写进合同,不能默认。
二是停服风险。服务停了,业务怎么办。这就是下面要说的事。
所以"按使用付费"适合起步,不适合长期托付。业务稳定下来、用量可预期之后,再考虑要不要转为私有化部署。
八、一个最容易被跳过的动作:想清楚怎么退
回到前面提过的"废止"两个字。
选型会上,几乎没人问这个问题:这个模型如果明年停服了、不做了,我们的数据和流程怎么办?
可这个问题一旦发生,代价很大。所有流程都建在它之上,人也都习惯了用它。
所以选型的时候,顺手要有三条判据:
接口是不是标准的。标准化接口意味着换一家的时候,上层应用不用重写。
数据能不能导出来。你们喂进去的材料、积累的知识库、沉淀的语料,属于你们自己,要能完整带走。
和现有系统是不是解耦的。如果它和 OA、公文系统缠在一起,换起来就是伤筋动骨。
这三条决定了你将来能不能换。它们是选型表里最少被列、出问题时最要命的三行。
九、一件立刻能用的事:选型四问
如果下次开会又要讨论选工具,把顺序换成这四问,一句话一步:
第一问,场景:这个场景,外面有没有已经做熟的?做熟了的买成熟产品,没人做过的才谈定制。
第二问,合规:备案号是多少?模型备案和应用登记,两个号能不能都拿出来,当场查。
第三问,形态:数据敏感到什么程度?决定是公有云、私有化,还是一体机。同时问一句:换一家的话,要重做多少。
第四问,实测:能不能先拿我们的真实材料跑两周?这段时间里,人改一遍的时间,比自己写一遍是快了还是慢了。
四问答完,答案基本就出来了。
· · ·