夜雨聆风学习资料网

ARTICLE · 1066701

AI工具选型别看榜单:游戏团队采购前该验的四件事

AI工具选型别看榜单:游戏团队采购前该验的四件事

鼬游白书 · 第 032 期 · 方法论

榜单告诉你谁跑得最快,合同告诉你谁能陪你跑到上线。

你们团队上一次拍板选一个 AI 工具,依据是什么?

是某个榜单上的排名,是行业群里刷屏的那个名字,还是销售发来的那张打满对勾的对比表?

这三样东西有个共同点——它们都不是你签字之后真正要承担的那部分风险。

AI 工具采购翻车,很少是因为「选了个能力不行的模型」。翻车大多发生在合同生效之后:工具方的版权赔付不覆盖你的用法、你上传的项目资产在条款上可以被留存、你把管线绑死的那个模型三个月后停服。

这些都不在榜单里。但它们全部写在公开材料上,采购前几个小时就能查完。

以下四件事,按顺序验。

第一件事:查备案编号,比查榜单排名重要得多

在国内,AI 工具采购的第一道门槛不在技术层,在一个公开网站上。

按《生成式人工智能服务管理暂行办法》,面向境内公众提供生成式 AI 服务须完成备案,国家网信办定期公示名单。截至 2025 年 12 月 31 日,累计 748 款生成式 AI 服务完成备案;到 2026 年 4 月 30 日,这个数字是 868 款。

真正值得注意的,是名单旁边那个总被略过的数字——备案和登记,是两件事。

直接提供服务的,在国家网信办「备案」;通过 API 接口或其他方式调用已备案模型能力的应用或功能,由地方网信办「登记」。截至 2025 年底,完成登记的应用与功能是 435 款。

这意味着市面上大量「AI 创作平台」本身并没有模型,它是别人模型的壳。它手里拿的是登记,不是备案。

两者的合规重量并不相同,但在销售话术里,往往被合并成一句「我们是合规的」。

所以采购动作只有一个:让供应商直接给编号,你自己上算法备案系统核一遍。查得到、备案主体名和签合同的主体对得上,这一关才算过。

查不到,后面三件事都不必验了。

第二件事:榜单测的是峰值,你的生产管线要的是方差

榜单从来不回答你真正关心的那个问题。

2025 年 4 月,Cohere Labs 与 AI2、普林斯顿、斯坦福、滑铁卢、华盛顿大学的研究者发布了一篇 68 页论文《The Leaderboard Illusion》(arXiv:2504.20879),指出主流对战式榜单存在系统性失衡:有厂商在公开一个模型之前,私下测了 27 个变体,最后只把成绩最好的那个推上榜;闭源模型拿到的对战数据份额在 54.3% 到 70.1% 之间,明显高于开源模型。

这篇论文本身有争议,榜单方也有公开回应。但即便把争议部分全部剔除,仍有一个结构性事实站得住——

榜单记录的是「最好的那一次」,而你的生产成本,由「最差的那一次」决定。

做过 CG 和过场的团队都懂这笔账。我们在第 015 期算过抽卡率:一个镜头出 8 版挑 1 版,和出 3 版挑 1 版,工具单价看着一样,工时差三倍。榜单上那 0.3 分的领先,抵不过一次跨镜头角色崩脸带来的返工。

所以评估对象要换。不要看它最好能做成什么样,要看它最差会做成什么样,以及最差出现得有多频繁

具体怎么换,第四节给判据。

第三件事:版权赔付有排除项,排除的恰好是游戏管线的用法

「商用安全」是这两年 AI 工具最好卖的一个词。

它不是空话——主流厂商确实把版权赔付写进了企业条款。Adobe 对符合条件的企业方案,为 Firefly 生成内容提供知识产权赔付;微软的 Copilot Copyright Commitment 承诺,为客户因使用其 AI 产品输出而面临的第三方版权主张兜底。

但承诺的边界,写在那份你不会读完的 PDF 里。

以 Adobe 公开的企业条款为例:标注为 beta 或 trial 的功能不在赔付范围;通过第三方集成或 API 封装方式使用的,同样不适用。微软那份承诺也设了前提——客户不得绕过产品内置的内容过滤与安全护栏。

把这几条排除项,放到游戏生产的真实用法上对一遍,问题就浮出来了。

游戏团队用 AI,几乎不是坐在官方网页里一张张点生成。是 API 批量调用,是接进自己的管线,是用垫图锁风格,是抢先试用那些还挂着 beta 标的新功能

这几种用法,恰好落在赔付覆盖之外。

所以别问「这个工具能不能商用」。要问三个具体问题,而且要对方书面答复:

1、通过 API 调用产生的内容,是否在赔付范围内?

2、我上传参考图(垫图、风格参考)之后,输出内容的责任归谁?

3、赔付有没有金额上限,上限是多少?

第 2 条尤其要问死。垫图是游戏美术锁风格的常规手法,一旦输入端引入了你没有权利的素材,责任怎么划分各家写法不一——不能靠推测,必须让对方白纸黑字回一句。

法律同行给的方向也一致:向第三方采购 AI 工具时,除核查其模型数据来源与授权外,还应在采购合同中对交付工具的侵权责任划分作出约定(德恒律师事务所公开文章)。

第四件事:你选的那个模型有报废日期,最短的只剩一个月

这是整个行业最容易忽略的一件事:采购 AI 能力不是买断,是租一段正在倒计时的东西。

翻一下 OpenAI 官方的 Deprecations 页面就明白了。GPT-4、GPT-3.5 Turbo、o1、o1-pro、o3-mini 的关停日期都是 2026 年 10 月 23 日;Assistants API 已于 2026 年 8 月 26 日完全关闭;o3 的 2025-04-16 快照走到 12 月 11 日;whisper-1 等转写模型撑到 2027 年 2 月 26 日。

按今天算,一批 2023 到 2025 年间搭起来的管线,离它依赖的那个模型名失效,只剩一个月。

停服其实还算好事——至少有公告、有日期、有缓冲期。真正麻烦的是另一种情况:模型换了,名字没换。

供应商在一个稳定别名后面替换底层模型,接口照样返回成功,不报任何错。但风格漂了、构图习惯变了、原来稳定能过的 prompt 开始出奇怪的东西。这类回归不会出现在任何日志里,只会出现在美术的返工单上。

对应地,采购时要确认三件事:

一是能不能锁版本——供应商是否提供带日期的模型快照,而不是只给一个滚动别名。

二是停服提前多久通知——注意有些模型只给 30 天缓冲。

三是历史产出与工程文件能不能完整导出——包括素材、你训的风格模型、你积累的 prompt 资产。

还有一条最容易漏:「不用于训练」和「不留存」,是两件事。

供应商同意不拿你的输入去训模型,不等于它不在服务器上存你的输入,这两条要在合同里分开写。更要注意,套壳工具适用的是套壳方的条款,不是它底层那家大模型公司的条款——你以为签的是甲,实际约束你的是乙。

四问判据:AI 工具采购按这个顺序验,任一不过就别往下走

前面四件事,落成可以直接拿去用的流程:

第一问 · 合规:要备案或登记编号,自己上算法备案系统核,核对备案主体与合同主体是否一致。

第二问 · 退出:能不能锁版本?停服提前几天通知?产出与工程文件能不能全量导出?

第三问 · 责任:API 调用、垫图输入、赔付上限——三个问题要书面答复。

第四问 · 方差:不看 demo,做 pilot。用你自己项目里的真实素材,同一组需求跑 20 次,只看最差的那三次,记返工工时。

执行顺序别搞反。第一、第二问是否决项,都是查资料和发邮件,半天能做完;第三、第四问要花钱花时间。先做便宜的那两项,能砍掉大半候选。

我们见过反着做的团队:兴冲冲先花两周做 pilot,效果还不错,进到合同阶段才发现对方拿不出备案编号,两周白做。

止损线也给一条:pilot 跑过两周还定不下来,答案通常不是「再调调」,而是这个工具不适合你现在这条管线。适配性在前三天就会暴露,后面十天大多是沉没成本在替你说话。

工具会过期,判断不会。

这四件事,没有一件需要你懂模型原理。它们全是公开信息加几封邮件的事——备案系统是公开的,厂商条款是公开的,停服日期是官方自己挂出来的。

真正难的不是查,是把「选工具」从一次技术判断,还原成一次采购判断。榜单服务的是眼球,合同服务的是你上线那天的交付,这两件事从来不是一回事。

AI 工具还会继续迭代,明年此时榜单前三名大概率全换一轮。但只要你的验收标准是「合规、可退出、责任清晰、方差可控」,换谁上榜,都不影响你签字的那只手。

下一期我们聊存量项目——把 AI 塞进一个已经跑了两年的老项目,该从哪个环节动刀,止损线又该画在哪。

《鼬游白书》· 服务游戏公司决策者与投资人的 AI 时代行业观察。关注我们,下一篇继续。

相关学习资料