乐于分享
好东西不私藏

AI 夜话|模型权重一旦出门,谁也叫不回来

AI 夜话|模型权重一旦出门,谁也叫不回来
 

AI 三餐 · 夜话 · 今日一句

 

模型权重像一箱会自我复制的工具:递出去容易,想收回来就只剩祈祷。

想象你租了一把电钻。店家能限时、断电、召回;你若买下图纸和整套模具,往后怎么改、复制给谁,店家都管不着。

这就是今天争论的“开放权重”。权重是模型训练后留下的海量参数,可以理解成它压缩过的经验和习惯。拿到权重,就能把模型放在自己的机器上运行、微调,也能拆掉原开发者设置的安全护栏。

7 月 27 日,Anthropic CEO Dario Amodei 发文澄清:公司从未主张全面禁止开放权重,能力不危险的开放模型是公共品;真正需要谨慎的是具备强网络攻击、生物风险等能力的前沿模型。第二天,Redis 作者 Salvatore Sanfilippo 公开反驳:最危险的单点,恰恰可能在少数封闭实验室内部。

 

⏱ 30 秒速览

 
  • 开放权重不是“公开一段代码”,而是把可复制的模型能力交出去。
  • 封闭服务有刹车,开放模型有更多审查者;两边各握着一种安全。
  • 我的结论:别禁开放模型,但高风险能力必须先过独立测试再谈发布。

01争的是哪道门

封闭模型像远程租用的大脑:你的请求送到公司的服务器,开发者能记录异常、更新护栏、封禁账户,极端情况下直接下线。开放权重则像把大脑文件下载回家。它可以离线运行,不必把资料交给云端,也不再受供应商涨价或停服摆布。

关键差异是控制权跟着副本走。一份权重可以被无限复制,护栏也能通过微调被改掉。开发者今天发现漏洞,无法像手机系统那样强制所有副本更新。Anthropic 把它称为“持续且不可逆的误用风险”,这个判断并不夸张。

📎 Anthropic 官方立场 · 2026-07-27

02为什么两边都对

谨慎派担心的是“一次成功就够了”。攻击者只需找到一个可利用的漏洞,或把模型改造成不拒绝危险请求的版本;防守者却要盯住所有入口。权重一旦散开,监控、撤回、统一修补这三只刹车同时消失。

英国 AI 安全研究所与美国 CAISI 在 7 月 23 日公布了 Kimi K3 初步评估:它在一个 32 步的模拟企业网络攻击中,平均走到第 17 步;10 次尝试里有 1 次走完全程。报告同时提醒,这个环境没有主动防守者,也不会惩罚触发警报的动作,不能直接等同于真实攻击。

 

📊 当前能力

 

17 / 32 步

 

Kimi K3 在 TLO 模拟企业网络攻击中的平均进度 · UK AISI / CAISI · 2026-07-23

📎 UK AISI / CAISI 初步评估 · 2026-07-23

开放派盯着另一种单点:少数公司握住最强模型、全部日志和发布节奏。如果实验室内部判断失误、权重被盗,外界既看不见,也来不及帮忙。Sanfilippo 的最强论据很直接:泄露发生后,封闭权重同样会变成无法召回的副本;把风险全算在正式开放上,漏掉了实验室本身。

“真正的风险是泄露,而不是发布;泄露发生在前沿公司内部。”
—— Salvatore Sanfilippo · 2026-07-28

📎 antirez 原文 · 2026-07-28

开放还带来两样实际好处:公司可以把敏感数据留在本地,研究者也能检查、修改和复现模型。开源促进组织 OSI 的定义更严格——真正的开源 AI 不只要给权重,还要给足够的训练数据说明与训练、运行代码。市面上许多“开放权重”模型,离完整开源还有一段距离。

📎 Open Source AI Definition 1.0

03历史给过答案

2000 年,美国 NIST 选出后来广泛使用的 AES 加密标准。它没有把算法锁进抽屉,而是办了一场持续 3 年的全球竞赛,邀请密码学家公开“攻击”候选方案。来自 12 个国家的研究者参与,15 个算法被筛到 5 个,最终选出 Rijndael。

 

📊 历史对照

 

15 → 5 → 1

 

AES 全球公开竞赛的候选筛选路径 · NIST · 1997—2000

这段历史支持开放派,但有个常被漏掉的前提:AES 的开放发生在明确标准、公开评审和制度组织之下。公开不是把东西往网上一扔;它是一套让更多人攻击、复核、再定稿的工程流程。AI 更麻烦,因为算法公开不会突然学会攻击网络,模型权重本身却已经装着能力。

📎 NIST:AES 全球竞赛 · 2000-10-02

04接下来盯三件事

未来 3—6 个月,别只看模型榜单。更值得盯的是:有没有独立机构做发布前的网络与生物能力测试;测试阈值是否同时约束开放和封闭模型;开发者会不会采用分阶段发布,先开放低风险版本,再根据评估决定是否放出更强权重。

对普通人来说,开放权重最直接的价值是本地运行、隐私和不被一家供应商锁死。最直接的代价,是你不能把“有护栏”当成永久保证。下载模型前看许可证、来源和安全说明,企业则要把开放模型当软件供应链来管:版本可追踪、权限可隔离、出事能停机。

 

🗣 Leif 怎么看

 

全面禁止开放权重,既挡不住泄露,也会把隐私、竞争和研究能力一起误伤。但把“开放”当免检金牌同样天真。我的票投给能力分级:低风险模型尽量开放;碰到可自主攻击网络、显著降低生物危害门槛的能力,先由独立机构测清楚,再决定开放到哪一层。

— AI 三餐 · 晚 8 点这顿,明天继续 —