夜雨聆风学习资料网

ARTICLE · 1038020

89TB AI 资产被删,账上只算出来 20.4 万

89TB AI 资产被删,账上只算出来 20.4 万

「一条命令跑了 17 个小时。第二天公司发现的时候,89TB 的 AI 模型和训练数据已经没了。」

2024 年秋天的一个下午,一个算法工程师在自己工位上敲了一行命令,打卡下班。

这行命令在他走后,又自己工作了 17 个小时。

等到公司运维定位到他的电脑、把进程中止时,89TB 数据已被删除。一台满负荷运转的 GPU 集群利用率直接归零,整个 AI 游戏部门的研发项目全部停摆,全部门停下来抢救数据,用了将近 20 天才把绝大部分数据恢复回来。

这件事的完整过程,是前阵子才被系统性公开的。最终认定的损失是 20.4 万余元。

多数讨论停在「删库跑路」这四个字上。这个角度没错,但不够。它只讲了故事,没讲这件事真正改变了什么。

我把它当成一份事故档案来读,读出三件比「删库跑路」更值钱的事。算力第一次被算进了「损失栏」,这是一。89TB 数据本身,一元钱都没算进去,这是二。最要紧的是第三件:决定这笔账最终算出来是多少的,可能不是被删了什么,而是一份审计报告怎么算账。

下面展开说。

📌 本文看点

01

算力第一次进损失栏

02

89TB 数据一元未计

03

决定这笔账的审计口径

01

FACTS

先把事实钉死:17 小时、89TB、20.4 万

他是 90 后,计算机科班出身,履历上写满互联网大厂经历。2024 年初入职一家科技公司,做算法工程师。

当年年中公司架构调整,部门要把数据从旧集群迁到新集群。一个多月里,部门在工作群里通知了三次,明确说了「数据迁移后部门不再有继续使用旧集群的权限」。包括他在内,所有人都回复了「收到」。

那天下午,他用此前的账号密码登录了旧集群。他想找本部门的文件夹,没找到。他打开了另一个部门的文件夹,那里放着公司自研的多个文生 3D 和渲染 AI 模型,以及全部训练数据。

他先试着拉取目录,系统没及时响应,他中止了操作。然后他敲了一条命令。

公开信息里没写出这条命令的字面,只写了它的含义,三个定语:以最高管理员权限,无须确认,强制删除当前目录下的所有文件和子目录。

下班。

这里有个细节我特别在意:他登录用的是旧账号,删的是别的部门的目录,用的是最高管理员权限。这三件事任意一件单独发生都不致命,三件叠在一起,这事儿就躲不掉了。

命令跑了 17 个小时。运维定位到他的电脑、中止进程时,89TB 已经没了。

— 事件时间线:从一条命令到数据恢复

损失认定是这部分信息里最实在的一段:公司请会计师事务所审计,结果分成两块:人工工资 16 万余元,恢复数据消耗的算力资源超过 4 万元,合计 20.4 万余元。

事后他一直辩称自己是「误删」:工作群里说旧集群不用了,他就认为集群被弃用了。

但这个辩解没成立。他与网上结识的同行早就约定「我这边用公司的资源帮你跑」,案发当天上午还在讨论模型细节。更关键的是事发一个月后他对那位同行说的那句:

「模型训练没帮上啥忙,下一份工作不知道还有没有这么大的训练资源了……下回我还敢。」

结论是:他删除公司数据,目的是为自己干私活的模型腾出空间。

02

PRICING

算力第一次进了「损失栏」

破坏计算机信息系统罪的经济损失认定,过去很多年其实是两句话:直接经济损失,加上为恢复数据、功能而支出的必要费用。实践中能落地的,往往是采购抗 DDoS 服务、买高防包、请第三方恢复数据库这类有发票的东西。

这个案子往里塞了一件新东西。

这个案子往里塞了一件新东西。论证的逻辑是这样的:删除行为让原本满负荷运转的集群 GPU 利用率直接归零,训练进程中断、算力闲置,集群在修复期间完全丧失了核心功能。公司为恢复数据、重启训练,既投了人力又投了算力。算力作为驱动数字经济的「新型能源」,是人工智能大模型训练的核心生产要素,两者都是为消除危害、恢复功能所必须投入的成本。

给出的计量口径,我建议每个做 AI 基础设施的人都抄一遍:

「按恢复任务使用的 GPU 显卡折算每小时的费用,乘以占用时间与数量。」

公式朴素到有点反高潮。但它管用:「AI 训练的停机」从此可以算成一笔账。

这件事还办了第二件事:把「还没上市的训练系统」拉进了保护圈。

法律意义上的「计算机信息系统」,判定要点是「具备自动处理数据功能」。这里的论证路径是功能要件,不看市场状态。AI 模型是硬件、软件、数据三位一体的系统,按机器学习算法对输入数据做采集清洗、加工训练、参数保存、分布式计算、调取推理,研发人员通过云端平台和终端指令与之交互。它能从数据中自我学习进化,产生超出预设代码的能力,已具备自动处理数据的功能。

为了让这个认定站得住,办案过程中引入了网络安全领域的专家意见。专家补上的那句最关键:

这句把保护门槛从「商用产品」降到了「已建成的训练系统」。

对 AI 公司是利好。但反向推论同样成立,而且目前还没有答案:既然训练系统已经被当作受保护的「信息系统」,那它的运营方是不是也相应承担起等保意义上的安全保护义务? 保护义务和合规义务通常是一体两面的,这道口子被打开了。

03

THE GAP

而 89TB 数据本身,一元钱都没算

这一点,我翻遍公开讨论都没见人提过。

那 89TB 里到底是什么?公司自研的多个文生 3D 和渲染 AI 模型,以及这些模型的全部训练数据。训练数据的钱花在哪——采集、清洗、标注、过滤、迭代。模型的钱花在哪——算法团队的人月、调参的算力、失败的实验。这些东西有成本、有原始凭证、有会计基础,但它们一分钱都没有进这份损失清单

— 已认定损失与未计入损失的对照

原因不复杂。这类案件的损失认定只认「直接经济损失 + 恢复的必要费用」,不认间接损失,也不认资产的重置价值。数据的重置成本、研发投入的摊销、研发线停摆的机会成本,全都落在罪名之外。企业真想主张这部分,得另走民事路径,比如侵犯商业秘密,或者劳动合同违约。

于是就有了一组很割裂的数字:恢复数据用的算力 4 万元,被删掉的数据规模 89TB。算下来,每 TB 大约赔了 2290 元。这个价钱在市场上连一块像样的企业级硬盘加数据重建的工时都覆盖不了,更不用说训练数据的重制成本。

再把口径往前推一步。这 4 万元算的是「恢复任务消耗的算力」,不是「重新训练这些模型需要多少算力」。如果按后者算,规模会差出几十倍到上百倍。司法在这里选了一个极其保守的口径。

「AI 资产入刑」这个说法,目前只完成了半场。算力定价了,数据还没有——这个结果给「停机」标了价,但没给「资产」标价。

司法审慎是好事。但它留下的空档很实在:一家 AI 公司最重要的资产被物理意义上抹掉,法律能替它追回的,是抢救费。

04

ACCOUNTING

这笔账是怎么算出来的

这段得慢慢说,因为它最容易被讲错。

先看规则。这类案件的经济损失认定是分档的:造成经济损失1 万元以上,就算「后果严重」;数额达到这个标准五倍以上(也就是 5 万),就升格为「后果特别严重」。

1 万

后果严重

5 万

后果特别严重

1 万的五倍,是 5 万。也就是说,损失金额跨过 5 万这条线,后果的定性直接跳档。

那真正的问题是:这 20.4 万是怎么来的?是公司聘请会计师事务所审计出来的。

我不认为这里面有什么暗箱操作,整个链条相当扎实。但这个机制本身值得所有人看清楚:在一个只有「1 万」和「5 万」两个刻度、跨过刻度就是断崖式跳档的认定结构里,损失金额的计量口径,本身就是结论的一部分。

更值得琢磨的是跨过这条线之后会发生什么。同类事件里,被认定的损失从几万元到上千万元都有,但最终的处理结果并不与金额成正比——跨过门槛之后,金额的边际影响急剧衰减,真正起作用的是别的东西:主观恶性、危害后果的定性、有没有影响主业务、悔罪态度。

— 损失金额的两个门槛:跨过即跳档

这次事件里也一样。他从头到尾辩称误删,事发一个月后还在说「下回我还敢」,主观恶性这一项几乎拉满。跨过门槛之后,金额就不再是主角了。

顺带说一句「下回我还敢」这句话。

很多人把它读成嚣张。我读出来的是另一层东西:他算过账。他知道私用公司算力会被开除,因为聊天记录里明明白白写着「有个同学之前跑了一个任务,用了公司资源,最后被开除了」。在他的风险模型里,最坏结果是丢工作。

他没算到的是删除数据。不是因为他对强制删除的危险无知。真正的空档在这儿:从「开除」到最坏的结果之间,没有中间档。一个人的风险感知会默认停在最坏结果的低档位,尤其当这个低档位有现成的先例。惩罚梯度设计成断崖,人的行为判断就会留在崖底下。

06

COST METHOD

会计和法律,在同一年选了同一个方法论

再往前看一层,有个巧合我认为不是巧合。

2024 年 1 月 1 日起,财政部《企业数据资源相关会计处理暂行规定》正式实施,数据资源可以确认为无形资产或存货。落地初期,市场上出现过一股「借评估增值做大资产规模」的冲动。

到 2025 年 12 月,财政部、国资委、金融监管总局、证监会四部门联合发文,把规则收紧,其中一条极其明确:企业应当以成本计量内部形成或外购的数据资源,不得将以评估等方式得出的金额直接作为入账和调账的依据。同时明确,此前已经费用化的数据资源支出不得追溯资本化。

同一年,这次认定给出了算力的损失口径:单位时长费率 × 占用时长 × 数量。也是成本法。

会计上,数据资产不能按评估价入账了,得按成本计。法律上,算力损失不能按「重训要花多少」算,得按「你实际花了多少」算。

— 会计侧与刑法侧在同一时间窗口的方法论趋同

为什么?因为这类资产没有活跃的二级市场。你没法像评估一栋楼、一台机器那样,去看可比交易、去算收益折现。数据值多少钱、模型参数值多少钱,谁都说不准。唯一能验证的,是「你已经花掉的钱」。

这个「不约而同」说明了什么?说明数字资产的价值发现,还处在非常早期的阶段。会计和司法都在用最保守的方法兜底,因为更激进的估值方法一旦被接受,滥用空间会很大。这个保守是对的——但它同时意味着,未来几年里,AI 公司真正的家底,在账面上和法律上都会是低估的。

对做安全和风控的人来说,这句话要反过来读:账面上被低估的资产,在风险管理上也会被相应地低估。一家公司会把几千万的机房当重点资产来保护,但未必会把「账面上更便宜、实际更贵」的训练数据集和模型权重当成同等重要的资产来对待。

这个案子,就是那个低估的代价。

07

POST-MORTEM

一条命令跑 17 小时,防线是怎么一层层漏掉的

回到技术面。媒体标题里有种荒诞感的来源是「一条代码」。但从工程角度看,该问的问题完全是另一个。

89 TB ÷ 17 小时 ≈ 1.45 GB/s 的持续吞吐

这个数字有意思的地方有两处。一是如此稳定的持续输出,本身就说明这个进程全程无人干预——他在家睡觉,命令在跑。二更该说:没有任何一层机制在这种异常速率面前踩下刹车

一条递归强制删除命令能连续跑 17 个小时,意味着三道本该存在的闸门全部缺失:

闸门一 · 速率熔断

删除操作达到某个阈值,比如单位时间删除文件数超过基线、或者单次操作影响的容量超过设定值——就应该触发阻断或审批。本案里没有。删到第 1 小时和第 17 小时,系统的反应完全一样。

闸门二 · 大批量删除行为检测

安全侧通常对「异常外传」盯得很紧,对「异常删除」的监控却薄弱得多。一个研发人员的正常操作里,不会出现持续十几小时的批量删除。这类行为特征并不难识别,难的是有没有人把它列为监控项。

闸门三 · 软删除与回收站

这是最让我意外的一点。快照、回收站、删除宽限期,这些谈不上高精尖,都是存储层的基础配置。它们不能防止删除动作发生,但能把「误操作」和「不可逆灾难」区分开。本案里,删除即消失。

再往上看权限这一层,失效得更彻底。四重问题叠在一起:账号未回收(部门 7 月已明确不再拥有 A 集群权限,他 9 月还能用旧账号登进去)、跨部门未隔离(AI 短剧部门的人能对 AI 游戏部门的目录做操作)、特权账号未管控(管理员权限是「持有」而非「临时申请」)、高危操作无确认(强制递归删除一次输入直接执行)。

还有一层很微妙的因素:时机

案发时公司正在做 A 集群到 B 集群的整体迁移,全员刚回复过「收到」。这个窗口期的特征是什么?权限状态最混乱、数据归属最容易搞错、所有人的注意力都在「搬东西」上而不是「守东西」上。攻击面和事故面在这种时候都是最大的。

17 小时之后,公司用了将近 20 天恢复数据。这里还有一个小推演可以做。

如果按市场上 A100 80G 大约 10 元/卡/小时的价格折算,4 万元的算力成本对应约 4000 卡时。如果是 8 卡机器连续跑,那是约 500 小时,差不多 20.8 天——跟「近 20 天恢复」对得上

也就是说,这家公司在用一台 8 卡机器,抢救 89TB 的研发资产。三天前还满负荷运转的集群,出事之后能调动的只有这么一台。

这个对比可能是整个案子最刺眼的:资产的规模,和恢复它的能力,完全不在一个量级上。

— 四重失效叠加与本该存在的四道闸门

事后提出的整改方向有四条:健全管控制度、强化数据备份安全、建立应急响应机制、职业伦理与法治教育培训。

我完全认同这四条。但如果只能留一条,我留第二条:惩罚解决不了企业存续,快照和权限能。追责是别人的事,备份是自己的事。

08

FORWARD

算力、算法、产权,正在被写进条文

这件事不是孤立的,它和立法节奏是咬合的。

2026 年 5 月,《国务院 2026 年度立法工作计划》公布,其中一句是:完善人工智能治理,加快推进人工智能健康发展综合性立法;加快完善保障数据、算力、算法、产权、网络安全、供应链安全等人工智能共性要素及规范重点应用场景方面的立法。同月的全国人大常委会年度立法工作计划,把人工智能健康发展方面的立法项目列入预备审议项目,同时还列了《网络犯罪防治法草案》。

「数据、算力、算法、产权」这四个词被并排列进立法任务里,是个信号。刑法已经先一步通过个案把「算力」纳入保护范围,接下来更可能是体系化的确认。

学术界也在推。有学者公开发文建议,针对数据资产领域增设「侵占数据资产罪」「破坏数据资产罪」,明确犯罪构成与量刑标准。同时建议在现有罪名中把「非法跨境转移数据资产」列为加重处罚情节,把「明知是非法获取的数据资产而予以收购、贩卖、中转」纳入规制,以切断数据资产犯罪的利益链条。还有一条我认为很关键——让刑法与《数据安全法》《个人信息保护法》建立动态衔接,明确「核心数据」「重要数据」的刑法保护标准。

配套的资产化管理也在铺路。2026 年 7 月,两项数据资产管理国家标准发布并于 9 月 1 日实施:《资产管理 数据资产分类与代码》《资产管理 数据资产登记指南》。它们要解决的是企业数据资产盘点、台账建立、权属梳理的统一规范,把「数据治理—资产登记—财务入账」这条链路打通。

我特别在意「资产登记」这件事。它和本案的关联非常直接:如果一家企业连自己的数据资产都没有台账、没有登记、没有权属记录,那么一旦出事,它在事后能主张的损失,就只能是抢救费。没有台账,就没有重置成本的证据。没有权属记录,就没有「这是我最重要的资产」的法律表达。

反过来说,这个结果其实给所有 AI 公司指了一条很实际的路:把数据资产做进管理台账,不只为了融资或报表,也是为了有朝一日能主张损失。整改意见里那句「强化数据备份安全」,和国标里的「数据资产登记」,本质上是同一件事的两个侧面。

EPILOGUE

真正的教训不在事故本身

这件事可以读成一个荒诞故事:一个算法工程师为了接私活腾空间,敲了一行被圈内戏称为「删库跑路」的命令,抹掉 89TB,把公司一条 AI 研发线按停。

也可以读成一份行业样本:算力第一次被写进损失栏,未上市的训练系统第一次被认定成「信息系统」,两个此前的空白都被填上了。

但我更愿意把它读成一份体检报告。

20.4 万的赔偿代表不了 89TB 的价值。数字资产太新了,新到会计不知道怎么记、刑法不知道怎么算、大多数公司还不知道该怎么守。

说到底,事后算出来的只是一个价。让这事儿压根不发生的功夫,得下在公司自己身上。

「那道防线的名字其实很朴素:软删除、快照、跨部门权限隔离、高危操作审批。没有一样是新发明。」

它们的成本,跟一条研发线停摆 20 天相比,大概可以忽略不计。

END

📎 事实与信源说明

信息来源

· 光明日报、澎湃新闻、南方财经网等媒体对该事件的公开报道

· 北京市知识产权公共信息服务平台等平台刊载的相关内容

法律依据

· 《中华人民共和国刑法》第 286 条

· 两高《关于办理危害计算机信息系统安全刑事案件应用法律若干问题的解释》(法释〔2011〕19 号)第 4 条、第 5 条

推算与说明

· 文中「每 TB 约 2290 元」「约 8 卡机器连续约 500 小时 / 20.8 天」「1.45 GB/s 删除吞吐」均为基于公开数据的推算,用于说明量级,非官方认定数据。

· 「损失金额的计算口径会直接影响认定结果」为作者分析。

· GPU 租用价格取 2026 年市场常见区间,用于推算,非实际采购价格。

如果你觉得今天这篇有收获,欢迎点赞、在看、转发三连,我们下篇见。

相关学习资料