
阅读约 8 分钟 | 全文约 4200 字
把合同、重要材料、经营报告、财务报表,直接扔进某个 AI 对话框,你干过没有?
扣子、workbuddy、qoderwork等这些Agent已经成为从老板到打工人日常都必不可少的办公工具。但你的使用姿势正确吗,这其中存在的合规风险到底有多大,可能你也没有仔细考虑过,你给AI的东西,他到底去哪了。
今天就AI使用过程中的合规问题,简单讨论下,那些常见的规避办法为什么治标不治本,以及如果你既想用 AI 又想合规,该怎么办,给出我个人的解决方案,即端侧模型、AI编程及AI Infra,复杂度逐步提升。
一、先谈合规风险
1. 数据隐私:你给AI模型的输入,被拿去做训练数据
很多免费或低价的AI工具,服务条款里都藏着一句:我们可能使用你的输入内容来改进产品。
啥意思呢?你问的每一个问题、传的每一份文档,都可能被拿去作为模型的训练数据。这个过程中就涉及传输、存储以及读取使用。数据从你的浏览器一路到对方服务器,中间过多少节点,没人说得清。
2. 敏感信息:商业机密被存储在模型服务商服务器
最典型的例子是 2023 年三星。有员工把内部源代码和会议记录直接粘进 ChatGPT,触发了内部告警,后来三星一度全面禁用。
一份客户名单、一套运营策略,个人图省事往 AI 里一丢,信息可能就被散播出去了。就算厂商拍胸脯说"绝对不拿你数据训练",数据在传输、缓存、日志里留的痕迹,也是实打实的风险敞口。
3. 法规合规:个保法、数安法,极易触碰
如果你传输的信息中包含个人信息,《个人信息保护法》《数据安全法》对"告知同意""数据出境""最小必要"都有刚性要求,涉及跨境传输的,还有更加严格的合规流程。
《生成式人工智能服务管理暂行办法》也明确:提供者对训练数据来源和生成内容的合法性负责。因此,拿 AI 处理用户数据出了事,你的主体责任跑不掉。
二、那些"规避操作"为什么治标不治本

常见的规避操作大体如下:
数据脱敏,用之前手动把姓名金额编号抹掉,问题是人工脱敏后,语义信息也不完整,回答的问题可能不尽人意。 访问控制,规定谁能用、什么能用,可规定是死的,人是活的,想用的人总能绕过去。 订阅企业版,最正规,但中小企业成本导向,且是否信得过厂商。
只要数据离开你的设备、离开你的内网,控制权就不在你手里了。
那是否能够在有限的成本解决这些问题呢。以下是我的鄙见,大家可参考。
三、第一条路:用 AI 编程给自己造个离线工具
这条是我自己从AI编程能力大幅提升后,最上头的一条,也最适合个人开发者和中小团队。
以前要解决个具体问题,比如从几百份合同里把甲乙方提取出来,要么手动硬抠,要么把数据丢给某个 AI。现在多了个选择:打开 Cursor、Qoder或者 Claude Code 这类 AI 编程工具,让它帮你写一个跑在本地的脚本或小应用。这个工具离线运行,底下可以接本地端侧模型或本地 API,数据从头到尾不离开你的电脑。
得跟端侧模型区分开:端侧是"通用模型在本地跑",这条是"用 AI 帮你造一个专干某件事的离线工具",等于把通用能力封装成一个只干一件活的本地应用。
它解决合规也简单:工具离线跑,数据不外传;针对你的场景定制,原始数据不用交给任何通用大模型;代码和模型都在你手里,可控、可审计。
适合干什么?个人或小团队的文档批量处理、格式转换、本地知识库问答;文本清洗、标注、分类这类轻活;还有内部非核心流程的自动化,比如自动生成日报、整理数据。
但边界我必须讲明白:这条路只适合事务处理要求不高的场景。核心业务逻辑、对准确率和一致性要求高的关键流程,它扛不住。另外它对使用者有动手门槛,虽然 AI 把门槛砍了一大半,但你总得会装环境、跑起来、调一调,造完还得维护,不是一劳永逸。
一句话总结:用 AI 造工具,而不是把敏感数据直接交给 AI。
四、第二条路:端侧模型,让数据从源头不出门
把模型跑在你自己设备上,本地推理。
端侧模型(On-device Model),指的是把参数压到能在手机、笔记本上直接跑的 AI 模型。推理全在本地完成,数据不离开设备,泄露的可能性从源头就被掐了。
它为什么能解决合规?数据不出设备,物理层面隐私风险为零;不依赖任何外部服务,也就没有数据跨境、厂商拿你数据去训练这些事。
大模型的发展现在有两个方向,一个是越做越大,模型参数万亿级,Kimi K3的万亿参数,一个是越做越小,让他能够以极小的参数得到比其参数规模更大模型的性能。
端侧模型发展势头不错,1B 到 7B 参数的模型在消费级硬件上已经跑得顺,、阿里的 Qwen 小模型、面壁科技的openbmb生态都是例子。苹果搞的 Apple Intelligence,走的也是端侧为主、云侧兜底的混合路子。
不过这种方式还是有一定局限:端侧模型由于训练过程以及其上下文限制,做复杂推理,目前无法与大参数模型相提并论。但日常办公辅助、本地知识问答、轻量代码修改够用。
五、第三条路:AI Infra,把 AI 圈进自己的内网

企业自己搭 AI 基础设施,模型和数据都待在你能掌控的环境里。
如果说端侧模型是"个人把 AI 关进手机",那 AI Infra(AI infrastructure)就是"企业把 AI 圈进自己的机房或私有云"。
它不光是本地部署一个开源模型,而是一整套东西:模型仓库、推理服务、API 网关、权限管理、安全审计、资源调度,全都关在内网里闭环。
合规上的价值很实在:数据整个生命周期不出内网,直接符合数据出境、跨境传输的要求;谁能什么时候问了什么,日志记得清清楚楚;模型自主可控,不依赖境外服务,政策风险也绕开了;多租户隔离加权限管控,企业级安全才有保障。
技术架构简单说分三层:上层是业务接入、审计日志、权限管理;中层是模型仓库、API 网关、负载均衡;底层是 GPU 算力池加推理引擎,比如 vLLM。
但这种方式仅适合大型企业,且对AI需求较大的企业。一次性投入成本以及运维成本较大,真正刚需的企业可能才会考虑AI infra方案。
六、三条路怎么选?一张表说清楚
简单给个选法:
个人、轻量通用的需求,端侧模型最省心; 企业、核心业务、强合规要求的,AI Infra 最稳妥; 个人或小团队、有特定低要求场景、又愿意动手的,离线专用工具最灵活。
七、写在最后
说实话,合规很麻烦但很重要,从今天起用 AI 的时候多想一层"这块数据能不能出去"。
后续,我会发一些个人写的效率工具,一定有适合你场景的。记得关注!
夜雨聆风