ARTICLE · 1083631
企业能否在不牺牲AI可靠性的前提下保护数据?

随着企业加速投资AI,数据隐私保护往往导致数据质量下降和关联性破裂,成为工程瓶颈。本文探讨了如何在AI时代兼顾数据保护与实用性,强调保持引用完整性和使用企业级脱敏算法的重要性,指出可信数据才是真正的竞争优势。
译自:Can enterprises protect data without making AI less reliable?[1]
作者:Mayank Ahluwalia
随着组织对AI的投资不断增加,许多人发现了一个新的瓶颈:获取既受保护又具有实用价值的数据。工程团队需要逼真的、生产级别的数据来验证AI生成的更改、训练模型、测试应用程序以及生成业务洞察。然而,隐私举措有时会使这些数据更难访问、更不能代表真实世界的条件,或者无法保留记录之间的关键关系。
Perforce Delphix[2]“2026年AI与数据隐私报告”[3]凸显了这一挑战。在接受调查的组织中,26%的人表示隐私控制使获取生产质量的数据变得更加困难,25%的人难以维护跨数据实体的关系,51%的人提到了数据质量挑战。
“如果数据无法再支持依赖它的系统,那么保护数据就远远不够。”
如果数据无法再支持依赖它的系统,那么保护数据就远远不够。对于工程团队而言,问题在于其数据保护策略能否保留最初使数据具有价值的品质。你需要一个全面的数据策略,并配备能够在各个环境中维护引用完整性和关系工具。
这些统计数据对从业者意味着什么
乍一看,报告中的统计数据,比如“51%的企业提到了数据质量挑战”,听起来可能纯粹是一个治理问题。
但在实践中,它们代表了工程问题。低质量的数据集会导致:
• 分析不准确。 • AI模型训练不佳。 • 测试覆盖率不完整。 • 返工增加。 • 发布延迟。 • 对数据自动化[4]的信心降低。
“当AI模型在不完整或失真的数据上进行训练时,其输出的可靠性就会降低。”
当AI模型在不完整或失真的数据上进行训练时,其输出的可靠性就会降低。当测试环境中包含不现实的数据时,缺陷可能会逃逸到生产环境中。当分析数据集缺乏一致性时,团队花在验证结果上的时间就会超过根据结果采取行动的时间。
数据保护与效能并非对立目标
一个常见的误区是,组织必须在隐私和创新之间做出选择,但最成功的组织深知,合规性、质量和速度可以而且需要协同工作。
受保护的数据仍然需要具备以下条件:
• 足够逼真,适合测试和验证。 • 具有足够的代表性,适合分析。 • 足够易于访问,方便工程团队使用。 • 受到充分管治,符合监管要求[5]。 • 具备足够的连通性,以维护引用完整性。
AI时代有一个双重目标:减少敏感数据的暴露,同时创建在受保护后仍然具有价值的可信数据。很多时候,企业为了创新或速度而牺牲合规性。这就是为什么我们报告中84%的受访者在其非生产环境中设有数据隐私例外的主要原因。
“AI时代有一个双重目标:减少敏感数据的暴露,同时创建在受保护后仍然具有价值的可信数据。”
组织只有在能够访问准确代表生产条件的可信数据时,才能以AI的速度前进。当隐私控制降低质量、限制真实性或限制对代表性数据集的访问时,数据层就会成为新的瓶颈。
为什么引用完整性比以往任何时候都重要
许多关于数据隐私的讨论都集中在屏蔽敏感字段上。然而,如果在保护过程中丢失了实体之间的引用完整性[6],被屏蔽的数据可能会产生另一种风险。
客户、订单或付款记录可能仍然存在,但如果在保护过程中连接这些记录的关系破裂,数据将不再类似于现实。以账单验证为例,当客户在多个数据库表中有多个产品、费用和发票以生成正确的产品或进行准确的收费时,它就需要引用完整性。
对于现代AI和分析[7]系统而言,断裂的关系尤其成问题。分析管道依赖于一致的标识符来跨源连接信息。AI和机器学习工作流依赖于完整的业务上下文来识别模式并进行预测。软件测试依赖于记录之间现实的关系来准确验证应用程序的行为。
当引用完整性丢失时:
• 分析可能会产生不完整或误导性的结果[8]。 • AI模型可能会从有缺陷的数据集中学习。 • 测试环境可能无法暴露生产问题。 • 团队对受保护的数据集失去信任。
重要的是,这些故障通常很难检测。管道可能会继续成功运行,同时默默地产生降级的成果,这可能是一个代价高昂的错误。
这有助于解释为什么25%的受访组织认为跨数据实体维护关系是一个重大挑战。对于从业者而言,该统计数据是一个警告:如果隐私控制未能维护业务上下文,它们可能会无意中破坏AI和analytics(分析) initiatives(倡议)的质量。
请记住,并非所有的数据保护解决方案都是生而平等的——企业级的屏蔽算法是维护关系的关键。当一致且大规模地[9]应用时,这些算法可确保相同的输入在您的系统和环境中产生相同的屏蔽输出。其他屏蔽方法可能是零星进行的,从而导致关系破裂。
工程团队应该衡量什么
许多组织仅通过合规性指标来衡量隐私成功与否。然而,由AI驱动的环境需要更广泛的成功定义。工程领导者应从几个维度评估隐私倡议:
• 数据质量: 受保护的数据集是否准确反映了生产条件? • 真实性: 开发人员、数据科学家和分析师能否放心地将数据用于其预期目的? • 引用完整性: 应用程序、表、环境和数据源之间的关系是否保持一致? • 可访问性: 团队能否在不引起延迟的情况下获取合规数据? • 配置速度: 需要时能多快交付可信的数据集?
这些衡量标准可帮助组织确定隐私工作是赋能AI成果还是造成了新的障碍。
默认进行治理设计
随着AI采用率的增长,隐私不能仍然是一个在开发开始后才进行的独立过程。相反,组织应绘制整个数据生命周期的图表,从数据请求和发现到重用和退役。
这种方法有助于确保将治理内置到工作流中,而不是作为后期检查点应用。它还提供更强的可审计性,减少合规性例外,并使团队更有信心认为受保护的数据集仍然适合其用途。
最重要的是,它将隐私目标与业务结果保持一致,而不是将它们视为竞争优先级。
可信数据将成为竞争的差异化因素
随着智能体开发的持续崛起[10],对测试数据(在数量、覆盖范围和规模上)的需求正在蓬勃发展。AI还增加了企业可以生成的更改量,但验证该更改的挑战仍未解决。
这一责任仍然属于数据。从AI中获得最大价值的组织不一定是拥有最先进模型的组织。它们将是拥有最可信数据基础的组织——采用投资组合方法,根据需要结合使用数据虚拟化来实现速度、屏蔽来实现安全性以及合成数据来实现覆盖范围。
“在AI时代,可信数据(而非快速的模型输出)可能是最终的竞争优势。”
这项研究指出了一个清晰的教训:如果隐私控制能够维护真实性、质量、记录之间的关系或对代表性数据集的访问,它们就能赋能AI的成功。
随着企业继续投资于AI和数据隐私,真正的目标应该是确保保护和效能共存。因为在AI时代,可信数据(而非快速的模型输出)可能是最终的竞争优势。
引用链接
[1] Can enterprises protect data without making AI less reliable?: https://thenewstack.io/protecting-enterprise-ai-data/[2] Perforce Delphix: https://www.perforce.com/[3] “2026年AI与数据隐私报告”: https://www.perforce.com/resources/pdx/state-of-ai-and-data-privacy-report[4] 数据自动化: https://www.perforce.com/resources/pdx/test-data-automation[5] 监管要求: https://www.perforce.com/resources/pdx/data-privacy-regulations[6] 引用完整性: https://www.perforce.com/resources/pdx/referential-integrity[7] 现代AI和分析: https://thenewstack.io/data-telemetry-is-the-lifeline-of-modern-analytics-and-ai/[8] 不完整或误导性的结果: https://www.perforce.com/blog/pdx/cost-of-software-defects[9] 一致且大规模地: https://thenewstack.io/consistency-at-scale-unifying-temporal-and-yugabytedb/[10] 随着智能体开发的持续崛起: https://thenewstack.io/enabling-autonomous-agents-with-environment-virtualization/