数据驻留(Data Residency)指的是:数据在存储和处理时,必须物理留在某个指定的国家或地区境内,不能随便跨境。
为什么企业揪着这件事不放?一是法规,很多国家和地区对个人信息、金融、医疗、政务数据有本地化要求;二是行业监管和客户合同——大客户采购 AI 服务时,常把"数据不得出境"直接写进条款。打个比方:你租的房子,房东不禁止你买家具,但要求所有家具必须放在这套房子里,不能搬去隔壁小区。数据可以存、可以算、可以备份,但落脚点得在境内。
这个约束落到 AI 服务上,架构要动的地方比想象中多。
1. 推理就近部署。 模型跑在哪,数据就流向哪。最直接的做法是把推理服务部署在境内可用区,用户请求不出境就能拿到回答。模型权重本身通常不被当作个人信息,但不少合同会把权重、索引、缓存都划进"数据"的范围,签之前要看清楚。
2. 数据链路全程闭环。 上传文件、提示词、会话记录、对象存储、消息队列、缓存、日志,整条链路都得落在同一区域内。常见的坑是:主体服务在境内,但消息队列或对象存储配的是境外区域,数据悄悄跑了出去。
3. 训练、微调与检索。 微调数据、向量化结果、向量库(vector database)、RAG 的索引文件,全都是数据副本。向量库尤其容易被忽略——它不是一份轻量索引,它存的是实打实的语义内容。
4. 可观测性与运维。 错误上报、链路追踪、应用性能监控(APM)、日志聚合工具,默认往往把数据发回厂商的境外中心。这是最常被漏掉的一环。要么本地化部署,要么在采集端脱敏并关闭内容上传。
5. 身份与密钥。 身份提供商(IdP)和密钥管理服务(KMS)如果在境外,一次 token 校验就是一次跨境传输。
6. 备份、灾备与删除。 备份不能复制到境外区域;用户行使删除权时,缓存、备份、日志里的副本都要能删掉,否则合规上说不清。
7. 别直接调境外 API。 调用境外模型 API,等于把提示词送出境。替代方案是本地部署开源模型,或使用在境内合规托管的同类模型。
几个容易混的概念:
| 概念 | 关注点 |
|---|---|
| 数据驻留 Data Residency | 数据物理上存放在哪 |
| 数据主权 Data Sovereignty | 数据受哪个国家的法律管辖 |
| 数据本地化 Data Localization | 法规强制要求必须存在境内 |
| 数据跨境传输 Cross-border Transfer | 具体某次传输行为,通常需配套合规机制 |
驻留是事实问题,主权是法律问题,本地化是义务问题。三者经常一起出现,但不是一回事。
对从业者来说,最实用的一条是把"区域"当成架构的一等公民:配置、密钥、存储、日志、模型都按区域切分,别留全局单例。对普通职场人来说,这意味着你用的某个 AI 功能背后可能有两套完全独立的部署,一次对话不会因为服务器调度就飘到国外去。具体某家厂商在哪些区域提供服务、满足哪些合规认证,以官方页面为准。
