机密 AI 的崛起:在可信执行环境中运行大模型推理的工程实践
\n1. 引言:当 AI 遇到数据隐私
\n2024 年,某医疗 AI 创业公司在部署医学影像分析系统时遇到一个棘手问题:医院要求患者数据「可用不可见」,但传统推理服务要求明文数据进入模型。这道鸿沟催生了一个新兴方向——机密 AI(Confidential AI):将整个大模型推理管道置于可信执行环境(TEE)中,确保数据和处理逻辑对基础设施操作员也不可见,从硬件层面构建信任根。
\n机密 AI 与传统机密计算有明显区别。后者聚焦通用计算保护(如加密数据库、隐私计算),保护对象是『飞地中的代码和数据』;而机密 AI 深度整合 GPU 硬件安全扩展、推理引擎改造、远程证明协议和隐私保护 ML,目标是实现『端到端不暴露』——用户数据在客户端加密,密文进入 TEE,在 TEE 内部解密、执行推理,结果再次加密返回。基础设施提供商全程无法接触明文。
\n这种能力对医疗、金融、政务、跨境数据场景尤为关键。欧盟《数据法》第 31 条和我国《数据要素×三年行动计划》均对 AI 推理中的数据隐私提出合规要求,而传统法律协议无法替代硬件级信任保证。机密 AI 正是从工程层面回应这一需求。
\n2. TEE 硬件演进与 AI 适配
\n从 2022 年至今,机密计算硬件经历了从 CPU 飞地向 GPU 原生支持的演进。理解各平台技术选型是设计机密 AI 系统的前提。
\n2.1 Intel TDX:信任域架构
\nIntel TDX(Trust Domain Extensions)在第四代至强可扩展处理器(Sapphire Rapids)引入,通过 SEAM(Secure Arbitration Mode)模块在 CPU 层面创建信任域(Trust Domain, TD)。内存由 MK-TME(Multi-Key Total Memory Engine)硬件加密,密钥由 Intel 硬件根信任生成,即使是 hypervisor、BMC、甚至物理接触主板的攻击者都无法读取 TD 内存。TD 间的隔离由 TDX 模块管理,每个 TD 拥有独立的 SEAM 根密钥和模块标识(MRTD)。
\n关键限制:TDX 不支持动态内存热添加,需在创建 TD 时预设内存上限;此外 TD 的 I/O 依赖共享 VMM 代理(TD 内运行 virtio 驱动),吞吐受限。
\n2.2 AMD SEV-SNP:反向映射表与防重放
\nAMD SEV-SNP 在 EPYC 7003 系列(Milan)后提供类似能力,核心创新是反向映射表(RMP, Reverse Map Table)。每个物理内存页在 RMP 中记录所属虚拟机 ID 和权限,硬件在每次内存访问时校验 RMP 条目,防止内存重放、重映射和伪造攻击。SEV-SNP 的密文内存由 AES-128 加密,比 TDX 的 AES-256-XTS 开销略低。
\n2.3 NVIDIA Confidential Computing:GPU 信任根
\n真正让机密 AI 成为生产可行的是 NVIDIA 的机密计算能力。Hopper 架构(H100)首次在 GPU 中引入机密计算:GPU 内部独立生成密钥,在显存中加密数据,并通过 PCIe 总线上的硬件信任根(RoT)执行设备证明。A100 不支持 CC,H100/H200/B200 系列是必需硬件基础。
\nNVIDIA CC 的关键特性:显存加密由 GPU 内部的 AES-128-XTS 引擎完成;PCIe 链路通过硬件保护防止 DMA 嗅探;GPU 通过 SPDM(Security Protocol and Data Model)协议报告设备状态;支持 GPU 与 CPU TEE 的联合证明。
\n2.4 平台选型对比
\n| 维度 | \nIntel TDX | \nAMD SEV-SNP | \nNVIDIA CC | \n
|---|---|---|---|
| 覆盖范围 | \nCPU 内存 | \nCPU 内存 | \nGPU 显存 | \n
| 加密强度 | \nAES-256-XTS | \nAES-128 | \nAES-128-XTS | \n
| 动态内存 | \n否 | \n是 | \n是 | \n
| 侧信道防护 | \nKPTI TLB 隔离 | \nRMP 校验 | \n显存隔离 | \n
| AI 友好度 | \n中(需额外 GPU 证明) | \n中(需额外 GPU 证明) | \n高(原生支持) | \n
3. 机密 AI 推理架构
\n典型的机密 AI 推理管道包含四个核心阶段:客户端加密传输、复合证明与密钥释放、TEE 内推理执行、结果加密返回。
\n3.1 整体架构
\n[客户端] --TLS--

发表评论 取消回复