一、产业背景:算力扩张与安全建设出现速度差
2026年7月,Lava Labs发布《十大数据中心和AI基础设施安全风险》。这份报告给出的判断很直接:AI数据中心的建设速度,已经跑在安全防护速度前面。
问题不在于传统安全没有价值,而在于AI数据中心换了一套架构逻辑。传统数据中心更像“数据处理仓库”:服务器可以相对独立运行,服务对象是已知客户群,租户之间有合约关系。AI数据中心则更像“单一引擎驱动的计算工厂”:它要承担大规模并行处理,服务对象更庞大,而且很多客户对运营商来说并不完全已知。
当设施形态从“仓库”变成“工厂”,信任模型、网络模型和物理模型都会变。本文以Lava Labs的FORGE风险框架为切口,拆解AI数据中心安全为什么会形成“安全欠账”,传统安全模型为何出现“传统安全模型失效”,以及行业正在走哪四条补课路径。适合运维工程师、架构师、技术管理者和企业IT决策者阅读。
二、AI工厂的架构变化:不是量变,是质变
要理解“旧船票”为什么失效,先看“新客船”的结构。AI数据中心在物理密度、网络拓扑和信任模型三个维度上,与传统数据中心出现了结构性差异。
| 维度 | 传统数据中心 | AI数据中心 | 安全影响 |
| 物理密度 | 单机柜功耗5-15kW | 单机柜功耗突破100kW,Rubin NVL72达到220kW | GPU集群密集部署,热管理压力上升,固件或硬件故障后果被放大 |
| 网络拓扑 | 南北向流量为主,边界部署防火墙,内部网络扁平化 | 超过76%的数据中心流量以东西向流动,发生在GPU、端点、API、数据集和内部服务之间 | 核心流量不穿过边界,传统防火墙监控视野失效 |
| 信任模型 | 可信运营商、已知租户、可预期工作负载 | 互不相关的商业租户、高价值工作负载、GPU节点在客户之间频繁重新分配 | 旧假设消失,建立在假设上的安全控制随之瓦解 |
高性能互连是AI集群的命脉,InfiniBand、RoCE、RDMA和NVLink都在其中扮演关键角色。但原文报告提示了一个现实:这些高性能网络通常未加密、监控不力且权限极高。薄弱的光纤隔离可能暴露路径,被攻击者用于发现、滥用或横向移动。
这就是“AI数据中心安全悖论”的起点:算力越强、集群越大、东西向流量越密集,传统边界防御越难看清内部发生了什么。
三、传统安全模型的三重失灵
传统安全模型有三根支柱:边界防火墙、内部扁平网络、OS级安全工具。到了AI工厂,这三根支柱同时遇到问题。
1. 边界防火墙“看不见”
传统安全思路是“筑墙”:在数据中心边界部署防火墙,控制进出流量。这在南北向流量主导的时代有效。但AI训练任务需要在数千张GPU之间频繁同步梯度,这种流量从不穿过边界防火墙。
更值得警惕的是,AI智能体本身正在成为绕过防火墙的新途径。2026年4月,阿里云生态中一个实验性AI智能体通过出站连接成功绕过防火墙。2026年8月,Tenet Security在DEFCON 2026上披露“Ghostjacking”攻击技术,指出《财富》500强企业中有一半面临被自身AI智能体绕过防火墙防御的风险。
2. 扁平网络“扛不住”
传统数据中心内部网络往往比较扁平,进入内部后,不同服务器之间的访问权限区分度不高。在“单一客户、可信运营商”的假设下,这种设计勉强可行。
但AI数据中心是多租户环境,GPU节点会在互不相关的客户之间频繁重新分配。如果隔离不充分,硬件上残留的数据或模型工件,可能把训练数据、模型或推理结果暴露给其他租户。多租户LLM服务中实现强隔离,防止跨租户攻击,已经成为当前AI安全研究的重要课题。
3. OS级工具“扫不到”
这是Lava Labs报告中最具洞察力的部分。报告将十大风险按严重程度排序,前五项全部在操作系统底层运行。
| 编号 | 风险 | 关键点 |
| FORGE-01 | 固件和硬件完整性被破坏 | 密集GPU集群需要复杂固件堆栈,一旦被攻破,OS之上的安全工具将失效 |
| FORGE-02 | 网络和互连漏洞 | 高性能网络架构未加密、监控不力、权限极高 |
| FORGE-03 | 不安全的多租户隔离和资源复用 | GPU节点在客户间重新分配,可能泄露残留数据 |
| FORGE-04 | 不安全的带外管理平面 | BMC自动化、Redfish和IPMI把巨大权限集中在一个很少被审查的控制层 |
| FORGE-05 | AI基础设施供应链妥协 | GPU短缺迫使运营商采用隔离更弱的替代处理器 |
这五项风险的共同特征是:运行在操作系统之下,难以检测,影响范围遍及整个集群。而当前绝大多数安全工具,运行在操作系统之上。OS之上的工具,很难看清OS之下的攻击。
四、“补票”成本:2026年的数据警示
安全建设滞后不是抽象风险,它已经在数据里体现出来。
| 来源 | 时间 | 关键数据 |
| Spacelift | 2026年6月 | 93%的组织已经历过AI引发的基础设施事件;40%的受访者表示安全漏洞出现速度在加快;40%表示治理难度在上升 |
| Check Point《2026云安全报告》 | 2026年 | 76%的企业将数据中心安全视为AI的关键需求,但只有35%认为其当前数据中心能够支撑这一需求;77%的组织已为AI更新安全策略,但只有26%具备执行能力 |
| 海光信息副总裁应志伟 | 2026世界互联网大会 | 人工智能时代算力需求、数据与模型规模急剧增长,与安全防护手段滞后形成巨大结构性落差;AI可快速挖掘漏洞、攻破防火墙;传统软件防护模式消耗高、效果差 |
| 兰德公司 | 2025年 | 当前多数AI数据中心仅能防御“网络犯罪团伙”级别的威胁,面对国家级行为体的“零日漏洞+供应链攻击+侧信道攻击”组合拳时几乎毫无招架之力 |
这些数据指向同一个判断:AI数据中心安全需求已经明确,但执行能力没有跟上。企业知道安全重要,却未必具备支撑能力;组织更新了策略,却未必能落地执行。
五、行业补课:四条正在形成的路径
“旧船票”失效了,行业正在绘制“新船票”。目前可以看到四条路径。
路径一:零信任架构内嵌AI工厂
2026年6月,Akamai宣布与NVIDIA扩大合作,将零信任安全架构直接分层植入AI工厂内部。通过将Akamai Guardicore Segmentation与NVIDIA Vera BlueField-4 STX架构集成,实现AI工厂数据、上下文记忆和智能体工作负载的实时零信任执行。Palo Alto Networks也宣布将零信任安全机制直接嵌入AI基础设施。
零信任的核心是“永不信任,始终验证”。它不再假设内部网络安全,也不再假设运营商天然可信。这正好回应了Lava Labs报告所说的信任模型变化。
路径二:安全能力下沉至固件与硬件层
Lava Labs把框架命名为FORGE,目的就是“加固模型下方的金属”。安全必须下沉到操作系统之下的固件和硬件层面。
NVIDIA在2026年3月发布了面向零信任AI工厂的参考架构,试图解决模型所有者、基础设施提供商和数据所有者之间长期存在的“AI信任三角”问题。安全能力正在从“附加在系统之上”变成“内嵌在系统之中”。
路径三:硬件级多租户隔离
多租户隔离失效是FORGE框架中的第三大风险。行业正在用硬件级隔离补课。
NVIDIA的Multi-Instance GPU(MIG)功能可将单张GPU分割为硬件级分区,分配给不同用户或租户。Cisco的策略是在主机DPU上使用硬件划分分区,提供真正的租户和VPC隔离。DDN也在为企业级AI工厂提供具有确定性性能隔离和治理控制的安全多租户AI环境。
路径四:政策层面的制度补课
2026年1月1日,修改后的《网络安全法》正式施行,新增第二十条对人工智能安全与发展作出专门规定。2026年5月,中央网信办启动智算云服务安全评估试点工作。
政策正在为AI数据中心的“安全欠账”补课。但从制度到每一个快速建成的AI数据中心,中间仍有很长的落地距离。
| 路径 | 代表动作/玩家 | 技术锚点 |
| 零信任内嵌 | Akamai、NVIDIA、Palo Alto Networks | Guardicore Segmentation、Vera BlueField-4 STX、实时零信任执行 |
| 固件与硬件下沉 | Lava Labs FORGE、NVIDIA参考架构 | 固件安全、硬件安全、“AI信任三角” |
| 硬件级多租户隔离 | NVIDIA MIG、Cisco DPU、DDN | GPU硬件分区、DPU硬件划分、VPC隔离、确定性性能隔离 |
| 政策制度补课 | 《网络安全法》、中央网信办 | 人工智能安全与发展、智算云服务安全评估试点 |
六、关键时间线
2025年,兰德公司报告评估AI数据中心防御能力
2026年1月1日,修改后的《网络安全法》正式施行,新增第二十条
2026年3月,NVIDIA发布面向零信任AI工厂的参考架构
2026年4月,阿里云生态中实验性AI智能体通过出站连接绕过防火墙
2026年5月,中央网信办启动智算云服务安全评估试点工作
2026年6月,Akamai与NVIDIA扩大合作;Spacelift发布研究数据
2026年7月,Lava Labs发布《十大数据中心和AI基础设施安全风险》
2026年8月,Tenet Security在DEFCON 2026披露“Ghostjacking”
七、趋势判断与从业者启示
首先,“旧船票”确实在失效。边界防火墙看不见东西向流量,内部扁平网络扛不住多租户隔离,OS级工具扫不到固件层攻击。传统安全模型的三重失灵不是理论推演,而是正在发生的现实。
其次,“补票”的代价正在显现。93%的组织已经历过AI引发的基础设施事件。安全建设滞后的“利息”,正在以事件、泄露和宕机的方式被支付。
最后,“新船票”正在被绘制,但远未普及。零信任架构内嵌至AI工厂、安全能力下沉至固件层、硬件级多租户隔离,这些方向是对的,但从头部玩家试点到全行业标配,中间隔着巨大的时间差和成本差。
对运维工程师:把安全作为AI基础设施运维的第一优先级。学习固件安全管理、理解多租户隔离机制、掌握零信任架构的落地方式。在AI数据中心,一次固件层攻击可能导致整个集群瘫痪。
对技术管理者:在AI数据中心建设的规划阶段,就把安全架构作为前置条件,而不是后续补充。安全架构的设计和验证,应该与算力架构的设计同步进行。
对企业IT决策者:重新评估AI数据中心建设的全周期成本。快速建成的数据中心如果安全基础薄弱,未来的事件响应成本、合规罚款和声誉损失可能远超建设阶段的提速收益。建议把“安全就绪度”纳入与“算力规模”同等重要的评估维度。
FAQ
Q1:为什么传统数据中心安全模型在AI数据中心会失效?
A:AI数据中心从“独立服务器组成的数据仓库”变成“必须作为单一引擎运行的计算工厂”。物理密度、东西向流量和多租户信任模型都发生质变,导致边界防火墙、扁平网络和OS级安全工具同时失灵。
Q2:FORGE风险框架前五项为什么特别危险?
A:FORGE-01到FORGE-05全部在操作系统底层运行,涉及固件硬件完整性、网络互连、多租户隔离、带外管理平面和供应链。它们难以检测,影响范围遍及整个集群,而当前多数安全工具运行在操作系统之上。
Q3:2026年的数据说明了什么?
A:Spacelift在2026年6月的数据显示,93%的组织已经历过AI引发的基础设施事件。Check Point《2026云安全报告》显示,76%的企业将数据中心安全视为AI关键需求,但只有35%认为当前数据中心能够支撑;77%更新了安全策略,只有26%具备执行能力。需求与能力之间存在明显落差。
Q4:行业正在形成哪些安全补课路径?
A:四条路径:零信任架构内嵌AI工厂、安全能力下沉至固件与硬件层、硬件级多租户隔离、政策层面的制度补课。代表动作包括Akamai与NVIDIA合作、NVIDIA零信任AI工厂参考架构、NVIDIA MIG、Cisco DPU隔离、DDN多租户环境,以及《网络安全法》和智算云服务安全评估试点。
Q5:企业和技术团队现在应该做什么?
A:把安全从“滞后选项”变成“前置约束”。运维团队优先学习固件安全管理、多租户隔离和零信任落地;技术管理者在规划阶段同步设计安全架构;企业决策者把安全就绪度纳入与算力规模同等重要的评估维度,并重估全周期成本。
| 关于作者:
本文由「云览」技术团队整理创作,聚焦IDC/云计算/AI基础设施产业与技术拆解。更深入资料已同步至CSDN专栏「智算中心架构与运维实战」,官网原文请从个人主页简介进入。欢迎点赞、收藏、关注,评论区交流你所在行业的变化。
网硕互联帮助中心



评论前必须登录!
注册