AI 工厂(AI Factory)是一种为 AI 训练和推理专门设计的算力设施:它不只是“放服务器的机房”,而是把芯片、网络、电力、冷却和调度软件打包成一条可复制的算力生产线。
普通数据中心更像“仓库”:盖好楼,隔出机柜,谁租谁自己搬服务器进去。AI 工厂更像“芯片厂”或“汽车厂”:厂房、供电、水冷管道、排气、物流都围着产线设计,目标不是“有地方放机器”,而是“持续稳定地产出模型能力”。一个训练任务可能几千张卡同时跑,功率密度远高于传统机柜,电和热成了第一约束。
因此 AI 工厂有几个标志性做法:
- 模块化算力:把机柜、电源、冷却、网络做成标准模块,像乐高一样复制,缩短建设周期。
- 电力与冷却打包交付:从变电站、UPS、配电到液冷/风冷、余热回收一起规划,而不是先盖楼再补电。
- 软硬协同:调度系统知道哪些任务可以错峰、哪些卡可以重组,把“产能”当指标来管。
和相邻概念的区别:
| 维度 | 普通数据中心 | AI 工厂 |
|---|---|---|
| 设计目标 | 通用托管 | 面向 AI 负载的产能 |
| 功率密度 | 相对低 | 高,常需液冷 |
| 冷却 | 风冷为主 | 风冷/液冷混合,常预留液冷 |
| 网络 | 通用 | 高带宽、低延迟东西向 |
| 交付 | 机柜/场地 | 模块化算力+电力+冷却 |
| 衡量 | 机柜数、出租率 | 有效算力、利用率、PUE |
为什么成为新叙事?因为 AI 竞争从“买卡”转向“建产能”。Crusoe 这类公司强调把能源侧和算力侧一起规划,Apple 这类终端生态公司则把 AI 基础设施看成持续生产模型的“工厂”,而非一次性项目。具体口径以各公司官方页面为准。
对从业者:做 IDC、云、运维、电力的人,要关注每机柜功率、液冷就绪、供电余量和网络拓扑。对普通人:AI 服务能不能便宜、稳定,越来越取决于电从哪来、热怎么排、工厂建在哪。
