对标全球最新一代「AI 超级工厂」与万卡集群实践:多个基地经专用高速网络连成一台虚拟超级计算机,让数百万件硬件共同完成同一个复杂任务。
传统数据中心同时运行数百万个彼此独立的应用;AI 超级工厂则让全部硬件为同一个训练任务协同工作。Fairwater 型数据中心采用双层机房提高 GPU 密度、缩短线缆路径,经专用 AI 广域网(AI WAN)光纤骨干把相距千里的园区连成一体——过去数月才能完成的训练任务,按周级交付。
达索时代实践:六大基地经全国算力网与专线骨干互联,支持跨基地分布式训练与推理调度。
Meta 为训练 Llama-3 建设了两座各 24,576 张 H100 的生产集群:每座由 3,072 台 Grand Teton 节点、1,536 个机柜组成,划分为 8 个 Pod(每 Pod 3,072 卡)。节点内 8 张 H100 经 NVLink 全互联,配 4 组 PCIe Gen5 交换与 8 张 400G 后端网卡。两座集群分别验证了两条 400G 无损网络路线——RoCEv2(Arista 7800)与 NDR InfiniBand(Quantum-2),Fat-tree 组网、汇聚层 2:1 收敛;为缓解 RoCE 拥塞,Meta 在接入层加倍投入注入带宽。
与达索时代同源的技术路线:400G InfiniBand / RoCE 双方案、Fat-tree 无阻塞组网、8 卡节点整柜交付。
达索时代把上述行业实践落地为全国布局:苏州、杭州、包头、桂林、青岛、成都六大基地按统一标准建设——400G InfiniBand / RoCE 无损网络、冷板液冷与自然冷源、电算协同绿电优先,经全国算力网互联调度,训练、推理与 Token 服务就近交付。
新基地按同一模板扩展:本页八大能力模块对未来基地同样生效。
资料参考:Microsoft Fairwater「AI Superfactory」公开资料;Glenn K. Lockwood《Meta's H100 clusters》;平台能力指标参考 CoreWeave 等 AI 云平台公开资料,作为能力对标与规划示意。网络配图来自 Pexels(可免费商用),加载失败时自动回退为基地实拍图。
关于达索时代 AI Factory 的通用问题解答,各基地具体指标以基地页面与交付方案为准。
训练、推理、Token 服务,从裸金属到 MaaS —— 联系我们获取专属算力方案。
注:本页各项技术指标为规划示意,用于统一展示各基地能力模块;实际以项目交付方案为准。配图为实拍 / 实景。