#1:功耗优化并非特定领域的问题,而是一个系统级挑战。.
长期以来,机房电源和机架电源一直被视为两个独立的工程领域。一个团队负责设计变电站、开关设备、不间断电源系统 (UPS) 和配电设备;另一个团队则负责设计机架电源配置、服务器电源和电压调节解决方案。我们自身的业务也一直沿用这种分工模式,各自专注于不同的领域。 临界功率 (电网到设施) 嵌入式电源 (机架级解决方案)。虽然这些分类有助于简化复杂的市场,但它们也可能掩盖电力输送是端到端的这一事实。.
尽管如此,该领域的大多数公司要么是关键电源专家,要么是嵌入式电源专家,这就要求数据中心运营商协调这两者,并确保电网电力接入设施后不会出现任何问题。在渐进式变更盛行且这两个领域压力都不大的时期,这尚可应对。但如今的GPU平台功耗几乎是几年前CPU的20倍。芯片和机架层面的决策会影响设施布局、冷却系统、电能质量、能源需求等等,并波及整个电力基础设施。工程师不应将电网基础设施、电力分配和机架级嵌入式电源视为独立的优化问题,而应作为一个协作的多学科团队来评估整个能源分配路径。边界远不如系统的整体性能重要。.
#2:高电压供电不是一种趋势,而是一种物理必然要求。.
随着吉瓦级人工智能工厂向1兆瓦以上机架的普及迈进,传统的48-54伏直流架构正接近其实际应用极限。这促使运营商开始探索新的方案。 800 VDC架构 为了解决在高功率密度下难以处理且成本高昂的问题,它们并非天生“更好”,而是能够提供独特的优势,尤其适用于以 GPU 为中心的环境,包括:
- 更高的功率和显著更低的电流,使得导体和母线尺寸更小,电缆更轻,布线更便捷,连接器要求也更低。
- 通过负载点转换器减少电网到负载点的功率转换级数,从而提高可靠性,并减少设备和维护需求。
- 降低整个电力网络的配电损耗,从而提高电力效率,减少能源浪费,并降低冷却需求。
- 减少铜消耗,可显著节省成本 每兆瓦 每增加一个数据中心容量需要27至33公吨铜,预计铜的短缺将对运营商和公用事业公司都构成威胁。
- 由于高压配电可以减少机架尺寸、线缆拥塞、电气室占用空间和机架顶部空间,从而更好地利用数据中心空间。
#3:它的力量 和 仅供制冷,而非供电加制冷。.
迁移到 800 VDC 基础设施将有助于数据中心运营商扩展规模,但高密度机架产生的巨大热量使得冷却问题同样重要—— 液体冷却, 具体而言,传统的机房空调/机房空调空气冷却系统以及传统电力系统都已接近其运行极限。液冷系统则是专为现代计算环境而设计的。. 先进技术 提供精确的芯片直接冷却,可支持 TDP 超过 3000 瓦的芯片,并且与传统的微通道冷板相比,热阻可降低三倍。.
作为 国际能源署 值得注意的是,在高效超大规模数据中心中,冷却系统约占总耗电量的 7% 到 15%,而在效率较低的企业级设施中,这一比例超过 30%。功率密度、热密度和系统效率紧密相关,无法单独优化。它们必须作为一个集成系统进行评估和设计,而不是作为独立的解决方案。电力分配决定了有多少电力到达机架,而冷却决定了有多少电力从机架流出。如果业界要管理和扩展基础设施以服务于日益强大的计算能力,电力团队之间的协作必须扩展到冷却团队。在设计过程的早期阶段开展合作,能够让他们考虑整个能量流,而不仅仅是他们最熟悉的部分。.
当这两个系统协同设计时,数据中心运营商可以:
- 减少不必要的功率转换,从而降低电力损耗
- 优化电力电子设备周围的冷却液温度
- 降低冷却开销,例如运行风扇和水泵所需的能源
- 利用集成控制和共享监控来优化系统并保持系统同步
- 整体提升 电源使用效率 (PUE)
#4:构造是线性的——但有一些方法可以加快它的速度。.
高昂的资本持有成本、可能延迟产生收入以及昂贵的GPU闲置的风险,促使数据中心运营商寻求简化和加快建设的方法。从电网连接延迟到劳动力短缺,再到某些建设阶段必须先于其他阶段这一简单事实,许多因素都超出了他们的控制范围。但有些决定权在他们手中。选择标准化、, 预制模块化数据中心 (PMDC) 的电力、冷却和 IT 系统 其中之一。.
遵循传统设计/采购/建造/调试流程的设施,由于土建、机电、装修和现场集成等环节需要依次进行,通常需要24至36个月才能完成。采用模块化解决方案可使工厂和现场工作并行开展,从而将部署速度提高30%。由于PMDC解决方案在工厂已预先布线和测试,因此还能减少高达70%的现场测试和布线工作。此外,标准化的模块化设计使工程师能够提前采购交货周期较长的电气和机械设备,从而确保施工进度按计划进行。而且,随着技术的不断更新换代(这是不可避免的),升级或更换模块化解决方案比重建整个数据中心基础设施更加便捷高效,成本也更低。.
#5:人工智能正在测试供应链中的每一个环节。.
行业供应链仍然沿用传统的数据中心架构、扩展速度和建设节奏,但数据中心的动态变化已经发生了翻天覆地的变化。电力分配、电力电子设备、冷却系统、机械设备、母线槽、机架基础设施、控制系统和IT设备都经历了重大升级。在某些情况下,它们甚至被彻底重新设计。几年前还适用的组件,在现代环境中已经过时,甚至根本无法使用。.
面向人工智能时代的统一系统思维
人工智能使得系统集成比单纯的优化更有价值。每一次电源转换都会引入复杂性,每一个接口都会带来工程上的权衡取舍,每一个设计决策都会影响效率、部署速度和长期可扩展性。虽然性能最高的UPS、最高效的电源架或最佳的散热技术固然值得关注,但如果它们不能在数据中心环境中协同工作,那就毫无意义。.
从我们的投资组合到我们的 制造工艺, Flex 从系统角度出发,体现了公用设施互联、关键电力基础设施、嵌入式电源转换、模块化系统和液冷解决方案的融合。我们并不将它们视为独立的产品类别,而是视为共同工程挑战的相互关联的组成部分:以尽可能高效、经济且可预测的方式将电力从电网输送到芯片。.
随着人工智能将数据中心基础设施推向传统极限,最大的机遇或许不在于采用新的架构,而在于采用新的思维方式。.
探索如何通过简化电力分配来帮助提高人工智能规模计算的效率、可扩展性和可持续性。.