El enfriamiento comienza en el silicio.
Los requisitos de refrigeración de un acelerador de IA no se definen únicamente por su consumo energético. Un paquete de 1500 vatios no representa simplemente una carga térmica de 1500 vatios. Los ingenieros deben comprender el origen de esos vatios y cómo se transmite el calor desde el silicio a través del paquete, ya que dos procesadores que consumen la misma cantidad de energía pueden tener requisitos de refrigeración muy diferentes. Las características térmicas del silicio dependen de la configuración del chip, la ubicación e intensidad de los núcleos de cómputo, los puntos calientes, la ubicación de la memoria de alto ancho de banda, la construcción del paquete, la resistencia térmica y las temperaturas de funcionamiento permitidas. Los aceleradores de IA modernos también pueden combinar varios chips de cómputo, pilas de memoria, interponedores y otros componentes dentro de un mismo paquete, y los diferentes componentes pueden tener límites térmicos distintos.
McKinsey señala que GPU y arquitecturas de silicio personalizadas Se establecen los requisitos de densidad de potencia, térmicos y de interconexión con años de antelación, integrando la refrigeración en la arquitectura informática. El desarrollo de la refrigeración puede comenzar antes de que el silicio de producción esté disponible. Los vehículos de prueba térmica (TTV, por sus siglas en inglés), modelados según las características previstas de un futuro procesador, pueden simular su distribución de calor y otras características relevantes del encapsulado, lo que permite a los ingenieros probar y perfeccionar físicamente las soluciones de refrigeración mientras el desarrollo del silicio aún está en marcha. Esto sitúa la refrigeración y el desarrollo del silicio en paralelo.
Diseñar la placa fría alrededor del procesador
Una vez que se comprende la disposición del paquete y las áreas de alto flujo de calor, la arquitectura de la placa fría interna se puede ajustar al procesador en lugar de tratar el paquete como una fuente de calor uniforme. Las trayectorias de flujo, las características de impacto de microconvección, los materiales, el método de montaje y las interfaces térmicas se utilizan para crear una solución que aborde las áreas que requieren mayor refrigeración o tipos específicos de refrigeración. Esto es especialmente importante para el silicio personalizado, donde la ubicación del chip, la ubicación de la memoria, la construcción del paquete y las temperaturas permitidas pueden variar significativamente de un diseño a otro. JetCool y Broadcom, Por ejemplo, recientemente anunció una solución de refrigeración directa al chip para las XPU de IA personalizadas de próxima generación, diseñadas para soportar un funcionamiento sostenido de ASIC de varios kilovatios con niveles de flujo de calor que alcanzan los 4 W/mm.2.
Este tipo de diseño experto es donde la personalización aporta valor. La placa de refrigeración se diseña en función de los requisitos térmicos y mecánicos del procesador, teniendo en cuenta también las condiciones de funcionamiento del rack, la unidad de distribución de refrigerante (CDU) y el sistema de agua de la instalación. Este enfoque integral, que abarca desde el silicio hasta la instalación, ayuda a los centros de datos a mejorar la eficiencia energética e hídrica, aumentar la densidad y mantener el rendimiento bajo cargas de trabajo máximas.
Estandariza los límites. Diferencia dentro de ellos.
A hiperescala, pequeñas mejoras en el rendimiento por vatio, la utilización o la economía de la carga de trabajo pueden multiplicarse en grandes flotas. Esto ayuda a explicar la inversión en silicio especializado. McKinsey estima que los chips personalizados podrían reducir el costo por token entre un 70 % y un 80 % para las cargas de trabajo de inferencia para las que están diseñados.
El desafío radica en que la optimización específica del procesador no puede convertir el resto de la infraestructura en un diseño único. En el silicio, la refrigeración se puede ajustar al mapa de calor, el diseño del encapsulado y los límites térmicos de un procesador específico. Más allá del chip, los enfoques comunes para las conexiones de fluidos, las condiciones de funcionamiento, los colectores, los bastidores, las unidades de distribución de refrigerante (CDU), los sistemas de agua de las instalaciones y la telemetría permiten que diferentes tipos y generaciones de computación coexistan en producción, aumentando la densidad y simplificando la implementación.
La estandarización no elimina la personalización, sino que define dónde debe ubicarse. Con un diseño experto, el trabajo más específico del procesador puede mantenerse cerca del silicio, mientras que la infraestructura de racks e instalaciones permanece consistente para permitir una implementación repetible a gran escala. A medida que la computación personalizada se vuelve más común, ese límite cobra mayor importancia.
Personalizar donde la física y el rendimiento Exígelo.
Estandarizar donde la repetibilidad y la escala Confía en ello.
Convierta la refrigeración personalizada en una infraestructura repetible.
Existe una gran diferencia entre diseñar una placa de refrigeración que funcione y fabricar un sistema térmico que pueda reproducirse a escala real. La geometría interna de los canales, la planitud, el acabado superficial, los procesos de unión, la compatibilidad de los materiales, la limpieza, la integridad de la presión, la consistencia de la interfaz térmica y la distribución del flujo influyen en el rendimiento final de la placa de refrigeración. Durante el desarrollo, las pequeñas variaciones suelen poder estudiarse, ajustarse o gestionarse mediante ingeniería. A escala de producción, esas mismas variaciones deben controlarse en miles de servidores y, potencialmente, en cientos de miles de procesadores.
Eso hace que capacidad de fabricación Parte de la solución de refrigeración, no una tarea que se realiza una vez finalizado el diseño. Las pruebas de fugas y presión, la caracterización del flujo, la validación térmica, los controles de limpieza y la monitorización del proceso deben escalarse con la producción. Deben generar confianza en cada unidad sin ralentizar la línea ni convertir la validación en un cuello de botella.
Para la refrigeración específica de procesadores, la diferencia entre prototipo y producción es crucial. Una placa fría optimizada para un mapa de calor específico debe reproducir de forma consistente el flujo y el comportamiento de refrigeración deseados a medida que aumenta el volumen, a la vez que se conecta sin problemas a colectores, bastidores, unidades de refrigeración y sistemas de agua de la instalación. El proveedor de silicio a medida necesita un socio capaz de ambas cosas: diseñar la arquitectura de refrigeración en torno al procesador y fabricarla con el control de procesos, la repetibilidad y la escalabilidad necesarios para su implementación.
Diseñar el sistema desde el chip hasta la instalación.
Nuestras capacidades de infraestructura de IA abarcan placas frías específicas para cada procesador y refrigeración líquida directa al chip. a través de colectores, CDU, racks de TI, energía integrada y crítica, e infraestructura de centro de datos integrada. Combinado con ingeniería de sistemas y fabricación avanzada a gran escala, Esa amplitud crea un camino que va desde una solución de refrigeración ajustada al mapa de calor de un procesador en particular hasta una infraestructura repetible a nivel de rack e instalación y un despliegue de alto volumen.
Obtenga más información sobre nuestras soluciones de refrigeración para silicio personalizado en la Cumbre Global OCP 2026.