SupermicroAS-8126GS-NB3RT-01-G2

La placa NVIDIA HGX B300 de ocho GPU acompañada de dos AMD EPYC 9575F, 3 TB de DDR5 y ocho puertos de 800 GbE, en la versión que Supermicro prepara para servir modelos grandes a mucha gente a la vez.

Supermicro AS-8126GS-NB3RT-01-G2Rack 8U · Gold Series G2

La configuración exacta

Es la configuración que Supermicro tiene montada y probada. Datasheet oficial

Frontal esquemático: pasa el ratón por cada componente.
Procesador2× AMD EPYC 9575F64 núcleos · 3,3 GHz
GPUNVIDIA HGX B300 8-GPU
Memoria3 TBDDR5-6400
Almacenamiento2× 1,9 TB M.2 NVMe
Red2× 2-port 200 GbE / NDR2008-port 800 GbE / XDR800
FormatoRack 8U
Garantía
3 años de piezas y mano de obra
Técnico in situ
Opcional, al siguiente día laborable durante 3 años
Software
Supermicro Data Center Management Suite, licencia por nodo

Servir modelos grandes a cientos de usuarios desde un solo chasis

Supermicro la cataloga para inferencia a gran escala y la configuración va en esa línea: las ocho GPU Blackwell Ultra suman más de 2 TB de memoria y se comunican por NVLink (el enlace directo de NVIDIA entre GPU) a través de un conmutador NVSwitch, así que un modelo de varios cientos de miles de millones de parámetros cabe entero en la máquina y aún queda sitio para la caché de contexto de muchas conversaciones simultáneas. Los EPYC 9575F son la variante de AMD que prima la frecuencia sobre el número de núcleos, y eso se nota en la parte del trabajo que sigue en la CPU, como encolar peticiones, tokenizar y alimentar a las GPU sin que esperen.

Lo que conviene pensar antes es la continuidad del servicio. Con un único nodo, una parada de mantenimiento deja el modelo fuera de línea, de modo que si va a producción el diseño serio empieza en dos máquinas, y ahí es donde los ocho puertos de 800 GbE y los dos de 200 GbE dejan de ser un lujo. Y si el modelo que vas a servir ronda los 70.000 millones de parámetros, una SYS-422GA-NRT-02-G2 con ocho RTX PRO 6000 lo mueve con holgura y ocupa la mitad de rack.

Lo que hacemos nosotros

La entregamos con RHEL o Ubuntu, los controladores de NVIDIA y el GPU Operator sobre Kubernetes u OpenShift AI, y con vLLM como servidor de inferencia, probado con el modelo que vayas a usar. Los dos puertos de 200 GbE los dejamos para el almacenamiento, normalmente un clúster Ceph donde viven los pesos de los modelos y los datos, de forma que ese tráfico nunca compita con el de las GPU. Tienes más detalle de cómo lo montamos en inferencia de IA sobre Kubernetes y Ceph.

Qué necesita tu CPD

Ocupa 8U y su chasis mide 950 mm de fondo, más de lo que admiten muchos armarios de 1.000 mm una vez puestos los cables. Lleva seis fuentes de 6.600 W Titanium en redundancia 3+3, según la ficha de Supermicro, lo que pide seis tomas repartidas en dos circuitos independientes para que la redundancia sirva de algo. La refrigeración es por aire, con hasta doce ventiladores de alto rendimiento, y por eso revisamos contigo la potencia disponible por rack, las PDU y el confinamiento del pasillo frío antes de cerrar nada.

Frente al resto de la familia

ModeloLo que llevaCuándo elegirlo
SYS-822GS-NB3RT-01-G2HGX B300 8-GPU · 2 TBLa HGX B300 con Intel; la opción si vuestro estándar es Xeon.
AS-5126GS-TNRT-01-G22x RTX PRO 6000 · 1,5 TBDos GPU hoy, hueco para ocho y memoria de sobra.
SYS-212GB-FNR-01-G22x RTX PRO 6000 · 512 GBLa más compacta: 2U, un solo procesador, hasta cuatro GPU.
SYS-422GA-NRT-01-G24x RTX PRO 6000 · 1 TBCuatro GPU y 144 núcleos; la mitad del camino hasta ocho.
SYS-422GA-NRT-02-G28x RTX PRO 6000 · 1,5 TBEl máximo en PCIe: ocho GPU y red de 400 GbE.
SYS-C542i-11302ULista para RTX 50 · 32 GBTorre de desarrollo sin GPU de serie; eliges tú la tarjeta.
ARS-511GD-NB-LCC-01-G2Grace + B300 · 748 GBUn nodo GB300 en torre para el equipo que entrena.

Ver todos los servidores IA y GPU

Qué incluye la entrega

De fábrica

  • Configuración montada y probada por Supermicro
  • Garantía de 3 años de piezas y mano de obra (1 año en edge y puesto)

De nuestra parte

  • Montaje en el rack
  • BMC y firmware al día
  • Sistema operativo y la pila que vaya encima
  • Pruebas con tu carga antes de pasar a producción

Si lo necesitas

  • Guardia 24×7 con SLA
  • Técnico in situ al siguiente día laborable, durante 3 años

Preguntas sobre la AS-8126GS-NB3RT-01-G2

¿Qué diferencia hay con la SYS-822GS-NB3RT-01-G2?

Las dos montan la misma placa HGX B300 de ocho GPU y el mismo chasis de 8U. Esta cambia los Xeon por dos AMD EPYC 9575F, sube la memoria del sistema de 2 a 3 TB y añade dos tarjetas de 200 GbE además de los ocho puertos de 800 GbE. Si tu parque es AMD, o quieres una red de almacenamiento separada sin añadir tarjetas, es la que encaja.

¿Qué tamaño de modelo cabe en la HGX B300?

Como regla de bolsillo, cada mil millones de parámetros ocupan unos 2 GB en 16 bits y 1 GB en 8 bits, y encima hay que reservar memoria para la caché de contexto, que crece con la longitud de las conversaciones y con los usuarios simultáneos. Con más de 2 TB entre las ocho GPU entra un modelo de unos 700.000 millones de parámetros en 8 bits con margen de sobra para servirlo a mucha gente.

¿Cuánto tarda en llegar?

Menos que un servidor fabricado por pedido, porque la configuración ya está montada y probada. El plazo exacto depende del stock del canal europeo en ese momento, y te lo confirmamos por escrito con el presupuesto.

¿Se puede cambiar la configuración?

La configuración Gold Series es fija, y por eso sale antes. Si necesitas otra memoria, otros discos u otra red, te presupuestamos el mismo modelo base a medida, sabiendo que entonces el plazo pasa a ser el de una fabricación por pedido.

¿La AS-8126GS-NB3RT-01-G2 encaja con lo que vais a montar?

Cuéntanos la carga y el CPD donde va a ir, y te devolvemos el precio, el plazo confirmado y lo que haría falta para ponerla en marcha.