Qué almacenamiento elegir para IA y HPC: Ceph, Lustre o DAOS

Infraestructura · Almacenamiento IA / HPC · Open Source

Almacenamiento para IA y HPC en 2026: Ceph, Storage Scale, Lustre, DAOS y BeeGFS.

Montas un clúster de GPUs que cuesta como un edificio y luego decides dónde viven los datos. Esa decisión —el sistema de ficheros— es la que marca si tus GPUs calculan o esperan. Mapeamos los cinco grandes, para qué sirve cada uno y cómo no equivocarte.

12 min lecturaComparativa técnica

Hay una escena que se repite cuando revisamos una plataforma de IA o HPC. El cliente nos enseña, con razón orgullosa, el clúster de GPUs recién comprado. Números impresionantes de TFLOPS. Y entonces preguntamos lo aburrido: «¿y de dónde leen los datos?». La respuesta, demasiadas veces, es un NAS por NFS montado en una esquina.

Comprar ocho GPUs que cuestan como un piso en Madrid y alimentarlas con un NFS es el equivalente digital a ponerle a un Fórmula 1 el depósito de una moto: la potencia está toda ahí, pero se pasa el día en boxes. El almacenamiento es lo que decide si esas GPUs trabajan o esperan — y elegirlo bien empieza por saber qué opciones hay y para qué sirve cada una.

1 y 2
Puestos de DAOS en la
IO500 de producción (SC25)
×4
Score de esos dos frente
a los 30 siguientes
#1
Lustre, el FS más extendido
en supercomputación
50+ PB
Ceph desplegado
en el CERN
01 · El vocabulario que decide la arquitectura

Cuatro conceptos antes de comparar nada

El almacenamiento distribuido acumula jerga rápido y las etiquetas de marketing no siempre ayudan. Antes de entrar en materia, conviene fijar cuatro ideas — porque son las que de verdad separan a un sistema de otro cuando toca elegir.

POSIX paralelo vs. objeto Un FS paralelo (rutas, permisos, open()/read()) reparte cada fichero entre cientos de servidores que lo sirven a la vez: es lo que espera el software HPC clásico. El almacenamiento de objetos no tiene directorios, sino claves y objetos vía API S3: es el idioma de los data lakes y de la IA moderna.
Ancho de banda vs. IOPS El HPC clásico quiere GB/s secuenciales para volcar checkpoints enormes. El entrenamiento de IA suele querer lo contrario: millones de ficheros diminutos leídos al azar, donde mandan los IOPS y el rendimiento de metadatos. Casi ningún sistema es el rey de las dos cosas.
El metadato manda El servidor de metadatos (MDS) es el que sabe dónde está cada cosa. En cargas de IA con millones de ficheros pequeños, suele ser el primer cuello de botella, antes que el disco. Muchas migraciones fracasan por dimensionar bien el disco y olvidar el metadato.
GPUDirect Storage Un camino directo entre el almacenamiento y la memoria de la GPU, sin pasar por la CPU ni por un buffer intermedio en RAM. Menos latencia, menos CPU quemada moviendo bytes y GPUs que dejan de esperar. Es la pieza que la IA moderna exige al almacenamiento.
La distinción que importa

El mejor almacenamiento es el que encaja con tu carga dominante. Si tu día a día son simulaciones que escriben ficheros gigantes, buscas ancho de banda secuencial. Si es entrenar modelos sobre millones de imágenes, buscas metadatos rápidos e IOPS. Confundir las dos cosas es el error de diseño más caro que vemos.

02 · Los cinco contendientes

¿Quién juega en qué liga?

Aquí están los cinco sistemas que dominan el almacenamiento serio para IA y HPC. No hay un ganador único: cada uno tiene un punto dulce. Las barras comparan, de forma orientativa, dos ejes que casi siempre están en tensión: el rendimiento pico que puede alcanzar y la facilidad de operarlo en el día a día.

Ceph
Unificado · objeto + bloque + fichero Rendimiento pico Versatilidad / operación
La navaja suiza
Storage Scale
POSIX paralelo · GPFS · IBM Rendimiento pico Soporte / operación
El caballo enterprise
Lustre
POSIX paralelo · el del TOP500 Rendimiento pico Facilidad de operación
El estándar HPC
DAOS
Objeto / KV sobre NVMe Rendimiento pico Facilidad de operación
El cohete de la IO500
BeeGFS
POSIX paralelo · fácil de montar Rendimiento pico Facilidad de operación
El de despliegue rápido
Barras orientativas · el mejor sistema es el que encaja con tu carga, no el de la barra más larga
03 · La tabla que puedes enseñar en una reunión

Cinco sistemas, de un vistazo

Lo esencial de cada uno: qué tipo de almacenamiento es, dónde brilla, con qué licencia se distribuye y en qué versión está en producción a mediados de 2026.

SistemaTipoPunto dulceLicenciaVersión (2026)
CephUnificadoPlataformas híbridas IA + HPC, nubes privadas, data lakes S3. Objeto, bloque y fichero desde un mismo clúster.Open source LGPL20.2.2 «Tentacle» (jun 2026)
IBM Storage ScalePOSIX paraleloHPC empresarial con soporte y SLA, IA sobre NVIDIA DGX BasePOD/SuperPOD, alto rendimiento «llave en mano».Comercial IBM5.2.x
LustrePOSIX paraleloSupercomputación clásica de máximo ancho de banda. El estándar del TOP500 cuando hay equipo que sepa operarlo.Open source GPLv22.17 (dic 2025)
DAOSObjeto / KVRendimiento extremo sobre NVMe puro. Lo más rápido de la IO500, para cargas donde la latencia lo es todo.Open source BSD2.6
BeeGFSPOSIX paraleloClústeres HPC medianos y grupos de investigación que quieren buen rendimiento sin un equipo de almacenamiento dedicado.Community + Enterprise8.3.x
04 · Uno a uno

Qué hace bien cada uno (y qué no)

Ceph — el que lo hace casi todo

Ceph es la navaja suiza del almacenamiento distribuido open source: sirve objeto (S3 vía RGW), bloque (RBD) y fichero (CephFS) desde el mismo clúster, se autorreplica y escala sumando nodos. En IA eso se traduce en RBD para las máquinas de entrenamiento, S3 para el data lake y CephFS para acceso paralelo — con integración nativa en OpenStack y Kubernetes. No es el rey del rendimiento pico en HPC extremo, pero su versatilidad no tiene rival, y despliegues como los 50+ PB del CERN demuestran que aguanta escalas serias. La versión 20.2.2 «Tentacle» (junio 2026) trae Crimson para pools con erasure coding y mejoras de cifrado en RGW. Es, además, el ganador natural del hueco que dejó MinIO al pasar a «maintenance mode» a finales de 2025 — lo contamos en nuestra guía Ceph vs MinIO 2026. En SIXE lo tocamos a diario: Ceph para IA & HPC y formación oficial de Ceph.

IBM Storage Scale (GPFS) — rendimiento con SLA

Antes GPFS, luego Spectrum Scale y hoy IBM Storage Scale: el mismo caballo de batalla con tres nombres. Es un FS paralelo POSIX maduro, con soporte enterprise, que en su versión 5.2.x integra GPUDirect Storage de NVIDIA y certificación para plataformas DGX BasePOD/SuperPOD y Grace Blackwell. Es la elección cuando quieres el rendimiento de un FS paralelo pero sin depender de que tu equipo sepa reconstruir un Lustre a las tres de la mañana: pagas licencia, ganas SLA. Montamos infraestructura HPC con Storage Scale + Spectrum LSF/SLURM y damos formación de administración de Storage Scale.

Lustre — el estándar del TOP500

Lustre sigue siendo, con diferencia, el sistema de ficheros más extendido en supercomputación: mueve una fracción enorme de los grandes centros de cálculo del mundo. Da un ancho de banda secuencial altísimo y escala a exabytes. El precio es la operación: no es «instalar y olvidar», y requiere expertise real para tunearlo y recuperarlo. La versión 2.17 (diciembre 2025) sigue esa línea, con la 2.18 preparando erasure coding a nivel de fichero (FLR-EC) y compresión en cliente. Si vienes de Lustre y buscas soporte comercial, escribimos sobre migrar de Lustre a IBM Storage Scale.

DAOS — el cohete que resucitó

DAOS es la respuesta a «¿y si tiramos POSIX a la basura y diseñamos para NVMe desde cero?». El resultado: ocupa los puestos 1 y 2 de la IO500 de producción (Argonne y LRZ, SC25), y 16 de los 30 primeros del ranking completo corren DAOS. Nació atado a la memoria Optane de Intel; cuando Intel mató Optane, muchos lo dieron por muerto. Pero desde la versión 2.6 (julio 2024) funciona solo con NVMe SSD y sigue muy vivo. Hoy lo gobierna la DAOS Foundation bajo la Linux Foundation (Argonne, HPE, Google Cloud, Intel), tras la cesión del equipo de Intel a HPE en 2024. Es la opción de máximo rendimiento para quien tiene NVMe puro y una carga que lo justifique; no un reemplazo general.

BeeGFS — el fácil de vivir

BeeGFS es el FS paralelo que prioriza que puedas desplegarlo un martes por la tarde sin un doctorado en almacenamiento. Da muy buen rendimiento para clústeres medianos y es el favorito de muchos grupos de investigación por su sencillez. Ojo con un cambio importante: desde BeeGFS 8 la Community Edition sigue siendo gratuita pero exige generar una licencia comunitaria (beegfs license), y las funciones enterprise quedan tras licencia de pago. La versión estable en 2026 es la 8.3.x.

El patrón que se repite

Fíjate en la tensión: Lustre y DAOS dan el rendimiento máximo pero exigen equipo experto. Storage Scale compra ese rendimiento con licencia y soporte. Ceph y BeeGFS renuncian a algo de pico a cambio de que la vida sea más fácil. Ninguna opción es gratis: cada una cambia rendimiento por sencillez, o licencia por soporte.

05 · El eje que de verdad decide

¿Tu carga es HPC clásica o es IA?

Antes de mirar marcas, mira tu carga. Lo que de verdad ordena la decisión es qué le vas a pedir al almacenamiento. Estos son los dos perfiles y lo que cada uno necesita.

HPC clásico
  • Simulación, CFD, dinámica molecular, meteorología
  • Escribe checkpoints enormes de forma secuencial
  • Lo que pide: GB/s de ancho de banda sostenido
  • Ficheros grandes, acceso más predecible
  • Encaja con: Lustre, Storage Scale, BeeGFS
Carga de IA / ML
  • Entrenamiento e inferencia sobre datasets masivos
  • Lee millones de ficheros pequeños al azar
  • Lo que pide: IOPS, metadatos rápidos y GPUDirect
  • Necesita alimentar GPUs sin que se queden esperando
  • Encaja con: DAOS, Storage Scale, Ceph (S3)

La mayoría de plataformas modernas mezclan las dos cosas — por eso el almacenamiento open source para IA y HPC tiende a arquitecturas híbridas: un FS paralelo para la parte de cálculo y objeto S3 para el data lake, a menudo conviviendo sobre Ceph + OpenStack + Kubernetes.

06 · Cómo elegir sin arrepentirte

Cuatro pasos antes de firmar nada

Define tu carga dominante

Antes de mirar productos, mide. ¿Escribes pocos ficheros gigantes o lees millones de pequeños? ¿Manda el ancho de banda o los metadatos? Esa única respuesta ya descarta la mitad de las opciones. Y no te fíes solo del hoy: dimensiona para la carga que tendrás cuando el proyecto de IA crezca.

Decide: open source con equipo, o soporte con SLA

Lustre y DAOS son gratis de licencia pero caros de operar: necesitas gente que los conozca. Storage Scale invierte esa ecuación: pagas licencia y compras tranquilidad. Ceph y BeeGFS quedan en medio. La pregunta honesta es: ¿tienes —o quieres tener— un equipo de almacenamiento?

Mira el ecosistema que ya tienes

¿Ya corres OpenStack o Kubernetes? Ceph encaja como un guante. ¿Tienes NVIDIA DGX / BasePOD? Storage Scale está certificado. ¿NVMe puro y sed de latencia? DAOS. El mejor almacenamiento suele ser el que menos fricción crea con lo que ya está en producción.

Prueba a escala antes de casarte

Un benchmark con cuatro nodos no predice el comportamiento con cuarenta. Prueba con tu carga real, no con la sintética del datasheet, y presta atención al metadato bajo concurrencia. Aquí la experiencia previa ahorra meses — y una compra equivocada de seis cifras.

Dónde entra SIXE

Diseñar la capa de almacenamiento de una plataforma de IA o HPC, comparar Ceph, Storage Scale, Lustre, DAOS o BeeGFS para tu caso, o migrar de una a otra sin perder datos ni noches de sueño — en SIXE llevamos más de 15 años en el cruce entre almacenamiento distribuido, IBM Power y open source. Ver soporte de Ceph e IBM Storage.

Resumen

Lo esencial en 5 puntos

Para llevarse de este post

El almacenamiento decide si tus GPUs trabajan o esperan. Es tan estratégico como el propio clúster de cálculo.

→ No hay «el mejor»: hay el mejor para tu carga. HPC clásico pide ancho de banda; la IA pide metadatos, IOPS y GPUDirect.

DAOS manda en rendimiento (1º y 2º de la IO500), Lustre en prevalencia, Storage Scale en soporte enterprise.

Ceph es la opción versátil para arquitecturas híbridas IA + HPC; BeeGFS, la más fácil de desplegar.

→ Antes de elegir: define la carga, decide open source vs. SLA, mira tu ecosistema y prueba a escala real.

FAQ

Preguntas frecuentes

¿Qué es mejor para IA, Ceph o Lustre?

Depende de la carga. Lustre da más ancho de banda secuencial y es el estándar en supercomputación clásica, pero requiere expertise para operarlo. Ceph es más versátil: ofrece objeto S3, bloque y fichero a la vez, se integra con OpenStack y Kubernetes, y su almacenamiento de objetos encaja con los data lakes de IA. Para entrenamiento masivo con checkpoints enormes, Lustre o Storage Scale; para plataformas híbridas y data lakes, Ceph.

¿DAOS está listo para producción?

Sí, en su nicho. Ocupa los puestos 1 y 2 de la lista de producción de la IO500 (SC25) y lo gobierna la DAOS Foundation bajo la Linux Foundation. Desde la versión 2.6 (julio 2024) funciona solo con NVMe SSD, sin la memoria Optane. Es la opción de máximo rendimiento, pero exige hardware NVMe y equipo especializado; no es un reemplazo general de Lustre o Ceph.

¿Storage Scale es lo mismo que GPFS o Spectrum Scale?

Sí. Es el mismo producto de IBM con distintos nombres: GPFS, luego IBM Spectrum Scale y hoy IBM Storage Scale. En 2026 va por la 5.2.x e incorpora GPUDirect Storage de NVIDIA y certificación para DGX BasePOD/SuperPOD.

¿BeeGFS sigue siendo gratis?

La Community Edition sigue siendo gratuita, pero desde BeeGFS 8 hay que generar una licencia comunitaria con beegfs license. Las funciones enterprise quedan tras una licencia de pago. La versión estable en 2026 es la 8.3.x.

¿Se puede usar Ceph para HPC serio?

Ceph aparece en la lista de producción de la IO500 y hay despliegues masivos (CERN supera los 50 PB), pero en cargas HPC de rendimiento extremo no suele sustituir a Lustre, Storage Scale o DAOS. Su fuerza está en las arquitecturas híbridas HPC + IA: objeto, bloque y fichero desde un mismo clúster e integrado con OpenStack y Kubernetes.

Almacenamiento IA / HPC · Open Source

¿Tus GPUs calculan o esperan?

Cuéntanos qué carga vas a mover, cuántas GPUs y qué tienes hoy en infraestructura. Te respondemos en menos de 24 horas con un esbozo de arquitectura de almacenamiento y una idea real de esfuerzo. Si Ceph encaja, te lo decimos. Si lo tuyo es Lustre, Storage Scale o DAOS, también.

SIXE