• Español Español Español es
  • English English Inglés en
  • Français Français Francés fr
  • Carrito de Compra Carrito de Compra
    0Carrito de Compra
SIXE
  • Servicios
    • Soporte técnico
      • IBM Power (AIX, Linux, IBM i)
      • Ubuntu con SIXE UP
      • Kubernetes
      • OpenStack
      • Red Hat (RHEL)
      • SUSE
      • SAP
      • Ceph
      • IBM Storage
      • Bases de datos
        • DB2 (Power y x86)
        • Informix
        • MariaDB / PostgreSQL
    • Migraciones
      • A Linux
      • VMWare a Proxmox VE
      • VMWare a OpenShift
      • A Ubuntu desde Red Hat / SUSE
      • A OpenStack desde VMWare e Hyper-V
      • A AIX desde Red Hat o z/OS
    • Estrategia y consultoría
      • Radar Tecnológico
      • Tecnología sostenible
      • Ceph para IA y HPC
      • DRP
      • vCTO
  • Infraestructura
    • Servidores
      • IBM LinuxOne 5
      • IBM Power11
      • Supermicro
      • Dell
      • Lenovo
    • Almacenamiento
      • Ceph
      • IBM Storage FlashSystems
      • IBM Storage Scale (GPFS)
      • IBM Storage Fusion
      • Backup
        • IBM Storage Defender
        • Bacula
        • Trilio
    • Cargas de trabajo
      • Contenedores
      • Máquinas virtuales
      • Nube privada
      • Bases de datos
      • Software IBM
      • Observabilidad y AIOps
  • Ciberseguridad
    • Seguridad IT
      • SIEM & SOAR
        • Wazuh
        • IBM QRadar
      • IRM & DLP
        • Sealpath IRM
      • IBM Power
        • ZeroTrust
    • Seguridad OT
      • Claroty
      • Tenable OT
      • Ciberseguridad industrial
  • IA ✨
    • Formación
    • Agentes de IA seguros para empresas
    • Inferencia de IA On-Premise
    • Automatizaciones
    • Docling
    • Ceph para IA y HPC
    • WatsonX
  • Formación
    • Linux | AIX | IBM i
      • Linux
      • AIX
      • IBM i (RPG, Cobol, ILE, DB2)
      • PowerVM
      • PowerHA Systems Mirror
    • Iaas & PaaS ☁️
      • OpenShift
      • Contenedores Docker + K8s
      • Virtualización oVirt y KVM
      • Virtualización VMWare ESXi & vSphere
      • Red Hat Ansible
      • Foreman / Satellite
    • Infra & Data
      • OpenStack
        • Despliegue y administración
        • Operaciones avanzadas
        • Producción y migración a VMware
      • CEPH
        • Despliegue y administración
        • Administración avanzada
        • Experto (Production Engineering)
      • HPC
      • Informix
      • IBM Storage
      • DB2
      • IBM Instana + Turbonomic
    • IBM Security
      • IBM QRadar
      • Analista de ciberseguridad
      • Guardium
    • Formación oficial
      • Catálogo de cursos de IBM
      • Catálogo de cursos de Canonical
      • Formación oficial a medida
  • Acerca de
  • Contactar
  • Menú Menú
Canonical business partner

Buscar

×

Explora por área de formación

IBM
🖥️ Mainframe y z/OS
z/OS 47CICS 9RPG 2DB2 40
📊 Datos y analítica
Planning Analytics 4Infosphere 30BigInsights 7Datacap 12
🤖 IA y automatización
Watson 6IBM AI 14IBM IA 28
☁️ Cloud e Infraestructura
Cloud Management 4SmartCloud 5AIX 11IBM i 14IBM Storage 6Linux 15
🔐 Seguridad 5
📁 Gestión de contenido
FileNet 12Content Navigator 7Case Manager 9Case Foundation 12Enterprise Records 8
⚙️ Desarrollo y middleware
Integration Bus 3API Connect 4Rational 13DataPower 6Operational Decision Manager 8IBM Decision Server 4
💼 Negocio y procesos
Business Process Manager 29Sterling 17Curam 13TRIRIGA 5Operations Analytics 3Algo One 16
Canonical / Ubuntu
🛠️ Administración de sistemas 4🔄 Automatización 2🛡️ Ciberseguridad 2☁️ Cloud 2📦 Contenedores 1🤖 IA 2💻 Virtualización 1
HashiCorp
🏗️ Terraform 3🔒 Vault 1
IA y Automatización
⚡ N8N 2⚡ Zapier 2

Curso de big data y Apache Spark para IA

3.075,00€

Curso de big data y Apache Spark de 3 días para preparar datos de IA sobre tu propio almacenamiento: canalizaciones repetibles, calidad, linaje y tiempo real. Online o presencial.

Categoría: IA
  • Descripción

Descripción

Curso de big data con Apache Spark para preparar los datos que alimentan modelos y asistentes de IA sobre vuestro propio almacenamiento: Ceph, almacenamiento compatible con S3 o sistemas de ficheros paralelos, no un servicio de nube. Se construye una canalización que se puede repetir sin duplicar datos y que explica de dónde sale cada resultado.

Datos del curso

Código SIXE: SXIA06Categoría: Inteligencia Artificial / Datos
Modalidad: Online y presencialDuración: 3 días

Para quién es

Ingenieros de datos, analistas avanzados y equipos de plataforma que tienen que mover y preparar volúmenes grandes de datos para entrenar o alimentar modelos.

Requisitos

Python y SQL básicos. No hace falta experiencia previa con Spark ni con Hadoop.

Qué vas a aprender

  • Diseñar la canalización: esquemas, contratos de datos, formatos como Parquet y controles de calidad desde la entrada.
  • Spark por dentro: particiones, shuffle y por qué un trabajo va lento; cuándo basta con Python y cuándo compensa distribuir.
  • Leer y escribir en vuestro almacenamiento: Spark contra almacenamiento compatible con S3, como Ceph, y cómo afectan la red y el disco al rendimiento.
  • Cargas incrementales: procesar solo lo nuevo, ejecutar dos veces sin duplicar y recuperar una carga que se cortó.
  • Datos en tiempo real: eventos con Spark Structured Streaming, ventanas y datos que llegan tarde.

Se trabaja con tres fuentes de ejemplo (un CSV, una API y un flujo de eventos) y termina con una canalización en Spark lista para alimentar un modelo, con su linaje y sus controles.

Qué te llevas

  • Una canalización en Spark con contratos y controles de calidad.
  • El registro de linaje y de cada carga.
  • Una prueba de recuperación de una carga interrumpida.

El almacenamiento es casi siempre el cuello de botella de estas cargas: lo explicamos en qué almacenamiento elegir para IA y HPC. Si usáis Ceph, tenemos formación de Ceph y soporte de Ceph para IA y HPC.

Preguntas frecuentes

¿Cuánto dura el curso?

3 días.

¿Es online o presencial?

Las dos cosas: en vuestras oficinas o en remoto, con instructor en directo.

¿Qué necesito saber antes?

Python y SQL básicos. No hace falta experiencia previa con Spark ni con Hadoop.

¿Hace falta un clúster de Hadoop?

No. Spark funciona en local, en Kubernetes o en un clúster pequeño. En el curso se usa un entorno de laboratorio y se explica cómo llevarlo al vuestro.

¿Sirve si no tenemos Ceph?

Sí. Vale cualquier almacenamiento compatible con S3 o un sistema de ficheros compartido.

¿Se puede adaptar a mi equipo?

Sí. Ajustamos ejemplos y prácticas a las herramientas y procesos del equipo, y podemos combinarlo con otros cursos de IA.

Productos relacionados

  • Curso de seguridad de IA: OWASP LLM y red teaming

    2.240,00€
    Add to cart Add to cart Nº de alumnos Mostrar detalles Mostrar detalles Mostrar detalles
  • logo de zapier sobre sixe

    Curso avanzado Zapier: Arquitectura enterprise | SIXE

    1.225,00€
    Add to cart Add to cart Nº de alumnos Mostrar detalles Mostrar detalles Mostrar detalles
  • Curso de deep learning con PyTorch y TensorFlow

    3.075,00€
    Add to cart Add to cart Nº de alumnos Mostrar detalles Mostrar detalles Mostrar detalles
  • logo de n8n sobre sixe ia

    Curso avanzado N8N para empresas | De Workflows a ecosistemas escalables

    1.225,00€
    Add to cart Add to cart Nº de alumnos Mostrar detalles Mostrar detalles Mostrar detalles

Blog!

  • Escasez de RAM: por qué suben los servidores y hasta cuándo
  • IBM Z y Arm: qué resuelve un procesador dual-ISA
  • Qué es una matriz de trazabilidad de requisitos
  • LLM en local: por qué las empresas montan sus propios servidores de IA
  • IBM Storage Scale para IA: 56x TTFT en inferencia LLM

Servicios

Soporte urgente 24/7
Hardware y sistemas
Migraciones
IA y HPC on-premise
Formación
Ciberseguridad

Recursos
Novedades
Whitepapers
Conviértete en partner de SIXE
Solicita una demo

Partners

  • Canonical
  • Docker
  • HCL
  • IBM
  • Kaspersky
  • Lenovo
  • Red Hat
  • Sealpath
  • SUSE
  • Tenable

Nuestra mision

SIXE garantiza que tus infraestructuras basadas en tecnologías IBM®, Red Hat®, Canonical® y SUSE® permanezcan estables, seguras y optimizadas durante todo el tiempo que las necesites.

En SIXE, nos comprometemos con la sostenibilidad. Por eso te ayudamos a diseñar, implementar y mantener soluciones tecnológicas duraderas y eficientes.

 

SIXE compromiso medioambiental green energy

+34 91 198 02 43 (UE) | +1 628 900 3024 (EE.UU.) | WhatsApp | Lun–Vie 8:30–16:30 (GMT+1)
© 2026 - SIXE | Formación, consultoría, servicios profesionales y proyectos llave en mano | IBM, Lenovo, Canonical, Red Hat, HCL, Sealpath & SUSE Authorized Business Partner. Empresa inscrita en el catálogo de empresas de ciberseguridad de INCIBE.
Desde Madrid y Barcelona para todo el mundo | Conócenos | Conviértete en Partner | Contactar
  • Link to LinkedIn Link to LinkedIn Link to LinkedIn
  • Link to X Link to X Link to X
  • Link to Facebook Link to Facebook Link to Facebook
  • Link to Youtube Link to Youtube Link to Youtube
  • Link to Mail Link to Mail Link to Mail
  • Política de cookies (UE)
  • Aviso legal
  • Política de privacidad
Link to: Curso de LangChain: RAG y agentes en local Link to: Curso de LangChain: RAG y agentes en local Curso de LangChain: RAG y agentes en localLink to: Curso de seguridad de IA: OWASP LLM y red teaming Link to: Curso de seguridad de IA: OWASP LLM y red teaming Curso de seguridad de IA: OWASP LLM y red teaming
Desplazarse hacia arriba Desplazarse hacia arriba Desplazarse hacia arriba
SIXE
SIXE
Gestionar el consentimiento de las cookies

En SIXE, priorizamos tu comodidad y seguridad. Estas tecnologías nos ayudan a optimizar nuestros servicios, personalizar contenidos y ofrecerte soluciones adaptadas a lo que realmente necesitas. Tu privacidad es importante: siempre estarás al mando de lo que compartes con nosotros.

Funcional Siempre activo
El almacenamiento o acceso técnico es estrictamente necesario para el propósito legítimo de permitir el uso de un servicio específico explícitamente solicitado por el abonado o usuario, o con el único propósito de llevar a cabo la transmisión de una comunicación a través de una red de comunicaciones electrónicas.
Preferencias
El almacenamiento o acceso técnico es necesario para la finalidad legítima de almacenar preferencias no solicitadas por el abonado o usuario.
Estadísticas
El almacenamiento o acceso técnico que es utilizado exclusivamente con fines estadísticos. El almacenamiento o acceso técnico que se utiliza exclusivamente con fines estadísticos anónimos. Sin un requerimiento, el cumplimiento voluntario por parte de tu Proveedor de servicios de Internet, o los registros adicionales de un tercero, la información almacenada o recuperada sólo para este propósito no se puede utilizar para identificarte.
Marketing
El almacenamiento o acceso técnico es necesario para crear perfiles de usuario para enviar publicidad, o para rastrear al usuario en una web o en varias web con fines de marketing similares.
  • Administrar opciones
  • Gestionar los servicios
  • Gestionar {vendor_count} proveedores
  • Leer más sobre estos propósitos
Ver preferencias
  • {title}
  • {title}
  • {title}