Contacta con nosotros

Temario del curso

Infraestructura como código con EXO

  • Resumen de los patrones de despliegue de EXO: nodos individuales, multinodo y clústeres RDMA
  • Automatización de la instalación de dependencias (Xcode, uv, Node.js, Rust) mediante gestión de configuraciones
  • Uso de Nix flakes para crear builds reproducibles de EXO y entornos de desarrollo
  • Redacción de playbooks de Ansible o scripts de shell para el aprovisionamiento no supervisado de clústeres

Builds reproducibles e integración continua

  • Fijación de dependencias y construcción del panel de control en pipelines CI
  • Ejecución de pruebas básicas (smoke tests) de EXO en runners de GitHub Actions o GitLab CI
  • Creación de imágenes doradas y flujos de trabajo de reversión basados en instantáneas para máquinas virtuales macOS y Linux
  • Gestión de versiones de tarjetas de modelo personalizadas junto al código de la aplicación

Descubrimiento de clústeres y automatización de redes

  • Configuración de mDNS y DNS estático para el descubrimiento fiable de nodos libp2p
  • Automatización de la creación de perfiles de red y gestión de puentes Thunderbolt en macOS
  • Uso de nombres de espacio personalizados (EXO_LIBP2P_NAMESPACE) para separar clústeres de desarrollo, staging y producción
  • Reglas de firewall y segmentación de red para entornos multitenant

Gestión del almacenamiento y ciclo de vida de modelos

  • Diseño de estrategias para EXO_MODELS_DIRS y EXO_MODELS_READ_ONLY_DIRS
  • Montaje de comparticiones NFS o SAN como repositorios de modelos de solo lectura para un aprovisionamiento rápido
  • Limpieza automática de cachés obsoletos y políticas de retención de pesos versionados
  • Automatización de la descarga previa de modelos y comprobaciones de estado antes de actualizaciones progresivas

Monitorización y alertas

  • Envío de registros EXO a un sistema de registro centralizado (ELK, Loki o Splunk)
  • Construcción de paneles de control en Grafana a partir de la salida EXO_TRACING_ENABLED
  • Configuración de alertas ante cambios en la membresía del clúster, eventos de falta de memoria (OOM) y picos de latencia de inferencia
  • Correlacionar la telemetría del hardware macmon con regresiones en el rendimiento del modelo

Actualizaciones, reversiones y recuperación ante desastres

  • Validación progresiva (canary) de las actualizaciones binarias de EXO en un nodo piloto antes del despliegue generalizado
  • Reversión a nivel de modelo: cambio entre versiones cuantizadas sin necesidad de volver a descargarlas
  • Copia de seguridad y restauración del estado del clúster, nombres de espacio personalizados y pesos en caché
  • Documentación de libros de trabajo (runbooks) de recuperación para escenarios de reconstrucción total del clúster

Endurecimiento de la seguridad y cumplimiento normativo

  • Aplicación de TLS en la capa del proxy inverso (nginx, traefik) para el panel de control y la API
  • Implementación de limitación de tasa de solicitudes a la API y listas blancas de IPs para los endpoints de EXO
  • Aislamiento de clústeres mediante VLANs y políticas de red de confianza cero (zero-trust)
  • Auditoría del acceso y mantenimiento de un inventario de modelos desplegados y sus versiones

Requerimientos

  • Experiencia en prácticas de DevOps (CI/CD, IaC, orquestación de contenedores)
  • Conocimientos sobre administración de sistemas y gestión de paquetes en macOS o Linux
  • Comprensión de conceptos de redes, DNS y almacenamiento

Público objetivo

  • Ingenieros de DevOps
  • Arquitectos de infraestructura
  • Ingenieros SRE responsables de cargas de trabajo de IA on-premise
 21 Horas

Número de participantes


Precio por participante

Reseñas (2)

Próximos cursos

Categorías Relacionadas