Gracias por enviar su consulta! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Gracias por enviar su reserva! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Duración 14 horas
Temario del curso
Introducción a AIOps
- ¿Qué es AIOps y por qué es importante?
- Monitoreo tradicional vs. observabilidad impulsada por AIOps.
- Arquitectura de AIOps y componentes clave.
Recolección y normalización de datos operativos
- Tipos de datos de observabilidad: métricas, registros y trazas.
- Ingesta de datos desde múltiples fuentes (servidores, contenedores, nube).
- Uso de agentes y exportadores (Prometheus, Beats, Fluentd).
Correlación de datos y detección de anomalías
- Correlación de series temporales y métodos estadísticos.
- Uso de modelos de aprendizaje automático para la detección de anomalías.
- Detección de incidentes en sistemas distribuidos.
Alertas y reducción de ruido
- Diseño de reglas y umbrales de alerta inteligentes.
- Supresión, deduplicación y agrupación de alertas.
- Integración con Alertmanager, Slack, PagerDuty o Opsgenie.
Análisis de causa raíz y visualización
- Uso de tableros para visualizar métricas y detectar tendencias.
- Exploración de eventos y líneas de tiempo para el análisis de causa raíz (RCA).
- Seguimiento de problemas entre capas con herramientas de trazas distribuidas.
Automatización y remediación
- Activación de scripts o flujos de trabajo automatizados desde incidentes.
- Integración con sistemas ITSM (ServiceNow, Jira).
- Casos de uso: sanación automática (self-healing), escalado, redirigimiento de tráfico.
Plataformas de AIOps de código abierto y comerciales
- Visión general de herramientas: Prometheus, Grafana, ELK, Moogsoft, Dynatrace.
- Criterios de evaluación para la selección de una plataforma de AIOps.
- Demostración y práctica con una pila seleccionada.
Resumen y próximos pasos
Requerimientos
- Conocimiento de los conceptos de operaciones de TI y monitoreo de sistemas.
- Experiencia con herramientas de monitoreo o tableros (dashboards).
- Familiaridad con formatos básicos de registros (logs) y métricas.
Audiencia
- Equipos de operaciones responsables de infraestructura y aplicaciones.
- Ingenieros de Confiabilidad de Sitio (SRE).
- Equipos de monitoreo de TI y observabilidad.