Contacta con nosotros

Temario del curso

Introducción

Esta sección ofrece una introducción general sobre cuándo utilizar el 'machine learning', qué aspectos considerar y su significado, incluyendo ventajas y desventajas. Tipos de datos (estructurados/no estructurados/estáticos/transmitidos), validez/volumen de los datos, análisis basado en datos vs. guiado por usuarios, modelos estadísticos vs. modelos de machine learning; desafíos del aprendizaje no supervisado, trade-off entre sesgo y varianza, iteración/evaluación, enfoques de validación cruzada, aprendizaje supervisado/no supervisado/reforzado.

TEMAS PRINCIPALES

1. Comprensión de Naive Bayes

  • Conceptos básicos de los métodos bayesianos
  • Probabilidad
  • Probabilidad conjunta
  • Probabilidad condicional con el teorema de Bayes
  • El algoritmo Naive Bayes
  • Clasificación con Naive Bayes
  • El estimador de Laplace
  • Uso de características numéricas con Naive Bayes

2. Comprensión de Decision Trees

  • Divide y vencerás
  • El algoritmo de árboles de decisión C5.0
  • Elegir la mejor división
  • Poda del árbol de decisión

3. Comprensión de Neural Networks

  • De neuronas biológicas a artificiales
  • Funciones de activación
  • Topología de la red
  • Número de capas
  • Dirección del flujo de información
  • Número de nodos en cada capa
  • Entrenamiento de redes neuronales con retropropagación
  • Deep Learning

4. Comprensión de Support Vector Machines

  • Clasificación con hiperplanos
  • Búsqueda del margen máximo
  • Caso de datos linealmente separables
  • Caso de datos no linealmente separables
  • Uso de kernels para espacios no lineales

5. Comprensión del Clustering

  • El clustering como tarea de machine learning
  • El algoritmo k-means para clustering
  • Uso de la distancia para asignar y actualizar clusters
  • Elegir el número adecuado de clusters

6. Medición del rendimiento en clasificación

  • Trabajo con datos de predicción en clasificación
  • Análisis detallado de las matrices de confusión
  • Uso de matrices de confusión para medir el rendimiento
  • Más allá de la precisión: otras medidas de rendimiento
  • La estadística kappa
  • Sensibilidad y especificidad
  • Precisión y recall
  • La F-measure
  • Visualización de los trade-offs de rendimiento
  • Curvas ROC
  • Estimación del rendimiento futuro
  • Método holdout
  • Validación cruzada
  • Muestreo bootstrap

7. Ajuste de modelos estándar para mejorar el rendimiento

  • Uso de caret para ajuste automático de parámetros
  • Creación de un modelo ajustado sencillo
  • Personalización del proceso de ajuste
  • Mejora del rendimiento del modelo con meta-aprendizaje
  • Comprensión de los conjuntos (ensembles)
  • Bagging
  • Boosting
  • Bosques aleatorios (Random forests)
  • Entrenamiento de bosques aleatorios
  • Evaluación del rendimiento de los bosques aleatorios

TEMAS SECUNDARIOS

8. Comprensión de la clasificación mediante vecinos más cercanos

  • El algoritmo kNN
  • Cálculo de distancias
  • Elegir un valor adecuado de k
  • Preparación de datos para el uso con kNN
  • ¿Por qué el algoritmo kNN es perezoso (lazy)?

9. Comprensión de reglas de clasificación

  • Divide y conquista
  • El algoritmo One Rule
  • El algoritmo RIPPER
  • Reglas derivadas de árboles de decisión

10. Comprensión de la regresión

  • Regresión lineal simple
  • Estimación por mínimos cuadrados ordinarios
  • Correlaciones
  • Regresión lineal múltiple

11. Comprensión de árboles de regresión y model trees

  • Agregación de regresión a los árboles

12. Comprensión de reglas de asociación

  • El algoritmo Apriori para el aprendizaje de reglas de asociación
  • Medición del interés de las reglas: soporte y confianza
  • Construcción de un conjunto de reglas con el principio de Apriori

Temas adicionales

  • Spark/PySpark/MLlib y bandits multi-brazo (multi-armed bandits)

Requerimientos

Conocimientos de Python

 21 Horas

Número de participantes


Precio por participante

Reseñas (7)

Próximos cursos

Categorías Relacionadas