Ponte en Contacto
 Duración 21 horas (3 días)

Temario del curso

Fundamentos de la clasificación de audio

  • Tipos de eventos de sonido: ambientales, mecánicos, generados por humanos.
  • Visión general de casos de uso: vigilancia, monitoreo, automatización.
  • Clasificación de audio vs. detección vs. segmentación.

Datos de audio y extracción de características

  • Tipos de archivos de audio y formatos.
  • Consideraciones sobre tasa de muestreo, enventanado (windowing) y tamaño de fotograma.
  • Extracción de MFCC, características cromáticas y mel-espectrogramas.

Preparación de datos y anotación

  • Conjuntos de datos UrbanSound8K, ESC-50 y personalizados.
  • Etiquetado de eventos de sonido y límites temporales.
  • Equilibrar conjuntos de datos y aumentar el audio.

Construcción de modelos de clasificación de audio

  • Uso de redes neuronales convolucionales (CNN) para audio.
  • Entrada del modelo: forma de onda cruda vs. características extraídas.
  • Funciones de pérdida, métricas de evaluación y sobreajuste (overfitting).

Detección de eventos y localización temporal

  • Estrategias de detección basadas en fotogramas y segmentos.
  • Postprocesamiento de detecciones mediante umbrales y suavizado.
  • Visualización de predicciones en líneas de tiempo de audio.

Temas avanzados y procesamiento en tiempo real

  • Aprendizaje por transferencia para escenarios con pocos datos.
  • Despliegue de modelos con TensorFlow Lite o ONNX.
  • Procesamiento de audio en streaming y consideraciones de latencia.

Desarrollo de proyectos y escenarios de aplicación

  • Diseño de una tubería completa: de la ingesta a la clasificación.
  • Desarrollo de una prueba de concepto para vigilancia, control de calidad o monitoreo.
  • Registros (logging), alertas e integración con tableros de control o API.

Resumen y próximos pasos

Requerimientos

  • Comprensión de los conceptos de aprendizaje automático y el entrenamiento de modelos.
  • Experiencia en programación con Python y preprocesamiento de datos.
  • Familiaridad con los fundamentos del audio digital.

Público objetivo

  • Científicos de datos.
  • Ingenieros de aprendizaje automático.
  • Investigadores y desarrolladores en procesamiento de señales de audio.

Número de participantes


Precio por participante

Próximos cursos

Categorías Relacionadas