Gracias por enviar su consulta! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Gracias por enviar su reserva! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Duración 21 horas (3 días)
Temario del curso
Fundamentos de la clasificación de audio
- Tipos de eventos de sonido: ambientales, mecánicos, generados por humanos.
- Visión general de casos de uso: vigilancia, monitoreo, automatización.
- Clasificación de audio vs. detección vs. segmentación.
Datos de audio y extracción de características
- Tipos de archivos de audio y formatos.
- Consideraciones sobre tasa de muestreo, enventanado (windowing) y tamaño de fotograma.
- Extracción de MFCC, características cromáticas y mel-espectrogramas.
Preparación de datos y anotación
- Conjuntos de datos UrbanSound8K, ESC-50 y personalizados.
- Etiquetado de eventos de sonido y límites temporales.
- Equilibrar conjuntos de datos y aumentar el audio.
Construcción de modelos de clasificación de audio
- Uso de redes neuronales convolucionales (CNN) para audio.
- Entrada del modelo: forma de onda cruda vs. características extraídas.
- Funciones de pérdida, métricas de evaluación y sobreajuste (overfitting).
Detección de eventos y localización temporal
- Estrategias de detección basadas en fotogramas y segmentos.
- Postprocesamiento de detecciones mediante umbrales y suavizado.
- Visualización de predicciones en líneas de tiempo de audio.
Temas avanzados y procesamiento en tiempo real
- Aprendizaje por transferencia para escenarios con pocos datos.
- Despliegue de modelos con TensorFlow Lite o ONNX.
- Procesamiento de audio en streaming y consideraciones de latencia.
Desarrollo de proyectos y escenarios de aplicación
- Diseño de una tubería completa: de la ingesta a la clasificación.
- Desarrollo de una prueba de concepto para vigilancia, control de calidad o monitoreo.
- Registros (logging), alertas e integración con tableros de control o API.
Resumen y próximos pasos
Requerimientos
- Comprensión de los conceptos de aprendizaje automático y el entrenamiento de modelos.
- Experiencia en programación con Python y preprocesamiento de datos.
- Familiaridad con los fundamentos del audio digital.
Público objetivo
- Científicos de datos.
- Ingenieros de aprendizaje automático.
- Investigadores y desarrolladores en procesamiento de señales de audio.