Gracias por enviar su consulta! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Gracias por enviar su reserva! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Duración 14 horas (2 días)
Temario del curso
Descripción general de las tecnologías de reconocimiento del habla
- Historia y evolución del reconocimiento del habla
- Modelos acústicos, modelos de lenguaje y decodificación
- Arquitecturas modernas: RNN, transformers y Whisper
Preprocesamiento de audio y fundamentos de la transcripción
- Manejo de formatos de audio y tasas de muestreo
- Limpieza, recorte y segmentación de audio
- Generación de texto a partir de audio: en tiempo real vs por lotes
Manejo práctico de Whisper y otras APIs
- Instalación y uso de OpenAI Whisper
- Llamadas a APIs en la nube (Google, Azure) para transcripción
- Comparación de rendimiento, latencia y costos
Lenguaje, acentos y adaptación al dominio
- Trabajo con múltiples idiomas y acentos
- Vocabularios personalizados y tolerancia al ruido
- Manejo de lenguaje legal, médico o técnico
Formato de salida e integración
- Adición de marcas de tiempo, puntuación y etiquetas de hablante
- Exportación a formatos de texto, SRT o JSON
- Integración de transcripciones en aplicaciones o bases de datos
Laboratorios de implementación de casos de uso
- Transcripción de reuniones, entrevistas o podcasts
- Sistemas de comandos de voz a texto
- Subtítulos en tiempo real para flujos de video/audio
Evaluación, limitaciones y ética
- Métricas de precisión y pruebas de referencia de modelos
- Sesgo e imparcialidad en los modelos de habla
- Consideraciones de privacidad y cumplimiento normativo
Resumen y siguientes pasos
Requerimientos
- Conocimiento de los conceptos generales de IA y aprendizaje automático
- Familiaridad con los formatos y herramientas de archivos de audio o medios
Público objetivo
- Científicos de datos e ingenieros de IA que trabajen con datos de voz
- Desarrolladores de software que construyan aplicaciones basadas en transcripción
- Organizaciones que estén explorando el reconocimiento del habla para la automatización