Contacta con nosotros

Temario del curso

Introducción a los modelos multimodales de Mistral

  • Visión general de Mistral Medium y sus capacidades multimodales
  • Modelos de OCR/documentos y casos de uso
  • Integración con ecosistemas de código abierto

Pipelines de OCR y visión

  • Fundamentos del OCR con modelos de Mistral
  • Preprocesamiento de imágenes y documentos escaneados
  • Extracción de texto estructurado de imágenes

Comprensión de documentos

  • Diseño de pipelines de PLN para documentos
  • Reconocimiento de entidades, resumen y clasificación
  • Vinculación entre texto y datos visuales

Aplicaciones de búsqueda y conocimiento

  • Sistemas de búsqueda de visión-texto
  • Construcción de búsqueda semántica con salidas de OCR
  • Repositorios empresariales de documentos

Aplicaciones asistivas e interactivas

  • Diseño de UI para asistentes multimodales
  • Aplicaciones de accesibilidad (p. ej., visión a texto)
  • Herramientas de productividad del mundo real

Rendimiento y optimización

  • Escala de pipelines multimodales
  • Ajuste del rendimiento de inferencia
  • Evaluación de los compromisos entre precisión y eficiencia

Casos de estudio y perspectivas futuras

  • Aplicaciones industriales de IA multimodal
  • Tendencias de investigación en OCR e inteligencia documental
  • Consideraciones de IA responsable en tareas de visión-texto

Resumen y próximos pasos

Requerimientos

  • Comprensión de conceptos de procesamiento del lenguaje natural
  • Experiencia con Python y marcos de ML
  • Familiaridad con los fundamentos de la visión por computadora

Público objetivo

  • Equipos de producto
  • Investigadores de ML
  • Ingenieros de ML aplicados
 14 Horas

Número de participantes


Precio por participante

Próximos cursos

Categorías Relacionadas