Contacta con nosotros

Temario del curso

Esquema detallado de la capacitación

  1. Introducción al PLN
    • Comprensión del PLN
    • Frameworks de PLN
    • Aplicaciones comerciales del PLN
    • Recopilación de datos desde la web (web scraping)
    • Uso de diversas APIs para recuperar datos de texto
    • Trabajo y almacenamiento de corpora de texto, guardando el contenido y los metadatos relevantes
    • Ventajas de usar Python y curso intensivo de NLTK
  2. Comprensión práctica de un corpus y conjunto de datos
    • ¿Por qué necesitamos un corpus?
    • Análisis del corpus
    • Tipos de atributos de datos
    • Diferentes formatos de archivos para corpora
    • Preparación de un conjunto de datos para aplicaciones de PLN
  3. Comprensión de la estructura de una oración
    • Componentes del PLN
    • Comprensión del lenguaje natural
    • Análisis morfológico: raíz (stem), palabra, token, etiquetas de parte de la oración
    • Análisis sintáctico
    • Análisis semántico
    • Gestión de la ambigüedad
  4. Preprocesamiento de datos de texto
    • Corpus: texto sin procesar
      • Tokenización de oraciones
      • Obtención de raíces para texto sin procesar (Stemming)
      • Lematización del texto sin procesar
      • Eliminación de palabras vacías
    • Corpus: oraciones sin procesar
      • Tokenización de palabras
      • Lematización de palabras
    • Trabajo con matrices Term-Documento / Documento-Term
    • Tokenización de texto en n-gramas y oraciones
    • Preprocesamiento práctico y personalizado
  5. Análisis de datos de texto
    • Características básicas del PLN
      • Analizadores y análisis sintáctico (parsing)
      • Etiquetado de partes de la oración (POS tagging) y etiquetadores
      • Reconocimiento de entidades nominales
      • N-gramas
      • Bolsa de palabras (Bag of Words)
    • Características estadísticas del PLN
      • Conceptos de álgebra lineal para el PLN
      • Teoría probabilística para el PLN
      • TF-IDF
      • Vectorización
      • Codificadores y decodificadores
      • Normalización
      • Modelos probabilísticos
    • Ingeniería avanzada de características y PLN
      • Fundamentos de word2vec
      • Componentes del modelo word2vec
      • Lógica del modelo word2vec
      • Extensión del concepto de word2vec
      • Aplicación del modelo word2vec
    • Caso de estudio: Aplicación de la bolsa de palabras: resumen automático de texto utilizando algoritmos simplificados y verdaderos de Luhn
  6. Agrupación, clasificación y modelado de temas de documentos
    • Agrupación de documentos y minería de patrones (agrupamiento jerárquico, k-means, clustering, etc.)
    • Comparación y clasificación de documentos utilizando medidas de distancia TFIDF, Jaccard y coseno
    • Clasificación de documentos usando Bayes ingenuo y Máxima Entropía
  7. Identificación de elementos importantes del texto
    • Reducción de dimensionalidad: Análisis de Componentes Principales, Descomposición en Valores Singulares (SVD), factorización matricial no negativa
    • Modelado de temas y recuperación de información utilizando Análisis Semántico Latente
  8. Extracción de entidades, análisis de sentimiento y modelado avanzado de temas
    • Positivo vs. negativo: grado de sentimiento
    • Teoría de respuesta al ítem
    • Etiquetado de partes de la oración y su aplicación: encontrar personas, lugares y organizaciones mencionadas en el texto
    • Modelado avanzado de temas: Asignación Dirichlet Latente (LDA)
  9. Casos de estudio
    • Minería de reseñas no estructuradas de usuarios
    • Clasificación y visualización del sentimiento en datos de reseñas de productos
    • Minería de registros de búsqueda para patrones de uso
    • Clasificación de texto
    • Modelado de temas

Requerimientos

Conocimiento y comprensión de los principios del PLN y una apreciación de la aplicación de la IA en los negocios

 21 Horas

Número de participantes


Precio por participante

Reseñas (1)

Próximos cursos

Categorías Relacionadas