Contacta con nosotros

Temario del curso

Día 01

Visión general de la inteligencia empresarial de Big Data para el análisis de inteligencia criminal

  • Casos de estudio de las fuerzas del orden: policía predictiva.
  • Tasa de adopción de Big Data en agencias de fuerzas del orden y cómo están alineando sus operaciones futuras en torno al análisis predictivo de Big Data.
  • Soluciones tecnológicas emergentes, como sensores de disparos, videovigilancia y redes sociales.
  • Uso de la tecnología de Big Data para mitigar la sobrecarga de información.
  • Interfaz de Big Data con datos heredados (legacy).
  • Comprensión básica de las tecnologías habilitadoras del análisis predictivo.
  • Integración de datos y visualización en paneles de control (dashboards).
  • Gestión de fraudes.
  • Reglas de negocio y detección de fraudes.
  • Detección de amenazas y perfilamiento.
  • Análisis costo-beneficio para la implementación de Big Data.

Introducción a Big Data

  • Características principales de Big Data: volumen, variedad, velocidad y veracidad.
  • Arquitectura MPP (Procesamiento Masivamente Paralelo).
  • Bodegas de datos (Data Warehouses) – esquema estático, conjunto de datos de evolución lenta.
  • Bases de datos MPP: Greenplum, Exadata, Teradata, Netezza, Vertica, entre otras.
  • Soluciones basadas en Hadoop – sin restricciones sobre la estructura del conjunto de datos.
  • Patrón típico: HDFS, MapReduce (procesamiento), recuperación desde HDFS.
  • Apache Spark para procesamiento en tiempo real.
  • Lote: adecuado para análisis no interactivo.
  • Volumen: datos de streaming CEP (Procesamiento de Eventos Complejos).
  • Opciones típicas: productos CEP (por ejemplo, Infostreams, Apama, MarkLogic, entre otros).
  • Menos preparados para producción: Storm/S4.
  • Bases de datos NoSQL (columnares y clave-valor): más adecuadas como complemento analítico a la bodega de datos/bases de datos.

Soluciones NoSQL

  • KV Store - Keyspace, Flare, SchemaFree, RAMCloud, Oracle NoSQL Database (OnDB).
  • KV Store - Dynamo, Voldemort, Dynomite, SubRecord, MongoDB, DovetailDB.
  • KV Store (Jerárquico) - GT.m, Cache.
  • KV Store (Ordenado) - TokyoTyrant, Lightcloud, NMDB, Luxio, MemcacheDB, Actord.
  • KV Cache - Memcached, Repcached, Coherence, Infinispan, EXtremeScale, JBossCache, Velocity, Terracoqua.
  • Tuple Store - Gigaspaces, Coord, Apache River.
  • Base de datos de objetos - ZopeDB, DB4O, Shoal.
  • Almacén de documentos - CouchDB, Cloudant, Couchbase, MongoDB, Jackrabbit, Bases de datos XML, ThruDB, CloudKit, Preserve, Riak-Basho, Scalaris.
  • Almacén columnar ancho - BigTable, HBase, Apache Cassandra, Hypertable, KAI, OpenNeptune, Qbase, KDI.

Variety of Data: Introducción a los problemas de limpieza de datos en Big Data

  • RDBMS – estructura/esquema estático, no fomenta un entorno ágil y exploratorio.
  • NoSQL – semiestructurado; tiene suficiente estructura para almacenar datos sin un esquema exacto previo al almacenamiento.
  • Problemas de limpieza de datos.

Hadoop

  • ¿Cuándo seleccionar Hadoop?
  • Datos ESTRUCTURADOS: las bodegas de datos/ bases de datos empresariales pueden almacenar datos masivos (a un costo) pero imponen estructura (no son ideales para la exploración activa).
  • Datos SEMIESTRUCTURADOS: difíciles de procesar mediante soluciones tradicionales (DW/DB).
  • La creación de una bodega de datos implica UNA GRAN ESFUERZO y resulta estática incluso después de su implementación.
  • Para la variedad y el volumen de datos, procesados en hardware commodity -> HADOOP.
  • Hardware commodity necesario para crear un clúster de Hadoop.

Introducción a MapReduce / HDFS

  • MapReduce: distribución del cálculo entre múltiples servidores.
  • HDFS: hacer los datos disponibles localmente para el proceso de cálculo (con redundancia).
  • Datos: pueden ser no estructurados o sin esquema (a diferencia de RDBMS).
  • Responsabilidad del desarrollador de dar sentido a los datos.
  • Programar MapReduce implica trabajar con Java (ventajas/desventajas) y cargar manualmente los datos en HDFS.

Día 02

Ecosistema de Big Data: construcción de ETL de Big Data (Extraer, Transformar, Cargar). ¿Qué herramientas de Big Data utilizar y cuándo?

  • Hadoop vs. otras soluciones NoSQL.
  • Para acceso aleatorio e interactivo a los datos.
  • Hbase (base de datos orientada a columnas) sobre Hadoop.
  • Acceso aleatorio a los datos, pero con restricciones impuestas (máximo 1 PB).
  • No es adecuado para análisis ad-hoc; es bueno para registro, conteo y series temporales.
  • Sqoop: importación desde bases de datos a Hive o HDFS (acceso JDBC/ODBC).
  • Flume: envío de datos en tiempo real (por ejemplo, datos de registro) a HDFS.

Sistema de gestión de Big Data

  • Componentes móviles, nodos de cálculo que inician/fallan: ZooKeeper para servicios de configuración/coordinación/nombrado.
  • Pipeline/flujo de trabajo complejo: Oozie para gestionar flujos de trabajo, dependencias y cadenas.
  • Despliegue, configuración, gestión de clústers, actualización, etc. (administrador del sistema): Ambari.
  • En la nube: Whirr.

Análisis predictivo: técnicas fundamentales e inteligencia empresarial basada en aprendizaje automático

  • Introducción al aprendizaje automático.
  • Aprendizaje de técnicas de clasificación.
  • Predicción bayesiana: preparación de un archivo de entrenamiento.
  • Máquinas de soporte vectorial (SVM).
  • Álgebra p-Tree KNN y minería vertical.
  • Redes neuronales.
  • Problema de grandes variables en Big Data: Bosque Aleatorio (RF).
  • Problema de automatización en Big Data: RF de conjunto de múltiples modelos.
  • Automatización a través de Soft10-M.
  • Herramienta de análisis de texto: Treeminer.
  • Aprendizaje ágil.
  • Aprendizaje basado en agentes.
  • Aprendizaje distribuido.
  • Introducción a herramientas de código abierto para análisis predictivo: R, Python, Rapidminer, Mahout.

Ecosistema de análisis predictivo y su aplicación en el análisis de inteligencia criminal

  • Tecnología y el proceso de investigación.
  • Análisis de percepción (Insight analytics).
  • Análisis de visualización.
  • Análisis predictivo estructurado.
  • Análisis predictivo no estructurado.
  • Perfilamiento de amenazas/fraudulentos/proveedores.
  • Motor de recomendación.
  • Detección de patrones.
  • Descubrimiento de reglas/escenarios: fallos, fraudes, optimización.
  • Descubrimiento de la causa raíz.
  • Análisis de sentimiento.
  • Análisis CRM.
  • Análisis de redes.
  • Análisis de texto para obtener información a partir de transcripciones, declaraciones testificales, conversaciones en internet, etc.
  • Revisión asistida por tecnología.
  • Análisis de fraude.
  • Análisis en tiempo real.

Día 03

Análisis en tiempo real y escalable sobre Hadoop

  • ¿Por qué fallan los algoritmos analíticos comunes en Hadoop/HDFS?
  • Apache Hama: para cálculo distribuido síncrono masivo.
  • Apache SPARK: para cómputo en clúster y análisis en tiempo real.
  • Laboratorio de gráficos CMU2: enfoque asíncrono basado en grafos para el cálculo distribuido.
  • KNN p: enfoque basado en álgebra de Treeminer para reducir el costo operativo del hardware.

Herramientas para eDiscovery y forense

  • eDiscovery sobre Big Data vs. datos heredados: comparación de costos y rendimiento.
  • Codificación predictiva y revisión asistida por tecnología (TAR).
  • Demo en vivo de vMiner para comprender cómo TAR permite un descubrimiento más rápido.
  • Indexación más rápida a través de HDFS: velocidad de los datos.
  • Procesamiento de lenguaje natural (NLP): productos y técnicas de código abierto.
  • eDiscovery en idiomas extranjeros: tecnología para el procesamiento de idiomas extranjeros.

Inteligencia empresarial de Big Data para la seguridad cibernética: obtener una visión de 360 grados, recopilación rápida de datos e identificación de amenazas

  • Comprensión de los fundamentos del análisis de seguridad: superficie de ataque, configuración incorrecta de seguridad, defensas del host.
  • Infraestructura de red/ gran tubería de datos / ETL de respuesta para análisis en tiempo real.
  • Predictivo prescriptivo vs. predictivo: reglas fijas basadas en reglas frente al descubrimiento automático de reglas de amenaza a partir de metadatos.

Recopilación de datos dispares para el análisis de inteligencia criminal

  • Uso de IoT (Internet de las cosas) como sensores para la captura de datos.
  • Uso de imágenes satelitales para vigilancia doméstica.
  • Uso de datos de vigilancia e imagen para la identificación criminal.
  • Otras tecnologías de recopilación de datos: drones, cámaras corporales, sistemas de etiquetado GPS y tecnología de imagen térmica.
  • Combinación de recuperación automatizada de datos con datos obtenidos de informantes, interrogatorios e investigación.
  • Pronóstico de actividades delictivas.

Día 04

Inteligencia empresarial para la prevención de fraudes basada en Big Data en el análisis de fraudes

  • Clasificación básica del análisis de fraudes: basado en reglas vs. análisis predictivo.
  • Aprendizaje supervisado vs. no supervisado para la detección de patrones de fraude.
  • Fraude empresarial a empresarial, fraude de reclamaciones médicas, fraude de seguros, evasión fiscal y lavado de dinero.

Análisis de redes sociales: recopilación e inteligencia y análisis

  • Cómo las redes sociales son utilizadas por criminales para organizarse, reclutar y planificar.
  • API de ETL de Big Data para extraer datos de redes sociales.
  • Texto, imágenes, metadatos y video.
  • Análisis de sentimiento a partir del feed de redes sociales.
  • Filtrado contextual y no contextual del feed de redes sociales.
  • Panel de control (Dashboard) de redes sociales para integrar diversas fuentes.
  • Perfilamiento automatizado de perfiles de redes sociales.
  • Se brindarán demostraciones en vivo de cada análisis a través de la herramienta Treeminer.

Análisis de Big Data en procesamiento de imágenes y flujos de video

  • Técnicas de almacenamiento de imágenes en Big Data: soluciones de almacenamiento para datos que superan los petabytes.
  • LTFS (Sistema de archivos de cinta lineal) y LTO (Cinta Lineal Abierta).
  • GPFS-LTFS (Sistema de Archivos Paralelo General - Sistema de Archivos de Cinta Lineal): solución de almacenamiento en capas para grandes datos de imagen.
  • Fundamentos del análisis de imágenes.
  • Reconocimiento de objetos.
  • Segmentación de imágenes.
  • Rastreo de movimiento.
  • Reconstrucción de imágenes 3D.

Biometría, ADN y Programas de Identificación de Nueva Generación

  • Más allá de las huellas dactilares y el reconocimiento facial.
  • Reconocimiento de voz, análisis de la digitación (patrón de escritura del usuario) y CODIS (Sistema combinado de índices de ADN).
  • Más allá de la coincidencia de ADN: uso de la fenotipificación forense del ADN para construir un rostro a partir de muestras de ADN.

Panel de control de Big Data para acceso rápido a datos diversos y su visualización:

  • Integración de la plataforma de aplicaciones existente con el panel de control de Big Data.
  • Gestión de Big Data.
  • Caso de estudio del panel de control de Big Data: Tableau y Pentaho.
  • Uso de aplicaciones de Big Data para impulsar servicios basados en la ubicación en el gobierno.
  • Sistema de seguimiento y gestión.

Día 05

Cómo justificar la implementación de inteligencia empresarial de Big Data dentro de una organización:

  • Definición del ROI (Retorno de Inversión) para implementar Big Data.
  • Casos de estudio sobre ahorro de tiempo de los analistas en la recopilación y preparación de datos, aumentando la productividad.
  • Ganancia de ingresos por menor costo de licencias de bases de datos.
  • Ganancia de ingresos por servicios basados en la ubicación.
  • Ahorro de costos mediante la prevención de fraudes.
  • Un enfoque integrado de hojas de cálculo para calcular gastos aproximados versus ganancias/ahorro de ingresos de la implementación de Big Data.

Procedimiento paso a paso para reemplazar un sistema de datos heredado con un sistema de Big Data

  • Hoja de ruta de migración de Big Data.
  • ¿Qué información crítica se necesita antes de diseñar un sistema de Big Data?
  • ¿Cuáles son las diferentes formas de calcular el volumen, velocidad, variedad y veracidad de los datos?
  • Cómo estimar el crecimiento de los datos.
  • Casos de estudio.

Revisión de proveedores de Big Data y de sus productos.

  • Accenture.
  • APTEAN (anteriormente CDC Software).
  • Cisco Systems.
  • Cloudera.
  • Dell.
  • EMC.
  • GoodData Corporation.
  • Guavus.
  • Hitachi Data Systems.
  • Hortonworks.
  • HP.
  • IBM.
  • Informatica.
  • Intel.
  • Jaspersoft.
  • Microsoft.
  • MongoDB (anteriormente 10Gen).
  • MU Sigma.
  • Netapp.
  • Opera Solutions.
  • Oracle.
  • Pentaho.
  • Platfora.
  • Qliktech.
  • Quantum.
  • Rackspace.
  • Revolution Analytics.
  • Salesforce.
  • SAP.
  • SAS Institute.
  • Sisense.
  • Software AG/Terracotta.
  • Soft10 Automation.
  • Splunk.
  • Sqrrl.
  • Supermicro.
  • Tableau Software.
  • Teradata.
  • Think Big Analytics.
  • Tidemark Systems.
  • Treeminer.
  • VMware (parte de EMC).

Sesión de preguntas y respuestas

Requerimientos

  • Conocimiento de los procesos y sistemas de datos de las fuerzas del orden
  • Comprensión básica de SQL/Oracle o bases de datos relacionales
  • Comprensión básica de estadísticas (nivel de hojas de cálculo)

Público objetivo

  • Especialistas de las fuerzas del orden con formación técnica
 35 Horas

Número de participantes


Precio por participante

Testimonios (3)

Próximos cursos

Categorías Relacionadas