Temario del curso
Día 01
Visión general de la inteligencia empresarial de Big Data para el análisis de inteligencia criminal
- Casos de estudio de las fuerzas del orden: policía predictiva.
- Tasa de adopción de Big Data en agencias de fuerzas del orden y cómo están alineando sus operaciones futuras en torno al análisis predictivo de Big Data.
- Soluciones tecnológicas emergentes, como sensores de disparos, videovigilancia y redes sociales.
- Uso de la tecnología de Big Data para mitigar la sobrecarga de información.
- Interfaz de Big Data con datos heredados (legacy).
- Comprensión básica de las tecnologías habilitadoras del análisis predictivo.
- Integración de datos y visualización en paneles de control (dashboards).
- Gestión de fraudes.
- Reglas de negocio y detección de fraudes.
- Detección de amenazas y perfilamiento.
- Análisis costo-beneficio para la implementación de Big Data.
Introducción a Big Data
- Características principales de Big Data: volumen, variedad, velocidad y veracidad.
- Arquitectura MPP (Procesamiento Masivamente Paralelo).
- Bodegas de datos (Data Warehouses) – esquema estático, conjunto de datos de evolución lenta.
- Bases de datos MPP: Greenplum, Exadata, Teradata, Netezza, Vertica, entre otras.
- Soluciones basadas en Hadoop – sin restricciones sobre la estructura del conjunto de datos.
- Patrón típico: HDFS, MapReduce (procesamiento), recuperación desde HDFS.
- Apache Spark para procesamiento en tiempo real.
- Lote: adecuado para análisis no interactivo.
- Volumen: datos de streaming CEP (Procesamiento de Eventos Complejos).
- Opciones típicas: productos CEP (por ejemplo, Infostreams, Apama, MarkLogic, entre otros).
- Menos preparados para producción: Storm/S4.
- Bases de datos NoSQL (columnares y clave-valor): más adecuadas como complemento analítico a la bodega de datos/bases de datos.
Soluciones NoSQL
- KV Store - Keyspace, Flare, SchemaFree, RAMCloud, Oracle NoSQL Database (OnDB).
- KV Store - Dynamo, Voldemort, Dynomite, SubRecord, MongoDB, DovetailDB.
- KV Store (Jerárquico) - GT.m, Cache.
- KV Store (Ordenado) - TokyoTyrant, Lightcloud, NMDB, Luxio, MemcacheDB, Actord.
- KV Cache - Memcached, Repcached, Coherence, Infinispan, EXtremeScale, JBossCache, Velocity, Terracoqua.
- Tuple Store - Gigaspaces, Coord, Apache River.
- Base de datos de objetos - ZopeDB, DB4O, Shoal.
- Almacén de documentos - CouchDB, Cloudant, Couchbase, MongoDB, Jackrabbit, Bases de datos XML, ThruDB, CloudKit, Preserve, Riak-Basho, Scalaris.
- Almacén columnar ancho - BigTable, HBase, Apache Cassandra, Hypertable, KAI, OpenNeptune, Qbase, KDI.
Variety of Data: Introducción a los problemas de limpieza de datos en Big Data
- RDBMS – estructura/esquema estático, no fomenta un entorno ágil y exploratorio.
- NoSQL – semiestructurado; tiene suficiente estructura para almacenar datos sin un esquema exacto previo al almacenamiento.
- Problemas de limpieza de datos.
Hadoop
- ¿Cuándo seleccionar Hadoop?
- Datos ESTRUCTURADOS: las bodegas de datos/ bases de datos empresariales pueden almacenar datos masivos (a un costo) pero imponen estructura (no son ideales para la exploración activa).
- Datos SEMIESTRUCTURADOS: difíciles de procesar mediante soluciones tradicionales (DW/DB).
- La creación de una bodega de datos implica UNA GRAN ESFUERZO y resulta estática incluso después de su implementación.
- Para la variedad y el volumen de datos, procesados en hardware commodity -> HADOOP.
- Hardware commodity necesario para crear un clúster de Hadoop.
Introducción a MapReduce / HDFS
- MapReduce: distribución del cálculo entre múltiples servidores.
- HDFS: hacer los datos disponibles localmente para el proceso de cálculo (con redundancia).
- Datos: pueden ser no estructurados o sin esquema (a diferencia de RDBMS).
- Responsabilidad del desarrollador de dar sentido a los datos.
- Programar MapReduce implica trabajar con Java (ventajas/desventajas) y cargar manualmente los datos en HDFS.
Día 02
Ecosistema de Big Data: construcción de ETL de Big Data (Extraer, Transformar, Cargar). ¿Qué herramientas de Big Data utilizar y cuándo?
- Hadoop vs. otras soluciones NoSQL.
- Para acceso aleatorio e interactivo a los datos.
- Hbase (base de datos orientada a columnas) sobre Hadoop.
- Acceso aleatorio a los datos, pero con restricciones impuestas (máximo 1 PB).
- No es adecuado para análisis ad-hoc; es bueno para registro, conteo y series temporales.
- Sqoop: importación desde bases de datos a Hive o HDFS (acceso JDBC/ODBC).
- Flume: envío de datos en tiempo real (por ejemplo, datos de registro) a HDFS.
Sistema de gestión de Big Data
- Componentes móviles, nodos de cálculo que inician/fallan: ZooKeeper para servicios de configuración/coordinación/nombrado.
- Pipeline/flujo de trabajo complejo: Oozie para gestionar flujos de trabajo, dependencias y cadenas.
- Despliegue, configuración, gestión de clústers, actualización, etc. (administrador del sistema): Ambari.
- En la nube: Whirr.
Análisis predictivo: técnicas fundamentales e inteligencia empresarial basada en aprendizaje automático
- Introducción al aprendizaje automático.
- Aprendizaje de técnicas de clasificación.
- Predicción bayesiana: preparación de un archivo de entrenamiento.
- Máquinas de soporte vectorial (SVM).
- Álgebra p-Tree KNN y minería vertical.
- Redes neuronales.
- Problema de grandes variables en Big Data: Bosque Aleatorio (RF).
- Problema de automatización en Big Data: RF de conjunto de múltiples modelos.
- Automatización a través de Soft10-M.
- Herramienta de análisis de texto: Treeminer.
- Aprendizaje ágil.
- Aprendizaje basado en agentes.
- Aprendizaje distribuido.
- Introducción a herramientas de código abierto para análisis predictivo: R, Python, Rapidminer, Mahout.
Ecosistema de análisis predictivo y su aplicación en el análisis de inteligencia criminal
- Tecnología y el proceso de investigación.
- Análisis de percepción (Insight analytics).
- Análisis de visualización.
- Análisis predictivo estructurado.
- Análisis predictivo no estructurado.
- Perfilamiento de amenazas/fraudulentos/proveedores.
- Motor de recomendación.
- Detección de patrones.
- Descubrimiento de reglas/escenarios: fallos, fraudes, optimización.
- Descubrimiento de la causa raíz.
- Análisis de sentimiento.
- Análisis CRM.
- Análisis de redes.
- Análisis de texto para obtener información a partir de transcripciones, declaraciones testificales, conversaciones en internet, etc.
- Revisión asistida por tecnología.
- Análisis de fraude.
- Análisis en tiempo real.
Día 03
Análisis en tiempo real y escalable sobre Hadoop
- ¿Por qué fallan los algoritmos analíticos comunes en Hadoop/HDFS?
- Apache Hama: para cálculo distribuido síncrono masivo.
- Apache SPARK: para cómputo en clúster y análisis en tiempo real.
- Laboratorio de gráficos CMU2: enfoque asíncrono basado en grafos para el cálculo distribuido.
- KNN p: enfoque basado en álgebra de Treeminer para reducir el costo operativo del hardware.
Herramientas para eDiscovery y forense
- eDiscovery sobre Big Data vs. datos heredados: comparación de costos y rendimiento.
- Codificación predictiva y revisión asistida por tecnología (TAR).
- Demo en vivo de vMiner para comprender cómo TAR permite un descubrimiento más rápido.
- Indexación más rápida a través de HDFS: velocidad de los datos.
- Procesamiento de lenguaje natural (NLP): productos y técnicas de código abierto.
- eDiscovery en idiomas extranjeros: tecnología para el procesamiento de idiomas extranjeros.
Inteligencia empresarial de Big Data para la seguridad cibernética: obtener una visión de 360 grados, recopilación rápida de datos e identificación de amenazas
- Comprensión de los fundamentos del análisis de seguridad: superficie de ataque, configuración incorrecta de seguridad, defensas del host.
- Infraestructura de red/ gran tubería de datos / ETL de respuesta para análisis en tiempo real.
- Predictivo prescriptivo vs. predictivo: reglas fijas basadas en reglas frente al descubrimiento automático de reglas de amenaza a partir de metadatos.
Recopilación de datos dispares para el análisis de inteligencia criminal
- Uso de IoT (Internet de las cosas) como sensores para la captura de datos.
- Uso de imágenes satelitales para vigilancia doméstica.
- Uso de datos de vigilancia e imagen para la identificación criminal.
- Otras tecnologías de recopilación de datos: drones, cámaras corporales, sistemas de etiquetado GPS y tecnología de imagen térmica.
- Combinación de recuperación automatizada de datos con datos obtenidos de informantes, interrogatorios e investigación.
- Pronóstico de actividades delictivas.
Día 04
Inteligencia empresarial para la prevención de fraudes basada en Big Data en el análisis de fraudes
- Clasificación básica del análisis de fraudes: basado en reglas vs. análisis predictivo.
- Aprendizaje supervisado vs. no supervisado para la detección de patrones de fraude.
- Fraude empresarial a empresarial, fraude de reclamaciones médicas, fraude de seguros, evasión fiscal y lavado de dinero.
Análisis de redes sociales: recopilación e inteligencia y análisis
- Cómo las redes sociales son utilizadas por criminales para organizarse, reclutar y planificar.
- API de ETL de Big Data para extraer datos de redes sociales.
- Texto, imágenes, metadatos y video.
- Análisis de sentimiento a partir del feed de redes sociales.
- Filtrado contextual y no contextual del feed de redes sociales.
- Panel de control (Dashboard) de redes sociales para integrar diversas fuentes.
- Perfilamiento automatizado de perfiles de redes sociales.
- Se brindarán demostraciones en vivo de cada análisis a través de la herramienta Treeminer.
Análisis de Big Data en procesamiento de imágenes y flujos de video
- Técnicas de almacenamiento de imágenes en Big Data: soluciones de almacenamiento para datos que superan los petabytes.
- LTFS (Sistema de archivos de cinta lineal) y LTO (Cinta Lineal Abierta).
- GPFS-LTFS (Sistema de Archivos Paralelo General - Sistema de Archivos de Cinta Lineal): solución de almacenamiento en capas para grandes datos de imagen.
- Fundamentos del análisis de imágenes.
- Reconocimiento de objetos.
- Segmentación de imágenes.
- Rastreo de movimiento.
- Reconstrucción de imágenes 3D.
Biometría, ADN y Programas de Identificación de Nueva Generación
- Más allá de las huellas dactilares y el reconocimiento facial.
- Reconocimiento de voz, análisis de la digitación (patrón de escritura del usuario) y CODIS (Sistema combinado de índices de ADN).
- Más allá de la coincidencia de ADN: uso de la fenotipificación forense del ADN para construir un rostro a partir de muestras de ADN.
Panel de control de Big Data para acceso rápido a datos diversos y su visualización:
- Integración de la plataforma de aplicaciones existente con el panel de control de Big Data.
- Gestión de Big Data.
- Caso de estudio del panel de control de Big Data: Tableau y Pentaho.
- Uso de aplicaciones de Big Data para impulsar servicios basados en la ubicación en el gobierno.
- Sistema de seguimiento y gestión.
Día 05
Cómo justificar la implementación de inteligencia empresarial de Big Data dentro de una organización:
- Definición del ROI (Retorno de Inversión) para implementar Big Data.
- Casos de estudio sobre ahorro de tiempo de los analistas en la recopilación y preparación de datos, aumentando la productividad.
- Ganancia de ingresos por menor costo de licencias de bases de datos.
- Ganancia de ingresos por servicios basados en la ubicación.
- Ahorro de costos mediante la prevención de fraudes.
- Un enfoque integrado de hojas de cálculo para calcular gastos aproximados versus ganancias/ahorro de ingresos de la implementación de Big Data.
Procedimiento paso a paso para reemplazar un sistema de datos heredado con un sistema de Big Data
- Hoja de ruta de migración de Big Data.
- ¿Qué información crítica se necesita antes de diseñar un sistema de Big Data?
- ¿Cuáles son las diferentes formas de calcular el volumen, velocidad, variedad y veracidad de los datos?
- Cómo estimar el crecimiento de los datos.
- Casos de estudio.
Revisión de proveedores de Big Data y de sus productos.
- Accenture.
- APTEAN (anteriormente CDC Software).
- Cisco Systems.
- Cloudera.
- Dell.
- EMC.
- GoodData Corporation.
- Guavus.
- Hitachi Data Systems.
- Hortonworks.
- HP.
- IBM.
- Informatica.
- Intel.
- Jaspersoft.
- Microsoft.
- MongoDB (anteriormente 10Gen).
- MU Sigma.
- Netapp.
- Opera Solutions.
- Oracle.
- Pentaho.
- Platfora.
- Qliktech.
- Quantum.
- Rackspace.
- Revolution Analytics.
- Salesforce.
- SAP.
- SAS Institute.
- Sisense.
- Software AG/Terracotta.
- Soft10 Automation.
- Splunk.
- Sqrrl.
- Supermicro.
- Tableau Software.
- Teradata.
- Think Big Analytics.
- Tidemark Systems.
- Treeminer.
- VMware (parte de EMC).
Sesión de preguntas y respuestas
Requerimientos
- Conocimiento de los procesos y sistemas de datos de las fuerzas del orden
- Comprensión básica de SQL/Oracle o bases de datos relacionales
- Comprensión básica de estadísticas (nivel de hojas de cálculo)
Público objetivo
- Especialistas de las fuerzas del orden con formación técnica
Testimonios (3)
fundamentos y amó los documentos y ejercicios preparados
Rekha Nallam - GE Medical Systems Polska Sp. z o.o.
Curso - Introduction to Predictive AI
Traducción Automática
Que fue muy priactico.
Alfonso Ramos - Banco de Mexico
Curso - Fundamentos de Integración de Datos Pentaho
Deepthi estaba muy atenta a mis necesidades, podía percibir cuándo añadir capas de complejidad y cuándo mantenerse atrás y adoptar un enfoque más estructurado. Deepthi realmente trabajó a mi ritmo y aseguró que pudiera utilizar las nuevas funciones/herramientas por mí mismo, primero mostrándome y luego dejándome recrear los elementos por mí mismo, lo cual ayudó mucho a consolidar la formación. ¡No podría estar más satisfecho con los resultados de esta capacitación y con el nivel de experiencia de Deepthi!
Deepthi - Invest Northern Ireland
Curso - IBM Cognos Analytics
Traducción Automática