ROCm para Windows
ROCm es una plataforma de código abierto para la programación de GPU que admite GPUs de AMD y también proporciona compatibilidad con CUDA y OpenCL. ROCm expone al programador los detalles del hardware y le brinda un control total sobre el proceso de paralelización. Sin embargo, esto también requiere un buen entendimiento de la arquitectura del dispositivo, el modelo de memoria, el modelo de ejecución y las técnicas de optimización.
ROCm para Windows es un desarrollo reciente que permite a los usuarios instalar y usar ROCm en el sistema operativo Windows, ampliamente utilizado con fines personales y profesionales. ROCm para Windows permite a los usuarios aprovechar el poder de las GPU de AMD para diversas aplicaciones, como inteligencia artificial, juegos, gráficos y computación científica.
Esta formación en vivo dirigida por instructores (en línea o en sitio) está dirigida a desarrolladores de nivel principiante e intermedio que desean instalar y usar ROCm en Windows para programar GPUs de AMD y explotar su paralelismo.
Al final de esta formación, los participantes podrán:
- Configurar un entorno de desarrollo que incluya la Plataforma ROCm, una GPU de AMD y Visual Studio Code en Windows.
- Crear un programa básico de ROCm que realice la adición de vectores en la GPU y recupere los resultados de la memoria de la GPU.
- Utilizar la API de ROCm para consultar información del dispositivo, asignar y liberar memoria del dispositivo, copiar datos entre el host y el dispositivo, lanzar kernels y sincronizar hilos.
- Utilizar el lenguaje HIP para escribir kernels que se ejecuten en la GPU y manipulen datos.
- Utilizar las funciones integradas, variables y bibliotecas de HIP para realizar tareas y operaciones comunes.
- Utilizar los espacios de memoria de ROCm y HIP, como global, compartido, constante y local, para optimizar las transferencias de datos y el acceso a la memoria.
- Utilizar los modelos de ejecución de ROCm y HIP para controlar los hilos, bloques y cuadrículas que definen el paralelismo.
- Depurar y probar programas de ROCm y HIP utilizando herramientas como el Depurador de ROCm y el Analizador de ROCm.
- Optimizar programas de ROCm y HIP utilizando técnicas como la coalescencia, el almacenamiento en caché, la precarga (prefetching) y la medición de rendimiento (profiling).
Formato del curso
- Conferencias interactivas y discusión.
- Muchas ejercicios y práctica.
- Implementación práctica en un entorno de laboratorio en vivo.
Opciones de personalización del curso
- Para solicitar una formación personalizada para este curso, por favor contáctenos para coordinar los detalles.
Temario del curso
Introducción
- ¿Qué es ROCm?
- ¿Qué es HIP?
- ROCm frente a CUDA frente a OpenCL
- Visión general de las características y arquitectura de ROCm y HIP
- ROCm para Windows frente a ROCm para Linux
Instalación
- Instalación de ROCm en Windows
- Verificación de la instalación y comprobación de la compatibilidad del dispositivo
- Actualización o desinstalación de ROCm en Windows
- Solución de problemas comunes de instalación
Primeros pasos
- Creación de un nuevo proyecto de ROCm utilizando Visual Studio Code en Windows
- Exploración de la estructura del proyecto y los archivos
- Compilación y ejecución del programa
- Visualización de la salida utilizando printf y fprintf
API de ROCm
- Uso de la API de ROCm en el programa host
- Consulta de información y capacidades del dispositivo
- Asignación y liberación de memoria del dispositivo
- Copiar datos entre el host y el dispositivo
- Lanzamiento de kernels y sincronización de hilos
- Gestión de errores y excepciones
Lenguaje HIP
- Uso del lenguaje HIP en el programa del dispositivo
- Escritura de kernels que se ejecutan en la GPU y manipulan datos
- Uso de tipos de datos, calificadores, operadores y expresiones
- Uso de funciones integradas, variables y bibliotecas
Modelo de memoria de ROCm y HIP
- Uso de diferentes espacios de memoria, como global, compartido, constante y local
- Uso de diferentes objetos de memoria, como punteros, matrices, texturas y superficies
- Uso de diferentes modos de acceso a la memoria, como solo lectura, solo escritura, lectura-escritura, etc.
- Modelo de coherencia de memoria y mecanismos de sincronización
Modelo de ejecución de ROCm y HIP
- Uso de diferentes modelos de ejecución, como hilos, bloques y cuadrículas
- Funciones de hilo, como hipThreadIdx_x, hipBlockIdx_x, hipBlockDim_x, etc.
- Funciones de bloque, como __syncthreads, __threadfence_block, etc.
- Funciones de cuadrícula, como hipGridDim_x, hipGridSync, grupos cooperativos, etc.
Depuración
- Depuración de programas de ROCm y HIP en Windows
- Uso del depurador de Visual Studio Code para inspeccionar variables, puntos de interrupción, pila de llamadas, etc.
- Uso del Depurador de ROCm para depurar programas de ROCm y HIP en dispositivos AMD
- Uso del Analizador de ROCm para analizar programas de ROCm y HIP en dispositivos AMD
Optimización
- Optimización de programas de ROCm y HIP en Windows
- Uso de técnicas de coalescencia para mejorar el rendimiento de la memoria
- Uso de técnicas de almacenamiento en caché y precarga (prefetching) para reducir la latencia de la memoria
- Uso de técnicas de memoria compartida y memoria local para optimizar los accesos a la memoria y el ancho de banda
- Uso de herramientas de medición de rendimiento (profiling) para medir y mejorar el tiempo de ejecución y la utilización de recursos
Resumen y próximos pasos
Requerimientos
- Comprensión del lenguaje C/C++ y conceptos de programación paralela
- Conocimientos básicos de la arquitectura de computadoras y jerarquía de memoria
- Experiencia con herramientas de línea de comandos y editores de código
- Familiaridad con el sistema operativo Windows y PowerShell
Público objetivo
- Desarrolladores que desean aprender a instalar y usar ROCm en Windows para programar GPUs de AMD y explotar su paralelismo
- Desarrolladores que desean escribir código de alto rendimiento y escalable que pueda ejecutarse en diferentes dispositivos de AMD
- Programadores que deseen explorar los aspectos de bajo nivel de la programación de GPU y optimizar el rendimiento de su código
Los cursos públicos requieren más de 5 participantes.
ROCm para Windows - Reserva
ROCm para Windows - Consulta
ROCm para Windows - Solicitud de consultoría
Próximos cursos
Cursos Relacionados
Desarrollo de aplicaciones de IA con Huawei Ascend y CANN
21 HorasHuawei Ascend es una familia de procesadores de inteligencia artificial diseñados para inferencia y entrenamiento de alto rendimiento.
Esta formación impartida por instructores (en línea o presencial) está dirigida a ingenieros de IA y científicos de datos de nivel intermedio que deseen desarrollar y optimizar modelos de redes neuronales utilizando la plataforma Ascend de Huawei y el kit de herramientas CANN.
Al finalizar esta formación, los participantes serán capaces de:
- Configurar y preparar el entorno de desarrollo de CANN.
- Desarrollar aplicaciones de IA utilizando MindSpore y los flujos de trabajo de CloudMatrix.
- Optimizar el rendimiento en NPUs Ascend mediante operadores personalizados y técnicas de segmentación (tiling).
- Implementar modelos en entornos de borde o en la nube.
Formato del curso
- Conferencia interactiva y discusión grupal.
- Práctica directa con Huawei Ascend y el kit de herramientas CANN en aplicaciones de ejemplo.
- Ejercicios guiados centrados en la construcción, entrenamiento e implementación de modelos.
Opciones de personalización del curso
- Para solicitar una formación personalizada basada en su infraestructura o conjuntos de datos, contáctenos para coordinarla.
Despliegue de modelos de IA con CANN y procesadores Ascend AI
14 HorasCANN (Compute Architecture for Neural Networks) es la pila de computación para IA de Huawei, diseñada para implementar y optimizar modelos de inteligencia artificial en procesadores Ascend.
Esta formación impartida por un instructor, en vivo (en línea o presencial), está dirigida a desarrolladores e ingenieros de nivel intermedio que deseen desplegar modelos de IA entrenados de manera eficiente en hardware Huawei Ascend utilizando el kit de herramientas CANN y herramientas como MindSpore, TensorFlow o PyTorch.
Al finalizar este curso, los participantes podrán:
- Comprender la arquitectura de CANN y su papel en el pipeline de implementación de IA.
- Convertir y adaptar modelos desde marcos de trabajo populares a formatos compatibles con Ascend.
- Utilizar herramientas como ATC, conversión de modelos OM y MindSpore para inferencia en borde y en la nube.
- Diagnosticar problemas de implementación y optimizar el rendimiento en hardware Ascend.
Formato del curso
- Conferencia interactiva y demostraciones.
- Trabajo práctico de laboratorio utilizando herramientas CANN y simuladores o dispositivos Ascend.
- Escenarios prácticos de implementación basados en modelos de IA del mundo real.
Opciones de personalización del curso
- Para solicitar una formación personalizada para este curso, contáctenos para coordinar los detalles.
Inferencia y despliegue de IA con CloudMatrix
21 HorasCloudMatrix es la plataforma unificada de desarrollo e implementación de IA de Huawei, diseñada para apoyar pipelines de inferencia escalables de nivel de producción.
Esta formación presencial impartida por un instructor (en línea o en las instalaciones) está dirigida a profesionales de IA de nivel principiante a intermedio que deseen implementar y monitorear modelos de IA utilizando la plataforma CloudMatrix con integración de CANN y MindSpore.
Al finalizar esta formación, los participantes podrán:
- Utilizar CloudMatrix para el empaquetado, despliegue y suministro de modelos.
- Convertir y optimizar modelos para conjuntos de chips Ascend.
- Configurar pipelines para tareas de inferencia en tiempo real y por lotes.
- Monitorear los despliegues y ajustar el rendimiento en entornos de producción.
Formato del curso
- Conferencias interactivas y debates.
- Uso práctico de CloudMatrix con escenarios reales de despliegue.
- Ejercicios guiados centrados en la conversión, optimización y escalado.
Opciones de personalización del curso
- Para solicitar una formación personalizada para este curso basada en su infraestructura de IA o entorno de nube, contáctenos para organizarlo.
Programación de GPU en aceleradores AI de Biren
21 HorasLos aceleradores AI de Biren son GPUs de alto rendimiento diseñadas para cargas de trabajo de IA y HPC, con soporte para entrenamiento e inferencia a gran escala.
Esta formación impartida por un instructor (en línea o presencial) está dirigida a desarrolladores de nivel intermedio a avanzado que deseen programar y optimizar aplicaciones utilizando la pila GPU propietaria de Biren, con comparaciones prácticas frente a entornos basados en CUDA.
Al final de esta formación, los participantes serán capaces de:
- Comprender la arquitectura y jerarquía de memoria de las GPUs de Biren.
- Configurar el entorno de desarrollo y utilizar el modelo de programación de Biren.
- Traducir y optimizar código estilo CUDA para plataformas Biren.
- Aplicar técnicas de ajuste de rendimiento y depuración.
Formato del curso
- Clase interactiva y discusión.
- Uso práctico del SDK de Biren en cargas de trabajo GPU de ejemplo.
- Ejercicios guiados centrados en el portado y ajuste de rendimiento.
Opciones de personalización del curso
- Para solicitar una formación personalizada para este curso basada en su pila de aplicaciones o necesidades de integración, contáctenos para coordinarlo.
Desarrollo con Cambricon MLU, BANGPy y Neuware
21 HorasLas unidades de aprendizaje automático (MLUs) de Cambricon son chips de IA especializados, optimizados para inferencia y entrenamiento en entornos de edge y centros de datos.
Esta formación presencial impartida por un instructor (en línea o a domicilio) está dirigida a desarrolladores de nivel intermedio que desean construir e implementar modelos de IA utilizando el framework BANGPy y el SDK de Neuware sobre hardware MLU de Cambricon.
Al finalizar esta formación, los participantes serán capaces de:
- Configurar y preparar los entornos de desarrollo para BANGPy y Neuware.
- Desarrollar y optimizar modelos basados en Python y C++ para MLUs de Cambricon.
- Implementar modelos en dispositivos edge y centros de datos que ejecuten el entorno de ejecución de Neuware.
- Integrar flujos de trabajo de ML con funciones de aceleración específicas de MLU.
Formato del curso
- Clase interactiva y discusión.
- Uso práctico de BANGPy y Neuware para desarrollo e implementación.
- Ejercicios guiados centrados en optimización, integración y pruebas.
Opciones de personalización del curso
- Para solicitar una formación personalizada para este curso según tu modelo de dispositivo Cambricon o caso de uso, contáctanos para organizarla.
Introducción a CANN para desarrolladores de marcos de IA
7 HorasCANN (Compute Architecture for Neural Networks) es la colección de herramientas de computación de inteligencia artificial de Huawei, utilizada para compilar, optimizar e implementar modelos de IA en procesadores de IA Ascend.
Esta formación presencial y en vivo (en línea o in situ) está dirigida a desarrolladores de IA con conocimientos básicos que desean comprender cómo CANN se integra en el ciclo de vida del modelo, desde el entrenamiento hasta la implementación, y cómo funciona junto con marcos como MindSpore, TensorFlow y PyTorch.
Al finalizar esta formación, los participantes serán capaces de:
- Comprender el propósito y la arquitectura del kit de herramientas CANN.
- Configurar un entorno de desarrollo con CANN y MindSpore.
- Convertir e implementar un modelo de IA sencillo en hardware Ascend.
- Adquirir conocimientos fundamentales para futuros proyectos de optimización o integración de CANN.
Formato del curso
- Conferencia interactiva y discusión grupal.
- Talleres prácticos con implementación de modelos sencillos.
- Recorrido paso a paso por la cadena de herramientas de CANN y los puntos de integración.
Opciones de personalización del curso
- Para solicitar una formación personalizada para este curso, contáctenos para coordinar los detalles.
CANN para el despliegue de IA en Edge
14 HorasEl kit de herramientas Ascend CANN de Huawei permite una potente inferencia de IA en dispositivos edge, como el Ascend 310. CANN proporciona las herramientas esenciales para compilar, optimizar y desplegar modelos en entornos con restricciones de cómputo y memoria.
Esta formación en vivo con instructor (en línea o presencial) está dirigida a desarrolladores e integradores de IA de nivel intermedio que deseen desplegar y optimizar modelos en dispositivos edge Ascend utilizando el conjunto de herramientas CANN.
Al finalizar esta formación, los participantes podrán:
- Preparar y convertir modelos de IA para Ascend 310 usando las herramientas CANN.
- Construir pipelines de inferencia ligeros utilizando MindSpore Lite y AscendCL.
- Optimizar el rendimiento del modelo en entornos con recursos limitados de cómputo y memoria.
- Desplegar y monitorear aplicaciones de IA en casos de uso reales de edge.
Formato del Curso
- Conferencia interactiva y demostración.
- Trabajo práctico en laboratorio con modelos y escenarios específicos para edge.
- Ejemplos de despliegue en vivo en hardware edge virtual o físico.
Opciones de Personalización del Curso
- Para solicitar una formación personalizada para este curso, póngase en contacto con nosotros para coordinarla.
Comprensión de la pila de computación AI de Huawei: De CANN a MindSpore
14 HorasLa pila de IA de Huawei, desde el SDK de bajo nivel CANN hasta el framework de alto nivel MindSpore, ofrece un entorno integrado y optimizado para el desarrollo y despliegue de IA, diseñado específicamente para hardware Ascend.
Esta formación presencial dirigida por instructores (en línea o in situ) está orientada a profesionales técnicos de nivel principiante a intermedio que deseen comprender cómo los componentes CANN y MindSpore colaboran para gestionar el ciclo de vida de la IA y tomar decisiones sobre infraestructura.
Al finalizar esta formación, los participantes podrán:
- Comprender la arquitectura en capas de la pila de computación AI de Huawei.
- Identificar cómo CANN apoya la optimización de modelos y el despliegue a nivel de hardware.
- Evaluar el framework MindSpore y su conjunto de herramientas en relación con las alternativas del sector.
- Posicionar la pila AI de Huawei dentro de entornos empresariales, en la nube o on-premises.
Formato del curso
- Conferencia interactiva y discusión.
- Demos en vivo del sistema y recorridos guiados basados en casos.
- Laboratorios guiados opcionales sobre el flujo de modelos desde MindSpore hasta CANN.
Opciones de personalización del curso
- Para solicitar una formación personalizada para este curso, contáctenos para coordinar los detalles.
Optimización del rendimiento de redes neuronales con CANN SDK
14 HorasCANN SDK (Compute Architecture for Neural Networks) es la base computacional de IA de Huawei que permite a los desarrolladores ajustar y optimizar el rendimiento de redes neuronales implementadas en procesadores de IA Ascend.
Esta formación presencial impartida por un instructor (en línea o in situ) está dirigida a desarrolladores de IA y ingenieros de sistemas de nivel avanzado que deseen optimizar el rendimiento de inferencia utilizando la herramienta avanzada de CANN, que incluye el Motor de Grafos, TIK y el desarrollo de operadores personalizados.
Al finalizar esta formación, los participantes podrán:
- Comprender la arquitectura en tiempo de ejecución y el ciclo de vida del rendimiento de CANN.
- Utilizar herramientas de perfilado y el Motor de Grafos para analizar y optimizar el rendimiento.
- Crear y optimizar operadores personalizados utilizando TIK y TVM.
- Resolver cuellos de botella de memoria y mejorar el caudal del modelo.
Formato del curso
- Ponencia interactiva y debate.
- Laboratorios prácticos con perfilado en tiempo real y ajuste de operadores.
- Ejercicios de optimización utilizando ejemplos de implementación de casos límite.
Opciones de personalización del curso
- Para solicitar una formación personalizada para este curso, contáctenos para concertar los detalles.
CANN SDK para canales de trabajo de Visión por Computadora y PLN
14 HorasEl CANN SDK (Compute Architecture for Neural Networks) ofrece potentes herramientas de implementación y optimización para aplicaciones de IA en tiempo real en visión por computadora y PLN, especialmente en hardware Huawei Ascend.
Este entrenamiento en vivo con instructores (en línea o presencial) está dirigido a profesionales de la IA de nivel intermedio que deseen crear, implementar y optimizar modelos visuales y lingüísticos mediante el CANN SDK para casos de uso en producción.
Al finalizar este curso, los participantes podrán:
- Implementar y optimizar modelos de visión por computadora (CV) y PLN usando CANN y AscendCL.
- Usar herramientas CANN para convertir modelos e integrarlos en canales de trabajo en vivo.
- Optimizar el rendimiento de la inferencia para tareas como detección, clasificación y análisis de sentimientos.
- Crear canales de trabajo de CV/PLN en tiempo real para escenarios de implementación en borde o nube.
Formato del curso
- Conferencia interactiva y demostración práctica.
- Laboratorio práctico con implementación de modelos y perfilado de rendimiento.
- Diseño en vivo de canales de trabajo utilizando casos de uso reales de CV y PLN.
Opciones de personalización del curso
- Para solicitar una formación personalizada para este curso, contáctenos para coordinarla.
Construcción de operadores de IA personalizados con CANN TIK y TVM
14 HorasCANN TIK (Tensor Instruction Kernel) y Apache TVM permiten la optimización avanzada y la personalización de los operadores de modelos de IA para el hardware Huawei Ascend.
Esta formación impartida por un instructor, en formato vivo (en línea o presencial), está dirigida a desarrolladores de sistemas de nivel avanzado que deseen crear, implementar y ajustar operadores personalizados para modelos de IA utilizando el modelo de programación TIK de CANN y la integración del compilador TVM.
Al finalizar esta formación, los participantes serán capaces de:
- Escribir y probar operadores de IA personalizados utilizando el DSL de TIK para procesadores Ascend.
- Integrar las operaciones personalizadas en el tiempo de ejecución y el grafo de ejecución de CANN.
- Utilizar TVM para la planificación, auto-ajuste y evaluación comparativa de los operadores.
- Depurar y optimizar el rendimiento a nivel de instrucciones para patrones de cómputo personalizados.
Formato del curso
- Lección interactiva y demostración.
- Práctica de programación de operadores utilizando los flujos de trabajo TIK y TVM.
- Pruebas y ajuste en hardware Ascend o simuladores.
Opciones de personalización del curso
- Para solicitar una formación personalizada para este curso, por favor contáctenos para coordinarla.
Migración de Aplicaciones CUDA a Arquitecturas de GPU Chinas
21 HorasLas arquitecturas de GPU chinas, como Huawei Ascend, Biren y los MLU de Cambricon, ofrecen alternativas a CUDA adaptadas para los mercados locales de IA y HPC.
Esta formación en vivo, impartida por un instructor (en línea o presencial), está dirigida a programadores de GPU y especialistas en infraestructura de nivel avanzado que deseen migrar y optimizar aplicaciones CUDA existentes para su implementación en plataformas de hardware chinas.
Al finalizar esta formación, los participantes serán capaces de:
- Evaluar la compatibilidad de las cargas de trabajo CUDA existentes con alternativas de chips chinos.
- Portar código CUDA a entornos como Huawei CANN, Biren SDK y Cambricon BANGPy.
- Comparar el rendimiento e identificar puntos de mejora entre plataformas.
- Solucionar desafíos prácticos en el soporte y despliegue multiarquitectura.
Formato del curso
- Clase interactiva con discusión.
- Laboratorios prácticos de traducción de código y comparación de rendimiento.
- Ejercicios guiados centrados en estrategias de adaptación para múltiples GPU.
Opciones de personalización del curso
- Para solicitar una formación personalizada basada en su plataforma o proyecto CUDA, contáctenos para coordinar los detalles.
Optimización del rendimiento en Ascend, Biren y Cambricon
21 HorasAscend, Biren y Cambricon son las principales plataformas de hardware de IA en China, cada una ofreciendo herramientas únicas de aceleración y análisis para cargas de trabajo de IA a escala industrial.
Esta capacitación en vivo impartida por un instructor (en línea o presencial) está dirigida a ingenieros avanzados de infraestructura de IA y rendimiento que deseen optimizar los flujos de trabajo de inferencia y entrenamiento de modelos en varias plataformas de chips de IA chinos.
Al finalizar esta capacitación, los participantes podrán:
- Efectuar pruebas de rendimiento (benchmark) de modelos en las plataformas Ascend, Biren y Cambricon.
- Identificar cuellos de botella del sistema e ineficiencias en memoria o cálculo.
- Aplicar optimizaciones a nivel de grafo, de núcleo y de operador.
- Ajustar los pipelines de implementación para mejorar el throughput (rendimiento) y la latencia.
Formato del curso
- Clase interactiva con discusiones.
- Uso práctico de herramientas de análisis y optimización en cada plataforma.
- Ejercicios guiados centrados en escenarios prácticos de ajuste.
Opciones de personalización del curso
- Para solicitar una capacitación personalizada para este curso basada en su entorno de rendimiento o tipo de modelo, por favor contáctenos para coordinarlo.