GPU-Programmierung mit CUDA Schulung
CUDA ist ein offener Standard für die GPU-Programmierung, der es ermöglicht, Code auf NVIDIA-GPUs auszuführen. Diese werden häufig in Bereichen wie Hochleistungsrechnen, künstliche Intelligenz (KI), Gaming und Grafik eingesetzt. CUDA gewährt dem Programmierer Einblick in die Hardware-Details sowie vollständige Kontrolle über den Parallelisierungsprozess. Dies erfordert jedoch ein fundiertes Verständnis der Gerätearchitektur, des Speichermodells, des Ausführungsmodells sowie von Optimierungstechniken.
Dieses von einem Experten geleitete Live-Training – online oder vor Ort – richtet sich an Entwickler mit Grund- bis Mittelkenntnissen, die CUDA nutzen möchten, um NVIDIA-GPUs zu programmieren und deren Parallelität auszuschöpfen.
Am Ende dieses Kurses verstehen die Teilnehmenden Folgendes:
- Eine Entwicklungsumgebung einrichten, in der das CUDA Toolkit, eine NVIDIA-GPU sowie Visual Studio Code integriert sind.
- Ein einfaches CUDA-Programm erstellen, das Vektorenadditionen auf der GPU ausführt und die Ergebnisse anschließend aus dem GPU-Speicher abruft.
- Die CUDA-API nutzen, um Geräteinformationen abzufragen, Speicher dynamisch zu reservieren bzw. freizugeben, Daten zwischen Host und Device zu übertragen, Kernel zu starten sowie Threads zu synchronisieren.
- In CUDA C/C++ Kernel schreiben, die auf der GPU ausgeführt werden und Daten verarbeiten können.
- Standardmäßig verfügbare CUDA-Funktionen, Variablen und Bibliotheken für häufige Aufgaben einsetzen.
- Diverse Speicherbereiche wie global, shared, constant oder local zu Nutzung bringen, um Datentransfers sowie den Zugriff auf den Speicher zu optimieren.
- Den CUDA-Ausführungsmodell verwenden, um die Anzahl der Threads, Blöcke und Gitter zur Steuerung der Parallelität festzulegen.
- CUDA-Programme mithilfe von Tools wie CUDA-GDB, CUDA-MEMCHECK sowie NVIDIA Nsight debuggen und testen.
- Methoden wie Coalescing, Caching, Prefetching oder Profiling anwenden, um CUDA-Anwendungen zu optimieren.
Ablauf des Kurses
- Interaktive Vorlesungen und Diskussionen.
- Zahlreiche Übungsaufgaben zur praktischen Anwendung.
- Praxisnahe Umsetzung in einem Live-Lab-Umfeld.
Möglichkeiten der Kursanpassung
- Wünschen Sie ein individuell angepasstes Training? Kontaktieren Sie uns zur Absprache.
- 96 % unserer Kunden sind vollständig zufrieden.
Schulungsübersicht
Einführung
- Was ist CUDA?
- CUDA im Vergleich zu OpenCL und SYCL
- Übersicht über Funktionen sowie Architektur von CUDA
- Einrichtung der Entwicklungsumgebung
Erste Schritte
- Erstellung eines neuen CUDA-Projekts mittels Visual Studio Code
- Betrachtung der Projektstruktur samt zugehörigen Dateien
- Kompilierung und Ausführung des Programms
- Ausgabeanzeige über printf bzw. fprintf veranlassen
CUDA-API
- Rolle der CUDA-API im Host-Programm verstehen
- Nutzung der API, um Geräteinformationen abzufragen
- Dynamische Reservierung sowie Freigabe von Speicher auf dem Device per API
- Übertragung von Daten zwischen Host und Device mittels API-Funktionen<\/li>
- Ausführung von Kerneln sowie Synchronisation der Threads steuern
- Behandlung von Fehlern und Ausnahmen durch Nutzung der API
CUDA C/C++
- Bedeutung von CUDA C/C++ für Device-Programme erkennen
- Verwendung der Sprache zur Entwicklung von Kerneln, die Daten auf der GPU verarbeiten.
- Einsatz von Datentypen, Qualifikatoren, Operatoren und Ausdrücken in CUDA C/C++.
- Nutzung integrierter Funktionen wie mathematischer Operationen oder Warp-Operationen.
- Verwendung systemeigener Variablen wie threadIdx, blockIdx oder blockDim.
- Einbindung von Bibliotheken wie cuBLAS, cuFFT sowie cuRAND in die Programmierung.
CUDA-Speichermodell
- Unterschiede zwischen Host- und Device-Speicherstrukturen erkennen
- Einsatz verschiedener Speicherbereiche wie global, shared, constant oder local zur Leistungssteigerung.
- Nutzung von Objekten wie Zeigern, Arrays oder Texturen als Speicherelemente.
- Auswahl passender Zugriffsmodi (Lesen nur, Schreiben nur etc.)
- Verständnis des Konsistenzmodells sowie von Mechanismen zur Synchronisation des Speichers.
CUDA-Ausführungsmodell
- Abgrenzung der Ausführungsmodelle auf Host- und Device-Ebene erkennen.
- Verwendung von Threads, Blöcken sowie Gittern zur Konfiguration paralleler Berechnungen.
- Bewusste Nutzung funktioneller Merkmale wie threadIdx oder blockDim im Rahmen der Programmierung.
- Einsatz synchronisierender Funktionen auf Block-Ebene, etwa __syncthreads oder __threadfence_block.
- Konfiguration von Netzstrukturen mit gridDim, gridSync sowie Kooperativen Gruppen im Hintergrund steuern.
Debugging
- Häufige Fehlerquellen und Programmfehler in CUDA-Programmen verstehen.
- Nutzung des Visual Studio Code Debuggers für das Inspektieren von Variablen, Breakpoints sowie Aufrufstapeln.
- Anwendung von CUDA-GDB zur Analyse von Fehlern auf Linux-Systemen.
- Erkennung fehlerhafter Speichervorgänge mittels CUDA-MEMCHECK.
- Verwendung von NVIDIA Nsight zur Diagnose und Analyse von Programmen unter Windows.
Optimierung
- Wesentliche Einflussfaktoren auf die Performance von CUDA-Programmen kennenlernen.
- Coalescing-Methoden verwenden, um den Datendurchsatz zu steigern.
- Caching und Prefetching zur Reduzierung der Zugriffszeiten effektiv einsetzen.
- Nutzung von Shared Memory sowie lokalem Speicher zur Vermeidung von Engpässen im Datenfluss.
- Anwendung von Profilwerkzeugen, um Laufzeit und Ressourcenverbrauch präzise zu ermitteln und zu verbessern.
Zusammenfassung sowie weitere Perspektiven
Voraussetzungen
- Solides Wissen in der C/C++-Programmiersprache sowie Kenntnisse zu Konzepten des Parallelprogramms.
- Grundsätzliche Einsicht in Computerarchitektur und Hierarchie der Speichersysteme.
- Erfahrung mit Kommandozeilenwerkzeugen sowie Code-Editoren.
Zielgruppe
- Entwickler, die CUDA erlernen möchten, um NVIDIA-GPUs effizient zu programmieren und Parallelität bestmöglich auszunutzen.
- Programmierer, die leistungsfähigen und skalierbaren Code erstellen wollen, der auf unterschiedlichen CUDA-fähigen Geräten läuft.
- Fachleute, die tiefergehende Einblicke in die GPU-Programmierung gewinnen sowie ihre Programme verbessern möchten.
Offene Schulungskurse erfordern mindestens 5 Teilnehmer.
GPU-Programmierung mit CUDA Schulung - Buchung
GPU-Programmierung mit CUDA Schulung - Anfrage
GPU-Programmierung mit CUDA - Beratungsanfrage
Kommende Kurse
Kombinierte Kurse
Entwicklung von KI-Anwendungen mit Huawei Ascend und CANN
21 StundenHuawei Ascend ist eine Reihe von KI-Prozessoren, die für leistungsstarke Inferenz- und Trainingsaufgaben konzipiert wurden.
Dieses praxisorientierte Training unter Anleitung eines Instruktors (online oder vor Ort) richtet sich an KI-Ingenieure sowie Datenwissenschaftler mittleren Kenntnisstands, die neuronale Netzwerke mithilfe der Ascend-Plattform und des CANN-Toolkits von Huawei entwickeln und optimieren möchten.
Am Ende dieses Trainings werden die Teilnehmer in der Lage sein:
- Das CANN-Entwicklungsumfeld einzurichten und zu konfigurieren.
- KI-Anwendungen mithilfe von MindSpore sowie CloudMatrix-Workflows zu entwickeln.
- Die Leistung auf Ascend-NPUs durch maßgeschneiderte Operatoren und optimierte Aufteilungsstrategien zu steigern.
- Modelle in Edge- oder Cloud-Umgebungen bereitzustellen.
Ablauf des Kurses
- Interaktive Vorträge und Diskussionen.
- Praktische Anwendung von Huawei Ascend sowie des CANN-Toolkits anhand von Beispielanwendungen.
- Übungsaufgaben zur Entwicklung, zum Training und zur Bereitstellung von Modellen.
Möglichkeiten zur individuellen Anpassung des Kurses
- Falls Sie ein maßgeschneidertes Training basierend auf Ihrer Infrastruktur oder Ihren Datensätzen wünschen, kontaktieren Sie uns bitte, um dies zu vereinbaren.
Bereitstellung von KI-Modellen mit CANN und Ascend-AI-Prozessoren
14 StundenCANN (Compute Architecture for Neural Networks) ist Huaweis KI-Berechnungsstack zur Bereitstellung und Optimierung von KI-Modellen auf den Ascend-AI-Prozessoren.
Dieses vom Dozenten geleitete Live-Training (online oder vor Ort) richtet sich an KI-Entwickler und -Ingenieure mittleren Kenntnisniveaus, die erlernte KI-Modelle effizient auf Huawei Ascend-Hardware mithilfe des CANN-Toolkits sowie Werkzeugen wie MindSpore, TensorFlow oder PyTorch einsetzen möchten.
Am Ende dieses Trainings werden die Teilnehmer in der Lage sein:
- Die CANN-Architektur sowie deren Rolle im KI-Bereitstellungsprozess zu verstehen.
- Modelle aus gängigen Frameworks in für Ascend kompatible Formate umzuwandeln und anzupassen.
- Werkzeuge wie ATC, die OM-Modellkonvertierung sowie MindSpore für die Inferenz auf Edge-Geräten und in der Cloud zu nutzen.
- Probleme bei der Bereitstellung zu diagnostizieren sowie die Leistung auf Ascend-Hardware zu optimieren.
Ablauf des Kurses
- Interaktive Vorträge und Demonstrationen.
- Praktische Übungen unter Verwendung von CANN-Tools sowie Ascend-Simulatoren oder -Geräten.
- Reale Einsatzszenarien auf Basis gängiger KI-Modelle.
Individuelle Anpassungsmöglichkeiten
- Wünschen Sie ein maßgeschneidertes Training zu diesem Thema? Kontaktieren Sie uns gerne, um dies zu vereinbaren.
KI-Inferenz und -Deployment mit CloudMatrix
21 StundenCloudMatrix ist die einheitliche Plattform von Huawei zur Entwicklung und zum Deployment von KI-Anwendungen. Sie dient der Erstellung skalierbarer Inferenz-Pipelines für den Produktivbetrieb.
Dieses vom Instruktor geleitete Live-Training – online oder vor Ort – richtet sich an KI-Fachkräfte mit Grundkenntnissen bis zu mittlerem Wissenstand, die lernen möchten, KI-Modelle mithilfe der CloudMatrix-Plattform in Verbindung mit CANN und MindSpore zu implementieren und zu überwachen.
Nach Abschluss dieses Trainings werden die Teilnehmenden in der Lage sein, Folgendes durchzuführen:
- CloudMatrix zur Verpackung, zum Deployment und zum Betrieb von Modellen einzusetzen.
- Modelle für die Nutzung auf Ascend-Chipsätzen umzuwandeln und zu optimieren.
- Pipelines zur Echtzeit- sowie Batch-Inferenz einzurichten.
- Implementierungen im Produktivumfeld zu überwachen und deren Leistung zu optimieren.
Ablauf des Kurses
- Interaktive Vorträge sowie Diskussionen.
- Praktische Anwendung von CloudMatrix anhand realer Deployment-Szenarien.
- Begleitete Übungen zu Umwandlung, Optimierung und Skalierung von Modellen.
Individuelle Anpassungsmöglichkeiten
- Falls Sie ein maßgeschneidertes Training zu diesem Thema wünschen – angepasst an Ihre KI-Infrastruktur oder Cloud-Umgebung –, kontaktieren Sie uns gerne, um die Details abzustimmen.
GPU-Programmierung auf Biren AI-Beschleunigern
21 StundenDie Biren AI-Beschleuniger sind leistungsstarke GPUs, die speziell für KI- und HPC-Anwendungen konzipiert wurden und eine großskalige Trainings- sowie Inferenzverarbeitung ermöglichen.
Dieses von einem Experten geleitete Live-Training – sowohl online als auch vor Ort – richtet sich an Entwickler mittleren bis fortgeschrittenen Niveaus, die Anwendungen unter Verwendung des proprietären GPU-Stacks von Biren programmieren und optimieren möchten. Dabei werden praktische Vergleiche mit CUDA-basierten Umgebungen gezogen.
Am Ende dieses Trainings verfügen die Teilnehmer über folgende Fähigkeiten:
- Verständnis der Architektur sowie der Speicherhierarchie der Biren-GPUs.
- Einrichtung der Entwicklungsumgebung und Nutzung des Programmiermodells von Biren.
- Übersetzung und Optimierung von CUDA-artigem Code für Plattformen von Biren.
- Anwendung von Techniken zur Leistungsoptimierung und Fehlerbehebung.
Ablauf des Kurses
- Interaktive Vorlesungen und Diskussionen.
- Praktische Anwendung des Biren SDK in typischen GPU-Anwendungsbeispielen.
- Anleitete Übungen zur Portierung von Code sowie zur Leistungsoptimierung.
Individuelle Kursanpassungen
- Falls Sie ein maßgeschneidertes Training zu diesem Thema wünschen – angepasst an Ihren Anwendungsbereich oder Integrationsanforderungen –, kontaktieren Sie uns bitte, um die Details abzusprechen.
Entwicklung mit Cambricon MLU unter Verwendung von BANGPy und Neuware
21 StundenCambricon MLUs (Machine Learning Units) sind spezialisierte KI-Chips, die für Inferenz- und Trainingsaufgaben in Edge- sowie Rechenzentrumsanwendungen optimiert sind.
Dieses von einem Instruktor geleitete Live-Training – entweder online oder vor Ort – richtet sich an Entwickler mittleren Kenntnisstands, die lernen möchten, KI-Modelle mithilfe des BANGPy-Frameworks und des Neuware SDK auf Cambricon MLU-Hardware zu erstellen und bereitzustellen.
Am Ende dieses Trainings werden die Teilnehmer in der Lage sein zu:
- Die Entwicklungsumgebungen von BANGPy und Neuware einzurichten und zu konfigurieren.
- In Python oder C++ geschriebene Modelle für Cambricon MLUs zu entwickeln sowie deren Leistung zu optimieren.
- Modelle auf Edge-Geräten sowie in Rechenzentren zu implementieren, die den Neuware Runtime nutzen.
- KI-Workflows mit speziellen Beschleunigungsfunktionen der MLUs zu integrieren.
Ablauf des Kurses
- Interaktive Vorlesungen und Diskussionen.
- Praktische Übungen mit BANGPy und Neuware zur Entwicklung und Bereitstellung von Modellen.
- Anleitete Aufgaben zu Optimierung, Integration und Testverfahren.
Möglichkeiten zur individuellen Anpassung
- Falls Sie ein maßgeschneidertes Training wünschen – beispielsweise basierend auf Ihrem spezifischen Cambricon-Gerätemodell oder konkreten Einsatzszenarien –, können Sie uns kontaktieren, um die Einzelheiten zu besprechen.
Einführung in CANN für Entwickler von KI-Frameworks
7 StundenCANN (Compute Architecture for Neural Networks) ist das KI-Entwicklungs-Toolkit von Huawei, mit dem KI-Modelle auf Ascend-KI-Prozessoren kompiliert, optimiert und bereitgestellt werden können.
Dieses praxisorientierte Live-Schulungsprogramm unter Anleitung eines Instruktors – online oder vor Ort – richtet sich an Einsteiger in der KI-Entwicklung, die verstehen möchten, wie CANN in den gesamten Lebenszyklus von Modellen vom Training bis zur Implementierung integriert wird sowie wie es mit Frameworks wie MindSpore, TensorFlow und PyTorch zusammenarbeitet.
Am Ende dieser Schulung werden die Teilnehmer in der Lage sein:
- Die Zielsetzung sowie die Architektur des CANN-Toolkits zu verstehen.
- Eine Entwicklungsumgebung mit CANN und MindSpore einzurichten.
- Ein einfaches KI-Modell in das Format für die Ascend-Hardware zu konvertieren und bereitzustellen.
- Grundlegendes Wissen zu erlangen, das für zukünftige CANN-Optimierungen oder Integrationsprojekte nützlich ist.
Aufbau des Kurses
- Interaktive Vorträge und Diskussionen.
- Praktische Übungen zur Bereitstellung einfacher Modelle.
- Schrittweise Erläuterung der CANN-Toolchain sowie der Integrationspunkte zu anderen Systemen.
Individuelle Anpassungen des Kurses
- Wünschen Sie ein maßgeschneidertes Schulungsprogramm? Kontaktieren Sie uns gerne, um dies zu vereinbaren.
CANN für die Edge-AI-Bereitstellung
14 StundenDas Ascend CANN-Toolkit von Huawei ermöglicht leistungsfähige KI-Inferenzen auf Edge-Geräten wie dem Ascend 310. CANN stellt wesentliche Hilfsmittel bereit, um Modelle in Umgebungen mit begrenzter Rechenleistung und Speicherkapazität zu kompilieren, zu optimieren sowie bereitzustellen.
Dieses von Instruktoren geleitete Live-Training (online oder vor Ort) richtet sich an fortgeschrittene KI-Entwickler und Integratoren, die Modelle mithilfe des CANN-Toolchains auf Ascend-Edge-Geräten bereitstellen und optimieren möchten.
Am Ende dieses Trainings werden die Teilnehmenden in der Lage sein:
- KI-Modelle mithilfe von CANN-Tools für den Einsatz auf dem Ascend 310 vorzubereiten und umzuwandeln.
- Leichtgewichtige Inferenz-Pipelines mit MindSpore Lite sowie AscendCL zu entwickeln.
- Die Performance von Modellen unter begrenzten Rechen- und Speicherbedingungen zu optimieren.
- KI-Anwendungen in realen Edge-Szenarien bereitzustellen und zu überwachen.
Aufbau des Kurses
- Interaktive Vorträge sowie Demonstrationen.
- Praktische Übungen mit Edge-spezifischen Modellen und Anwendungsfällen.
- Live-Beispiele zur Bereitstellung auf virtueller oder physischer Edge-Hardware.
Individuelle Anpassungsmöglichkeiten des Kurses
- Sollten Sie ein maßgeschneidertes Training wünschen, kontaktieren Sie uns gerne zur Absprache.
Verständnis der KI-Rechenplattform von Huawei: Von CANN bis MindSpore
14 StundenDie KI-Plattform von Huawei – vom niedrigschwelligen CANN SDK bis hin zum hochschwelligen MindSpore-Framework – stellt eine eng integrierte Umgebung für die Entwicklung und Bereitstellung künstlicher Intelligenz dar, die speziell für Hardware der Ascend-Reihe optimiert ist.
Dieses von Instruktoren geleitete Live-Training (online oder vor Ort) richtet sich an technische Fachkräfte mit Anfänger- bis Mittelstufenkenntnissen, die erfahren möchten, wie die Komponenten CANN und MindSpore zusammenarbeiten, um den gesamten Lebenszyklus von KI-Anwendungen zu unterstützen sowie fundierte Entscheidungen bezüglich der Infrastruktur zu treffen.
Am Ende des Trainings werden die Teilnehmer in der Lage sein:
- Die mehrschichtige Architektur der KI-Rechenplattform von Huawei zu verstehen.
- Zu erkennen, wie CANN bei der Modelloptimierung und Bereitstellung auf Hardwareebene unterstützt.
- Das MindSpore-Framework sowie dessen Toolchain im Vergleich zu anderen marktüblichen Lösungen einzuschätzen.
- Die KI-Plattform von Huawei in Unternehmensumgebungen oder Cloud-/On-Premises-Szenarien richtig einzuordnen.
Ablauf des Kurses
- Interaktive Vorträge und Diskussionen.
- Live-Demos sowie praktische Fallbeispiele zur Anwendung der Plattform.
- Optionale Übungen, in denen die Teilnehmer einen Modellfluss von MindSpore bis zu CANN nachvollziehen können.
Individuelle Anpassungsmöglichkeiten des Kurses
- Wünschen Sie ein maßgeschneidertes Training zu diesem Thema? Kontaktieren Sie uns, um die Details zu vereinbaren.
Optimierung der Leistung neuronaler Netze mit dem CANN SDK
14 StundenDas CANN SDK (Compute Architecture for Neural Networks) stellt die zentrale Rechenbasis für KI von Huawei dar und ermöglicht Entwicklern, die Leistung bereits implementierter neuronaler Netze auf Ascend-AI-Prozessoren zu verfeinern sowie zu optimieren.
Dieses von erfahrenen Instruktoren geleitete Live-Training – online oder vor Ort – richtet sich an fortgeschrittene KI-Entwickler und Systemingenieure, die mithilfe der leistungsstarken Werkzeuge des CANN SDK die Inferenzgeschwindigkeit optimieren möchten. Dazu zählen insbesondere das Graph Engine-Modul, TIK sowie die Entwicklung individueller Operatoren.
Am Ende dieses Kurses werden die Teilnehmer in der Lage sein zu:/p>
- Die Architektur des CANN-Laufzeitsystems sowie den Gesamtprozess der Leistungsoptimierung nachvollziehen.
- Profiling-Tools und das Graph Engine-Modul für Analyse- und Optimierungszwecke einzusetzen.
- Eigene Operatoren mithilfe von TIK sowie TVM zu erstellen und zu optimieren.
- Speicherengpässe zu beheben sowie die Durchsatzrate der Modelle zu erhöhen.
Ablauf des Kurses
- Interaktive Vorlesungen und Diskussionen.
- Praktische Übungen mit Echtzeit-Profiling sowie Anpassung von Operatoren.
- Optimierungsaufgaben anhand realer Einsatzszenarien unter extremer Last.
Möglichkeiten zur individuellen Kursgestaltung
- Für eine auf Ihre Bedürfnisse zugeschnittene Schulung kontaktieren Sie uns bitte.
CANN SDK für Computer Vision- und NLP-Pipelines
14 StundenDas CANN SDK (Compute Architecture for Neural Networks) stellt leistungsstarke Tools zur Bereitstellung und Optimierung von KI-Anwendungen in Echtzeit bereit – insbesondere im Bereich Computer Vision und NLP, wobei es vor allem auf Huawei-Ascend-Hardware optimiert ist.
Dieses von erfahrenen Trainern geleitete Live-Training (online oder vor Ort) richtet sich an KI-Experten mittleren Kenntnisstands, die CV- und Sprachmodelle mit dem CANN SDK für praktische Anwendungen entwickeln, bereitstellen und optimieren möchten.
Nach Abschluss dieses Kurses werden die Teilnehmer in der Lage sein:
- CV- und NLP-Modelle mithilfe von CANN sowie AscendCL zu implementieren und zu optimieren.
- Die Tools des CANN SDKs zur Modellkonvertierung sowie deren Integration in laufende Pipelines einzusetzen.
- Die Inferenzleistung bei Aufgaben wie Objekterkennung, Klassifizierung und Stimmungsanalyse zu verbessern.
- Echtzeit-CV- bzw. NLP-Pipelines für den Einsatz an Edge-Systemen oder in Cloud-Umgebungen zu erstellen.
Aufbau des Kurses
- Interaktive Vorlesungen und praktische Demonstrationen.
- Hands-on-Übungen zur Modellbereitstellung sowie Leistungsanalyse.
- Entwicklung von echten CV-/NLP-Pipelines anhand konkreter Anwendungsbeispiele.
Individuelle Anpassungen des Kurses
- Sollten Sie ein maßgeschneidertes Training wünschen, kontaktieren Sie uns bitte zur Absprache.
Erstellung benutzerdefinierter KI-Operatoren mit CANN TIK und TVM
14 StundenCANN TIK (Tensor Instruction Kernel) sowie Apache TVM ermöglichen eine fortschrittliche Optimierung und Anpassung von KI-Modelloperatoren für Huaweis Ascend-Hardware.
Dieses praxisorientierte Live-Training unter Anleitung eines Experten (online oder vor Ort) richtet sich an fortgeschrittene Systementwickler, die eigene Operatoren für KI-Modelle mithilfe des TIK-Programmiermodells von CANN sowie der TVM-Kompilierungsintegration entwickeln, bereitstellen und optimieren möchten.
Am Ende dieses Trainings werden die Teilnehmer in der Lage sein zu:
- Benutzerdefinierte KI-Operatoren mithilfe der TIK-DSL für Ascend-Prozessoren zu schreiben und zu testen.
- Eigene Operatoren in die CANN-Laufzeitumgebung sowie das Ausführungsdiagramm einzubinden.
- TVM zur Planung, automatischen Optimierung und Leistungsbewertung von Operatoren zu nutzen.
- Die Leistung benutzerdefinierter Rechenabläufe auf Instruktionsebene zu debuggen und zu verbessern.
Ablauf des Kurses
- Interaktive Vorlesungen und praktische Demonstrationen.
- Hands-on-Programmierung von Operatoren unter Verwendung der TIK- und TVM-Werkzeuge.
- Tests sowie Optimierungen anhand echter Ascend-Hardware oder Simulatoren.
Möglichkeiten zur Kursanpassung
- Wünschen Sie ein maßgeschneidertes Training? Kontaktieren Sie uns, um die Details zu besprechen.
Migration von CUDA-Anwendungen auf chinesische GPU-Architekturen
21 StundenChinesische GPU-Architekturen wie Huawei Ascend, Biren sowie Cambricon MLUs bieten Alternativen zu CUDA, die speziell für den lokalen Markt im Bereich KI und High-Performance Computing entwickelt wurden.
Dieses von einem Trainer geleitete Live-Training – online oder vor Ort – richtet sich an erfahrene GPU-Programmierer sowie Infrastrukturexperten, die bestehende CUDA-Anwendungen auf chinesische Hardwareplattformen migrieren und optimieren möchten.
Nach Abschluss des Kurses werden die Teilnehmer in der Lage sein zu:
- Beurteilen, wie gut bestehende CUDA-Workloads mit alternativen chinesischen Chips kompatibel sind.
- CUDA-Codebasen auf Huawei CANN, Biren SDK sowie Cambricon BANGPy zu portieren.
- Leistungseigenschaften vergleichen und Optimierungspotenziale identifizieren.
- Praktische Herausforderungen bei der Nutzung mehrerer GPU-Architekturen lösen.
Aufbau des Kurses
- Interaktive Vorlesungen und Diskussionen.
- Praktische Übungen zum Übersetzen von Code sowie zum Vergleich der Leistungsfähigkeit.
- Geleitete Aufgaben zur Erarbeitung von Strategien für den Einsatz mehrerer GPUs.
Individuelle Anpassungsmöglichkeiten
- Falls Sie ein maßgeschneidertes Training zu Ihrer eigenen Plattform oder Ihrem CUDA-Projekt wünschen, kontaktieren Sie uns bitte zur Absprache.
Leistungsoptimierung auf Ascend, Biren und Cambricon
21 StundenAscend, Biren sowie Cambricon zählen zu den führenden KI-Hardwareplattformen in China. Jede von ihnen stellt spezielle Tools zur Beschleunigung und Profilanalyse für großangelegte KI-Anwendungen bereit.
Dieses von einem Trainer geleitete Live-Training – sowohl online als auch vor Ort – richtet sich an erfahrene Ingenieure aus dem Bereich der KI-Infrastruktur und Performance-Optimierung, die ihre Modelle auf verschiedenen chinesischen KI-Chipplattformen effizienter nutzen möchten.
Nach Abschluss des Trainings sind die Teilnehmer in der Lage:
- Modelle auf den Plattformen Ascend, Biren und Cambricon zu bewerten.
- Systemische Engpässe sowie Ineffizienzen im Speicher- und Rechenbereich zu identifizieren.
- Optimierungen auf Graphenebene, Kernel-Ebene und Operatorenebene anzuwenden.
- Bereitstellungspipelines so einzustellen, dass Durchsatz sowie Latenz verbessert werden.
Aufbau des Kurses
- Interaktive Vorträge und Diskussionen.
- Praktische Anwendung von Profilierungs- und Optimierungstools auf jeder der Plattformen.
- Eingeführte Übungen, die realistische Optimierungsszenarien behandeln.
Möglichkeiten zur Kursanpassung
- Falls Sie ein individuell angepasstes Training für Ihre spezifischen Leistungsvoraussetzungen oder Modelltypen wünschen, kontaktieren Sie uns bitte, um die Details zu besprechen.