Programmierung von AMD-GPUs Schulung
ROCm ist eine Open-Source-Plattform zur GPU-Programmierung, die AMD-GPUs unterstützt und außerdem Kompatibilität mit CUDA sowie OpenCL gewährleistet. ROCm verschafft dem Entwickler Einblicke in die Hardwarestruktur und ermöglicht eine vollständige Kontrolle über den Parallelisierungsprozess. Dafür ist jedoch ein solides Verständnis der Gerätearchitektur, des Speichermodells, des Ausführungsmodells sowie von Optimierungstechniken erforderlich.
HIP stellt eine C++-Laufzeit-API sowie eine Kernel-Sprache bereit; sie ermöglicht das Erstellen portabler Code, der sowohl auf AMD- als auch auf NVIDIA-GPUs ausgeführt werden kann. HIP bietet eine dünne Abstraktionsschicht über die nativen GPU-APIs wie ROCm und CUDA und erlaubt es so, bestehende GPU-Bibliotheken sowie Werkzeuge zu nutzen.
Dieses von einem Trainer geleitete Live-Training (online oder vor Ort) richtet sich an Entwickler mit Anfänger- bis Mittelstufenwissen, die ROCm und HIP einsetzen möchten, um AMD-GPUs zu programmieren sowie deren Parallelisierungspotenzial auszuschöpfen.
Am Ende dieses Kurses werden die Teilnehmer in der Lage sein, Folgendes durchzuführen:
- Eine Entwicklungsumgebung einzurichten, die ROCm-Plattform, eine AMD-GPU sowie Visual Studio Code umfasst.
- Ein grundlegendes ROCm-Programm zu erstellen, welches Vektoradditionen auf der GPU ausführt und anschließend die Ergebnisse aus dem GPUspeicher abruft.
- Mit der ROCm-API Geräteinformationen abzufragen, Speicher auf dem Gerät zuzuweisen bzw. freizugeben, Daten zwischen Host- und Device-Speicher zu kopieren, Kernel zu starten sowie Threads zu synchronisieren.
- Mit der HIP-Sprache Kernel zu schreiben, die auf der GPU ausgeführt werden und Daten manipulieren können.
- HIP-interne Funktionen, Variablen sowie Bibliotheken zur Erledigung häufiger Aufgaben zu nutzen.
- Durch den Einsatz von Speicherbereichen wie global, shared, constant und local in ROCm und HIP Datenübertragungen sowie Speicherzugriffe zu optimieren.
- Mit Hilfe der Ausführungsmodelle von ROCm und HIP Threads, Blöcke und Gitter zu steuern, um den Parallelisierungsprozess zu definieren.
- ROCm- sowie HIP-Programme mittels Werkzeugen wie dem ROCm Debugger und ROCm Profiler zu debuggen und zu testen.
- ROCm- und HIP-Programme durch Methoden wie Coalescing, Caching, Prefetching und Profiling zu optimieren.
Ablauf des Kurses
- Interaktive Vorträge und Diskussionen.
- Zahlreiche Übungen und praktische Aufgaben.
- Praktische Umsetzung in einer Live-Laborumgebung.
Möglichkeiten zur individuellen Anpassung des Kurses
- Um ein auf Ihre Bedürfnisse zugeschnittenes Training anzufordern, wenden Sie sich bitte an uns.
Schulungsübersicht
Einführung
- Was ist ROCm?
- Was ist HIP?
- ROCm im Vergleich zu CUDA und OpenCL
- Überblick über die Merkmale und Architektur von ROCm sowie HIP
- Einrichtung der Entwicklungsumgebung
Erste Schritte
- Erstellung eines neuen ROCm-Projekts mit Visual Studio Code.
- Betrachtung der Projektstruktur sowie der zugehörigen Dateien.
- Kompilieren und Ausführen des Programms.
- Ausgabe der Ergebnisse mithilfe von printf und fprintf.
ROCm-API
- Bedeutung der ROCm-API im Host-Programm verstehen.
- Mittels ROCm-API Geräteinformationen sowie -fähigkeiten abfragen.
- Speicher auf dem Gerät mithilfe der ROCm-API zuweisen bzw. freigeben.
- Datenübertragung zwischen Host- und Device-Speicher durch die ROCm-API steuern.
- Kernel starten sowie Threads synchronisieren per ROCm-API.
- Fehlerbehandlung in Programmen mit Hilfe der ROCm-API.
HIP-Sprache
- Bedeutung der HIP-Sprache im Device-Programm verstehen.
- Mit HIP-Kernel schreiben, die auf der GPU ausgeführt werden und Daten manipulieren können.
- Gewöhnung an HIP-Datentypen, Qualifizierer, Operatoren sowie Ausdrücke.
- HIP-interne Funktionen, Variablen und Bibliotheken nutzen, um alltägliche Aufgaben zu bewältigen.
Speichermodell von ROCm und HIP
- Unterschiede zwischen Host- und Device-Speichermodellen erkennen.
- Durch Verwendung der Speicherbereiche global, shared, constant und local in ROCm und HIP Datenübertragungen zu optimieren.
- Mithilfe von Objekten wie Zeigern, Arrays, Texturen und Surfaces im Speicher arbeiten.
- Speicherzugriffsmodi verstehen – etwa read-only, write-only oder read-write – in ROCm und HIP nutzen.
- Mit den Mechanismen der Speichersynchronisation sowie dem Konsistenzkonzept von ROCm und HIP arbeiten.
Ausführungsmodell von ROCm und HIP
- Unterschiede zwischen Host- und Device-Ausführungsmodellen kennenlernen.
- Threads, Blöcke sowie Gitter in ROCm und HIP zur Steuerung der Parallelität definieren.
- HIP-Funktionen wie hipThreadIdx_x, hipBlockIdx_x und hipBlockDim_x verstehen und nutzen.
- Blockfunktionen wie __syncthreads oder __threadfence_block in ROCm und HIP einbinden.
- Gitterfunktionen etwa hipGridDim_x, hipGridSync sowie Kooperationsgruppen korrekt einsetzen.
Debugging
- Häufige Fehler und Bugs in ROCm- sowie HIP-Programmen erkennen.
- Visual Studio Code Debugger nutzen, um Variablen zu prüfen, Breakpoints zu setzen sowie den Aufrufstapel zu analysieren.
- ROCm Debugger einsetzen, um Programme auf AMD-Hardware zu debuggen.
- Mit ROCm Profiler die Leistung von Programmen unter Verwendung von AMD-GPUs untersuchen.
Optimierung
- Faktoren erkennen, welche die Performance von ROCm- und HIP-Programmen beeinflussen.
- Coalescing-Techniken nutzen, um den Speicherdurchsatz zu verbessern.
- Caching sowie Prefetching zur Reduzierung der Speicherlatenz anwenden.
- Gemeinsamen Speicher und lokalen Speicher in ROCm und HIP gezielt für optimierten Zugriff einsetzen.
- Profiling-Werkzeuge nutzen, um Ausführungszeit sowie Ressourcennutzung zu analysieren und weiter zu verbessern.
Zusammenfassung und weitere Schritte
Voraussetzungen
- Grundverständnis der Programmiersprachen C/C++ sowie von Konzepten zur Parallelprogrammierung
- Grundsätzliche Kenntnisse der Computerarchitektur und des Speicherhierarchiekonzepts
- Erfahrung mit Kommandozeilenwerkzeugen sowie Code-Editoren
Zielgruppe
- Entwickler, die lernen möchten, wie man ROCm und HIP nutzt, um AMD-GPUs zu programmieren und deren Parallelisierungspotenzial auszuschöpfen.
- Entwickler, die hochleistungsfähigen und skalierbaren Code entwerfen möchten, der auf verschiedenen AMD-Hardwaren läuft.
- Programmierer, die tiefergehende Aspekte der GPU-Programmierung erkunden sowie die Leistung ihres Codes optimieren wollen.
Offene Schulungskurse erfordern mindestens 5 Teilnehmer.
Programmierung von AMD-GPUs Schulung - Buchung
Programmierung von AMD-GPUs Schulung - Anfrage
Programmierung von AMD-GPUs - Beratungsanfrage
Kommende Kurse
Kombinierte Kurse
Entwicklung von KI-Anwendungen mit Huawei Ascend und CANN
21 StundenHuawei Ascend ist eine Reihe von KI-Prozessoren, die für leistungsstarke Inferenz- und Trainingsaufgaben konzipiert wurden.
Dieses praxisorientierte Training unter Anleitung eines Instruktors (online oder vor Ort) richtet sich an KI-Ingenieure sowie Datenwissenschaftler mittleren Kenntnisstands, die neuronale Netzwerke mithilfe der Ascend-Plattform und des CANN-Toolkits von Huawei entwickeln und optimieren möchten.
Am Ende dieses Trainings werden die Teilnehmer in der Lage sein:
- Das CANN-Entwicklungsumfeld einzurichten und zu konfigurieren.
- KI-Anwendungen mithilfe von MindSpore sowie CloudMatrix-Workflows zu entwickeln.
- Die Leistung auf Ascend-NPUs durch maßgeschneiderte Operatoren und optimierte Aufteilungsstrategien zu steigern.
- Modelle in Edge- oder Cloud-Umgebungen bereitzustellen.
Ablauf des Kurses
- Interaktive Vorträge und Diskussionen.
- Praktische Anwendung von Huawei Ascend sowie des CANN-Toolkits anhand von Beispielanwendungen.
- Übungsaufgaben zur Entwicklung, zum Training und zur Bereitstellung von Modellen.
Möglichkeiten zur individuellen Anpassung des Kurses
- Falls Sie ein maßgeschneidertes Training basierend auf Ihrer Infrastruktur oder Ihren Datensätzen wünschen, kontaktieren Sie uns bitte, um dies zu vereinbaren.
Bereitstellung von KI-Modellen mit CANN und Ascend-AI-Prozessoren
14 StundenCANN (Compute Architecture for Neural Networks) ist Huaweis KI-Berechnungsstack zur Bereitstellung und Optimierung von KI-Modellen auf den Ascend-AI-Prozessoren.
Dieses vom Dozenten geleitete Live-Training (online oder vor Ort) richtet sich an KI-Entwickler und -Ingenieure mittleren Kenntnisniveaus, die erlernte KI-Modelle effizient auf Huawei Ascend-Hardware mithilfe des CANN-Toolkits sowie Werkzeugen wie MindSpore, TensorFlow oder PyTorch einsetzen möchten.
Am Ende dieses Trainings werden die Teilnehmer in der Lage sein:
- Die CANN-Architektur sowie deren Rolle im KI-Bereitstellungsprozess zu verstehen.
- Modelle aus gängigen Frameworks in für Ascend kompatible Formate umzuwandeln und anzupassen.
- Werkzeuge wie ATC, die OM-Modellkonvertierung sowie MindSpore für die Inferenz auf Edge-Geräten und in der Cloud zu nutzen.
- Probleme bei der Bereitstellung zu diagnostizieren sowie die Leistung auf Ascend-Hardware zu optimieren.
Ablauf des Kurses
- Interaktive Vorträge und Demonstrationen.
- Praktische Übungen unter Verwendung von CANN-Tools sowie Ascend-Simulatoren oder -Geräten.
- Reale Einsatzszenarien auf Basis gängiger KI-Modelle.
Individuelle Anpassungsmöglichkeiten
- Wünschen Sie ein maßgeschneidertes Training zu diesem Thema? Kontaktieren Sie uns gerne, um dies zu vereinbaren.
KI-Inferenz und -Deployment mit CloudMatrix
21 StundenCloudMatrix ist die einheitliche Plattform von Huawei zur Entwicklung und zum Deployment von KI-Anwendungen. Sie dient der Erstellung skalierbarer Inferenz-Pipelines für den Produktivbetrieb.
Dieses vom Instruktor geleitete Live-Training – online oder vor Ort – richtet sich an KI-Fachkräfte mit Grundkenntnissen bis zu mittlerem Wissenstand, die lernen möchten, KI-Modelle mithilfe der CloudMatrix-Plattform in Verbindung mit CANN und MindSpore zu implementieren und zu überwachen.
Nach Abschluss dieses Trainings werden die Teilnehmenden in der Lage sein, Folgendes durchzuführen:
- CloudMatrix zur Verpackung, zum Deployment und zum Betrieb von Modellen einzusetzen.
- Modelle für die Nutzung auf Ascend-Chipsätzen umzuwandeln und zu optimieren.
- Pipelines zur Echtzeit- sowie Batch-Inferenz einzurichten.
- Implementierungen im Produktivumfeld zu überwachen und deren Leistung zu optimieren.
Ablauf des Kurses
- Interaktive Vorträge sowie Diskussionen.
- Praktische Anwendung von CloudMatrix anhand realer Deployment-Szenarien.
- Begleitete Übungen zu Umwandlung, Optimierung und Skalierung von Modellen.
Individuelle Anpassungsmöglichkeiten
- Falls Sie ein maßgeschneidertes Training zu diesem Thema wünschen – angepasst an Ihre KI-Infrastruktur oder Cloud-Umgebung –, kontaktieren Sie uns gerne, um die Details abzustimmen.
GPU-Programmierung auf Biren AI-Beschleunigern
21 StundenDie Biren AI-Beschleuniger sind leistungsstarke GPUs, die speziell für KI- und HPC-Anwendungen konzipiert wurden und eine großskalige Trainings- sowie Inferenzverarbeitung ermöglichen.
Dieses von einem Experten geleitete Live-Training – sowohl online als auch vor Ort – richtet sich an Entwickler mittleren bis fortgeschrittenen Niveaus, die Anwendungen unter Verwendung des proprietären GPU-Stacks von Biren programmieren und optimieren möchten. Dabei werden praktische Vergleiche mit CUDA-basierten Umgebungen gezogen.
Am Ende dieses Trainings verfügen die Teilnehmer über folgende Fähigkeiten:
- Verständnis der Architektur sowie der Speicherhierarchie der Biren-GPUs.
- Einrichtung der Entwicklungsumgebung und Nutzung des Programmiermodells von Biren.
- Übersetzung und Optimierung von CUDA-artigem Code für Plattformen von Biren.
- Anwendung von Techniken zur Leistungsoptimierung und Fehlerbehebung.
Ablauf des Kurses
- Interaktive Vorlesungen und Diskussionen.
- Praktische Anwendung des Biren SDK in typischen GPU-Anwendungsbeispielen.
- Anleitete Übungen zur Portierung von Code sowie zur Leistungsoptimierung.
Individuelle Kursanpassungen
- Falls Sie ein maßgeschneidertes Training zu diesem Thema wünschen – angepasst an Ihren Anwendungsbereich oder Integrationsanforderungen –, kontaktieren Sie uns bitte, um die Details abzusprechen.
Entwicklung mit Cambricon MLU unter Verwendung von BANGPy und Neuware
21 StundenCambricon MLUs (Machine Learning Units) sind spezialisierte KI-Chips, die für Inferenz- und Trainingsaufgaben in Edge- sowie Rechenzentrumsanwendungen optimiert sind.
Dieses von einem Instruktor geleitete Live-Training – entweder online oder vor Ort – richtet sich an Entwickler mittleren Kenntnisstands, die lernen möchten, KI-Modelle mithilfe des BANGPy-Frameworks und des Neuware SDK auf Cambricon MLU-Hardware zu erstellen und bereitzustellen.
Am Ende dieses Trainings werden die Teilnehmer in der Lage sein zu:
- Die Entwicklungsumgebungen von BANGPy und Neuware einzurichten und zu konfigurieren.
- In Python oder C++ geschriebene Modelle für Cambricon MLUs zu entwickeln sowie deren Leistung zu optimieren.
- Modelle auf Edge-Geräten sowie in Rechenzentren zu implementieren, die den Neuware Runtime nutzen.
- KI-Workflows mit speziellen Beschleunigungsfunktionen der MLUs zu integrieren.
Ablauf des Kurses
- Interaktive Vorlesungen und Diskussionen.
- Praktische Übungen mit BANGPy und Neuware zur Entwicklung und Bereitstellung von Modellen.
- Anleitete Aufgaben zu Optimierung, Integration und Testverfahren.
Möglichkeiten zur individuellen Anpassung
- Falls Sie ein maßgeschneidertes Training wünschen – beispielsweise basierend auf Ihrem spezifischen Cambricon-Gerätemodell oder konkreten Einsatzszenarien –, können Sie uns kontaktieren, um die Einzelheiten zu besprechen.
Einführung in CANN für Entwickler von KI-Frameworks
7 StundenCANN (Compute Architecture for Neural Networks) ist das KI-Entwicklungs-Toolkit von Huawei, mit dem KI-Modelle auf Ascend-KI-Prozessoren kompiliert, optimiert und bereitgestellt werden können.
Dieses praxisorientierte Live-Schulungsprogramm unter Anleitung eines Instruktors – online oder vor Ort – richtet sich an Einsteiger in der KI-Entwicklung, die verstehen möchten, wie CANN in den gesamten Lebenszyklus von Modellen vom Training bis zur Implementierung integriert wird sowie wie es mit Frameworks wie MindSpore, TensorFlow und PyTorch zusammenarbeitet.
Am Ende dieser Schulung werden die Teilnehmer in der Lage sein:
- Die Zielsetzung sowie die Architektur des CANN-Toolkits zu verstehen.
- Eine Entwicklungsumgebung mit CANN und MindSpore einzurichten.
- Ein einfaches KI-Modell in das Format für die Ascend-Hardware zu konvertieren und bereitzustellen.
- Grundlegendes Wissen zu erlangen, das für zukünftige CANN-Optimierungen oder Integrationsprojekte nützlich ist.
Aufbau des Kurses
- Interaktive Vorträge und Diskussionen.
- Praktische Übungen zur Bereitstellung einfacher Modelle.
- Schrittweise Erläuterung der CANN-Toolchain sowie der Integrationspunkte zu anderen Systemen.
Individuelle Anpassungen des Kurses
- Wünschen Sie ein maßgeschneidertes Schulungsprogramm? Kontaktieren Sie uns gerne, um dies zu vereinbaren.
CANN für die Edge-AI-Bereitstellung
14 StundenDas Ascend CANN-Toolkit von Huawei ermöglicht leistungsfähige KI-Inferenzen auf Edge-Geräten wie dem Ascend 310. CANN stellt wesentliche Hilfsmittel bereit, um Modelle in Umgebungen mit begrenzter Rechenleistung und Speicherkapazität zu kompilieren, zu optimieren sowie bereitzustellen.
Dieses von Instruktoren geleitete Live-Training (online oder vor Ort) richtet sich an fortgeschrittene KI-Entwickler und Integratoren, die Modelle mithilfe des CANN-Toolchains auf Ascend-Edge-Geräten bereitstellen und optimieren möchten.
Am Ende dieses Trainings werden die Teilnehmenden in der Lage sein:
- KI-Modelle mithilfe von CANN-Tools für den Einsatz auf dem Ascend 310 vorzubereiten und umzuwandeln.
- Leichtgewichtige Inferenz-Pipelines mit MindSpore Lite sowie AscendCL zu entwickeln.
- Die Performance von Modellen unter begrenzten Rechen- und Speicherbedingungen zu optimieren.
- KI-Anwendungen in realen Edge-Szenarien bereitzustellen und zu überwachen.
Aufbau des Kurses
- Interaktive Vorträge sowie Demonstrationen.
- Praktische Übungen mit Edge-spezifischen Modellen und Anwendungsfällen.
- Live-Beispiele zur Bereitstellung auf virtueller oder physischer Edge-Hardware.
Individuelle Anpassungsmöglichkeiten des Kurses
- Sollten Sie ein maßgeschneidertes Training wünschen, kontaktieren Sie uns gerne zur Absprache.
Verständnis der KI-Rechenplattform von Huawei: Von CANN bis MindSpore
14 StundenDie KI-Plattform von Huawei – vom niedrigschwelligen CANN SDK bis hin zum hochschwelligen MindSpore-Framework – stellt eine eng integrierte Umgebung für die Entwicklung und Bereitstellung künstlicher Intelligenz dar, die speziell für Hardware der Ascend-Reihe optimiert ist.
Dieses von Instruktoren geleitete Live-Training (online oder vor Ort) richtet sich an technische Fachkräfte mit Anfänger- bis Mittelstufenkenntnissen, die erfahren möchten, wie die Komponenten CANN und MindSpore zusammenarbeiten, um den gesamten Lebenszyklus von KI-Anwendungen zu unterstützen sowie fundierte Entscheidungen bezüglich der Infrastruktur zu treffen.
Am Ende des Trainings werden die Teilnehmer in der Lage sein:
- Die mehrschichtige Architektur der KI-Rechenplattform von Huawei zu verstehen.
- Zu erkennen, wie CANN bei der Modelloptimierung und Bereitstellung auf Hardwareebene unterstützt.
- Das MindSpore-Framework sowie dessen Toolchain im Vergleich zu anderen marktüblichen Lösungen einzuschätzen.
- Die KI-Plattform von Huawei in Unternehmensumgebungen oder Cloud-/On-Premises-Szenarien richtig einzuordnen.
Ablauf des Kurses
- Interaktive Vorträge und Diskussionen.
- Live-Demos sowie praktische Fallbeispiele zur Anwendung der Plattform.
- Optionale Übungen, in denen die Teilnehmer einen Modellfluss von MindSpore bis zu CANN nachvollziehen können.
Individuelle Anpassungsmöglichkeiten des Kurses
- Wünschen Sie ein maßgeschneidertes Training zu diesem Thema? Kontaktieren Sie uns, um die Details zu vereinbaren.
Optimierung der Leistung neuronaler Netze mit dem CANN SDK
14 StundenDas CANN SDK (Compute Architecture for Neural Networks) stellt die zentrale Rechenbasis für KI von Huawei dar und ermöglicht Entwicklern, die Leistung bereits implementierter neuronaler Netze auf Ascend-AI-Prozessoren zu verfeinern sowie zu optimieren.
Dieses von erfahrenen Instruktoren geleitete Live-Training – online oder vor Ort – richtet sich an fortgeschrittene KI-Entwickler und Systemingenieure, die mithilfe der leistungsstarken Werkzeuge des CANN SDK die Inferenzgeschwindigkeit optimieren möchten. Dazu zählen insbesondere das Graph Engine-Modul, TIK sowie die Entwicklung individueller Operatoren.
Am Ende dieses Kurses werden die Teilnehmer in der Lage sein zu:/p>
- Die Architektur des CANN-Laufzeitsystems sowie den Gesamtprozess der Leistungsoptimierung nachvollziehen.
- Profiling-Tools und das Graph Engine-Modul für Analyse- und Optimierungszwecke einzusetzen.
- Eigene Operatoren mithilfe von TIK sowie TVM zu erstellen und zu optimieren.
- Speicherengpässe zu beheben sowie die Durchsatzrate der Modelle zu erhöhen.
Ablauf des Kurses
- Interaktive Vorlesungen und Diskussionen.
- Praktische Übungen mit Echtzeit-Profiling sowie Anpassung von Operatoren.
- Optimierungsaufgaben anhand realer Einsatzszenarien unter extremer Last.
Möglichkeiten zur individuellen Kursgestaltung
- Für eine auf Ihre Bedürfnisse zugeschnittene Schulung kontaktieren Sie uns bitte.
CANN SDK für Computer Vision- und NLP-Pipelines
14 StundenDas CANN SDK (Compute Architecture for Neural Networks) stellt leistungsstarke Tools zur Bereitstellung und Optimierung von KI-Anwendungen in Echtzeit bereit – insbesondere im Bereich Computer Vision und NLP, wobei es vor allem auf Huawei-Ascend-Hardware optimiert ist.
Dieses von erfahrenen Trainern geleitete Live-Training (online oder vor Ort) richtet sich an KI-Experten mittleren Kenntnisstands, die CV- und Sprachmodelle mit dem CANN SDK für praktische Anwendungen entwickeln, bereitstellen und optimieren möchten.
Nach Abschluss dieses Kurses werden die Teilnehmer in der Lage sein:
- CV- und NLP-Modelle mithilfe von CANN sowie AscendCL zu implementieren und zu optimieren.
- Die Tools des CANN SDKs zur Modellkonvertierung sowie deren Integration in laufende Pipelines einzusetzen.
- Die Inferenzleistung bei Aufgaben wie Objekterkennung, Klassifizierung und Stimmungsanalyse zu verbessern.
- Echtzeit-CV- bzw. NLP-Pipelines für den Einsatz an Edge-Systemen oder in Cloud-Umgebungen zu erstellen.
Aufbau des Kurses
- Interaktive Vorlesungen und praktische Demonstrationen.
- Hands-on-Übungen zur Modellbereitstellung sowie Leistungsanalyse.
- Entwicklung von echten CV-/NLP-Pipelines anhand konkreter Anwendungsbeispiele.
Individuelle Anpassungen des Kurses
- Sollten Sie ein maßgeschneidertes Training wünschen, kontaktieren Sie uns bitte zur Absprache.
Erstellung benutzerdefinierter KI-Operatoren mit CANN TIK und TVM
14 StundenCANN TIK (Tensor Instruction Kernel) sowie Apache TVM ermöglichen eine fortschrittliche Optimierung und Anpassung von KI-Modelloperatoren für Huaweis Ascend-Hardware.
Dieses praxisorientierte Live-Training unter Anleitung eines Experten (online oder vor Ort) richtet sich an fortgeschrittene Systementwickler, die eigene Operatoren für KI-Modelle mithilfe des TIK-Programmiermodells von CANN sowie der TVM-Kompilierungsintegration entwickeln, bereitstellen und optimieren möchten.
Am Ende dieses Trainings werden die Teilnehmer in der Lage sein zu:
- Benutzerdefinierte KI-Operatoren mithilfe der TIK-DSL für Ascend-Prozessoren zu schreiben und zu testen.
- Eigene Operatoren in die CANN-Laufzeitumgebung sowie das Ausführungsdiagramm einzubinden.
- TVM zur Planung, automatischen Optimierung und Leistungsbewertung von Operatoren zu nutzen.
- Die Leistung benutzerdefinierter Rechenabläufe auf Instruktionsebene zu debuggen und zu verbessern.
Ablauf des Kurses
- Interaktive Vorlesungen und praktische Demonstrationen.
- Hands-on-Programmierung von Operatoren unter Verwendung der TIK- und TVM-Werkzeuge.
- Tests sowie Optimierungen anhand echter Ascend-Hardware oder Simulatoren.
Möglichkeiten zur Kursanpassung
- Wünschen Sie ein maßgeschneidertes Training? Kontaktieren Sie uns, um die Details zu besprechen.
Migration von CUDA-Anwendungen auf chinesische GPU-Architekturen
21 StundenChinesische GPU-Architekturen wie Huawei Ascend, Biren sowie Cambricon MLUs bieten Alternativen zu CUDA, die speziell für den lokalen Markt im Bereich KI und High-Performance Computing entwickelt wurden.
Dieses von einem Trainer geleitete Live-Training – online oder vor Ort – richtet sich an erfahrene GPU-Programmierer sowie Infrastrukturexperten, die bestehende CUDA-Anwendungen auf chinesische Hardwareplattformen migrieren und optimieren möchten.
Nach Abschluss des Kurses werden die Teilnehmer in der Lage sein zu:
- Beurteilen, wie gut bestehende CUDA-Workloads mit alternativen chinesischen Chips kompatibel sind.
- CUDA-Codebasen auf Huawei CANN, Biren SDK sowie Cambricon BANGPy zu portieren.
- Leistungseigenschaften vergleichen und Optimierungspotenziale identifizieren.
- Praktische Herausforderungen bei der Nutzung mehrerer GPU-Architekturen lösen.
Aufbau des Kurses
- Interaktive Vorlesungen und Diskussionen.
- Praktische Übungen zum Übersetzen von Code sowie zum Vergleich der Leistungsfähigkeit.
- Geleitete Aufgaben zur Erarbeitung von Strategien für den Einsatz mehrerer GPUs.
Individuelle Anpassungsmöglichkeiten
- Falls Sie ein maßgeschneidertes Training zu Ihrer eigenen Plattform oder Ihrem CUDA-Projekt wünschen, kontaktieren Sie uns bitte zur Absprache.
Leistungsoptimierung auf Ascend, Biren und Cambricon
21 StundenAscend, Biren sowie Cambricon zählen zu den führenden KI-Hardwareplattformen in China. Jede von ihnen stellt spezielle Tools zur Beschleunigung und Profilanalyse für großangelegte KI-Anwendungen bereit.
Dieses von einem Trainer geleitete Live-Training – sowohl online als auch vor Ort – richtet sich an erfahrene Ingenieure aus dem Bereich der KI-Infrastruktur und Performance-Optimierung, die ihre Modelle auf verschiedenen chinesischen KI-Chipplattformen effizienter nutzen möchten.
Nach Abschluss des Trainings sind die Teilnehmer in der Lage:
- Modelle auf den Plattformen Ascend, Biren und Cambricon zu bewerten.
- Systemische Engpässe sowie Ineffizienzen im Speicher- und Rechenbereich zu identifizieren.
- Optimierungen auf Graphenebene, Kernel-Ebene und Operatorenebene anzuwenden.
- Bereitstellungspipelines so einzustellen, dass Durchsatz sowie Latenz verbessert werden.
Aufbau des Kurses
- Interaktive Vorträge und Diskussionen.
- Praktische Anwendung von Profilierungs- und Optimierungstools auf jeder der Plattformen.
- Eingeführte Übungen, die realistische Optimierungsszenarien behandeln.
Möglichkeiten zur Kursanpassung
- Falls Sie ein individuell angepasstes Training für Ihre spezifischen Leistungsvoraussetzungen oder Modelltypen wünschen, kontaktieren Sie uns bitte, um die Details zu besprechen.