Schulungsübersicht
Grundlagen agentenbasierter Systeme im Produktiveinsatz
- Agent-Architekturen: Schleifen, Werkzeuge, Speicher sowie Orchestrierungsebenen
- Lebenszyklus von Agenten: Entwicklung, Bereitstellung und kontinuierlicher Betrieb
- Herausforderungen bei der Verwaltung vieler Agenten in Produktionsumgebungen
Infrastruktur und Deployment-Modelle
- Bereitstellung von Agenten in containerisierten sowie Cloud-Umgebungen
- Skalierungsstrategien: horizontales vs. vertikales Scaling, Parallelverarbeitung und Begrenzung der Auslastung
- Orchestrierung mehrerer Agenten sowie Lastverteilung zwischen ihnen
Überwachung und Observabilität
- Wichtige Kennzahlen: Latenz, Erfolgsrate, Speichernutzung sowie Tiefe der Agenten-Aufrufe
- Nachverfolgung von Aktivitäten und Aufrufbeziehungen zwischen Agenten
- Implementierung von Überwachungsmechanismen mithilfe von Prometheus, OpenTelemetry und Grafana
Protokollierung, Audits und Compliance
- Zentrale Protokollverwaltung sowie strukturierte Erfassung von Ereignissen
- Einhaltung gesetzlicher Vorgaben und Nachvollziehbarkeit in agentenbasierten Abläufen
- Gestaltung von Audit-Spuren sowie Wiederholungsmechanismen zur Fehlersuche
Leistungsoptimierung und Ressourcenmanagement
- Reduktion des Rechenaufwands bei der Inferenz sowie Optimierung der Agenten-Orchestrierungszyklen
- Nutzung von Model-Caching und leichtgewichtigen Vektorrepräsentationen zur beschleunigten Abrufausführung
- Last- sowie Stress-Tests für KI-basierte Pipeline-Konfigurationen
Kostenkontrolle und Governance
- Identifikation der Haupttreiber von Agenten-Kosten: API-Aufrufe, Speicherbedarf, Rechenressourcen sowie externe Diensteintegrationen
- Erfassung agentenspezifischer Kosten sowie Einführung entsprechender Abrechnungsmodelle
- Automatisierte Richtlinien zur Steuerung der Verbreitung von Agenten sowie Vermeidung untätiger Ressourcenverbrauchung
CI/CD und Bereitstellungsstrategien für Agenten
- Integration der Agenten-Pipelines in vorhandene CI/CD-Infrastrukturen
- Testverfahren, Versionssteuerung sowie Rückrollmechanismen für kontinuierliche Updates von Agenten
- Schrittweise Rollout-Strategien und sichere Bereitstellungstechniken
Fehlerbehebung und Zuverlässigkeitstechnik
- Entwurf fehlertoleranter Systeme, die auch bei Ausfällen den Betrieb fortsetzen können
- Anwendung von Retry-, Timeout- und Circuit-Breaker-Mechanismen zur Erhöhung der Agentenzuverlässigkeit
- Strukturierte Vorgehensweisen bei Vorfällen sowie Analysemethoden nach einem Ausfall in KI-Systemen
Abschlussprojekt
- Erstellung und Inbetriebnahme eines vollständig überwachten sowie kostengeregelten agentenbasierten KI-Systems
- Simulation von Belastungssituationen, Messung der Leistungswerte sowie Optimierung des Ressourcenverbrauchs
- Präsentation der finalen Architektur und des Überwachungs-Dashboards vor Kollegen
Zusammenfassung sowie weitere Schritte
Voraussetzungen
- Fundierte Kenntnisse im Bereich MLOps sowie Betriebsumgebungen für maschinelles Lernen
- Erfahrung mit containerbasierten Deployments (Docker/Kubernetes)
- Vertrautheit mit Tools zur Kostenoptimierung in Cloud-Umgebungen sowie zu Überwachungszwecken
Zielgruppe
- MLOps-Ingenieure
- Site-Reliability Engineers (SREs)
- Engineering-Manager, die sich mit der KI-Infrastruktur befassen
Erfahrungsberichte (3)
Der Trainer ist geduldig und sehr hilfsbereit. Er kennt sich gut mit dem Thema aus.
CLIFFORD TABARES - Universal Leaf Philippines, Inc.
Kurs - Agentic AI for Business Automation: Use Cases & Integration
Maschinelle Übersetzung
Guter Mix aus Wissen und Praxis
Ion Mironescu - Facultatea S.A.I.A.P.M.
Kurs - Agentic AI for Enterprise Applications
Maschinelle Übersetzung
Die Mischung aus Theorie und Praxis sowie den Perspektiven auf hohem und niedrigem Niveau
Ion Mironescu - Facultatea S.A.I.A.P.M.
Kurs - Autonomous Decision-Making with Agentic AI
Maschinelle Übersetzung