Kontakt aufnehmen

Schulungsübersicht

Einführung in Reinforcement Learning aus menschlichem Feedback (RLHF)

  • Was ist RLHF und warum ist es von Bedeutung?
  • Vergleich mit Verfahren zur überwachten Feinabstimmung von Modellen
  • Einsatzmöglichkeiten von RLHF in modernen KI-Systemen

Belohnungsmodellierung anhand menschlichen Feedbacks

  • Sammeln und Strukturierung von Feedback durch Menschen
  • Erstellung und Training von Belohnungsmodellen
  • Bewertung der Wirksamkeit solcher Modelle

Training mithilfe des Proximal Policy Optimization-Algorithmus (PPO)

  • Einblick in PPO-Algorithmen im Kontext von RLHF
  • Umsetzung von PPO unter Verwendung der Belohnungsmodelle
  • Sichere und iterative Feinabstimmung der Modelle

Praktische Feinabstimmung von Sprachmodellen

  • Vorbereitung geeigneter Datensätze für RLHF-Prozesse
  • Konkrete Übungen zur Feinabstimmung eines kleineren LLM mit RLHF-Techniken
  • Häufige Herausforderungen sowie Lösungsansätze

Skalierung von RLHF für Produktionssysteme

  • Aspekte zur Infrastruktur und zur Rechenleistung
  • Qualitätskontrolle sowie kontinuierliche Verbesserungszyklen durch Feedback-Schleifen
  • Bewährte Verfahren für die Implementierung und den Betrieb von RLHF-Systemen

Ethische Aspekte und Maßnahmen zur Vermeidung von Bias

  • Umgang mit ethischen Risiken im Zusammenhang mit menschlichem Feedback
  • Möglichkeiten zur Erkennung und Korrektur von Verzerrungen in den Modellen
  • Sicherstellung der Konformität sowie sicherer Ausgaben durch die Modelle

Fallstudien und reale Beispiele aus der Praxis

  • Beispiel: Feinabstimmung von ChatGPT mithilfe von RLHF
  • Weitere erfolgreiche Implementierungen von RLHF
  • Erfahrungen und Erkenntnisse aus der Praxis

Zusammenfassung sowie nächste Schritte

Voraussetzungen

  • Grundkenntnisse in überwachtem und Reinforcement Learning
  • Erfahrung bei der Feinabstimmung von Modellen sowie Kenntnis gängiger neuronaler Netzarchitekturen
  • Gute Vertrautheit mit der Programmiersprache Python sowie Deep-Learning-Frameworks wie TensorFlow oder PyTorch

Zielgruppe

  • Machine-Learning-Ingenieure
  • KI-Forscher
 14 Stunden

Teilnehmerzahl


Preis je Teilnehmer (exkl. USt)

Kommende Kurse

Verwandte Kategorien