Kontakt aufnehmen

Schulungsübersicht

Jede Sitzung dauert 2 Stunden

Tag 1: Sitzung 1: Geschäftlicher Überblick: Warum Big Data Business Intelligence in der öffentlichen Verwaltung

  • Fallstudien aus NIH, DoE
  • Big-Data-Adoptionsrate in Regierungsbehörden und wie sie ihre künftigen Operationen um Big-Data-Prädiktive Analytik ausrichten
  • Bereichs­weitere Anwendungsgebiete in DoD, NSA, IRS, USDA etc.
  • Verbindung von Big Data mit Legacy-Daten
  • Grundverständnis der ermöglichenden Technologien in der prädiktiven Analytik
  • Datenintegration und Dashboard-Visualisierung
  • Betrugsmanagement
  • Generierung von Business Rules / Betrugserkennung
  • Drohenerkennung und -profilierung
  • Kosten-Nutzen-Analyse für die Big-Data-Implementierung

Tag 1: Sitzung 2: Einführung in Big Data-1

  • Hauptmerkmale von Big Data: Volumen, Vielfalt, Geschwindigkeit und Wahrhaftigkeit. MPP-Architektur für Volumen.
  • Daten­warenhäuser – statische Schema, langsam evolvierende Datensätze
  • MPP-Datenbanken wie Greenplum, Exadata, Teradata, Netezza, Vertica etc.
  • Haupdbasierte Lösungen – keine Bedingungen an die Struktur des Datensatzes.
  • Typisches Muster: HDFS, MapReduce (crunch), Abruf aus HDFS
  • Batch – geeignet für analytische/nicht-interaktive Aufgaben
  • Volumen: CEP-Streaming-Daten
  • Typische Wahlmöglichkeiten – CEP-Produkte (z. B. Infostreams, Apama, MarkLogic etc)
  • Geringere Produktionsreife – Storm/S4
  • NoSQL-Datenbanken – (spaltbasiert und Key-Value): Am besten geeignet als analytische Ergänzung zum Daten­warehouse/Datenbank

Tag 1: Sitzung 3: Einführung in Big Data-2

NoSQL-Lösungen

  • KV Store - Keyspace, Flare, SchemaFree, RAMCloud, Oracle NoSQL Database (OnDB)
  • KV Store - Dynamo, Voldemort, Dynomite, SubRecord, Mo8onDb, DovetailDB
  • KV Store (Hierarchisch) - GT.m, Cache
  • KV Store (Geordnet) - TokyoTyrant, Lightcloud, NMDB, Luxio, MemcacheDB, Actord
  • KV Cache - Memcached, Repcached, Coherence, Infinispan, EXtremeScale, JBossCache, Velocity, Terracoqua
  • Tuple Store - Gigaspaces, Coord, Apache River
  • Objektdatenbank - ZopeDB, DB40, Shoal
  • Dokumentenspeicher - CouchDB, Cloudant, Couchbase, MongoDB, Jackrabbit, XML-Datenbanken, ThruDB, CloudKit, Prsevere, Riak-Basho, Scalaris
  • Wide Columnar Store - BigTable, HBase, Apache Cassandra, Hypertable, KAI, OpenNeptune, Qbase, KDI

Vielfalt von Daten: Einführung in Datenreinigungsprobleme in Big Data

  • RDBMS – statische Struktur/Schema, fördert keine agile, explorative Umgebung.
  • NoSQL – halbstrukturiert, genügend Struktur zur Speicherung von Daten ohne exaktes Schema vor der Speicherung
  • Datenreinigungsprobleme

Tag 1: Sitzung 4: Big Data Einführung-3: Hadoop

  • Wann Hadoop auswählen?
  • STRUKTURIERT - Unternehmens-Daten­warenhäuser/Datenbanken können riesige Daten speichern (gegen Kosten), aber erzwingen Struktur (nicht gut für aktive Exploration)
  • HALBSTRUKTURIERT Daten – schwierig mit traditionellen Lösungen (DW/DB)
  • Daten­warehousing = RIESIGER Aufwand und statisch auch nach Implementierung
  • Für Vielfalt & Volumen von Daten, verarbeitet auf Commodity-Hardware – HADOOP
  • Commodity-H/W benötigt, um einen Hadoop-Cluster zu erstellen

Einführung in Map Reduce /HDFS

  • MapReduce – Verteilte Berechnung über mehrere Server
  • HDFS – Daten lokal für den Berechnungsprozess verfügbar machen (mit Redundanz)
  • Daten – können unstrukturiert/ohne Schema sein (im Gegensatz zu RDBMS)
  • Verantwortung des Entwicklers, Sinn aus den Daten zu ziehen
  • Programmierung von MapReduce = Arbeiten mit Java (Vorteile/Nachteile), manuelles Laden von Daten in HDFS

Tag 2: Sitzung 1: Big-Data-Ökosystem-Aufbau von Big-Data-ETL: Universum der Big-Data-Tools-welches zu nutzen und wann?

  • Hadoop vs. Andere NoSQL-Lösungen
  • Für interaktiven, zufälligen Zugriff auf Daten
  • Hbase (spaltorientierte Datenbank) auf Basis von Hadoop
  • Zufälliger Zugriff auf Daten, aber mit Einschränkungen (max. 1 PB)
  • Nicht gut für Ad-hoc-Analysen, gut für Logging, Zählen, Zeitreihen
  • Sqoop - Import aus Datenbanken in Hive oder HDFS (JDBC/ODBC-Zugriff)
  • Flume – Streaming-Daten (z. B. Logdaten) in HDFS

Tag 2: Sitzung 2: Big-Data-Management-System

  • Bewegliche Teile, Compute-Knoten starten/fehlen :ZooKeeper - Für Konfiguration/Koordination/Namen­dienstleistungen
  • Complex Pipeline/Workflow: Oozie – Workflow-Management, Abhängigkeiten, Kettisierung
  • Deploy, Konfiguration, Cluster-Management, Upgrade etc. (Sysadmin) :Ambari
  • In der Cloud : Whirr

Tag 2: Sitzung 3: Prädiktive Analytik in Business Intelligence -1: Grundlegende Techniken & Machine-learning-basierte BI :

  • Einführung in Machine Learning
  • Lernen von Klassifikationstechniken
  • Bayes'sche Prädiktion - Vorbereitung der Trainingsdatei
  • Support Vector Machine
  • KNN p-Tree Algebra & vertikales Mining
  • Neuronales Netz
  • Big-Data-Großes-Variable-Problem -Random Forest (RF)
  • Big-Data-Automatisierungsproblem – Multi-Modell-Ensemble RF
  • Automatisierung durch Soft10-M
  • Textanalytik-Tool-Treeminer
  • Agiles Lernen
  • Agentenbasiertes Lernen
  • Verteiltes Lernen
  • Einführung in Open-Source-Tools für prädiktive Analytik: R, Rapidminer, Mahut

Tag 2: Sitzung 4 Prädiktive-Analytik-Ökosystem-2: Häufige prädiktive Analytikprobleme in der öffentlichen Verwaltung.

  • Insight-Analytik
  • Visualisierungs­analytik
  • Strukturierte prädiktive Analytik
  • Unstrukturierte prädiktive Analytik
  • Drohnen/Betrug/Vendor-Profiling
  • Recommendation Engine
  • Mustererkennung
  • Rule/Szenario-Erkennung –Fehler, Betrug, Optimierung
  • Ursachenermittlung
  • Stimmungsanalyse
  • CRM-Analytik
  • Netzwerk-­Analytik
  • Textanalytik
  • Technologie­gestützte Überprüfung
  • Betrugsanalytik
  • Echtzeit­Analytik

Tag 3 : Sesion-1 : Echtzeit- und skalierbare Analytik über Hadoop

  • Warum gängige Analytik-Algorithmen in Hadoop/HDFS versagen
  • Apache Hama- für Bulk-Synchronous-verteilte Berechnung
  • Apache SPARK- für Cluster-Berechnung für Echtzeit-Analytik
  • CMU Graphics Lab2- Graphbasierte asynchrone Annäherung an verteilte Berechnung
  • KNN p-Algebra-basierte Annäherung von Treeminer für reduzierte Hardwarekosten im Betrieb

Tag 3: Sitzung-2: Tools für eDiscovery und Forensik

  • eDiscovery über Big Data vs. Legacy-Daten – ein Vergleich von Kosten und Leistung
  • Prädiktive Kodierung und technologie­gestützte Überprüfung (TAR)
  • Livedemo eines TAR-Produkts (vMiner), um zu verstehen, wie TAR für schnellere Entdeckungen funktioniert
  • Schnelleres Indexieren über HDFS –Geschwindigkeit von Daten
  • NLP oder Natural Language Processing –verschiedene Techniken und Open-Source-Produkte
  • eDiscovery in Fremdsprachen-Technologie für Fremdsprachenvorellesung

Tag 3 : Sitzung 3: Big Data BI für Cybersicherheit – Verständnis von ganzen 360-Grad-Ansichten von schneller Datenerfassung bis zur Drohenerkennung

  • Verstehen der Grundlagen der Sicherheitsanalytik-Angriffsfläche, Sicherheitsfehlkonfiguration, Host-Abwehr
  • Netzwerk­infrastruktur/ Große Daten­pipeline / Response ETL für Echtzeit-Analytik
  • Vorschreibend vs. prädiktiv – Fixe regelbasierte vs. automatische Entdeckung von Bedrohungsregeln aus Metadaten

Tag 3: Sitzung 4: Big Data in USDA : Anwendung in der Landwirtschaft

  • Einführung in IoT (Internet of Things) für die Landwirtschaft-sensorbasierte Big Data und Steuerung
  • Einführung in Satelliten­imaging und seine Anwendung in der Landwirtschaft
  • Integration von Sensor- und Bilddaten für Fruchtbarkeit des Bodens, Anbauempfehlung und Prognose
  • Landwirtschafts­versicherung und Big Data
  • Ernteausfall­prognose

Tag 4 : Sitzung-1: Betrugsvorbeugung BI aus Big Data in der öffentlichen Verwaltung-Betrugsanalytik:

  • Grundlegende Klassifikation der Betrugsanalytik- regelbasiert vs. prädiktive Analytik
  • Überwachte vs. unüberwachte Machine Learning für Betrags­muster­erkennung
  • Vendor-Betrug/Übertreibung bei Projekten
  • Medicare und Medicaid-Betrug- Betrugserkennungstechniken für Abrechnungs­verarbeitung
  • Reisekostenrückerstattungs­betrug
  • IRS-Rückerstattungs­betrug
  • Fallstudien und Livedemos werden gegeben, wo Daten verfügbar sind.

Tag 4 : Sitzung-2: Social-Media-Analytik- Informationssammlung und Analyse

  • Big-Data-ETL-API für die Extraktion von Social-Media-Daten
  • Text, Bild, Meta­daten und Video
  • Stimmungsanalyse aus Social-Media-Feed
  • Kontextuelle und nicht-kontextuelle Filterung von Social-Media-Feed
  • Social-Media-Dashboard zur Integration verschiedener Social-Medien
  • Automatisierte Profilierung von Social-Media-Profilen
  • Livedemo jeder Analytik wird durch Treeminer Tool gegeben.

Tag 4 : Sitzung-3: Big-Data-Analytik in Bildverarbeitung und Videofeed

  • Bildspeichertechniken in Big Data- Speicher­lösung für Daten, die Petabytes überschreiten
  • LTFS und LTO
  • GPFS-LTFS (Layered Speicher­lösung für Big Image Data)
  • Grundlagen der Bildanalytik
  • Objekterkennung
  • Bildsegmentierung
  • Bewegungserkennung
  • 3-D-Bildrekonstruktion

Tag 4: Sitzung-4: Big-Data-Anwendungen in NIH:

  • Entstehende Bereiche der Bio-Informatik
  • Meta-Genomik und Big-Data-Mining-Problem
  • Big-Data-Prädiktive Analytik für Pharmacogenomics, Metabolomics und Proteomics
  • Big Data in downstream Genomics Prozess
  • Anwendung von Big-Data-prädiktive Analytik in der öffentlichen Gesundheit

Big-Data-Dashboard für schnellen Zugriff auf verschiedene Daten und Darstellung :

  • Integration der bestehenden Anwendungs­plattform mit Big-Data-Dashboard
  • Big-Data-Management
  • Fallstudie von Big-Data-Dashboard: Tableau und Pentaho
  • Big-Data-App nutzen, um lsbased Services in der öffentlichen Verwaltung zu fördern.
  • Tracking-System und Management

Tag 5 : Sitzung-1: Wie man Big-Data-BI-Implementierung innerhalb einer Organisation rechtfertigt:

  • ROI für Big-Data-Implementierung definieren
  • Fallstudien für Zeitersparnis des Analysten für Sammlung und Vorbereitung von Daten –Zunahme des Produktivitätsgewinns
  • Fallstudien von Umsatzgewinn durch Ersparnis der lizenzierten Datenbankkosten
  • Umsatzgewinn aus lsbased Services
  • Ersparnis durch Betrugsvorbeugung
  • Ein integriertes Spreadsheet-Ansatz, um approx. Kosten vs. Umsatzgewinn/Ersparnis aus Big-Data-Implementierung zu berechnen.

Tag 5 : Sitzung-2: Schritt-für-Schritt-Verfahren, um Legacy-Systeme durch Big-Data-Systeme zu ersetzen:

  • Verstehen des praktischen Big-Data-Migration-Roadmap
  • Was sind die wichtigen Informationen, die vor der Architektur einer Big-Data-Implementierung benötigt werden
  • Was sind die verschiedenen Arten, Volumen, Geschwindigkeit, Vielfalt und Wahrhaftigkeit von Daten zu berechnen
  • Wie man Datenwachstum schätzt
  • Fallstudien

Tag 5: Sitzung 4: Bewertung der Big-Data-Anbieter und ihrer Produkte. Q/A Sitzung:

  • Accenture
  • APTEAN (Ehemals CDC Software)
  • Cisco Systems
  • Cloudera
  • Dell
  • EMC
  • GoodData Corporation
  • Guavus
  • Hitachi Data Systems
  • Hortonworks
  • HP
  • IBM
  • Informatica
  • Intel
  • Jaspersoft
  • Microsoft
  • MongoDB (Ehemals 10Gen)
  • MU Sigma
  • Netapp
  • Opera Solutions
  • Oracle
  • Pentaho
  • Platfora
  • Qliktech
  • Quantum
  • Rackspace
  • Revolution Analytics
  • Salesforce
  • SAP
  • SAS Institute
  • Sisense
  • Software AG/Terracotta
  • Soft10 Automation
  • Splunk
  • Sqrrl
  • Supermicro
  • Tableau Software
  • Teradata
  • Think Big Analytics
  • Tidemark Systems
  • Treeminer
  • VMware (Teil von EMC)

Voraussetzungen

  • Grundkenntnisse in Geschäftsabläufen und Daten­systemen in der öffentlichen Verwaltung innerhalb ihres Fachbereichs
  • Grundverständnis von SQL/Oracle oder relationalen Datenbanken
  • Grundverständnis von Statistik (auf Spreadsheet-Niveau)
 35 Stunden

Teilnehmerzahl


Preis je Teilnehmer (exkl. USt)

Erfahrungsberichte (1)

Kommende Kurse

Verwandte Kategorien