Vielen Dank für die Zusendung Ihrer Anfrage! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Vielen Dank, dass Sie Ihre Buchung abgeschickt haben! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Schulungsübersicht
Jede Sitzung dauert 2 Stunden
Tag 1: Sitzung 1: Geschäftlicher Überblick: Warum Big Data Business Intelligence in der öffentlichen Verwaltung
- Fallstudien aus NIH, DoE
- Big-Data-Adoptionsrate in Regierungsbehörden und wie sie ihre künftigen Operationen um Big-Data-Prädiktive Analytik ausrichten
- Bereichsweitere Anwendungsgebiete in DoD, NSA, IRS, USDA etc.
- Verbindung von Big Data mit Legacy-Daten
- Grundverständnis der ermöglichenden Technologien in der prädiktiven Analytik
- Datenintegration und Dashboard-Visualisierung
- Betrugsmanagement
- Generierung von Business Rules / Betrugserkennung
- Drohenerkennung und -profilierung
- Kosten-Nutzen-Analyse für die Big-Data-Implementierung
Tag 1: Sitzung 2: Einführung in Big Data-1
- Hauptmerkmale von Big Data: Volumen, Vielfalt, Geschwindigkeit und Wahrhaftigkeit. MPP-Architektur für Volumen.
- Datenwarenhäuser – statische Schema, langsam evolvierende Datensätze
- MPP-Datenbanken wie Greenplum, Exadata, Teradata, Netezza, Vertica etc.
- Haupdbasierte Lösungen – keine Bedingungen an die Struktur des Datensatzes.
- Typisches Muster: HDFS, MapReduce (crunch), Abruf aus HDFS
- Batch – geeignet für analytische/nicht-interaktive Aufgaben
- Volumen: CEP-Streaming-Daten
- Typische Wahlmöglichkeiten – CEP-Produkte (z. B. Infostreams, Apama, MarkLogic etc)
- Geringere Produktionsreife – Storm/S4
- NoSQL-Datenbanken – (spaltbasiert und Key-Value): Am besten geeignet als analytische Ergänzung zum Datenwarehouse/Datenbank
Tag 1: Sitzung 3: Einführung in Big Data-2
NoSQL-Lösungen
- KV Store - Keyspace, Flare, SchemaFree, RAMCloud, Oracle NoSQL Database (OnDB)
- KV Store - Dynamo, Voldemort, Dynomite, SubRecord, Mo8onDb, DovetailDB
- KV Store (Hierarchisch) - GT.m, Cache
- KV Store (Geordnet) - TokyoTyrant, Lightcloud, NMDB, Luxio, MemcacheDB, Actord
- KV Cache - Memcached, Repcached, Coherence, Infinispan, EXtremeScale, JBossCache, Velocity, Terracoqua
- Tuple Store - Gigaspaces, Coord, Apache River
- Objektdatenbank - ZopeDB, DB40, Shoal
- Dokumentenspeicher - CouchDB, Cloudant, Couchbase, MongoDB, Jackrabbit, XML-Datenbanken, ThruDB, CloudKit, Prsevere, Riak-Basho, Scalaris
- Wide Columnar Store - BigTable, HBase, Apache Cassandra, Hypertable, KAI, OpenNeptune, Qbase, KDI
Vielfalt von Daten: Einführung in Datenreinigungsprobleme in Big Data
- RDBMS – statische Struktur/Schema, fördert keine agile, explorative Umgebung.
- NoSQL – halbstrukturiert, genügend Struktur zur Speicherung von Daten ohne exaktes Schema vor der Speicherung
- Datenreinigungsprobleme
Tag 1: Sitzung 4: Big Data Einführung-3: Hadoop
- Wann Hadoop auswählen?
- STRUKTURIERT - Unternehmens-Datenwarenhäuser/Datenbanken können riesige Daten speichern (gegen Kosten), aber erzwingen Struktur (nicht gut für aktive Exploration)
- HALBSTRUKTURIERT Daten – schwierig mit traditionellen Lösungen (DW/DB)
- Datenwarehousing = RIESIGER Aufwand und statisch auch nach Implementierung
- Für Vielfalt & Volumen von Daten, verarbeitet auf Commodity-Hardware – HADOOP
- Commodity-H/W benötigt, um einen Hadoop-Cluster zu erstellen
Einführung in Map Reduce /HDFS
- MapReduce – Verteilte Berechnung über mehrere Server
- HDFS – Daten lokal für den Berechnungsprozess verfügbar machen (mit Redundanz)
- Daten – können unstrukturiert/ohne Schema sein (im Gegensatz zu RDBMS)
- Verantwortung des Entwicklers, Sinn aus den Daten zu ziehen
- Programmierung von MapReduce = Arbeiten mit Java (Vorteile/Nachteile), manuelles Laden von Daten in HDFS
Tag 2: Sitzung 1: Big-Data-Ökosystem-Aufbau von Big-Data-ETL: Universum der Big-Data-Tools-welches zu nutzen und wann?
- Hadoop vs. Andere NoSQL-Lösungen
- Für interaktiven, zufälligen Zugriff auf Daten
- Hbase (spaltorientierte Datenbank) auf Basis von Hadoop
- Zufälliger Zugriff auf Daten, aber mit Einschränkungen (max. 1 PB)
- Nicht gut für Ad-hoc-Analysen, gut für Logging, Zählen, Zeitreihen
- Sqoop - Import aus Datenbanken in Hive oder HDFS (JDBC/ODBC-Zugriff)
- Flume – Streaming-Daten (z. B. Logdaten) in HDFS
Tag 2: Sitzung 2: Big-Data-Management-System
- Bewegliche Teile, Compute-Knoten starten/fehlen :ZooKeeper - Für Konfiguration/Koordination/Namendienstleistungen
- Complex Pipeline/Workflow: Oozie – Workflow-Management, Abhängigkeiten, Kettisierung
- Deploy, Konfiguration, Cluster-Management, Upgrade etc. (Sysadmin) :Ambari
- In der Cloud : Whirr
Tag 2: Sitzung 3: Prädiktive Analytik in Business Intelligence -1: Grundlegende Techniken & Machine-learning-basierte BI :
- Einführung in Machine Learning
- Lernen von Klassifikationstechniken
- Bayes'sche Prädiktion - Vorbereitung der Trainingsdatei
- Support Vector Machine
- KNN p-Tree Algebra & vertikales Mining
- Neuronales Netz
- Big-Data-Großes-Variable-Problem -Random Forest (RF)
- Big-Data-Automatisierungsproblem – Multi-Modell-Ensemble RF
- Automatisierung durch Soft10-M
- Textanalytik-Tool-Treeminer
- Agiles Lernen
- Agentenbasiertes Lernen
- Verteiltes Lernen
- Einführung in Open-Source-Tools für prädiktive Analytik: R, Rapidminer, Mahut
Tag 2: Sitzung 4 Prädiktive-Analytik-Ökosystem-2: Häufige prädiktive Analytikprobleme in der öffentlichen Verwaltung.
- Insight-Analytik
- Visualisierungsanalytik
- Strukturierte prädiktive Analytik
- Unstrukturierte prädiktive Analytik
- Drohnen/Betrug/Vendor-Profiling
- Recommendation Engine
- Mustererkennung
- Rule/Szenario-Erkennung –Fehler, Betrug, Optimierung
- Ursachenermittlung
- Stimmungsanalyse
- CRM-Analytik
- Netzwerk-Analytik
- Textanalytik
- Technologiegestützte Überprüfung
- Betrugsanalytik
- EchtzeitAnalytik
Tag 3 : Sesion-1 : Echtzeit- und skalierbare Analytik über Hadoop
- Warum gängige Analytik-Algorithmen in Hadoop/HDFS versagen
- Apache Hama- für Bulk-Synchronous-verteilte Berechnung
- Apache SPARK- für Cluster-Berechnung für Echtzeit-Analytik
- CMU Graphics Lab2- Graphbasierte asynchrone Annäherung an verteilte Berechnung
- KNN p-Algebra-basierte Annäherung von Treeminer für reduzierte Hardwarekosten im Betrieb
Tag 3: Sitzung-2: Tools für eDiscovery und Forensik
- eDiscovery über Big Data vs. Legacy-Daten – ein Vergleich von Kosten und Leistung
- Prädiktive Kodierung und technologiegestützte Überprüfung (TAR)
- Livedemo eines TAR-Produkts (vMiner), um zu verstehen, wie TAR für schnellere Entdeckungen funktioniert
- Schnelleres Indexieren über HDFS –Geschwindigkeit von Daten
- NLP oder Natural Language Processing –verschiedene Techniken und Open-Source-Produkte
- eDiscovery in Fremdsprachen-Technologie für Fremdsprachenvorellesung
Tag 3 : Sitzung 3: Big Data BI für Cybersicherheit – Verständnis von ganzen 360-Grad-Ansichten von schneller Datenerfassung bis zur Drohenerkennung
- Verstehen der Grundlagen der Sicherheitsanalytik-Angriffsfläche, Sicherheitsfehlkonfiguration, Host-Abwehr
- Netzwerkinfrastruktur/ Große Datenpipeline / Response ETL für Echtzeit-Analytik
- Vorschreibend vs. prädiktiv – Fixe regelbasierte vs. automatische Entdeckung von Bedrohungsregeln aus Metadaten
Tag 3: Sitzung 4: Big Data in USDA : Anwendung in der Landwirtschaft
- Einführung in IoT (Internet of Things) für die Landwirtschaft-sensorbasierte Big Data und Steuerung
- Einführung in Satellitenimaging und seine Anwendung in der Landwirtschaft
- Integration von Sensor- und Bilddaten für Fruchtbarkeit des Bodens, Anbauempfehlung und Prognose
- Landwirtschaftsversicherung und Big Data
- Ernteausfallprognose
Tag 4 : Sitzung-1: Betrugsvorbeugung BI aus Big Data in der öffentlichen Verwaltung-Betrugsanalytik:
- Grundlegende Klassifikation der Betrugsanalytik- regelbasiert vs. prädiktive Analytik
- Überwachte vs. unüberwachte Machine Learning für Betragsmustererkennung
- Vendor-Betrug/Übertreibung bei Projekten
- Medicare und Medicaid-Betrug- Betrugserkennungstechniken für Abrechnungsverarbeitung
- Reisekostenrückerstattungsbetrug
- IRS-Rückerstattungsbetrug
- Fallstudien und Livedemos werden gegeben, wo Daten verfügbar sind.
Tag 4 : Sitzung-2: Social-Media-Analytik- Informationssammlung und Analyse
- Big-Data-ETL-API für die Extraktion von Social-Media-Daten
- Text, Bild, Metadaten und Video
- Stimmungsanalyse aus Social-Media-Feed
- Kontextuelle und nicht-kontextuelle Filterung von Social-Media-Feed
- Social-Media-Dashboard zur Integration verschiedener Social-Medien
- Automatisierte Profilierung von Social-Media-Profilen
- Livedemo jeder Analytik wird durch Treeminer Tool gegeben.
Tag 4 : Sitzung-3: Big-Data-Analytik in Bildverarbeitung und Videofeed
- Bildspeichertechniken in Big Data- Speicherlösung für Daten, die Petabytes überschreiten
- LTFS und LTO
- GPFS-LTFS (Layered Speicherlösung für Big Image Data)
- Grundlagen der Bildanalytik
- Objekterkennung
- Bildsegmentierung
- Bewegungserkennung
- 3-D-Bildrekonstruktion
Tag 4: Sitzung-4: Big-Data-Anwendungen in NIH:
- Entstehende Bereiche der Bio-Informatik
- Meta-Genomik und Big-Data-Mining-Problem
- Big-Data-Prädiktive Analytik für Pharmacogenomics, Metabolomics und Proteomics
- Big Data in downstream Genomics Prozess
- Anwendung von Big-Data-prädiktive Analytik in der öffentlichen Gesundheit
Big-Data-Dashboard für schnellen Zugriff auf verschiedene Daten und Darstellung :
- Integration der bestehenden Anwendungsplattform mit Big-Data-Dashboard
- Big-Data-Management
- Fallstudie von Big-Data-Dashboard: Tableau und Pentaho
- Big-Data-App nutzen, um lsbased Services in der öffentlichen Verwaltung zu fördern.
- Tracking-System und Management
Tag 5 : Sitzung-1: Wie man Big-Data-BI-Implementierung innerhalb einer Organisation rechtfertigt:
- ROI für Big-Data-Implementierung definieren
- Fallstudien für Zeitersparnis des Analysten für Sammlung und Vorbereitung von Daten –Zunahme des Produktivitätsgewinns
- Fallstudien von Umsatzgewinn durch Ersparnis der lizenzierten Datenbankkosten
- Umsatzgewinn aus lsbased Services
- Ersparnis durch Betrugsvorbeugung
- Ein integriertes Spreadsheet-Ansatz, um approx. Kosten vs. Umsatzgewinn/Ersparnis aus Big-Data-Implementierung zu berechnen.
Tag 5 : Sitzung-2: Schritt-für-Schritt-Verfahren, um Legacy-Systeme durch Big-Data-Systeme zu ersetzen:
- Verstehen des praktischen Big-Data-Migration-Roadmap
- Was sind die wichtigen Informationen, die vor der Architektur einer Big-Data-Implementierung benötigt werden
- Was sind die verschiedenen Arten, Volumen, Geschwindigkeit, Vielfalt und Wahrhaftigkeit von Daten zu berechnen
- Wie man Datenwachstum schätzt
- Fallstudien
Tag 5: Sitzung 4: Bewertung der Big-Data-Anbieter und ihrer Produkte. Q/A Sitzung:
- Accenture
- APTEAN (Ehemals CDC Software)
- Cisco Systems
- Cloudera
- Dell
- EMC
- GoodData Corporation
- Guavus
- Hitachi Data Systems
- Hortonworks
- HP
- IBM
- Informatica
- Intel
- Jaspersoft
- Microsoft
- MongoDB (Ehemals 10Gen)
- MU Sigma
- Netapp
- Opera Solutions
- Oracle
- Pentaho
- Platfora
- Qliktech
- Quantum
- Rackspace
- Revolution Analytics
- Salesforce
- SAP
- SAS Institute
- Sisense
- Software AG/Terracotta
- Soft10 Automation
- Splunk
- Sqrrl
- Supermicro
- Tableau Software
- Teradata
- Think Big Analytics
- Tidemark Systems
- Treeminer
- VMware (Teil von EMC)
Voraussetzungen
- Grundkenntnisse in Geschäftsabläufen und Datensystemen in der öffentlichen Verwaltung innerhalb ihres Fachbereichs
- Grundverständnis von SQL/Oracle oder relationalen Datenbanken
- Grundverständnis von Statistik (auf Spreadsheet-Niveau)
35 Stunden
Erfahrungsberichte (1)
Die Fähigkeit des Trainers, den Kurs den Anforderungen der Organisation anzupassen, anstatt ihn nur zur Erbringung zu geben.
Masilonyane - Revenue Services Lesotho
Kurs - Big Data Business Intelligence for Govt. Agencies
Maschinelle Übersetzung