Schulungsübersicht
Tag 01
Einführung in Big Data Business Intelligence für die kriminalistische Analyse
- Fallbeispiele aus der Strafverfolgung – prädiktive Polizeiarbeit
- Adoptionsquote von Big Data bei Behörden und deren zukünftige Ausrichtung auf prädiktive Analysen
- Neue Technologien wie Schussdetektoren, Überwachungsvideos sowie Social Media
- Einsatz von Big Data-Technologien zur Reduzierung der Informationsflut
- Kombination von Big Data mit Bestandsdaten
- Grundverständnis prädiktiver Analyse-Technologien
- Datenintegration sowie Darstellung via Dashboards
- Betrugserkennung und -verwaltung<\/li>
- Geschäftsregeln zur Betrugsaufdeckung
- Erkennung und Profilierung von Bedrohungen
- Kosten-Nutzen-Analyse bei der Implementierung von Big Data
Einführung in Big Data
- Wesentliche Merkmale: Volumen, Vielfalt, Geschwindigkeit und Zuverlässigkeit
- MPS-Architektur (Massively Parallel Processing)
- Datenwarenhäuser – statisches Schema, langsam verändernde Datensätze
- MPP-Datenbanken: Greenplum, Exadata, Teradata, Netezza, Vertica etc.
- Hadoop-basierte Lösungen – keine Voraussetzung hinsichtlich der Datenstruktur
- Typisches Schema: HDFS, MapReduce, Datenabruf aus HDFS
- Apache Spark für Echtzeit-Datenverarbeitung
- Bulk-Verarbeitung eignet sich ideal für analytische Zwecke und nicht-interaktive Aufgaben
- Volumen: Ereignisdatenfluss in Echtzeit
- Gängige Auswahl – CEP-Produkte (z. B. Infostreams, Apama, MarkLogic)
- Weniger einsatzfertig – Storm/S4
- NoSQL-Datenbanken – spaltenbasiert und schlüssel-Wert: Ideal als Ergänzung zu herkömmlichen Datenbanksystemen
NoSQL-Lösungen
- Schlüssel-Wert-Speicher: Keyspace, Flare, SchemaFree, RAMCloud, Oracle NoSQL Database (OnDB)
- Schlüssel-Wert-Speicher: Dynamo, Voldemort, Dynomite, SubRecord, Mo8onDb, DovetailDB
- Hierarchische Schlüssel-Wert-Speicher: GT.m, Cache
- Geordnete Schlüssel-Wwert-Speicher: TokyoTyrant, Lightcloud, NMDB, Luxio, MemcacheDB, Actord
- Schlüssel-Cache: Memcached, Repcached, Coherence, Infinispan, EXtremeScale, JBossCache, Velocity, Terracoqua
- Tupel-Speicher: Gigaspaces, Coord, Apache River
- Objektdatenbanken: ZopeDB, DB40, Shoal
- Dokumentenspeicher: CouchDB, Cloudant, Couchbase, MongoDB, Jackrabbit, XML-Datenbanken, ThruDB, CloudKit, Prsevere, Riak-Basho, Scalaris
- Weitflächige Spaltenbasierte Speicher: BigTable, HBase, Apache Cassandra, Hypertable, KAI, OpenNeptune, Qbase, KDI
Datenvielfalt – Einführung in Probleme bei der Datenbereinigung
- RDBMS – statisches Schema verhindert agiles und exploratives Arbeiten
- NoSQL – semi-strukturierte Daten: ausreichend Struktur für die Speicherung, auch ohne festes Schema vorab
- Typische Probleme bei der Datenbereinigung
Hadoop
- Wann ist Hadoop die richtige Wahl?
- STRUKTURIERTE Daten – Enterprise-Datenwarenhäuser können große Mengen speichern, erfordern aber ein festes Schema (ungeeignet für freie Exploration)
- SEMI-STRUKTURierte Daten – traditionelle Lösungen wie DW/DB haben hier Schwierigkeiten
- Datenspeicherung im Data Warehouse = enormer Aufwand und starre Strukturen nach Implementierung
- Für Vielfalt und große Mengen ist Hadoop ideal, auch auf Standard-Hardware einzusetzen
- Zur Bildung eines Hadoop-Clusters werden günstige Server erforderlich
Einführung in MapReduce/HDFS
- MapReduce verteilt Berechnungen auf mehrere Rechner
- HDFS stellt Daten lokal bereit (inkl. Redundanz)
- Daten können unstrukturiert sein – im Gegensatz zu RDBMS
- Programmierer müssen die Bedeutung der Daten selbst erschließen
- MapReduce-Entwicklung erfolgt mit Java; manuelles Hochladen in HDFS notwendig
Tag 02
Big Data-Ökosystem – Aufbau von ETL-Prozessen (Extraktion, Transformation, Laden). Welche Tools wann zu nutzen sind?
- Hadoop im Vergleich zu anderen NoSQL-Lösungen
- Einsatz für interaktiven Zugriff auf Daten in Echtzeit
- HBase – spaltenbasierte Datenbank oberhalb von Hadoop
- Zwar beliebiger Datenzugriff, aber mit Einschränkung bis 1 Petabyte verfügbar
- Nicht ideal für Ad-hoc-Analysen; eher geeignet für Log-Recording und Zeitreihenverarbeitung
- Sqoop – Import aus Datenbanken nach Hive oder HDFS (über JDBC/ODBC)
- Flume überträgt kontinuierlich Datenflüsse in HDFS, etwa Protokolldaten
Verwaltungssysteme für Big Data
- Rechnerknoten werden hinzugefügt bzw. entfallen – ZooKeeper regelt Konfiguration und Koordination
- Komplexe Verarbeitungsabläufe: Oozie sorgt für Workflow-Planung, Abhängigkeiten sowie Sequenzierung
- Bereitstellung, Einrichtung, Cluster-Verwaltung, Updates – Ambari unterstützt Admins dabei
- In der Cloud ist Whirr eine praktische Wahl
Prädiktive Analytik – Grundlagen und maschinenbasierte Methoden
- Einführung in das Maschinelle Lernen
- Lernverfahren zur Klassifizierung von Mustern
- Bayesian Prediction: Erstellung einer Trainingsdatei
- Support Vector Machine
- KNN p-Tree Algebra sowie vertikale Datendurchsuchung
- Neuronale Netzwerke<\/li>
- Bei komplexen Variablen in großen Datensätzen hilft Random Forest (RF)
- Für automatisierte Big Data-Analysen: Multi-Modell-Ensemble RF
- Automatisierung mithilfe von Soft10-M
- Textanalyse-Werkzeug: Treeminer
- Agresives Lernen
- Lernverfahren basierend auf Agenden
- Verteilte Lernprozesse
- Einführung in frei verfügbare Werkzeuge für prädiktive Analytik: R, Python, Rapidminer, Mahut
Ökosystem der prädiktiven Analytik – Nutzung im kriminalistischen Kontext
- Technologie und Ermittlungsprozesse
- Einsichtbasierte Analyseverfahren
- Datenvisualisierung in der Analyse
- Gestrukturte prädiktive Analytik
- Unstrukturierte Formen der prädiktiven Analyse
- Profilbildung von Bedrohungen, Betrügern oder Lieferanten
- Empfehlungsmechanismen
- Mustererkennung
- Auffinden von Regeln bzw. Szenarien – etwa bei Fehlern, Betrug oder Optimierungen
- Ausfindigmachen der Hauptursachen für Probleme
- Stimmungsanalyse
- Analyse von CRM-Daten
- Netzwerkanalytik
- Auswertung von Texten – Transkripte, Zeugenaussagen oder Internetkommunikation mit Treeminer
- Technologieunterstützte Dokumentenprüfung<\/li>
- Betrugsanalyse
- Echtzeitanalytik
Tag 03
Echtzeit- und skalierbare Analyse mittels Hadoop
- Gründe, warum klassische Algorithmen in Hadoop/HDFS scheitern
- Apache Hama – für asynchrones Massenparallelrechnen
- Apache Spark – optimiert für Clusterberechnungen und Echtzeitanalyse
- CMU Graphics Lab2 – asynchrone Verarbeitung graphbasiert auf verteilten Rechenressourcen
- KNN p: Algebraische Methode aus Treeminer zur Reduzierung von Hardwareaufwand
Tools für eDiscovery und forensische Analyse
- Vergleich Kosten und Leistung bei Big Data vs. herkömmlichen Datenmethoden
- Predictive Coding und technologiegestützte Dokumentensuche (TAR)
- Echtzeit-Demo von vMiner – zeigt, wie TAR schnellere Analyseermöglicht
- Schnelleres Indizieren mittels HDFS durch hohes Datenaufkommen
- NLP – verfügbare Open-Source-Technologien zur Sprachverarbeitung<\/li>
- Verarbeitung von Fremdsprachen in eDiscovery-Prozessen
Big Data BI für Cybersicherheit: ganzheitliche Übersicht, schnelle Datenerfassung sowie Bedrohungserkennung
- Einführung in Grundlagen der Sicherheitsanalytik – Angriffsflächen, Fehlkonfigurationen oder Schutzmechanismen am Host
- Netzwerkinfrastruktur und Echtzeit-ETL für schnelle Analysen
- Präskriptive vs. prädiktive Ansätze – festgelegte Regeln im Kontrast zur automatischen Erkennung von Bedrohungsmustern durch Metadaten
Erfassung diverser Datenquellen für die kriminalistische Analyse
- Verwendung des Internet der Dinge als Sensoren zur Datenerfassung
- Nutzung von Satellitenbildern für landesweite Überwachung
- Bild- und Videoanalysen im Rahmen der Personenidentifikation
- Weitere Technologien – Drohnen, Bodycams, GPS-Tagging sowie Wärmebildkameras
- Automatisierte Datenerhebung kombiniert mit Informationen von Informanten oder Ermittlungsberichten
- Vorhersage von Kriminalitätstrends
Tag 04
Betrugsprävention mithilfe von Big Data BI und Analytik
- Klassifikation der Betrugsanalyse: Regelbasiert vs. prädiktiv
- Lernverfahren – überwachtes versus unüberwachtes maschinelles Lernen zur Mustererkennung im Betrugsspektrum
- B2B-Betrügereien, Fälschungen medizinischer Rechnungen, Versicherungsbetrug, Steuerhinterziehung sowie Geldwäsche
Social Media Analytics – Informationssammlung und -auswertung
- Nutzung von Social Media durch Kriminelle zur Organisation, Rekrutierung oder Planung
- Big Data ETL-APIs zur Extraktion sozialer Netzwerkdaten
- Auswertung von Texten, Bildern, Metadaten sowie Videos
- Sentimentanalyse von Beiträgen in Social Networks
- Kontextabhängige und kontextunabhängige Filterungsverfahren
- Social Media-Dashboards zur Sammlung vielfältiger Plattformen
- Automatisierte Profilanalyse aus sozialen Netzwerken
- Für alle Analysebereiche erfolgt Live-Demonstration mit Treeminer-Tool
Big Data Analytics bei Bild- und Videoverarbeitung
- Speichermethoden im Bereich Big Data – Lösungen für Petabyte-Datensätze
- LTFS (Linear Tape File System) sowie LTO (Linear Tape Open)
- GPFS-LTFS – mehrschichtige Speicherarchitektur für große Bilddatenmengen
- Grundlagen der Bilderkennung
- Objekterkennung in Bildern
- Bildsegmentierung und -trennung
- Nachverfolgung von Bewegungsabläufen
- Dreidimensionale Rekonstruktion von Objekten anhand von Fotos
Biometrie, DNA-Analyse sowie moderne Identifikationssysteme
- Über Fingerabdrücke und Gesichtserkennung hinausgehende Methoden
- Sprecherkennung, Schlussfolgerungen aus Tastaturbenutzung oder CODIS – nationales System zur DNA-Analyse
- Nachweis von DNA-Merkmalen für die rekonstruktive Gesichtserkennung
Big Data Dashboards – zentralisiertes Zugriffsmöglichkeiten und Visualisierung:
- Integration vorhandener Softwareplattformen mit dem Big Data Dashboard
- Verwaltung großer Datenvolumina durch die Plattform
- Fallstudie: Tableau und Pentaho im praktischen Einsatz
- Nutzung von Ortsdaten für staatliche Services mithilfe der Big Data-Anwendung
- Überwachungs- und Verwaltungsmechanismen
Tag 05
Wie lässt sich die Einführung von Big Data BI in Organisationen rechtfertigen?
- Berechnung des ROI (Return on Investment) für Big Data-Projekte
- Fallstudien zu Zeitersparnis bei Datensammlung und -aufbereitung – erhöhte Produktivität der Analysten
- Einsparungen durch reduzierte Lizenzkosten für Datenbanken
- Umsatzgewinne aus geografisch orientierten Services
- Kosteneffizienz dank effektiverer Betrugsprävention
- Ausgearbeitete Tabellen zur Schätzung von Kosten sowie erwarteter finanzieller Vorteile aus Big Data-Projekten
Schritt-für-Schritt-Anleitung zum Umstieg auf ein Big Data System statt eines alten Datenmodells
- Migrationsplan für Big Data Systeme
- Welche wichtigen Informationen vor der Architekturgestaltung erforderlich sind?
- Möglichkeiten zur Quantifizierung von Volumen, Geschwindigkeit, Vielfalt und Zuverlässigkeit der Daten
- Prognose des künftigen Datenzuwachses
- Erfahrungen aus bereits realisierten Projekten
Beschreibung gängiger Big Data-Anbieter und deren Produkte.
- Accenture
- APTEAN (früher CDC Software)
- Cisco Systems
- Cloudera
- Dell
- EMC
- GoodData Corporation
- Guavus
- Hitachi Data Systems
- Hortonworks
- HP
- IBM
- Informatica
- Intel
- Jaspersoft
- Microsoft
- MongoDB (früher 10Gen)
- MU Sigma
- Netapp
- Opera Solutions
- Oracle
- Pentaho
- Platfora
- Qliktech
- Quantum
- Rackspace
- Revolution Analytics
- Salesforce
- SAP
- SAS Institute
- Sisense
- Software AG/Terracotta
- Soft10 Automation
- Splunk
- Sqrrl
- Supermicro
- Tableau Software
- Teradata
- Think Big Analytics
- Tidemark Systems
- Treeminer
- VMware (Teil von EMC)
Fragen- und Antwortesession
Voraussetzungen
- Kenntnisse über Abläufe der Strafverfolgung sowie Datenverarbeitungssysteme
- Grundverständnis von SQL/Oracle oder relationalen Datenbanken
- Grundlegende Statistikkenntnisse (auf Tabellenkalkulationsniveau)
Zielgruppe
- Fachkräfte aus dem Bereich Strafverfolgung mit technischem Hintergrund.
Erfahrungsberichte (3)
Refactoring Übung und Graph Visualisierung
Tiago Kocevar - Lang Energie AG / Osterwalder Zurich AG
Kurs - Business Intelligence and Data Analysis with Metabase
Grundlagen und hat die vorbereiteten Dokumente und Übungen geliebt
Rekha Nallam - GE Medical Systems Polska Sp. z o.o.
Kurs - Introduction to Predictive AI
Maschinelle Übersetzung
Deepthi war sehr empfänglich für meine Bedürfnisse, sie konnte erkennen, wann sie zusätzliche Komplexität hinzufügen und wann sie zurückhaltend sein und einen strukturierteren Ansatz verfolgen sollte. Deepthi hat wirklich in meinem Tempo gearbeitet und sicher gestellt, dass ich die neuen Funktionen/Tools selbstständig einsetzen kann, indem sie mir zunächst gezeigt hat, wie es geht, und mich dann selbst nachbauen ließ. Dies half enorm bei der Vertiefung des Trainings. Ich bin extrem zufrieden mit den Ergebnissen dieses Trainings und mit Deepthis Fachwissen!
Deepthi - Invest Northern Ireland
Kurs - IBM Cognos Analytics
Maschinelle Übersetzung