Kontakt aufnehmen

Schulungsübersicht

Tag 01

Einführung in Big Data Business Intelligence für die kriminalistische Analyse

  • Fallbeispiele aus der Strafverfolgung – prädiktive Polizeiarbeit
  • Adoptionsquote von Big Data bei Behörden und deren zukünftige Ausrichtung auf prädiktive Analysen
  • Neue Technologien wie Schussdetektoren, Überwachungsvideos sowie Social Media
  • Einsatz von Big Data-Technologien zur Reduzierung der Informationsflut
  • Kombination von Big Data mit Bestandsdaten
  • Grundverständnis prädiktiver Analyse-Technologien
  • Datenintegration sowie Darstellung via Dashboards
  • Betrugserkennung und -verwaltung<\/li>
  • Geschäftsregeln zur Betrugsaufdeckung
  • Erkennung und Profilierung von Bedrohungen
  • Kosten-Nutzen-Analyse bei der Implementierung von Big Data

Einführung in Big Data

  • Wesentliche Merkmale: Volumen, Vielfalt, Geschwindigkeit und Zuverlässigkeit
  • MPS-Architektur (Massively Parallel Processing)
  • Datenwarenhäuser – statisches Schema, langsam verändernde Datensätze
  • MPP-Datenbanken: Greenplum, Exadata, Teradata, Netezza, Vertica etc.
  • Hadoop-basierte Lösungen – keine Voraussetzung hinsichtlich der Datenstruktur
  • Typisches Schema: HDFS, MapReduce, Datenabruf aus HDFS
  • Apache Spark für Echtzeit-Datenverarbeitung
  • Bulk-Verarbeitung eignet sich ideal für analytische Zwecke und nicht-interaktive Aufgaben
  • Volumen: Ereignisdatenfluss in Echtzeit
  • Gängige Auswahl – CEP-Produkte (z. B. Infostreams, Apama, MarkLogic)
  • Weniger einsatzfertig – Storm/S4
  • NoSQL-Datenbanken – spaltenbasiert und schlüssel-Wert: Ideal als Ergänzung zu herkömmlichen Datenbanksystemen

NoSQL-Lösungen

  • Schlüssel-Wert-Speicher: Keyspace, Flare, SchemaFree, RAMCloud, Oracle NoSQL Database (OnDB)
  • Schlüssel-Wert-Speicher: Dynamo, Voldemort, Dynomite, SubRecord, Mo8onDb, DovetailDB
  • Hierarchische Schlüssel-Wert-Speicher: GT.m, Cache
  • Geordnete Schlüssel-Wwert-Speicher: TokyoTyrant, Lightcloud, NMDB, Luxio, MemcacheDB, Actord
  • Schlüssel-Cache: Memcached, Repcached, Coherence, Infinispan, EXtremeScale, JBossCache, Velocity, Terracoqua
  • Tupel-Speicher: Gigaspaces, Coord, Apache River
  • Objektdatenbanken: ZopeDB, DB40, Shoal
  • Dokumentenspeicher: CouchDB, Cloudant, Couchbase, MongoDB, Jackrabbit, XML-Datenbanken, ThruDB, CloudKit, Prsevere, Riak-Basho, Scalaris
  • Weitflächige Spaltenbasierte Speicher: BigTable, HBase, Apache Cassandra, Hypertable, KAI, OpenNeptune, Qbase, KDI

Datenvielfalt – Einführung in Probleme bei der Datenbereinigung

  • RDBMS – statisches Schema verhindert agiles und exploratives Arbeiten
  • NoSQL – semi-strukturierte Daten: ausreichend Struktur für die Speicherung, auch ohne festes Schema vorab
  • Typische Probleme bei der Datenbereinigung

Hadoop

  • Wann ist Hadoop die richtige Wahl?
  • STRUKTURIERTE Daten – Enterprise-Datenwarenhäuser können große Mengen speichern, erfordern aber ein festes Schema (ungeeignet für freie Exploration)
  • SEMI-STRUKTURierte Daten – traditionelle Lösungen wie DW/DB haben hier Schwierigkeiten
  • Datenspeicherung im Data Warehouse = enormer Aufwand und starre Strukturen nach Implementierung
  • Für Vielfalt und große Mengen ist Hadoop ideal, auch auf Standard-Hardware einzusetzen
  • Zur Bildung eines Hadoop-Clusters werden günstige Server erforderlich

Einführung in MapReduce/HDFS

  • MapReduce verteilt Berechnungen auf mehrere Rechner
  • HDFS stellt Daten lokal bereit (inkl. Redundanz)
  • Daten können unstrukturiert sein – im Gegensatz zu RDBMS
  • Programmierer müssen die Bedeutung der Daten selbst erschließen
  • MapReduce-Entwicklung erfolgt mit Java; manuelles Hochladen in HDFS notwendig

Tag 02

Big Data-Ökosystem – Aufbau von ETL-Prozessen (Extraktion, Transformation, Laden). Welche Tools wann zu nutzen sind?

  • Hadoop im Vergleich zu anderen NoSQL-Lösungen
  • Einsatz für interaktiven Zugriff auf Daten in Echtzeit
  • HBase – spaltenbasierte Datenbank oberhalb von Hadoop
  • Zwar beliebiger Datenzugriff, aber mit Einschränkung bis 1 Petabyte verfügbar
  • Nicht ideal für Ad-hoc-Analysen; eher geeignet für Log-Recording und Zeitreihenverarbeitung
  • Sqoop – Import aus Datenbanken nach Hive oder HDFS (über JDBC/ODBC)
  • Flume überträgt kontinuierlich Datenflüsse in HDFS, etwa Protokolldaten

Verwaltungssysteme für Big Data

  • Rechnerknoten werden hinzugefügt bzw. entfallen – ZooKeeper regelt Konfiguration und Koordination
  • Komplexe Verarbeitungsabläufe: Oozie sorgt für Workflow-Planung, Abhängigkeiten sowie Sequenzierung
  • Bereitstellung, Einrichtung, Cluster-Verwaltung, Updates – Ambari unterstützt Admins dabei
  • In der Cloud ist Whirr eine praktische Wahl

Prädiktive Analytik – Grundlagen und maschinenbasierte Methoden

  • Einführung in das Maschinelle Lernen
  • Lernverfahren zur Klassifizierung von Mustern
  • Bayesian Prediction: Erstellung einer Trainingsdatei
  • Support Vector Machine
  • KNN p-Tree Algebra sowie vertikale Datendurchsuchung
  • Neuronale Netzwerke<\/li>
  • Bei komplexen Variablen in großen Datensätzen hilft Random Forest (RF)
  • Für automatisierte Big Data-Analysen: Multi-Modell-Ensemble RF
  • Automatisierung mithilfe von Soft10-M
  • Textanalyse-Werkzeug: Treeminer
  • Agresives Lernen
  • Lernverfahren basierend auf Agenden
  • Verteilte Lernprozesse
  • Einführung in frei verfügbare Werkzeuge für prädiktive Analytik: R, Python, Rapidminer, Mahut

Ökosystem der prädiktiven Analytik – Nutzung im kriminalistischen Kontext

  • Technologie und Ermittlungsprozesse
  • Einsichtbasierte Analyseverfahren
  • Datenvisualisierung in der Analyse
  • Gestrukturte prädiktive Analytik
  • Unstrukturierte Formen der prädiktiven Analyse
  • Profilbildung von Bedrohungen, Betrügern oder Lieferanten
  • Empfehlungsmechanismen
  • Mustererkennung
  • Auffinden von Regeln bzw. Szenarien – etwa bei Fehlern, Betrug oder Optimierungen
  • Ausfindigmachen der Hauptursachen für Probleme
  • Stimmungsanalyse
  • Analyse von CRM-Daten
  • Netzwerkanalytik
  • Auswertung von Texten – Transkripte, Zeugenaussagen oder Internetkommunikation mit Treeminer
  • Technologieunterstützte Dokumentenprüfung<\/li>
  • Betrugsanalyse
  • Echtzeitanalytik

Tag 03

Echtzeit- und skalierbare Analyse mittels Hadoop

  • Gründe, warum klassische Algorithmen in Hadoop/HDFS scheitern
  • Apache Hama – für asynchrones Massenparallelrechnen
  • Apache Spark – optimiert für Clusterberechnungen und Echtzeitanalyse
  • CMU Graphics Lab2 – asynchrone Verarbeitung graphbasiert auf verteilten Rechenressourcen
  • KNN p: Algebraische Methode aus Treeminer zur Reduzierung von Hardwareaufwand

Tools für eDiscovery und forensische Analyse

  • Vergleich Kosten und Leistung bei Big Data vs. herkömmlichen Datenmethoden
  • Predictive Coding und technologiegestützte Dokumentensuche (TAR)
  • Echtzeit-Demo von vMiner – zeigt, wie TAR schnellere Analyseermöglicht
  • Schnelleres Indizieren mittels HDFS durch hohes Datenaufkommen
  • NLP – verfügbare Open-Source-Technologien zur Sprachverarbeitung<\/li>
  • Verarbeitung von Fremdsprachen in eDiscovery-Prozessen

Big Data BI für Cybersicherheit: ganzheitliche Übersicht, schnelle Datenerfassung sowie Bedrohungserkennung

  • Einführung in Grundlagen der Sicherheitsanalytik – Angriffsflächen, Fehlkonfigurationen oder Schutzmechanismen am Host
  • Netzwerkinfrastruktur und Echtzeit-ETL für schnelle Analysen
  • Präskriptive vs. prädiktive Ansätze – festgelegte Regeln im Kontrast zur automatischen Erkennung von Bedrohungsmustern durch Metadaten

Erfassung diverser Datenquellen für die kriminalistische Analyse

  • Verwendung des Internet der Dinge als Sensoren zur Datenerfassung
  • Nutzung von Satellitenbildern für landesweite Überwachung
  • Bild- und Videoanalysen im Rahmen der Personenidentifikation
  • Weitere Technologien – Drohnen, Bodycams, GPS-Tagging sowie Wärmebildkameras
  • Automatisierte Datenerhebung kombiniert mit Informationen von Informanten oder Ermittlungsberichten
  • Vorhersage von Kriminalitätstrends

Tag 04

Betrugsprävention mithilfe von Big Data BI und Analytik

  • Klassifikation der Betrugsanalyse: Regelbasiert vs. prädiktiv
  • Lernverfahren – überwachtes versus unüberwachtes maschinelles Lernen zur Mustererkennung im Betrugsspektrum
  • B2B-Betrügereien, Fälschungen medizinischer Rechnungen, Versicherungsbetrug, Steuerhinterziehung sowie Geldwäsche

Social Media Analytics – Informationssammlung und -auswertung

  • Nutzung von Social Media durch Kriminelle zur Organisation, Rekrutierung oder Planung
  • Big Data ETL-APIs zur Extraktion sozialer Netzwerkdaten
  • Auswertung von Texten, Bildern, Metadaten sowie Videos
  • Sentimentanalyse von Beiträgen in Social Networks
  • Kontextabhängige und kontextunabhängige Filterungsverfahren
  • Social Media-Dashboards zur Sammlung vielfältiger Plattformen
  • Automatisierte Profilanalyse aus sozialen Netzwerken
  • Für alle Analysebereiche erfolgt Live-Demonstration mit Treeminer-Tool

Big Data Analytics bei Bild- und Videoverarbeitung

  • Speichermethoden im Bereich Big Data – Lösungen für Petabyte-Datensätze
  • LTFS (Linear Tape File System) sowie LTO (Linear Tape Open)
  • GPFS-LTFS – mehrschichtige Speicherarchitektur für große Bilddatenmengen
  • Grundlagen der Bilderkennung
  • Objekterkennung in Bildern
  • Bildsegmentierung und -trennung
  • Nachverfolgung von Bewegungsabläufen
  • Dreidimensionale Rekonstruktion von Objekten anhand von Fotos

Biometrie, DNA-Analyse sowie moderne Identifikationssysteme

  • Über Fingerabdrücke und Gesichtserkennung hinausgehende Methoden
  • Sprecherkennung, Schlussfolgerungen aus Tastaturbenutzung oder CODIS – nationales System zur DNA-Analyse
  • Nachweis von DNA-Merkmalen für die rekonstruktive Gesichtserkennung

Big Data Dashboards – zentralisiertes Zugriffsmöglichkeiten und Visualisierung:

  • Integration vorhandener Softwareplattformen mit dem Big Data Dashboard
  • Verwaltung großer Datenvolumina durch die Plattform
  • Fallstudie: Tableau und Pentaho im praktischen Einsatz
  • Nutzung von Ortsdaten für staatliche Services mithilfe der Big Data-Anwendung
  • Überwachungs- und Verwaltungsmechanismen

Tag 05

Wie lässt sich die Einführung von Big Data BI in Organisationen rechtfertigen?

  • Berechnung des ROI (Return on Investment) für Big Data-Projekte
  • Fallstudien zu Zeitersparnis bei Datensammlung und -aufbereitung – erhöhte Produktivität der Analysten
  • Einsparungen durch reduzierte Lizenzkosten für Datenbanken
  • Umsatzgewinne aus geografisch orientierten Services
  • Kosteneffizienz dank effektiverer Betrugsprävention
  • Ausgearbeitete Tabellen zur Schätzung von Kosten sowie erwarteter finanzieller Vorteile aus Big Data-Projekten

Schritt-für-Schritt-Anleitung zum Umstieg auf ein Big Data System statt eines alten Datenmodells

  • Migrationsplan für Big Data Systeme
  • Welche wichtigen Informationen vor der Architekturgestaltung erforderlich sind?
  • Möglichkeiten zur Quantifizierung von Volumen, Geschwindigkeit, Vielfalt und Zuverlässigkeit der Daten
  • Prognose des künftigen Datenzuwachses
  • Erfahrungen aus bereits realisierten Projekten

Beschreibung gängiger Big Data-Anbieter und deren Produkte.

  • Accenture
  • APTEAN (früher CDC Software)
  • Cisco Systems
  • Cloudera
  • Dell
  • EMC
  • GoodData Corporation
  • Guavus
  • Hitachi Data Systems
  • Hortonworks
  • HP
  • IBM
  • Informatica
  • Intel
  • Jaspersoft
  • Microsoft
  • MongoDB (früher 10Gen)
  • MU Sigma
  • Netapp
  • Opera Solutions
  • Oracle
  • Pentaho
  • Platfora
  • Qliktech
  • Quantum
  • Rackspace
  • Revolution Analytics
  • Salesforce
  • SAP
  • SAS Institute
  • Sisense
  • Software AG/Terracotta
  • Soft10 Automation
  • Splunk
  • Sqrrl
  • Supermicro
  • Tableau Software
  • Teradata
  • Think Big Analytics
  • Tidemark Systems
  • Treeminer
  • VMware (Teil von EMC)

Fragen- und Antwortesession

Voraussetzungen

  • Kenntnisse über Abläufe der Strafverfolgung sowie Datenverarbeitungssysteme
  • Grundverständnis von SQL/Oracle oder relationalen Datenbanken
  • Grundlegende Statistikkenntnisse (auf Tabellenkalkulationsniveau)

Zielgruppe

  • Fachkräfte aus dem Bereich Strafverfolgung mit technischem Hintergrund.
 35 Stunden

Teilnehmerzahl


Preis je Teilnehmer (exkl. USt)

Erfahrungsberichte (3)

Kommende Kurse

Verwandte Kategorien