Stackable Docs Hub

Stackable

Stackable

Machine Learning zur Ausreißererkennung

Demo · spark-anomaly-detection

Machine Learning zur Ausreißererkennung

Unüberwachte Ausreißererkennung auf New Yorker Taxidaten: Apache Spark trainiert einen Isolation Forest, die Ergebnisse landen in Apache Iceberg und Superset visualisiert die Anomalien.

SO GEHT'S LOS

Mit einem Kubernetes-Cluster genügt ein einziger Befehl:

$stackablectl demo install spark-anomaly-detection

Funktionen

Was diese Demo zeigt

Unüberwachtes ML

Ein Isolation Forest braucht keine gelabelten Daten, um Ausreißer zu finden.

Iceberg-Ergebnisspeicher

Vorhersagen werden als offene Iceberg-Tabelle persistiert.

Reproduzierbar

Feste Images und deklarative Jobs machen Läufe wiederholbar.

Verteiltes Training

Spark skaliert den Trainingsjob über den Cluster.

Visuelle Prüfung

Superset stellt die markierten Ausreißer zur Inspektion dar.

Erweiterbar

Tausche mit wenig Aufwand dein eigenes Modell oder deinen Datensatz ein.

Demo-Komponenten

Der Stack im Detail

Apache Spark

ML-Compute

Trainiert das Isolation-Forest-Modell als verteilten Spark-Job.

Apache Iceberg

Ergebnisspeicher

Speichert die Modellvorhersagen als offene, abfragbare Tabelle.

Apache Superset

Visualisierung

Visualisiert die markierten Anomalien gegenüber den Rohfahrten.

MinIO

Data Lake

S3-kompatibler Objektspeicher, der den Taxi-Datensatz hält.

Demo-Ablauf

Von Rohdaten zu markierten Ausreißern

1

Installation

Ein Befehl installiert Spark, Iceberg-gestützten Speicher und Superset.

2

Taxidaten laden

Die Demo lädt den New Yorker Taxi-Datensatz in den Lake.

3

Spark-Job ausführen

Trainiere den Isolation Forest als verteilten Spark-Job.

4

In Iceberg schreiben

Persistiere die Anomalie-Vorhersagen in einer Iceberg-Tabelle.

5

Anomalien erkunden

Inspiziere die markierten Ausreißer im Superset-Dashboard.

Bereit, es selbst auszuprobieren?

Fahre eine vollständige ML-Batch-Pipeline auf der Plattform, vom Training bis zum Dashboard.