WhitepaperWasserSeptember 20268 minVergleichsstudie · öffentliche Daten, reproduzierbar

Anomalien in Sensordaten aus Wassersystemen erkennen: was gut eingestellte Verfahren leisten — und wo der Betrieb sie einholt

Auf zwei öffentlichen Benchmark-Datensätzen — einem Prüfstand für Wasserzirkulation und fünf Monaten Trinkwasserqualität aus dem Netzbetrieb — wurden neun Verfahren der automatischen Anomalieerkennung unter identischen Bedingungen verglichen. Drei Ergebnisse tragen das Papier: Ein lineares Verfahren mit kurzem Zeitfenster übertrifft am Prüfstand das bislang beste veröffentlichte Ergebnis eines neuronalen Netzes; dokumentierte Störfälle aus der Vergangenheit heben die Erkennungsquote im Trinkwasser von 7 auf 11 von 12 Ereignissen; und einmal eingestellte Schwellen verlieren innerhalb weniger Wochen an Wirkung, weil Sensoren driften.

WasserwirtschaftAnomalieerkennungSensor-MonitoringBenchmarkDrift von Schwellen quantifiziertStörfalldokumentation
01

Ausgangslage: viele Sensoren, eine Frage

Wasseraufbereitungs- und Wasserverteilsysteme werden heute durchgängig mit Sensoren überwacht. Leitfähigkeit, pH-Wert, Trübung, Temperatur, Druck und Durchfluss werden im Minuten- oder Sekundentakt aufgezeichnet. Die Frage, die sich daraus ergibt, ist, ob sich aus diesen Datenströmen automatisch und verlässlich erkennen lässt, wann ein System vom Normalbetrieb abweicht — durch eine Störung, einen Sensorfehler oder eine Veränderung der Wasserqualität.

Grundprinzip der Anomalieerkennung vom Sensor zum Alarm
SENSORDATENLeitfähigkeitpHTrübungTemperaturDruckDurchflussNormalmodellaus Normalbetrieb gelerntAbweichungsmaßje Wert oder FensterSchwellefest oder mitlaufendAlarmBetrieb prüftPunktverfahren: ein Messwert zur ZeitZeitfensterverfahren: die letzten Sekunden bis Minuten gemeinsam
Abb. 1 — Alle Verfahren folgen demselben Muster. Aus Daten des Normalbetriebs wird gelernt, was „normal“ ist. Für jeden neuen Messwert wird ein Abweichungsmaß berechnet und mit einer Schwelle verglichen. Die Verfahren unterscheiden sich darin, wie das Normalmodell aussieht — und ob sie einzelne Messwerte oder kurze Zeitfenster betrachten.

Die Verfahren dafür reichen von einfachen statistischen Grenzwerten, wie sie in vielen Leitsystemen bereits vorhanden sind, bis zu neuronalen Netzen. Welche davon in der Praxis den Unterschied machen, ist aus veröffentlichten Vergleichen oft nicht ablesbar: Aufwendige Verfahren werden dort meist sorgfältiger eingestellt als die einfachen, und die Bewertung erfolgt nicht selten auf denselben Daten, mit denen auch eingestellt wurde.

02

Fragestellung

Die Studie sollte zwei Fragen beantworten:

  • Wie viel Verbesserung bringen aufwendigere Verfahren gegenüber einfachen Standardmethoden, wenn beide gleich sorgfältig eingestellt und auf getrennten Daten bewertet werden?
  • Welche praktischen Hürden treten beim Übergang von historischen Daten in den laufenden Betrieb auf — und was ist dagegen wirksam?
03

Datengrundlage: zwei Situationen, zwei Datensätze

Verwendet wurden zwei öffentlich verfügbare Datensätze, die unterschiedliche Anwendungssituationen abbilden.

Datensatz A — Prüfstand für Wasserzirkulation (SKAB). Ein Laborsystem mit Pumpe, Ventilen und acht Sensoren für Vibration, Strom, Druck, Temperatur und Durchfluss. In 34 Versuchen wurden gezielt Störungen herbeigeführt, etwa teilweise geschlossene Ventile oder reduzierte Pumpenleistung. Die Störzeiträume sind exakt dokumentiert. Dieser Datensatz steht für maschinennahe Überwachung mit wenigen Trainingsdaten je Versuch.

Datensatz B — Trinkwasserqualität eines Fernwasserversorgers (GECCO 2019). Fünf Monate Messdaten im Minutentakt aus dem realen Netzbetrieb: Temperatur, pH, Leitfähigkeit, Trübung, spektraler Absorptionskoeffizient und Durchfluss. Ereignisse mit auffälliger Wasserqualität wurden vom Betreiber markiert. Sie sind selten — weniger als ein Prozent der Zeit — und dauern typischerweise 15 bis 20 Minuten. Dieser Datensatz steht für die Langzeitüberwachung von Wasserchemie im laufenden Betrieb.

Die beiden Datensätze im Vergleich Zeitraum, Sensoren und Anteil gestörter Zeit
APrüfstand für WasserzirkulationSKAB · 34 Versuche · je 12–22 Minuten · Sekundentakt8 Sensoren: Vibration, Strom, Druck, Temperatur, Durchflussgestört54 %54 % der Bewertungszeit gestörtBTrinkwasserqualität im NetzbetriebGECCO 2019 · 5 Monate · Juli–November 2017 · Minutentakt6 Sensoren: Temperatur, pH, Leitfähigkeit, Trübung, Absorption, Durchflussgestört0,6 %0,6 % der Zeit, 12 Ereignisse à ~16 mingestört / EreignisMesswertverlauf (schematisch)
Abb. 2 — Zwei sehr unterschiedliche Aufgaben. Am Prüfstand ist über die Hälfte der Bewertungszeit gestört und jede Störung dauert Minuten; im Trinkwassernetz sind Ereignisse selten, kurz und in eine über Monate driftende Messreihe eingebettet. Ein Verfahren, das für die eine Situation gut ist, muss es für die andere nicht sein.
04

Vorgehen: gleicher Aufwand, getrennte Bewertung

Verglichen wurden neun Verfahren, die ohne Kenntnis der Störereignisse arbeiten und lediglich aus Daten des Normalbetriebs lernen. Für den Trinkwasserdatensatz kamen zwei Verfahren hinzu, die die markierten Ereignisse der Vergangenheit zum Lernen nutzen dürfen. Damit lässt sich beziffern, welchen Wert dokumentierte Störfälle für die Erkennungsleistung haben.

Drei Regeln für einen fairen Vergleich

  • Strikte Trennung von Einstellung und Bewertung. Jedes Verfahren wurde auf einem Teil der Daten eingestellt und auf einem davon getrennten, zeitlich späteren Teil bewertet. Die Bewertungsdaten wurden zu keinem Zeitpunkt zur Einstellung verwendet.
  • Gleicher Aufwand für alle Verfahren. Jedes Verfahren, auch das einfachste, erhielt denselben Umfang an automatischer Parameteroptimierung — 40 Durchläufe. Ohne diese Regel schneiden aufwendige Verfahren oft nur deshalb besser ab, weil sie sorgfältiger eingestellt wurden.
  • Mehrere Kennzahlen statt einer. Neben der üblichen Gesamtkennzahl (F1-Wert, der Treffergenauigkeit und Vollständigkeit kombiniert; 1,0 wäre perfekt) wurden Fehlalarmrate, Rate verpasster Störungen, Anteil erkannter Ereignisse und Zahl der Fehlalarmphasen ausgewiesen. Jedes Ergebnis wurde dreimal mit unterschiedlichen Zufallsstartwerten wiederholt.
Zeitliche Trennung im Trinkwasserdatensatz so, wie es im Betrieb wäre
TRINKWASSER · 2017Einstellen13 EreignisseVerfahren lernen „normal“Prüfen12 EreignisseAuswahl & SchwelleBewerten12 Ereignisseberichtete ZahlenJulAugSepOktNovInformationen fließen nur vorwärts — kein Blick in die Zukunft, keine Bewertungsdaten in der EinstellungPRÜFSTAND · 34 VERSUCHE10 Versuche zur Einstellung24 Versuche zur Bewertung
Abb. 3 — Einstellen, prüfen, bewerten: immer nur vorwärts in der Zeit. Die Verfahren lernen auf dem Sommer, werden im Oktober verglichen und eingestellt und im November bewertet. Am Prüfstand wurde analog verfahren: 10 der 34 Versuche dienten der Einstellung, die übrigen 24 der Bewertung.
05

Ergebnisse am Prüfstand: Zeitkontext schlägt Modellkomplexität

Alle Verfahren erkennen die herbeigeführten Störungen grundsätzlich. Die einfachen Grenzwertverfahren erreichen einen F1-Wert von rund 0,75 bis 0,77. Das beste Verfahren — eine lineare Methode, die statt einzelner Messwerte kurze Zeitfenster von wenigen Sekunden betrachtet — erreicht 0,81 und liegt damit über dem bislang besten veröffentlichten Ergebnis für diesen Datensatz, einem neuronalen Netz mit 0,78. Ein ebenfalls getestetes neuronales Netz auf denselben Zeitfenstern erreichte 0,77.

Erkennungsleistung am Prüfstand F1-Wert auf den 24 Bewertungsversuchen
0,000,250,500,751,00Zeitfensterverfahren, linear0,81Nächste-Nachbarn-Abstand0,77Hauptkomponenten-Rekonstruktion0,77Zeitfenster-Autoencoder (neuronal)0,77Mahalanobis-Abstand0,76Ein-Klassen-SVM0,76Isolation Forest0,75Grenzwert je Sensor (z-Score)0,75Zufall0,57Dauer-Alarm 0,70beste Publikation 0,78F1-Wert (1,0 = perfekt), 24 Bewertungsversuche, Mittel aus 3 Wiederholungen
Abb. 4 — Der Abstand zum Dauer-Alarm zählt. Weil die Bewertungsabschnitte zu über der Hälfte gestört sind, erreicht ein System, das ständig Alarm gibt, bereits 0,70. Die Punktverfahren liegen nur knapp darüber; erst das Zeitfensterverfahren setzt sich deutlich ab. Die gestrichelte Linie markiert das bislang beste veröffentlichte Ergebnis.
Befund

Der Gewinn entsteht durch die Betrachtung des zeitlichen Verlaufs, nicht durch die Komplexität des Modells. Ein lineares Verfahren mit Zeitkontext ist einem neuronalen Netz hier ebenbürtig oder überlegen — bei deutlich geringerem Rechen- und Wartungsaufwand.

Zwei Einschränkungen des Datensatzes selbst: Der hohe Störanteil macht den F1-Wert wenig trennscharf; Fehlalarmrate und Rate verpasster Störungen unterscheiden die Verfahren deutlicher. Und eine der 34 Versuchsdateien enthält bereits im als „normal“ definierten Trainingsabschnitt Störungen — auf ihr versagen erwartungsgemäß alle Verfahren.

06

Ergebnisse im Trinkwassernetz: der Wert von Labels und das Problem der Drift

Dieser Datensatz ist deutlich anspruchsvoller, weil die Ereignisse selten und kurz sind und die Messwerte über Monate driften. Ohne Nutzung markierter Ereignisse erkannte das beste Verfahren im Bewertungsmonat 7 der 12 Ereignisse. Die einfachen Grenzwertverfahren erkannten nur 2 bis 4 Ereignisse, allerdings nahezu ohne Fehlalarme. Mit Nutzung der markierten Ereignisse aus der Vergangenheit erkannte das beste Verfahren 11 der 12 Ereignisse. Die Erkennung stützt sich dabei vor allem auf kurzfristige Abweichungen der Trübung und des Absorptionskoeffizienten vom jeweiligen lokalen Niveau.

Erkannte Ereignisse im Bewertungsmonat 12 markierte Ereignisse, November 2017
Erkannte Ereignisse (von 12)Fehlalarmphasen im MonatGrenzwert je Sensorohne Labels20Hauptkomponenten-Rekonstruktionohne Labels40Nächste-Nachbarn-Abstandohne Labels712Logistische Regressionmit Labels83Gradient Boostingmit Labels1113
Abb. 5 — Von 2 auf 11 erkannte Ereignisse. Jeder Punkt ist eines der zwölf Ereignisse. Verfahren ohne Ereigniswissen erkennen bis zu sieben; das lernende Verfahren mit dokumentierten Störfällen elf. Die Gegenrechnung steht rechts: Fehlalarmphasen im Monat, die im Betrieb jeweils eine Prüfung auslösen würden.

Einstellungen veralten

Alle Verfahren schnitten im Bewertungsmonat schlechter ab als im Einstellmonat davor, teilweise deutlich. Zwei Verfahren, die auf absoluten Messwerten statt auf Abweichungen vom lokalen Niveau arbeiteten, fielen im Bewertungsmonat vollständig aus, weil eine Niveauverschiebung zu Daueralarm führte. Ein einzelner Kalibrierungszeitraum reicht für die Auswahl und Einstellung eines Verfahrens nicht aus.

Einstellmonat gegen Bewertungsmonat F1-Wert, ein Monat später
0,000,250,500,751,00Gradient Boosting (mit Labels)0,830,58Logistische Regression (mit Labels)0,740,48Nächste-Nachbarn-Abstand0,590,45Hauptkomponenten-Rekonstruktion0,560,38Grenzwert je Sensor0,440,28Ein-Klassen-SVM (absolute Werte)0,510,17Zeitfensterverfahren (absolute Werte)0,510,01Einstellmonat (Oktober)Bewertungsmonat (November)Ausfall durch Niveauverschiebung
Abb. 6 — Der Monat danach. Jede Linie verbindet die Leistung im Einstellmonat (Oktober, heller Punkt) mit der im Bewertungsmonat (November, dunkler Punkt). Alle Verfahren verlieren; zwei Verfahren auf absoluten Messwerten fallen auf nahe null.

Mitlaufende Schwellen helfen nur bedingt

Als Gegenmaßnahme wurde eine Alarmschwelle getestet, die sich fortlaufend aus den Daten der vergangenen ein bis zwei Wochen ableitet — ohne Kenntnis von Ereignissen und ohne Blick in die Zukunft. Sie verhinderte den Totalausfall der betroffenen Verfahren zuverlässig, verschlechterte aber bei anderen Verfahren die Erkennungsleistung. Es handelt sich um eine Maßnahme für Robustheit, nicht für bessere Erkennung.

Feste gegen mitlaufende Schwelle F1-Wert im Bewertungsmonat
0,000,250,50Zeitfensterverfahren0,010,36+0,35Hauptkomponenten-Rekonstruktion0,380,43+0,05Grenzwert je Sensor0,280,33+0,05Zeitfenster-Autoencoder0,320,16−0,16Nächste-Nachbarn-Abstand0,450,31−0,14feste Schwelle aus der Historiemitlaufend, verbessertmitlaufend, verschlechtert
Abb. 7 — Robuster, nicht besser. Die mitlaufende Schwelle behebt den Ausfall des Zeitfensterverfahrens und verbessert die einfachen Verfahren leicht; das bislang beste Verfahren ohne Labels verliert dagegen. Für den Betrieb wiegt der vermiedene Totalausfall schwerer als der Mittelwert.
2 → 7 → 11
erkannte Ereignisse von 12: Grenzwert · bestes Verfahren ohne Labels · mit Labels
−0,18
typischer F1-Verlust vom Einstell- zum Bewertungsmonat
1–4 h
Fenster für das lokale Niveau, gegen das Abweichungen gemessen werden
07

Belastbarkeit und Grenzen

Die Ergebnisse sind methodisch belastbar in dem Sinn, dass keine Bewertungsdaten in die Einstellung eingeflossen sind, alle Verfahren gleich behandelt wurden und die Rangfolge über drei Wiederholungen stabil ist. Sie sind in ihrer Aussagekraft dennoch begrenzt.

  • Der Trinkwasserdatensatz enthält im Bewertungszeitraum nur 12 Ereignisse. Unterschiede von wenigen Hundertstel im F1-Wert können nicht als gesichert gelten.
  • Am Prüfstand stehen je Versuch nur wenige Minuten Normalbetrieb zum Lernen zur Verfügung; die Schwellenregel kompensiert das nur näherungsweise.
  • Die Verfahren wurden mit begrenzter Rechenkapazität umgesetzt. Aufwendigere neuronale Architekturen mit Faltung oder Rekurrenz wurden nicht getestet.
  • Beide Datensätze sind öffentliche Benchmarks. Die Übertragung auf eine konkrete Anlage erfordert eigene Daten und eigene Ereignisdokumentation.
VerfahrenPrüfstand (A)Trinkwasser (B) ohne LabelsTrinkwasser (B) mit Labels
Einfaches Grenzwertverfahren0,750,282 von 12 Ereignissen
Bestes Verfahren0,81lineares Zeitfensterverfahren0,457 von 12 Ereignissen0,5811 von 12 Ereignissen
Bislang veröffentlichte Bestleistung0,78neuronales Netz
08

Schlussfolgerungen

  • Einfache Verfahren sind ein solider Ausgangspunkt, aber kein Endpunkt. Bei sorgfältiger Einstellung erreichen sie eine brauchbare Grundleistung mit wenigen Fehlalarmen. Sie verpassen jedoch einen erheblichen Teil kurzer Ereignisse in driftenden Messreihen.
  • Zeitlicher Kontext ist der wirksamste Hebel. Die Auswertung kurzer Zeitfenster und die Betrachtung von Abweichungen vom lokalen Niveau bringen mehr als komplexere Modellklassen. Beide Maßnahmen sind mit geringem Aufwand umsetzbar und erklärbar.
  • Dokumentierte Störfälle haben einen messbaren Wert. Die Zahl der erkannten Ereignisse stieg von 7 auf 11 von 12, sobald markierte Ereignisse der Vergangenheit zum Lernen genutzt wurden. Die systematische Erfassung von Störungen im Betrieb ist damit eine direkte Investition in die spätere Erkennungsleistung.
  • Der Betrieb erfordert laufende Nachkalibrierung. Einmalig eingestellte Schwellen und Modelle verlieren innerhalb weniger Wochen an Wirkung. Ein Erkennungssystem muss von Anfang an mit einem Prozess für regelmäßige Überprüfung und Anpassung geplant werden.
Kurzfassung

Nicht das aufwendigste Modell entscheidet, sondern Zeitkontext, dokumentierte Ereignisse und ein Prozess für die Nachkalibrierung.

09

Nächste Schritte

Sofort

Ereignisprotokoll im Betrieb einführen

Zeitpunkt, Art und Ursache jeder Störung erfassen. Das schafft die Grundlage für lernende Verfahren und ist die einzige Maßnahme, die sich nicht nachholen lässt.

1–2 Monate

Vorgehen auf eigene Betriebsdaten übertragen

Mindestens sechs Monate Historie mit dokumentierten Ereignissen, gleiche Trennung von Einstellung und Bewertung, gleiche Kennzahlen.

Parallel

Zielwerte mit den Anwendern festlegen

Fehlalarmrate und Erkennungsquote müssen gegeneinander abgewogen werden. Welche Zahl an Prüfungen pro Woche ist tragbar, welche verpasste Störung nicht?

3–6 Monate

Pilotbetrieb parallel zur bestehenden Überwachung

Ein Verfahren mit Zeitkontext und mitlaufender Schwelle über mehrere Monate mitlaufen lassen, Nachkalibrierung monatlich prüfen, danach über die Einführung entscheiden.

Fragen zu diesem Beitrag: [email protected]← Alle Case Studies