Lücken und fehlerhafte Werte in SCADA-Daten: was vor der Modellierung zu tun ist
Zeitstempel, Lücken, eingefrorene Sensoren, physikalisch unmögliche Werte, Abregelung und Wartungszeiten, Sensortausch: was in SCADA-Daten vor einem Modell für vorausschauende Wartung oder Leistungsprognose zu prüfen ist.
In Projekten zur vorausschauenden Wartung und Leistungsprognose fließt die meiste Zeit in die Daten, nicht in das Modell. SCADA-Systeme sind für den Betrieb gebaut, nicht für die Analyse: Daten werden meist als 10-Minuten-Mittelwerte gespeichert, Kommunikationsausfälle hinterlassen Lücken, und Sensortausch oder Neukalibrierung hinterlassen in den Daten keine Spur. Ein Modell, das vor der Bereinigung trainiert wird, lernt Datenfehler statt Ausfälle.
Die folgenden Prüfungen führen wir zu Beginn jedes Projekts mit Daten von Windparks und rotierenden Anlagen durch.
1. Zeitstempel
Die erste Frage ist, zu welcher Zeitzone ein Zeitstempel gehört und ob er den Anfang oder das Ende des Mittelungsintervalls markiert. In Daten mit Ortszeit erscheint bei der Zeitumstellung eine Stunde doppelt oder gar nicht. Daten aus verschiedenen Systemen (SCADA, Alarmprotokoll, Wartungsaufträge) sollten vor dem Zusammenführen alle in UTC umgerechnet werden.
2. Lücken
Ein Kommunikationsausfall löscht Daten; manche Systeme füllen die Lücke mit Nullen oder dem letzten Wert. Ein mit Nullen gefüllter Leistungswert bedeutet für das Modell „die Anlage hat nichts erzeugt“. Eine Lücke sollte eine Lücke bleiben, und die Abdeckung sollte je Kanal ausgewiesen werden.
3. Eingefrorene Werte
Ein defekter oder getrennter Sensor kann stundenlang denselben Wert wiederholen. Werte, die sich über einen bestimmten Zeitraum überhaupt nicht ändern, sollten markiert werden. Das ist vor allem bei Temperatur- und Schwingungskanälen wichtig: Eine eingefrorene Temperatur verdeckt eine echte Erwärmung.
4. Physikalisch unmögliche Werte
Eine negative Windgeschwindigkeit, eine Richtung über 360 Grad, eine Leistung weit über der Nennleistung oder eine Lagertemperatur unter der Umgebungstemperatur sind Datenfehler. Für jeden Kanal sollten physikalische Unter- und Obergrenzen definiert und Überschreitungen markiert werden.
5. Abregelung, Wartung und Störungen
Ein Normalverhaltensmodell sollte aus Zeiträumen lernen, in denen die Anlage gesund und ohne Einschränkung läuft. Bleiben Netzabregelung, geplante Wartung, Vereisung und Störungsstillstände in den Trainingsdaten, hält das Modell sie für „normal“ und übersieht eine echte Abweichung. Diese Zeiträume sollten aus Statuscodes und Alarmprotokollen abgeleitet und markiert werden.
6. Sensortausch und Niveausprünge
Wird ein Sensor getauscht oder neu kalibriert, kann sich das Messniveau sprunghaft ändern; das Modell hält das für Verschleiß. Plötzliche Niveauänderungen, die die Wartungsprotokolle nicht erklären, verdienen eine eigene Prüfung.
Markieren statt löschen
Statt fragwürdige Datensätze zu löschen, versieht man jeden mit einer Markierung, die den Grund angibt. Das hat zwei Vorteile: Für das Training lassen sich saubere Zeitfenster auswählen, und Verlustrechnungen können offen ausweisen, welcher Teil der Daten nicht bewertet werden konnte. Unsere Leistungsprognose- und Verluststudie mit offenen Daten eines Windparks beschreiben wir in der Fallstudie, wie man ohne gelabelte Ausfalldaten vorgeht, in diesem Beitrag. Die meisten dieser Prüfungen führen Sie mit unserer SCADA-Datenqualitätsprüfung an Ihrer eigenen CSV-Datei durch, ohne sie hochzuladen. Für eine erste Einschätzung mit Ihren eigenen Daten schreiben Sie uns.
Lassen Sie uns das für Ihr Werk besprechen
Weitere Notizen
Alle Notizen →- 3 Min. LesezeitSechs häufige Fehler auf UDI-Etiketten von MedizinproduktenVerpackungsebenen, Änderungen mit neuer UDI-DI, Verwechslung von Basic UDI-DI und UDI-DI, fehlende Herstellungskennung, Etikett und Barcode passen nicht zusammen, ungeprüfte Druckqualität: die häufigsten UDI-Fehler bei Medizinprodukten.
- 2 Min. LesezeitSechs Situationen, in denen die Karton-Paletten-Beziehung bei der Aggregation brichtAusgeschleuste Packungen, Teilkartons, Probenahme, manuelle Eingriffe, Doppelzuordnung und Palettenauflösung: die häufigsten Situationen, in denen Aggregationsdaten vom physischen Inhalt abweichen, und wie man sie an der Linie verhindert.
- 2 Min. LesezeitFünf häufige Fehler bei Pharma-Serialisierungscodes und wie man sie an der Linie erkenntFehlende Trennzeichen, falsche Prüfziffern, verwechselte Datumsformate, doppelte Seriennummern und unzulässige Zeichen: die häufigsten Fehler in Pharma-DataMatrix-Codes und wie man jeden an der Linie verhindert.