GrandEdu Journal · News

Fehlende Werte bei KI: Warum unbekannt nicht null bedeutet

Zwei berufserfahrene Fachkräfte prüfen an einem Laptop eine Datentabelle mit einzelnen leeren Feldern in einem hellen Lernraum.
GrandEdu Media · NewsZwei berufserfahrene Fachkräfte prüfen an einem Laptop eine Datentabelle mit einzelnen leeren Feldern in einem hellen Lernraum.

In einer Kundendatei steht bei der Anzahl bisheriger Kontakte einmal „0“ und einmal gar nichts. Für einen Menschen kann das einen klaren Unterschied bedeuten: Beim ersten Fall gab es tatsächlich keinen Kontakt, beim zweiten fehlt die Information. Wird die leere Zelle automatisch mit null gefüllt, verschwindet dieser Unterschied, noch bevor ein KI-Modell die Daten verarbeitet.

Fehlende Werte bei KI sind deshalb nicht bloß ein Tabellenproblem. Sie betreffen die Bedeutung der Eingaben. Dieser Beitrag richtet sich an Fachkräfte, die Daten für ein KI-Projekt bereitstellen oder dessen Vorbereitung fachlich prüfen. An einem vollständig erfundenen Servicefall lernen Sie, echte Nullen, fehlende Angaben und rechnerische Ersatzwerte auseinanderzuhalten – ohne selbst programmieren zu müssen.

Erst die Bedeutung klären, dann die Zelle füllen

Eine echte Null ist eine beobachtete Angabe: In unserem Beispiel wurden keine früheren Kontakte registriert. Eine Datenlücke sagt dagegen zunächst nur, dass ein Wert nicht vorliegt. Vielleicht wurde er nicht erfasst, nicht übertragen oder ist für diesen Vorgang gar nicht anwendbar. Diese Erklärungen sind verschiedene mögliche Fälle, keine Diagnose einer konkreten Datei.

Legen Sie mit dem Fachbereich fest, was das Feld misst, auf welchen Zeitraum es sich bezieht und welche fehlenden Zustände vorkommen dürfen. „Nicht bekannt“ und „nicht anwendbar“ müssen fachlich nicht dasselbe bedeuten. Eine technische Vorbereitung sollte diesen Unterschied nicht unbemerkt beseitigen.

Die offizielle scikit-learn-Einführung zur Imputation beschreibt fehlende Werte unter anderem als leere Felder oder spezielle Platzhalter. Imputation bedeutet, solche Lücken durch abgeleitete Ersatzwerte zu ergänzen. Das liefert verwendbare Eingaben, aber keine nachträgliche Messung des ursprünglich unbekannten Sachverhalts.

Ein Servicefall mit vier Angaben und einer Lücke

Für eine Lernübung betrachten wir fünf fiktive Servicevorgänge. Das Merkmal lautet: Anzahl dokumentierter Kundenkontakte in den 30 Tagen vor Eingang des jeweiligen Vorgangs. Alle vorhandenen Zahlen wurden für die Übung erfunden; die Informationen sollen bereits beim Eingang verfügbar sein.

  • Vorgang A: null vorherige Kontakte, ausdrücklich überprüft.
  • Vorgang B: zwei vorherige Kontakte.
  • Vorgang C: vier vorherige Kontakte.
  • Vorgang D: sechs vorherige Kontakte.
  • Vorgang E: Kontaktzahl unbekannt, weil die Übertragung unvollständig ist.

Die vier bekannten Zahlen ergeben zusammen zwölf. Ihr Mittelwert beträgt 12 ÷ 4 = 3. Auch der Median beträgt hier drei: Bei vier sortierten Zahlen wird der Mittelwert der beiden mittleren Werte zwei und vier gebildet. Dass beide Kennzahlen übereinstimmen, ist eine Eigenschaft dieses Beispiels, keine allgemeine Regel.

Variante eins: Unbekannt wird ungeprüft zu null

Die Datei enthält anschließend die fünf Zahlen 0, 2, 4, 6 und 0. A und E sehen für dieses Merkmal gleich aus, obwohl A eine bestätigte Null und E eine Informationslücke besitzt. Der Mittelwert dieser ausgefüllten Liste sinkt auf 12 ÷ 5 = 2,4.

Die Rechnung ist korrekt, ihre Bedeutung hat sich jedoch geändert: Der zweite Nullwert wurde nicht beobachtet. Wenn ein Bericht die 2,4 ohne Hinweis als durchschnittlich erfasste Kontaktzahl ausweist, beschreibt er die ersetzte Datei statt ausschließlich die bekannten Angaben. Eine bequeme Voreinstellung wird damit zur inhaltlichen Annahme.

Variante zwei: Ein begründeter Ersatzwert wird markiert

Wir testen nun eine Median-Ersetzung. E erhält rechnerisch den Wert drei; A bleibt bei seiner tatsächlich beobachteten Null. Die ergänzte Liste lautet 0, 2, 4, 6 und 3. Ihr Mittelwert ist 15 ÷ 5 = 3. Auch das beweist nicht, dass E wirklich drei Kontakte hatte.

Die Dokumentation zu SimpleImputer nennt Mittelwert, Median, häufigsten Wert und feste Konstanten als mögliche Strategien. Mittelwert und Median sind dabei für numerische Daten vorgesehen. Welche Strategie zur Aufgabe passt, muss begründet und geprüft werden. Unser Beispiel zeigt eine Alternative zur ungeprüften Null, keinen grundsätzlich überlegenen Ersatz.

Die Lücke kann trotz Ersatz sichtbar bleiben

Ergänzen Sie im Lernfall eine zweite Information: „Kontaktzahl fehlte ursprünglich“. Bei A bis D lautet sie nein, bei E ja. Dadurch können eine echte Angabe von drei und eine eingesetzte drei später unterschieden werden. Die scikit-learn-Einführung erläutert solche Fehlwert-Indikatoren und ihre Verbindung mit Imputation.

Die Markierung erklärt allerdings nicht, warum die Angabe fehlt, und garantiert keine bessere Vorhersage. In unserem Fall wissen wir den Übertragungsgrund nur, weil er ausdrücklich vorgegeben wurde. In einer echten Datei müsste diese Erklärung geprüft werden. Bewahren Sie außerdem den ursprünglichen Datenstand und eine nachvollziehbare Beschreibung der Ersatzregel auf; ein markierter Ersatzwert sollte nicht als Originalwert zurückgeschrieben werden.

Eine konkrete Softwaregrenze verdient Aufmerksamkeit: Bei SimpleImputer mit zusätzlichem Indikator erhalten Merkmale, die beim Anpassen keine Lücken hatten, nicht automatisch einen neuen Indikator für später auftretende Lücken. Lassen Sie deshalb auch neue Fehlwertsituationen im späteren Einsatz prüfen, statt sich allein auf eine gesetzte Option zu verlassen.

Warum Löschen ebenfalls eine Entscheidung ist

Man könnte Vorgang E vollständig entfernen. Dann bleiben nur vollständige Fälle übrig. Die offizielle Imputationsübersicht weist darauf hin, dass beim Entfernen ganzer Zeilen oder Spalten auch wertvolle vorhandene Informationen verloren gehen können.

Erweitern Sie unseren erfundenen Fall gedanklich: E stammt als einziger Vorgang aus einem neu angebundenen Servicekanal. Wird E entfernt, enthält der kleine Datenbestand keinen Fall dieses Kanals mehr. Das ist eine direkte Folge der angenommenen Fallauswahl. Daraus lässt sich nicht ableiten, wie stark sich eine reale Modellleistung verändert; sichtbar wird lediglich, welche Beobachtung aus der Bewertung verschwindet.

Halten Sie deshalb fest, welche Fälle nach einer Bereinigung fehlen. „Keine leeren Zellen mehr“ ist kein ausreichendes Qualitätsziel. Wichtiger ist, ob der verbleibende Bestand noch zur vorgesehenen Anwendung passt.

Die Ersatzregel braucht eine klare Datengrenze

Soll die spätere Modellleistung unabhängig bewertet werden, darf der Ersatz-Median nicht aus Trainings- und Testdaten gemeinsam stammen. Die offiziellen Hinweise zu Datenleckage beziehen diese Grenze ausdrücklich auch auf Imputation: zuerst aufteilen, die Vorbereitung nur am jeweiligen Trainingsbestand anpassen und die gelernte Regel auf weitere Daten anwenden.

Für unseren Lernfall wäre die drei nur dann ein zulässiger trainingsbasierter Ersatz, wenn A bis D tatsächlich zum entsprechenden Trainingsbestand gehören. Ein separat berechneter Test-Median wäre wiederum eine andere Regel. Eine geeignete Pipeline kann die richtige Reihenfolge unterstützen. Die fachliche Frage bleibt: Aus welchen Fällen wurde der Ersatz gelernt, und wird derselbe Ablauf später wiederverwendet?

FAQ zu fehlenden Werten bei KI

Ist null als Ersatz grundsätzlich verboten?

Nein. Ein konstanter Ersatz kann bewusst gewählt werden. Er muss aber als Annahme erkennbar bleiben und zur konkreten Aufgabe passen. Eine echte Null sollte nicht versehentlich als fehlend behandelt werden.

Muss jedes Modell zuerst alle Lücken ersetzen?

Nein. Die scikit-learn-Übersicht nennt auch Verfahren, die fehlende Werte direkt verarbeiten können. Prüfen Sie das konkrete Modell und dessen Eingabeformat; daraus entsteht keine allgemeine Freigabe für beliebige unvollständige Daten.

Kann der Artikel meine Datei bereinigen?

Nein. Er erklärt die Entscheidungen an fiktiven Vorgängen. Für Ihre Datei müssen Feldbedeutung, Erfassung, Ausfallgründe und späterer Einsatzzweck gesondert geklärt werden.

Fazit: Ein Ersatzwert ist keine wiedergefundene Tatsache

Fragen Sie bei einer ausgefüllten KI-Datentabelle nicht nur, ob noch Lücken vorhanden sind. Lassen Sie sich erklären, welche Werte ursprünglich fehlten, warum sie fehlen und nach welcher Regel sie ersetzt wurden. Unser Servicefall zeigt: Bestätigte null, unbekannt und eingesetzte drei sind drei verschiedene Informationen.

Der öffentliche Kurs KI-Grundlagenkompetenzen für die digitale Arbeitswelt nennt Daten als Grundlage von KI-Systemen und die fachliche Bewertung ihrer Ergebnisse. Dieser Artikel ist eine eigenständige Einführung, keine Zusage zu einer bestimmten Imputationsübung im Kurs. Besprechen Sie Ihren Lernbedarf über den Kontakt zu GrandEdu Media.

Quellen- und Angebotsprüfung: 10. Oktober 2026. Alle Servicevorgänge und Rechenvarianten sind eigens erfundene Lernfälle.

Wissen wird wertvoll, wenn es Dich weiterbringt.

Welcher Bildungsweg passt zu Deinem nächsten Schritt?

Wir verbinden Deine beruflichen Ziele mit einer Weiterbildung, die fachlich, förderorientiert und persönlich zu Dir passt.

Beratungsgespräch