In einer Datentabelle wird eine geplante Bearbeitungszeit von Minuten auf Stunden umgestellt. Inhaltlich bleibt alles gleich: 60 Minuten sind eine Stunde. Trotzdem kann ein KI-Verfahren anschließend einen anderen Vergleichsfall als besonders ähnlich auswählen. Der Grund liegt nicht in neuen Informationen, sondern darin, wie das Verfahren Abstände zwischen Zahlen berechnet.
Feature-Skalierung bei KI betrifft die Größenordnung einzelner Eingabemerkmale. Wer KI-Ergebnisse im Berufsalltag fachlich prüft, sollte diesen Zusammenhang verstehen. Dafür müssen Sie kein Modell programmieren. Ein kleiner, vollständig erfundener Auftragsvergleich macht sichtbar, weshalb die Einheit zur Berechnungslogik gehört – und nicht nur zur Beschriftung eines Berichts.
Eine Ähnlichkeitssuche braucht eine Rechenregel
Ein Feature ist ein Merkmal, das als Eingabe verwendet wird. Bei einem Auftrag könnten das die Anzahl geplanter Arbeitsschritte und die geplante Bearbeitungszeit sein. Ein Verfahren zur Suche nach nächsten Nachbarn vergleicht einen neuen Fall mit vorhandenen Fällen. „Ähnlich“ bedeutet dabei zunächst nur: nach der gewählten Berechnungsregel nahe beieinander.
Im folgenden Lernfall verwenden wir den euklidischen Abstand der eingegebenen Zahlen: Die Differenzen beider Merkmale werden quadriert, addiert und daraus die Quadratwurzel gezogen. Es handelt sich nicht um eine physikalische Entfernung. Die Regel setzt fest, wie die beiden numerischen Unterschiede gemeinsam zählen.
Die offizielle scikit-learn-Demonstration zur Feature-Skalierung zeigt, dass die Skalierung bei Nachbarschaftsverfahren erheblich beeinflussen kann, welche Fälle benachbart sind. Das dortige Beispiel verwendet andere Daten. Unser Auftragsfall ist eine eigene Rechenübung, keine gemessene Modellleistung.
Der Einheitenwechsel im Auftragsvergleich
Für alle drei fiktiven Aufträge liegen dieselben zwei Planungsangaben vor. Die Zeiten sind bereits vor der Suche bekannt; wir verwenden keine später tatsächlich gemessene Bearbeitungsdauer.
- Neuer Auftrag: sechs Arbeitsschritte, geplant 60 Minuten.
- Vergleichsfall A: fünf Arbeitsschritte, geplant 100 Minuten.
- Vergleichsfall B: ein Arbeitsschritt, geplant 65 Minuten.
Welcher Vergleichsfall liegt näher? Spontan ist A bei der Schrittzahl ähnlicher, B bei der Zeit. Die Rechenregel muss beides verbinden. Wir ändern nun ausschließlich die Zeiteinheit; Schrittzahlen und die tatsächlich gemeinten Zeitspannen bleiben unverändert.
Mit Minuten wird B zum nächsten Nachbarn
Zwischen neuem Auftrag und A unterscheiden sich die Schrittzahlen um eins und die Zeiten um 40 Minuten. Der numerische Abstand beträgt daher √(1² + 40²) ≈ 40,01. Bei B sind es fünf Schritte und fünf Minuten: √(5² + 5²) ≈ 7,07.
B hat den kleineren Abstand. Der Zeitunterschied von 40 geht bei A als 1.600 in die Summe ein; der Unterschied von einem Schritt lediglich als eins. In dieser Darstellung prägt die Zeit den Vergleich sehr stark.
Mit Stunden liegt A näher
Nun teilen wir sämtliche Minutenangaben durch 60. Der neue Auftrag hat eine geplante Stunde, A rund 1,667 Stunden und B rund 1,083 Stunden. Für die Rechnung behalten wir die exakten Brüche bei und runden erst das Ergebnis.
Bei A ergibt sich √(1² + (40/60)²) ≈ 1,20. Bei B lautet die Rechnung √(5² + (5/60)²) ≈ 5,00. Jetzt ist A der nächste Nachbar. Kein Auftrag hat sich verändert. Verändert wurde das relative Gewicht der Zeitdifferenz innerhalb derselben numerischen Abstandsregel.
Diese Umkehr ist der Kern der Übung. Sie beweist weder, dass A fachlich der bessere Vergleichsfall ist, noch dass Stunden grundsätzlich die bessere Einheit sind. Sie zeigt eine Modellannahme, die ein Team bewusst festlegen und prüfen muss.
Standardisierung macht den Maßstab ausdrücklich
Eine verbreitete Vorbereitung ist, jedes Merkmal anhand seiner Trainingsdaten zu standardisieren: vom Wert den Mittelwert abziehen und durch die Standardabweichung teilen, sofern diese nicht null ist. Die Dokumentation zu StandardScaler beschreibt dieses Vorgehen und die spätere Anwendung der gespeicherten Kennwerte auf weitere Daten.
Die umgerechneten Werte drücken dann Abweichungen in Standardabweichungen aus statt in Minuten oder Stunden. Bei einer konsistenten linearen Einheitenumrechnung ändern sich Mittelwert und Standardabweichung entsprechend mit. Damit bleibt der standardisierte Wert bei diesem Einheitenwechsel gleich. Das ist eine rechnerische Eigenschaft, noch kein Nachweis eines guten Modells.
Standardisierung macht eine Verteilung außerdem nicht automatisch normalverteilt. Sie verändert Lage und Maßstab, nicht von selbst die Form der Verteilung. Die Softwaredokumentation weist ausdrücklich auf die Empfindlichkeit gegenüber Ausreißern hin. Eine auffällige Zahl verlangt deshalb eine Datenprüfung; sie sollte nicht allein wegen ihres Einflusses ungeprüft gelöscht werden.
Einheitlich standardisierte Merkmale sind auch nicht automatisch fachlich gleich wichtig. Vielleicht ist die Schrittzahl für die gewünschte Vergleichsaufgabe wenig aussagekräftig. Dann braucht es eine bessere Merkmalsauswahl oder eine begründete Gewichtung. Kein Rechenschritt ersetzt diese inhaltliche Entscheidung.
Die Skalierung gehört zum Modell, nicht neben das Modell
Für eine unabhängige Bewertung dürfen Mittelwert und Standardabweichung nicht bereits aus den späteren Testfällen berechnet werden. Die offiziellen Hinweise zu typischen Fehlern und Datenleckage erklären: zuerst die Daten aufteilen, die Vorbereitung nur am jeweiligen Trainingsbestand lernen und anschließend dieselbe gelernte Transformation auf Testdaten anwenden.
Wer Testdaten separat neu standardisiert, verwendet andere Kennwerte und damit einen anderen Maßstab. Eine Pipeline kann Vorbereitung und Modell zu einem gemeinsamen Ablauf verbinden. Auch bei Kreuzvalidierung muss die Vorbereitung innerhalb des jeweiligen Trainingsdurchlaufs gelernt werden. Der unabhängige Testbestand bleibt für die abschließende Bewertung reserviert.
Für einen Fachbereich wird daraus eine konkrete Übergabefrage: „Welche Daten haben die Skalierung bestimmt, und wird genau diese Transformation später wiederverwendet?“ Das ist hilfreicher als die allgemeine Forderung, die Tabelle möge „normalisiert“ werden. Der Begriff allein beschreibt noch kein eindeutig festgelegtes Verfahren.
Was Sie in einer KI-Besprechung klären können
Bitten Sie die technische Ansprechperson um eine kurze Beschreibung der vollständigen Eingabekette. Diese vier Fragen reichen als Einstieg:
- Welche Merkmale werden verwendet, und welche Einheiten besitzen sie?
- Reagiert das konkrete Verfahren auf Größenordnungen oder Abstände?
- Welche Transformation wird anhand welchen Trainingsbestands festgelegt?
- Wie wird geprüft, ob die Vorbereitung im späteren Einsatz identisch angewendet wird?
Ergänzen Sie einen kleinen Gegencheck: Ändert eine konsistente Umrechnung von Minuten in Stunden die Vergleichsergebnisse? Falls ja, lassen Sie sich den Grund erklären. Ein Unterschied kann beabsichtigt sein, muss aber zur Aufgabe passen. Unser Zwei-Fälle-Beispiel dient dabei nur dem Verständnis. Für eine reale Entscheidung braucht es geeignete Daten, eine begründete Vergleichsaufgabe und eine unabhängige Bewertung.
FAQ zur Feature-Skalierung bei KI
Braucht jedes KI-Verfahren Standardisierung?
Nein. Die offizielle Skalierungsdemonstration unterscheidet abstandssensitive Verfahren von baumbasierten Modellen, die von solchen Skalierungen meist kaum beeinflusst werden. Prüfen Sie das konkrete Verfahren statt eine Regel auf alle KI-Systeme zu übertragen.
Kann ich einfach überall dieselbe Einheit eintragen?
Verschiedene Merkmale messen unterschiedliche Dinge. Minuten und eine Anzahl lassen sich nicht durch eine gemeinsame Beschriftung gleichartig machen. Entscheidend ist die dokumentierte Berechnungs- und Vorbereitungsregel.
Verbessert Skalierung garantiert die Qualität?
Nein. Sie kann das Verhalten verändern oder bestimmte Verfahren unterstützen. Ob das Ergebnis für Ihre Aufgabe besser ist, muss separat geprüft werden. Unpassende Merkmale werden durch Skalierung nicht automatisch nützlich.
Fazit: Ähnlichkeit ist eine begründete Festlegung
Der Wechsel von Minuten zu Stunden zeigt, wie stark eine scheinbare Formatentscheidung einen numerischen Vergleich prägen kann. Fragen Sie deshalb nicht nur, welcher Fall als ähnlich ausgegeben wird, sondern auch nach Merkmalen, Einheiten und Vorverarbeitung. Wer diese Grundlagen versteht, kann KI-Ergebnisse gezielter hinterfragen.
Der öffentlich angebotene Kurs KI-Grundlagenkompetenzen für die digitale Arbeitswelt behandelt Daten als Grundlage von KI-Systemen und die fachliche Bewertung von Ergebnissen. Dieser Artikel ist eine eigenständige Einführung und keine Zusage zu einer bestimmten Softwareübung im Kurs. Über den Kontakt zu GrandEdu Media können Sie Ihren Lernbedarf und Fragen zum Angebot besprechen.
Quellen- und Angebotsprüfung: 9. Oktober 2026. Sämtliche Auftragsdaten wurden für diese Lernübung erfunden.