GrandEdu Journal · News

MAE und RMSE bei KI: Große Prognosefehler gezielt prüfen

Eine berufserfahrene Frau mit lockigem Haar vergleicht zwei unbeschriftete Linienverläufe auf einem Bildschirm im hellen Büro einer Servicestelle.
GrandEdu Media · NewsEine berufserfahrene Frau mit lockigem Haar vergleicht zwei unbeschriftete Linienverläufe auf einem Bildschirm im hellen Büro einer Servicestelle.

Ein Planungsteam bekommt die Meldung: „Die KI liegt im Durchschnitt um drei Serviceanfragen daneben.“ Das klingt überschaubar. Für den nächsten Arbeitstag fehlt aber eine wichtige Information: Sind die Abweichungen meistens ähnlich groß, oder steckt hinter dem Durchschnitt ein einzelner deutlich unterschätzter Tag?

MAE und RMSE bei KI helfen, numerische Prognosefehler unterschiedlich zusammenzufassen. An einem vollständig erfundenen Servicefall lässt sich der Rechenweg nachvollziehen. Im Mittelpunkt steht nicht die Auswahl eines angeblich besten Modells, sondern die Frage, welche einzelne Abweichung das Team genauer untersuchen sollte.

Vier Tage als Lernfall für die Einsatzplanung

Eine fiktive Servicestelle prognostiziert vor jedem Arbeitstag die Anzahl neu eingehender Anfragen. Nach Tagesende werden die tatsächlich eingegangenen Anfragen gezählt. Für die Übung ist „Anfrage“ eindeutig definiert; wiederholte Kontakte zum selben Vorgang zählen nicht als neue Anfrage. Alle Zahlen wurden für diesen Artikel erfunden.

Wir rechnen den Tagesfehler als Prognose minus Istwert. Ein positives Vorzeichen bedeutet zu hoch geschätzt, ein negatives zu niedrig. Jeder Tag erhält dasselbe Gewicht. Wir betrachten nur eine Zielgröße, nicht gleichzeitig Anzahl, Bearbeitungsdauer und Umsatz.

Erfundene Tageswerte: Anzahl eingehender Serviceanfragen
Tag Ist Prognose Fehler
1 12 14 +2
2 18 16 −2
3 10 10 0
4 22 14 −8

Schon vor jeder Zusammenfassung fällt Tag 4 auf: Acht Anfragen mehr als erwartet gingen ein. Diese Beobachtung ist konkret. Ob daraus eine Überlastung entstanden wäre, wissen wir nicht; dafür fehlen unter anderem Informationen zur Bearbeitungsdauer und zur verfügbaren Kapazität.

Zwei Rechenwege für dieselben Abweichungen

MAE: Die durchschnittliche Größe des Fehlers

MAE steht für „Mean Absolute Error“, den mittleren absoluten Fehler. Die offizielle scikit-learn-Dokumentation zu MAE beschreibt die Kennzahl für numerische Zielwerte und unterstützt auch unterschiedliche Fallgewichte. Hier verwenden wir bewusst keine solchen Gewichte.

Wir nehmen die Beträge der vier Tagesfehler: 2, 2, 0 und 8. Das Minuszeichen verschwindet, die Abweichung selbst bleibt erhalten. Dann wird addiert und durch die Anzahl der Tage geteilt:

MAE = (2 + 2 + 0 + 8) ÷ 4 = 3 Anfragen.

Die richtige Aussage lautet: Über diese vier Tage beträgt die durchschnittliche absolute Abweichung drei Anfragen. Nicht richtig wäre: „An jedem Tag fehlen drei Anfragen.“ Drei ist weder unser größter Fehler noch eine Grenze für die nächste Prognose.

RMSE: Große Tagesfehler wirken stärker

RMSE steht für „Root Mean Squared Error“. Die offizielle scikit-learn-Dokumentation zu RMSE erläutert die entsprechende Kennzahl für numerische Prognosen. Für unseren ungewichteten Fall quadrieren wir jeden Fehler, bilden den Mittelwert und ziehen daraus die Quadratwurzel.

Die quadrierten Fehler sind 4, 4, 0 und 64. Ihre Summe beträgt 72. Der mittlere quadratische Fehler, MSE, ist daher 72 ÷ 4 = 18. Erst danach folgt die Wurzel:

RMSE = √18 ≈ 4,24 Anfragen.

MAE und RMSE haben hier dieselbe Einheit wie die Zielgröße. Der MSE hat dagegen die quadrierte Einheit. Ein Wert von 18 für MSE sollte deshalb nicht als „18 Anfragen Abweichung“ vorgelesen werden. Die Google-Lerneinheit zu Prognoseverlusten erklärt diese Rechenregeln und den stärkeren Einfluss großer Fehler bei quadratischer Bewertung.

Was Tag 4 an den Kennzahlen verändert

Die Abweichung von acht Anfragen liefert 64 der insgesamt 72 quadrierten Fehlereinheiten. Tag 4 prägt den RMSE in dieser Übung also stark. Beim MAE gehen dieselben acht Anfragen als acht von zwölf absoluten Fehlereinheiten ein. Die Kennzahlen zeigen unterschiedliche Zusammenfassungen derselben Tabelle, keinen Widerspruch.

Eine Gegenrechnung macht den Einfluss sichtbar: Würden wir nur die ersten drei Tage betrachten, ergäben sich MAE = 4 ÷ 3 ≈ 1,33 und RMSE = √(8 ÷ 3) ≈ 1,63. Diese freundlichere Ausgabe wäre aber eine andere Prüfgrundlage. Sie beschreibt nicht mehr alle vier Tage.

Gerade deshalb darf ein auffälliger Tag nicht allein wegen seines Einflusses verschwinden. Für unseren Lernfall gibt es drei verschiedene Prüfaufträge: War die Anzahl falsch erfasst? Trat ein tatsächlich besonderes Ereignis auf? Oder unterschätzt die Prognose eine bestimmte Art von Tagen? Die Tabelle beantwortet keine dieser Ursachenfragen von selbst.

Bei einer nachgewiesenen fehlerhaften Erfassung müsste die Korrektur nachvollziehbar dokumentiert werden. Bei einem korrekt erfassten besonderen Ereignis bleibt dagegen zu entscheiden, ob solche Tage zur späteren Einsatzaufgabe gehören. Ein gesonderter Bericht kann die Besonderheit zeigen, ohne sie im Gesamtergebnis zu verstecken.

Vorzeichen und betriebliche Folgen bleiben offen

Beide Kennzahlen entfernen in unserer Rechnung das Vorzeichen. Ein Fehler von plus acht und einer von minus acht tragen jeweils gleich viel bei. Für die Servicestelle könnten sie trotzdem unterschiedliche Folgen haben: zu viel eingeplante Kapazität oder zu wenig. Das ist eine Frage des Arbeitsablaufs, keine Eigenschaft der Wurzelrechnung.

Zur Ergänzung betrachten wir die gerichteten Fehler. Ihre Summe beträgt 2 − 2 + 0 − 8 = −8; der Mittelwert beträgt −2 Anfragen. Über die vier Tage wurden insgesamt 54 Anfragen prognostiziert, tatsächlich gingen 62 ein. In diesem Datensatz liegt die Prognose in Summe zu niedrig. Eine dauerhafte systematische Unterschätzung ist damit noch nicht nachgewiesen.

Auch der RMSE ist kein Eurobetrag. Wer betriebliche Fehlerkosten untersuchen möchte, muss zusätzliche Annahmen festlegen: Welche Arbeit entsteht pro Anfrage, welche Reserven bestehen und welche Folgen haben Unter- und Überschätzung? Ein quadratischer Rechenweg bildet diese Kosten nicht automatisch richtig ab.

Aus Zahlen wird ein nachvollziehbarer Prüfauftrag

Für die nächste Besprechung würde unser Planungsteam nicht nur „MAE 3, RMSE 4,24“ weiterreichen. Es würde vier Tage, die Zielgröße, die Fehlerrichtung und die gleiche Gewichtung nennen. Dazu gehört der konkrete Befund: Tag 4 wurde um acht Anfragen unterschätzt und hat einen großen Einfluss auf die quadratische Zusammenfassung.

Der nächste Auftrag könnte lauten: „Prüft die Erfassung und die bekannten Besonderheiten von Tag 4. Haltet fest, welche davon vor der Prognose verfügbar waren.“ Nachträglich bekannte Informationen hätten die ursprüngliche Tagesplanung nicht unterstützen können. Diese Unterscheidung verhindert eine Bewertung mit Wissen, das zum Entscheidungszeitpunkt fehlte.

Für einen Vergleich weiterer Prognosen müssten dieselben Tage und Berechnungsregeln verwendet werden. Die kleine Übung liefert jedoch weder eine allgemeine Gütegrenze noch einen belastbaren Nachweis für künftige Wochen. Dafür braucht das Team eine passende, deutlich breitere Prüfgrundlage und eine fachlich begründete Planungsanforderung.

FAQ zu MAE und RMSE bei KI

Ist der höhere RMSE ein Rechenfehler?

Nein. In unserer Tabelle vergrößert die quadratische Bewertung den Einfluss des Tagesfehlers von acht Anfragen. Beide Ergebnisse lassen sich aus denselben vier Zeilen korrekt berechnen.

Ist MAE von drei Anfragen grundsätzlich gut?

Das lässt sich ohne Planungsanforderung nicht entscheiden. Drei Anfragen können bei einer kleinen Servicestelle anders ins Gewicht fallen als bei einem großen Betrieb. Unser Wert ist ein Lernergebnis, kein Qualitätsstandard.

Lässt sich daraus ein sicherer Puffer für morgen ableiten?

Nein. Weder drei noch 4,24 ist eine garantierte Obergrenze eines künftigen Tagesfehlers. Eine Reserve braucht eine eigene Begründung anhand des Prozesses und geeigneter Daten.

Fazit: Den auffälligen Tag erklären, nicht nur den Durchschnitt melden

MAE beschreibt in unserer Übung die mittlere absolute Fehlermenge; RMSE macht große Abweichungen rechnerisch stärker wirksam. Zusammen mit den Tageswerten entsteht ein sinnvoller Prüfauftrag. Das ersetzt weder die Ursachenklärung noch die Entscheidung über Personal oder Reserven.

Wer solche KI-Ergebnisse im Berufsalltag verständlich einordnen möchte, findet im öffentlich angebotenen Kurs KI-Grundlagenkompetenzen für die digitale Arbeitswelt Informationen zu Datenlogik und fachlicher Ergebnisbewertung. Dieser Artikel ist eine eigenständige Lernübung und verspricht kein bestimmtes Kennzahlenmodul. Besprechen Sie Ihren Lernbedarf über den Kontakt zu GrandEdu Media.

Quellen- und Angebotsprüfung: 10. Oktober 2026. Die Servicestelle, alle Tageswerte und die beschriebenen Planungssituationen sind erfunden.

Wissen wird wertvoll, wenn es Dich weiterbringt.

Welcher Bildungsweg passt zu Deinem nächsten Schritt?

Wir verbinden Deine beruflichen Ziele mit einer Weiterbildung, die fachlich, förderorientiert und persönlich zu Dir passt.

Beratungsgespräch