GrandEdu Journal · News

Konfusionsmatrix lesen: Warum eine hohe Trefferquote täuschen kann

Zwei berufserfahrene Fachkräfte prüfen an einem Laptop eine abstrakte Vier-Felder-Auswertung in einem modernen Büro.
GrandEdu Media · NewsZwei berufserfahrene Fachkräfte prüfen an einem Laptop eine abstrakte Vier-Felder-Auswertung in einem modernen Büro.

Eine KI sortiert eingehende Serviceanfragen und meldet eine hohe Trefferquote. Klingt überzeugend – bis Sie feststellen, dass gerade die dringenden Fälle häufig im normalen Posteingang landen. Wer eine Konfusionsmatrix lesen kann, erkennt solche Schwächen hinter einer einzigen Prozentzahl. Dafür brauchen Sie weder Programmierkenntnisse noch eine komplizierte Statistiksoftware.

Dieser Beitrag erklärt die Matrix an einem vollständig erfundenen Zahlenbeispiel. Es geht um die Bewertung einer Klassifikation: Ein Modell ordnet Anfragen entweder „Eilfall“ oder „normal“ zu. Die Zahlen beschreiben kein GrandEdu-Angebot und keine tatsächlich gemessene Modellleistung.

Was eine Konfusionsmatrix gegenüber einer Trefferquote zeigt

Die Matrix stellt die Modellzuordnung der tatsächlichen Zuordnung gegenüber. Dadurch sehen Sie nicht nur, wie oft das Modell richtig liegt, sondern auch, welche Verwechslungen entstehen. In unserem Beispiel bezeichnet „positiv“ die Klasse Eilfall. Das Wort bedeutet hier weder „gut“ noch „erwünscht“.

Die vier Felder lassen sich so lesen:

  • True Positive (TP): Ein tatsächlicher Eilfall wird als Eilfall erkannt.
  • False Negative (FN): Ein tatsächlicher Eilfall wird als normale Anfrage übersehen.
  • False Positive (FP): Eine normale Anfrage wird irrtümlich als Eilfall markiert.
  • True Negative (TN): Eine normale Anfrage wird richtig als normal zugeordnet.

Wichtig sind die Achsenbeschriftungen. In der offiziellen scikit-learn-Dokumentation zur Konfusionsmatrix stehen die tatsächlichen Klassen in den Zeilen und die Vorhersagen in den Spalten. Andere Darstellungen können das anders anordnen. Merken Sie sich deshalb nicht bloß „links oben“, sondern lesen Sie immer beide Beschriftungen.

Unser Zahlenfall: 1.000 Anfragen, aber nur 20 Eilfälle

Angenommen, ein Serviceteam bewertet 1.000 Anfragen anhand einer vorher festgelegten Dringlichkeitsdefinition. 20 sind tatsächlich Eilfälle, 980 sind normale Anfragen. Das Modell erkennt 12 Eilfälle, übersieht 8 und markiert zusätzlich 18 normale Anfragen als dringend. Die übrigen 962 normalen Anfragen ordnet es korrekt zu.

Erfundenes Beispiel: tatsächliche Klasse in den Zeilen, Modellzuordnung in den Spalten
Tatsächlich Modell: Eilfall Modell: normal
Eilfall 12 TP 8 FN
Normal 18 FP 962 TN

Zur Kontrolle: Die erste Zeile ergibt 20 tatsächliche Eilfälle, die zweite 980 normale Anfragen. Die erste Spalte ergibt 30 Modellmeldungen „Eilfall“. Alle vier Felder zusammen ergeben 1.000. Diese Summenprüfung hilft, vertauschte Achsen und fehlerhaft übertragene Zahlen früh zu entdecken.

Drei Kennzahlen – drei unterschiedliche Fragen

Die offizielle Google-Lerneinheit zu Accuracy, Precision und Recall erläutert die Formeln und ihre Auswahl nach Aufgabe und Fehlerfolgen. Für unser Beispiel ergeben sich folgende Werte:

Accuracy: Wie viele Zuordnungen stimmen insgesamt?

Accuracy = (TP + TN) / alle Fälle. Hier sind das (12 + 962) / 1.000 = 97,4 Prozent. Die Zahl fasst beide Klassen zusammen.

Precision: Wie verlässlich ist eine Eilfallmeldung?

Precision = TP / (TP + FP). Von 30 markierten Anfragen sind 12 tatsächlich dringend: 12 / 30 = 40 Prozent. 18 Meldungen sind Fehlalarme.

Recall: Wie viele tatsächliche Eilfälle werden gefunden?

Recall = TP / (TP + FN). Das Modell findet 12 der 20 Eilfälle: 12 / 20 = 60 Prozent. Acht dringende Anfragen bleiben unentdeckt.

Die Kennzahlen beantworten also verschiedene Fragen. Ein Team, das nur Accuracy berichtet, lässt die Zuverlässigkeit seiner Eilfallmeldungen und den Anteil übersehener Eilfälle offen.

Der überraschende Vergleich: „Immer normal“ erreicht 98 Prozent

Nun ersetzen wir das Modell gedanklich durch die Regel: Jede Anfrage ist normal. Diese Regel ordnet alle 980 normalen Fälle richtig zu und alle 20 Eilfälle falsch. Ihre Accuracy beträgt 980 / 1.000 = 98 Prozent – mehr als die 97,4 Prozent des Modells.

Trotzdem erkennt die Regel keinen einzigen Eilfall; ihr Recall beträgt null. Unser Rechenvergleich zeigt, warum das Verhältnis der Klassen zur Bewertung gehört. Eine hohe Gesamtquote ist noch kein Beleg dafür, dass die seltene, für den Prozess wichtige Klasse zuverlässig erkannt wird.

Fragen Sie bei einem Leistungsbericht deshalb nach den absoluten Fallzahlen und einem einfachen Vergleichsmaßstab. „97,4 Prozent korrekt“ wird erst zusammen mit „8 von 20 Eilfällen übersehen“ zu einer Information, mit der ein Fachbereich sinnvoll diskutieren kann.

Fehlalarm oder übersehener Fall: Was belastet Ihren Prozess?

Übertragen wir den Zahlenfall in einen hypothetischen Arbeitsablauf: Die 30 markierten Anfragen gelangen in eine zusätzliche manuelle Prüfung. Davon benötigen 18 keine Eilbehandlung. Gleichzeitig bleiben 8 echte Eilfälle im normalen Ablauf. Damit entstehen zwei verschiedene Belastungen – unnötige Prüfungen und nicht rechtzeitig erkannte Dringlichkeit.

Welche davon schwerer wiegt, muss der verantwortliche Fachbereich anhand seines konkreten Prozesses entscheiden. Die Matrix liefert die Mengen, aber keine automatische Freigabeentscheidung. Dokumentieren Sie beispielsweise, wie viel zusätzliche Prüfkapazität verfügbar ist und welche Folgen ein übersehener Eilfall hätte. Daraus können Sie begründete Anforderungen an die Bewertung ableiten, ohne eine allgemein „gute“ Prozentgrenze zu erfinden.

Warum der Schwellenwert zur Auswertung gehört

Manche Klassifikationsmodelle liefern zunächst einen Zahlenwert statt einer fertigen Klasse. Ein Schwellenwert entscheidet dann über die Zuordnung. Die Google-Dokumentation zu Klassifikationsschwellen erklärt diese Umwandlung und ihre Auswirkungen auf die vier Matrixfelder.

Bei denselben Modellwerten und Testfällen kann eine niedrigere Schwelle mehr positive Zuordnungen erzeugen: Übersehene Eilfälle können abnehmen, Fehlalarme zunehmen. Eine höhere Schwelle kann die umgekehrte Verschiebung bewirken. Daraus folgt keine pauschale Verbesserung. Bewerten Sie die neue Matrix anhand Ihrer Anforderungen und dokumentieren Sie die verwendete Schwelle.

Achten Sie außerdem darauf, wie ein Wert genau auf der Grenze behandelt wird. Die Zuordnung bei Gleichheit hängt von der festgelegten Implementierung ab. Zwei Berichte sind nur sinnvoll vergleichbar, wenn diese Bedingungen klar sind.

Eine saubere Matrix beginnt vor der Berechnung

Die tatsächliche Klasse muss anhand nachvollziehbarer Regeln bestimmt werden. Legen Sie im Serviceteam beispielsweise zuerst fest, was als Eilfall zählt, und klären Sie strittige Fälle. Sonst misst die Matrix womöglich wechselnde Einschätzungen statt der gewünschten Aufgabe.

Für die Modellentwicklung sollten Trainings-, Validierungs- und Testdaten getrennte Aufgaben erfüllen. Das unabhängige Testset dient der abschließenden Bewertung und sollte nicht fortlaufend zur Modellanpassung genutzt werden. Google beschreibt außerdem, warum repräsentative Fälle und das Vermeiden von Duplikaten aus den Trainingsdaten wichtig sind: Datensätze in Training, Validierung und Test aufteilen.

Unser Beispiel enthält nur 20 tatsächliche Eilfälle. Ein einzelner zusätzlich erkannter Eilfall würde den Recall bereits um fünf Prozentpunkte verändern. Berichten Sie daher die Fallzahlen mit; eine Nachkommastelle allein sagt nichts über die Belastbarkeit einer Auswertung.

FAQ zur Konfusionsmatrix

Ist Precision dasselbe wie Accuracy?

Nein. Precision betrachtet hier ausschließlich die vom Modell markierten Eilfälle. Accuracy betrachtet sämtliche Zuordnungen. Im Beispiel stehen deshalb 40 Prozent Precision neben 97,4 Prozent Accuracy.

Kann ich damit auch frei formulierte KI-Antworten bewerten?

Nicht ohne eine klar definierte Zuordnungsaufgabe. Eine Matrix für „Eilfall oder normal“ prüft nicht automatisch Verständlichkeit, Vollständigkeit oder Qualität eines frei geschriebenen Textes.

Gibt es einen Recall, der für jeden Betrieb ausreicht?

Nein. Unsere 60 Prozent sind ein Rechenergebnis, keine Empfehlung. Anforderungen hängen unter anderem von Fehlerfolgen, Prüfkapazität und dem Einsatzbereich ab.

Fazit: Erst die Verwechslungen verstehen, dann die Prozentzahl bewerten

Eine Konfusionsmatrix macht sichtbar, wo ein Modell richtig liegt und welche Fehler es erzeugt. Lesen Sie zuerst die Achsen, prüfen Sie die Summen und betrachten Sie Accuracy, Precision und Recall zusammen mit den absoluten Zahlen. So wird aus einer attraktiven Gesamtquote eine nachvollziehbare fachliche Bewertung.

Wenn Sie KI-Ergebnisse im beruflichen Alltag systematischer beurteilen möchten, informieren Sie sich über die Weiterbildung „Anwendungsbezogene KI im beruflichen Arbeitsalltag“. Für Fragen zur passenden Weiterbildung können Sie GrandEdu Media kontaktieren.

Quellen und Angebotsseite geprüft am 8. Oktober 2026. Alle Zahlen des Servicebeispiels sind frei gewählt.

Wissen wird wertvoll, wenn es Dich weiterbringt.

Welcher Bildungsweg passt zu Deinem nächsten Schritt?

Wir verbinden Deine beruflichen Ziele mit einer Weiterbildung, die fachlich, förderorientiert und persönlich zu Dir passt.

Beratungsgespräch