GrandEdu Journal · News

ROC-AUC bei KI: Ranking prüfen, Schwellenwert begründen

Berufserfahrener Analyst mit Brille betrachtet unbeschriftete Modellbewertungskurven auf einem großen Monitor in einem modernen Büro.
GrandEdu Media · NewsBerufserfahrener Analyst mit Brille betrachtet unbeschriftete Modellbewertungskurven auf einem großen Monitor in einem modernen Büro.

Ein KI-Bericht nennt eine ROC-AUC von 0,83. Soll das Team damit 83 Prozent der Fälle richtig entscheiden können? Nicht unbedingt. Die Kennzahl beschreibt eine Rangfolge über unterschiedliche Entscheidungsschwellen hinweg. Sie sagt noch nicht, welche Fälle bei einer bestimmten Schwelle markiert werden.

Wer ROC-AUC bei KI einordnen kann, stellt deshalb zwei getrennte Fragen: Trennt das Modell positive und negative Fälle anhand seiner Scores sinnvoll? Und welche Entscheidung ist im geplanten Arbeitsablauf vertretbar? Fünf erfundene Bildfälle zeigen den Unterschied – ohne Programmierkenntnisse und ohne eine pauschale Freigabegrenze.

Vor der Rechnung: Was bedeutet ein hoher Score?

Wir betrachten ausschließlich eine binäre Aufgabe, also zwei mögliche Klassen. Ein fiktives Modell bewertet Produktfotos darauf, ob der Hintergrund von einer vorher festgelegten Fotovorgabe abweicht. Die Referenzklasse „Abweichung vorhanden“ heißt positiv, die Klasse „keine Abweichung“ negativ. „Positiv“ ist hier kein Lob, sondern ein technischer Klassenname.

Ein höherer Score soll stärker für die positive Klasse sprechen. Das muss vor jeder Auswertung klar sein. Ein Wert für „keine Abweichung“ hätte die entgegengesetzte Richtung. Nach der offiziellen Dokumentation zu roc_auc_score können für binäre Aufgaben sowohl passende Wahrscheinlichkeitsausgaben als auch noch nicht in Klassen umgewandelte Entscheidungswerte verwendet werden.

Unsere Zahlen sind frei gewählte Scores. Wir behandeln 0,90 nicht als nachgewiesene 90-Prozent-Wahrscheinlichkeit. Die Referenzklassen sind ebenfalls vorgegeben. Der Lernfall beschreibt weder eine tatsächliche GrandEdu-Anwendung noch die Qualität eines realen KI-Modells.

Die AUC wird durch sechs Paarvergleiche verständlich

AUC steht für „Area Under the Curve“, die Fläche unter der ROC-Kurve. Die Google-Lerneinheit zu ROC und AUC erläutert für die binäre Aufgabe eine anschauliche Interpretation: Wie wahrscheinlich erhält ein zufällig ausgewählter positiver Fall einen höheren Score als ein zufällig ausgewählter negativer Fall? Im folgenden kleinen Datensatz haben alle Fälle gleiches Gewicht und unterschiedliche Scores.

Erfundene Bildfälle: Referenzklasse und Modellscore
Fall Referenz Score
A positiv 0,90
B positiv 0,70
C positiv 0,40
D negativ 0,60
E negativ 0,20

Drei positive Fälle lassen sich jeweils mit zwei negativen vergleichen. Das ergibt 3 × 2 = 6 Paare. Wir zählen nicht sechs verschiedene Fotos, sondern sechs Vergleiche zwischen den vorhandenen Fotos.

  • A gegen D und E: 0,90 ist größer als 0,60 und 0,20. Beide Paare sind richtig geordnet.
  • B gegen D und E: Auch 0,70 liegt über beiden negativen Scores. Wieder sind zwei Paare richtig geordnet.
  • C gegen D und E: 0,40 liegt unter 0,60, aber über 0,20. Nur eines der beiden Paare ist richtig geordnet.

Damit erhalten wir AUC = 5 ÷ 6 ≈ 0,8333. Der Wert bedeutet in dieser Übung: Fünf der sechs positiven-negativen Paare haben die gewünschte Reihenfolge. Er bedeutet nicht „83,33 Prozent richtige Klassifikationen“ und auch nicht „83,33 Prozent aller markierten Fotos sind tatsächlich auffällig“.

Aus derselben Rangfolge entstehen verschiedene ROC-Punkte

Für eine konkrete Markierung benötigen wir zusätzlich eine Schwelle. Wir vereinbaren ausdrücklich: Score größer oder gleich der Schwelle bedeutet positive Markierung. Die Dokumentation zu roc_curve beschreibt ROC-Punkte durch die Rate richtig erkannter positiver Fälle und die Rate falsch markierter negativer Fälle bei den jeweiligen Schwellen.

Auf der senkrechten Achse steht die True Positive Rate: erkannte positive Fälle geteilt durch alle tatsächlichen positiven Fälle. Auf der waagerechten Achse steht die False Positive Rate: falsch markierte negative Fälle geteilt durch alle tatsächlichen negativen Fälle. Der Nenner ist also nicht bei beiden Achsen die Gesamtzahl aller Fotos.

Schwelle 0,70: Zwei positive Fälle, kein Fehlalarm

A und B werden markiert. C bleibt unmarkiert; D und E ebenfalls. Wir erkennen zwei von drei positiven Fällen: TPR = 2/3, rund 66,7 Prozent. Von zwei negativen Fällen wird keiner markiert: FPR = 0. Der ROC-Punkt liegt bei (0; 2/3).

Schwelle 0,50: Ein zusätzlicher Fehlalarm, kein zusätzlicher Treffer

Nun wird auch D markiert, C aber weiterhin nicht. Die TPR bleibt 2/3. Die FPR steigt auf 1/2, also 50 Prozent. Der Punkt liegt bei (1/2; 2/3). In dieser Übung bringt die niedrigere Schwelle zunächst ausschließlich einen zusätzlichen Fehlalarm.

Schwelle 0,40: Alle positiven Fälle werden markiert

Jetzt kommt C hinzu. Die TPR steigt auf 3/3 = 1, die FPR bleibt 1/2. Der Punkt lautet (1/2; 1). Vier Fotos werden markiert, davon drei tatsächlich positive. Diese drei Punkte gehören zur selben Rangfolge und damit zur selben bereits berechneten AUC.

Die Fläche entscheidet nicht über Ihren Arbeitsablauf

Die scikit-learn-Einführung zur Wahl von Entscheidungsschwellen trennt das statistische Modell ausdrücklich von der anschließenden Handlung. Eine veränderte Schwelle kann andere Klassenentscheidungen erzeugen, obwohl die Scores und die ROC-Kurve gleich bleiben.

Für unseren Fotofall wäre deshalb zuerst der weitere Ablauf zu klären. Soll eine Markierung eine zusätzliche Sichtprüfung auslösen? Wie viele Fotos kann das Team ansehen? Was geschieht mit einem nicht markierten Foto, das dennoch von der Vorgabe abweicht? Diese Fragen werden von der AUC nicht beantwortet.

Die hohe Schwelle spart in unserer Übung eine unnötige Prüfung, übersieht aber C. Die niedrige Schwelle findet C zusätzlich, lässt jedoch D weiterhin prüfen. Keine Variante ist allein wegen der Fläche unter der Kurve für jeden Betrieb richtig. Die Zahlen machen den Zielkonflikt sichtbar; die verantwortliche Entscheidung braucht die Anforderungen des konkreten Prozesses.

Was in einem belastbaren Bericht zusätzlich stehen sollte

Die Aussage „AUC 0,83“ sollte um Klasse, Score-Richtung, Datenbestand und Berechnungsvariante ergänzt werden. Unsere Rechnung behandelt eine ungewichtete binäre Gesamt-AUC. Ein Wert für eine andere Variante, etwa einen begrenzten Kurvenbereich, ist nicht ohne Weiteres derselbe Maßstab. Die roc_auc_score-Dokumentation beschreibt solche unterschiedlichen Optionen.

Für die betriebliche Nutzung gehört außerdem der relevante Kurvenbereich in den Bericht. Wenn viele Fehlalarme nicht bearbeitbar wären, interessiert besonders, welche Trefferquote bei niedriger Fehlalarmrate erreichbar ist. Ein Gesamtwert über alle Schwellen legt diesen einzelnen Arbeitspunkt nicht fest.

Auch fünf Fotos reichen nicht für eine belastbare Auswahl. Der Fall erklärt die Rechnung, nicht die Übertragbarkeit auf andere Motive. Die Schwelle sollte nicht auf denselben Daten optimiert werden, mit denen das Modell trainiert wurde; darauf weist die offizielle Schwellen-Dokumentation wegen des Überanpassungsrisikos hin. Die abschließende Bewertung benötigt eine von der Anpassung getrennte Prüfgrundlage.

FAQ zur ROC-AUC bei KI

Ist eine AUC von 0,50 gleich 50 Prozent Trefferquote?

Nein. 0,50 ist die typische Referenz für eine zufällige Rangfolge in der binären Betrachtung. Die Trefferquote bei einer konkreten Schwelle ist eine andere Größe.

Was sagt eine AUC von 1 aus?

Bei unseren Annahmen liegen sämtliche positiven Scores über sämtlichen negativen. Das beschreibt die Trennung im betrachteten Datensatz, nicht eine Garantie für neue Fotos oder einen automatisch passenden Arbeitsprozess.

Kann ich die Rechnung für mehrere Klassen übernehmen?

Nicht unverändert. Mehrklassen-AUC benötigt zusätzliche Festlegungen zu Vergleich und Zusammenfassung. Dieser Beitrag erklärt bewusst nur die binäre Aufgabe.

Fazit: Rangfolge und Entscheidung getrennt begründen

Die ROC-AUC bewertet nicht eine einzige fertige Ja-Nein-Entscheidung. Unser Paarvergleich erklärt den Gesamtwert; die ROC-Punkte zeigen, was unterschiedliche Schwellen daraus machen. Lesen Sie beides zusammen und übersetzen Sie den relevanten Arbeitspunkt in konkrete Prüfaufgaben.

Der öffentlich angebotene Kurs KI-Grundlagenkompetenzen für die digitale Arbeitswelt behandelt Datenlogik und die fachliche Bewertung von KI-Ergebnissen. Dieser Artikel ist eine eigenständige Einführung, keine Zusage zu einer bestimmten Kennzahlenübung im Kurs. Über den Kontakt zu GrandEdu Media können Sie Ihren Lernbedarf besprechen.

Quellen- und Angebotsprüfung: 10. Oktober 2026. Alle Bildfälle und Scores sind erfunden und dienen ausschließlich dem Lernen.

Wissen wird wertvoll, wenn es Dich weiterbringt.

Welcher Bildungsweg passt zu Deinem nächsten Schritt?

Wir verbinden Deine beruflichen Ziele mit einer Weiterbildung, die fachlich, förderorientiert und persönlich zu Dir passt.

Beratungsgespräch