GrandEdu Journal · News

Brier-Score bei KI: Gleiche Trefferquote, andere Wahrscheinlichkeiten

Berufstätige Frau vergleicht an einem Arbeitsplatz zwei grafische Wahrscheinlichkeitsdarstellungen auf einem Monitor.
GrandEdu Media · NewsBerufstätige Frau vergleicht an einem Arbeitsplatz zwei grafische Wahrscheinlichkeitsdarstellungen auf einem Monitor.

Eine KI sagt nicht immer nur „ja“ oder „nein“. Manche Modelle liefern zusätzlich eine Wahrscheinlichkeit: etwa 60 oder 90 Prozent dafür, dass ein Dokument unvollständig ist. Für die spätere Entscheidung wird daraus häufig ein festes Etikett. Dabei geht Information verloren. Zwei Modelle können dieselben Etiketten erzeugen, obwohl eines bei einem Fehler viel selbstsicherer auftritt. Der Brier-Score bei KI hilft, diese Wahrscheinlichkeitsangaben zu beurteilen. Entscheidend ist allerdings, genau zu wissen, was berechnet wird und welche Schlussfolgerungen daraus zulässig sind.

Erst das Ereignis festlegen, dann die Zahl lesen

Bevor ein Team Wahrscheinlichkeiten vergleicht, braucht es eine eindeutige Frage. In unserem Beispiel lautet sie: „Fehlt mindestens eines der zuvor festgelegten Dokumentbestandteile?“ Das Ereignis „unvollständig“ erhält den tatsächlichen Wert 1, ein vollständiges Dokument den Wert 0. Das ist eine frei erfundene Prüfübung, keine Aussage über GrandEdu-Ergebnisse und keine rechtliche Beurteilung von Unterlagen.

Die Modellangabe muss sich auf genau dieses Ereignis beziehen. Eine Wahrscheinlichkeit von 0,90 bedeutet hier also 90 Prozent für unvollständig, nicht 90 Prozent für vollständig. Vertauschte Klassen würden die ganze Auswertung verändern. Auch die Einheit muss stimmen: In die Rechnung gehört 0,90, nicht die Zahl 90. Eine frei formulierte Selbstbewertung eines Chatbots wie „Ich bin ziemlich sicher“ ist dafür noch keine überprüfte Modellwahrscheinlichkeit.

Der Brier-Score misst die mittlere quadratische Abweichung zwischen vorhergesagter Wahrscheinlichkeit und tatsächlichem Ergebnis. Die offizielle scikit-learn-Dokumentation zum Brier-Score beschreibt die Berechnung und die unterschiedlichen Skalierungskonventionen. Im Folgenden verwenden wir ausschließlich die ungewichtete binäre Variante für eine festgelegte positive Klasse, mit einem Wertebereich von 0 bis 1.

Ein Vergleich mit identischer Trefferquote

Zwei fiktive Modelle werden an denselben vier Dokumenten getestet. Die ersten drei sind nach der festgelegten Checkliste unvollständig, das vierte ist vollständig. Beide Modelle sagen bei jedem Fall eine Wahrscheinlichkeit oberhalb von 0,50 voraus. Wenn wir ab einschließlich 0,50 das Etikett „unvollständig“ vergeben, treffen beide dieselben vier Entscheidungen.

Fiktive Testfälle: Wahrscheinlichkeit für „unvollständig“
Fall / Ergebnis Modell A Modell B
1 · unvollständig (1) 0,90 0,60
2 · unvollständig (1) 0,90 0,60
3 · unvollständig (1) 0,90 0,60
4 · vollständig (0) 0,99 0,60

Die Fälle 1 bis 3 werden richtig eingeordnet, Fall 4 falsch. Beide Modelle erreichen in dieser kleinen Übung 75 Prozent Trefferquote. Der Schwellenwert macht die Wahrscheinlichkeit von 0,60 und die von 0,99 zu demselben Etikett. Für die Bewertung der Wahrscheinlichkeiten sind sie jedoch nicht gleichwertig.

So entsteht der Brier-Score Schritt für Schritt

Modell A: sehr zuversichtlich, einmal deutlich daneben

Für jeden Fall wird die Wahrscheinlichkeit minus tatsächlicher Wert gerechnet; anschließend wird diese Differenz quadriert. Bei den ersten drei Fällen ergibt sich jeweils (0,90 − 1)² = 0,01. Beim vierten Fall ergibt sich dagegen (0,99 − 0)² = 0,9801. Modell A hat gerade beim vollständigen Dokument eine sehr hohe Wahrscheinlichkeit für das Gegenteil angegeben.

Die vier Werte werden addiert und durch vier geteilt: (0,01 + 0,01 + 0,01 + 0,9801) ÷ 4 = 0,252525. Gerundet auf vier Nachkommastellen lautet der Brier-Score 0,2525.

Modell B: zurückhaltender, in diesem Vergleich günstiger

Die ersten drei Abweichungen ergeben hier jeweils (0,60 − 1)² = 0,16. Beim vierten Fall ergibt sich (0,60 − 0)² = 0,36. Damit lautet die Rechnung (0,16 + 0,16 + 0,16 + 0,36) ÷ 4 = 0,21.

Modell B hat auf diesen vier Fällen den niedrigeren Score. Modell A lag bei den drei richtigen Fällen näher am tatsächlichen Ergebnis, verlor diesen Vorteil aber durch die extreme Fehlprognose im letzten Fall. Das ist die eigentliche Lernidee: Eine Kennzahl für feste Entscheidungen und eine Kennzahl für Wahrscheinlichkeiten beantworten unterschiedliche Fragen. Die quadratische Abweichung enthält dabei noch keine betriebsspezifischen Kosten eines Fehlers.

Was die bessere Zahl ausdrücklich nicht beweist

Vier Fälle erklären eine Rechnung, reichen aber nicht für eine belastbare Auswahl eines KI-Systems. Außerdem ist ein niedrigerer Brier-Score kein alleiniger Nachweis besserer Kalibrierung. Nach der offiziellen Dokumentation zur Wahrscheinlichkeitskalibrierung gehen mehrere Aspekte der Prognosequalität in den Score ein. Für die Kalibrierung selbst sind unter anderem Zuverlässigkeitsdiagramme hilfreich.

Kalibrierung fragt beispielsweise, ob in einer größeren Gruppe von Fällen mit einer Prognose um 80 Prozent ungefähr 80 Prozent tatsächlich positiv sind. Sie fragt nicht, ob jede einzelne 80-Prozent-Prognose richtig sein muss. Ein Team sollte deshalb den Gesamtwert zusammen mit der Verteilung der Wahrscheinlichkeiten, den Fallzahlen und den beobachteten Ergebnissen ansehen. Kleine oder seltene Gruppen erlauben nur vorsichtige Aussagen.

Auch die Übertragbarkeit bleibt begrenzt: Ein Vorteil auf einem bestimmten Testbestand ist kein Beleg für dieselbe Qualität bei anderen Dokumentarten. Ein Modellwechsel oder eine veränderte Datengrundlage verlangt eine neue Prüfung. Ein niedriger Score ersetzt weder die fachliche Kontrolle kritischer Fälle noch die Entscheidung, welche Fehler im konkreten Arbeitsprozess akzeptabel sind.

Ein schlanker Prüfauftrag für den Arbeitsalltag

Statt nur „Welches Modell gewinnt?“ zu fragen, kann ein Fachteam vor einer Auswertung fünf konkrete Punkte schriftlich vereinbaren:

  1. Ereignis: Was zählt als positiver Fall, und nach welcher festen Checkliste wird das tatsächliche Ergebnis geprüft?
  2. Ausgabe: Stammt die Zahl aus einer geeigneten Wahrscheinlichkeitsausgabe, und gehört sie zur richtigen Klasse?
  3. Vergleich: Werden beide Modelle auf denselben Fällen, mit identischen Gewichten und derselben Skalierung beurteilt?
  4. Einordnung: Welche Fallzahlen und Wahrscheinlichkeitsgruppen stehen hinter dem Gesamtwert?
  5. Nutzung: Welche zusätzliche fachliche Prüfung bleibt für Entscheidungen notwendig?

Diese Vereinbarungen verhindern, dass eine scheinbar präzise Zahl ohne verständlichen Kontext in eine Präsentation wandert. Für unser Beispiel wäre die korrekte Aussage: „Modell B hat auf den vier fiktiven Fällen den niedrigeren binären Brier-Score bei gleicher Trefferquote.“ Nicht korrekt wäre: „Modell B ist damit für jede Aufgabe verlässlich.“

FAQ zum Brier-Score bei KI

Ist 0,21 grundsätzlich ein guter Wert?

Das lässt sich ohne Vergleichskontext nicht sagen. Aufgaben, Testbestände und Ereignishäufigkeiten können verschieden sein. Unser Wert ist ein Rechenergebnis aus vier erfundenen Fällen, kein allgemeiner Qualitätsstandard.

Muss man dafür den Entscheidungsschwellenwert ändern?

Nein. Der Score verwendet hier die Wahrscheinlichkeiten vor der Umwandlung in Etiketten. Ein anderer Schwellenwert könnte die Trefferquote verändern, ohne die bereits berechneten Wahrscheinlichkeitsabweichungen zu verändern.

Gilt dieselbe Formel auch für mehrere Klassen?

Der Beitrag behandelt nur zwei mögliche Ergebnisse. Bei Mehrklassenaufgaben sind Klassenanzahl und Skalierung zu berücksichtigen. Ungeprüft übernommene Werte aus unterschiedlichen Berechnungsvarianten sollten nicht miteinander verglichen werden.

Fazit: Wahrscheinlichkeiten sichtbar machen

Eine Trefferquote verdeckt, wie entschieden ein Modell seine Prognosen abgibt. Der Brier-Score ergänzt diesen Blick durch eine nachvollziehbare Rechnung, liefert aber kein vollständiges Qualitätssiegel. Wer Ereignis, Klassenrichtung und Vergleichsgrundlage sauber festhält, kann gezielter über KI-Ergebnisse sprechen und passende Rückfragen stellen.

Wenn Sie KI im Arbeitsalltag fachlich einordnen möchten, finden Sie im öffentlich angebotenen Kurs Anwendungsbezogene KI für den beruflichen Arbeitsalltag Informationen zu Datenlogik, praktischen Anwendungen und Ergebnisprüfung. Dieser Beitrag ist eine eigenständige Einführung; er verspricht keine Behandlung einzelner Kennzahlen im Kurs. Über die Kontaktseite von GrandEdu Media können Sie Ihre Lernziele und Fragen zum Angebot besprechen.

Wissen wird wertvoll, wenn es Dich weiterbringt.

Welcher Bildungsweg passt zu Deinem nächsten Schritt?

Wir verbinden Deine beruflichen Ziele mit einer Weiterbildung, die fachlich, förderorientiert und persönlich zu Dir passt.

Beratungsgespräch