Zwei Personen beurteilen Oberflächen: „unauffällig“ oder „auffällig“. In 90 Prozent der Fälle geben sie dasselbe Urteil ab. Das klingt zunächst beruhigend. Ob diese Zahl viel über ihre Übereinstimmung aussagt, hängt jedoch auch davon ab, wie oft beide die einzelnen Kategorien verwenden.
Cohens Kappa macht diese zusätzliche Perspektive sichtbar. Der Beitrag richtet sich an Interessenten am Qualitätsmanagement und an Beschäftigte, die visuelle Prüfungen verstehen möchten. Zwei frei erfundene Datensätze zeigen, warum dieselbe Übereinstimmungsquote zu unterschiedlichen Kappa-Werten führen kann. Es geht um kategorische Urteile, nicht um den Vergleich von Millimeterwerten oder die Überwachung eines Prozessverlaufs.
Erst klären: Was vergleichen wir überhaupt?
Für unsere Übung sehen Person A und Person B dieselben 20 Übungsstücke jeweils einmal. Jede Person ordnet jedes Stück unabhängig der anderen genau einer von zwei Kategorien zu. „Unauffällig“ und „auffällig“ sind hier Bezeichnungen ohne Rangabstufung. Eine bekannte richtige Referenzentscheidung liegt nicht vor.
Die Minitab-Methodendokumentation zu Cohens Kappa beschreibt für den Vergleich zwischen Personen bei unbekanntem Standard genau zwei Beurteilende mit jeweils einem Durchgang und nominalen Kategorien. Mehr Personen, Wiederholungen oder abgestufte Bewertungen erfordern eine passend gewählte Auswertung. Unser einfaches Beispiel darf nicht ungeprüft auf jede Prüfstudie übertragen werden.
Die wichtigste Einschränkung steht schon vor der Rechnung: Wir untersuchen, ob A und B gleich urteilen. Wir wissen damit noch nicht, ob ihre Urteile fachlich richtig sind. Auch ein gemeinsamer Irrtum erzeugt Übereinstimmung.
Datensatz eins: Beide Kategorien werden gleich häufig genutzt
Im ersten fiktiven Datensatz erhält jede Kategorie bei beiden Personen zehn Zuordnungen. Die Tabelle zählt die gemeinsamen Urteile. Ihre Zeilen gehören zu A, ihre Spalten zu B. Eine Tabellenzelle enthält also eine Anzahl von Übungsstücken, keinen Prozentwert.
| Urteil A | B: unauffällig | B: auffällig |
|---|---|---|
| Unauffällig | 9 | 1 |
| Auffällig | 1 | 9 |
Auf der Hauptdiagonale stehen neun gemeinsam unauffällige und neun gemeinsam auffällige Urteile. Insgesamt stimmen 18 von 20 Entscheidungen überein: 90 Prozent. Bei zwei Stücken gehen die Urteile auseinander. Welche Person dort richtigliegt, lässt sich ohne geeignete Referenz nicht entscheiden.
Die Zufallserwartung kommt aus den Randanteilen
Die offizielle scikit-learn-Dokumentation zu Cohens Kappa gibt die Formel κ = (pₒ − pₑ) / (1 − pₑ) an. pₒ bezeichnet den beobachteten Übereinstimmungsanteil. pₑ ist die erwartete Übereinstimmung bei unabhängigen Zuordnungen mit den beobachteten Kategoriehäufigkeiten jeder Person.
„Zufall“ bedeutet dabei nicht, dass die Prüfenden tatsächlich geraten hätten. Es ist eine rechnerische Vergleichserwartung. Für Datensatz eins verwendet jede Person jede Kategorie mit Anteil 0,50. Deshalb beträgt pₑ = 0,50 × 0,50 + 0,50 × 0,50 = 0,50.
Mit pₒ = 0,90 folgt κ = (0,90 − 0,50) / (1 − 0,50) = 0,80. Die Übereinstimmung liegt deutlich über der hier berechneten Zufallserwartung. Das ist eine Beschreibung dieses erfundenen Datensatzes, kein Freigabeurteil.
Datensatz zwei: Fast alles heißt „unauffällig“
Nun betrachten wir einen zweiten, ebenfalls vollständig erfundenen Datensatz. Wieder werden 20 Stücke beurteilt. Diesmal verwenden beide Personen „unauffällig“ jeweils 19-mal und „auffällig“ jeweils einmal. Die beiden auffälligen Urteile betreffen unterschiedliche Stücke.
| Urteil A | B: unauffällig | B: auffällig |
|---|---|---|
| Unauffällig | 18 | 1 |
| Auffällig | 1 | 0 |
Erneut stimmen 18 von 20 Urteilen überein. Die einfache Quote bleibt also bei 90 Prozent. Die Kategorieanteile lauten aber nun 0,95 und 0,05. Damit wird pₑ = 0,95 × 0,95 + 0,05 × 0,05 = 0,905, also 90,5 Prozent.
Die Rechnung ergibt κ = (0,90 − 0,905) / (1 − 0,905) = rund −0,053. Laut JMP-Dokumentation zur Übereinstimmungsstatistik bedeutet ein negativer Kappa-Wert, dass die beobachtete Übereinstimmung unter der modellierten Zufallserwartung liegt.
Unser Ergebnis zeigt keine absichtliche Gegnerschaft der Prüfenden. Es zeigt: Bei diesen Randanteilen ist eine hohe Gesamtquote bereits rechnerisch zu erwarten. Außerdem stimmen die Personen bei keinem gemeinsam als auffällig eingeordneten Stück überein. Genau diese Information verschwindet hinter der pauschalen Aussage „90 Prozent gleich“.
Was Sie aus den beiden Rechnungen mitnehmen sollten
Kappa ergänzt die einfache Quote, ersetzt aber nicht die Tabelle. Datensatz eins und zwei haben dieselbe beobachtete Übereinstimmung und sehr unterschiedliche Randverteilungen. Daher sollte ein Bericht Quote, Kappa und Kategoriehäufigkeiten gemeinsam zeigen. Vergleiche zwischen Studien brauchen auch einen Blick auf deren unterschiedliche Zusammensetzung.
Verwenden Sie die Zahlen nicht als Rangliste zweier realer Teams. Dafür fehlen hier insbesondere ein angemessener Untersuchungsplan, belastbare Stichproben und eine Bewertung der Unsicherheit. Die 20 Stücke dienen allein dazu, die Rechenschritte nachvollziehbar zu halten.
Für eine reale Entscheidung ist zudem relevant, welche Fehlentscheidung welche Folgen hätte. Ein gemeinsam übersehener kritischer Fehler wäre etwas anderes als eine unnötige Nachprüfung. Ohne Referenzurteile kann unser Vergleich solche Fehlerarten nicht bestimmen. Ein hoher Kappa-Wert allein beweist deshalb weder Produktsicherheit noch die Richtigkeit einer Freigabe.
Vor einer echten Untersuchung: Kriterien und Auswahl vorbereiten
Beginnen Sie mit einer klaren Beschreibung der Kategorien. Welche sichtbaren Merkmale gehören wohin? Wie werden Grenzfälle beurteilt? Halten Sie die Arbeitsanweisung fest, bevor die Daten entstehen. Ein nachträgliches Umbenennen schwieriger Fälle verändert die Fragestellung.
Die Minitab-Hinweise zur Studienplanung empfehlen unter anderem zufällige Beurteilungsreihenfolgen, repräsentative Personen und eine geeignete Mischung der Kategorien einschließlich grenznaher Stücke. Wiederholungen helfen bei einer anderen Frage: Bleibt dieselbe Person bei ihrem Urteil? Ein bekannter Standard ermöglicht zusätzlich den Vergleich mit einer Referenz.
Übertragen Sie eine bewusst zusammengestellte Lern- oder Untersuchungsstichprobe nicht automatisch auf die Häufigkeit von Fehlern im Produktionsalltag. Lassen Sie Umfang, Auswertungsverfahren und Entscheidungskriterien fachlich festlegen. Die beiden Tabellen dieses Artikels sind weder ein Normnachweis noch ein vollständiges Studiendesign.
FAQ: Cohens Kappa richtig einordnen
Sind 90 Prozent Übereinstimmung immer schlecht?
Nein. Unsere Beispiele zeigen lediglich, dass die Quote ohne Kategorieverteilung unvollständig ist. Ob eine Prüfung für ihren Zweck ausreichend ist, muss anhand passender Anforderungen und einer geeigneten Datenbasis bewertet werden.
Beweist Kappa gleich eins richtige Urteile?
Nein. Vollständige Übereinstimmung zwischen Personen ist nicht automatisch Übereinstimmung mit einem richtigen Referenzurteil. Gleich urteilen und richtig urteilen sind verschiedene Fragen.
Was passiert, wenn beide nur eine Kategorie verwenden?
Dann können pₒ und pₑ beide eins sein; der Nenner wird null. Kappa ist in diesem Fall nicht definiert. Auch die scikit-learn-Dokumentation weist auf solche Konstellationen hin. Ein fehlender Wert darf nicht stillschweigend als „perfekt bestanden“ ausgegeben werden.
Fazit: Die Häufigkeiten gehören zur Aussage
Cohens Kappa erklärt, weshalb eine hohe Übereinstimmungsquote nicht immer eine starke zusätzliche Übereinstimmung bedeutet. Beginnen Sie mit der Kreuztabelle, rechnen Sie die Randanteile nach und trennen Sie den Vergleich zwischen Personen von der fachlichen Richtigkeit ihrer Entscheidungen.
Sie möchten solche Qualitätsfragen systematischer bearbeiten? Der öffentlich angebotene Qualitätsmanager-Lehrgang bei GrandEdu Media nennt Messung, Prüfung und Überwachung von Prozessen und Produkten als Inhalte. Dieser Beitrag ist eine eigenständige Lernanregung, keine Zusage eines speziellen Kappa-Moduls. Über den Kontakt zu GrandEdu Media können Sie klären, welches Angebot zu Ihren Aufgaben und Vorkenntnissen passt.
Quellen und Angebot geprüft am 9. Oktober 2026. Sämtliche Tabellenwerte sind erfunden und ausschließlich für Lernzwecke bestimmt.