GrandEdu Journal · News

Bonferroni-Korrektur im QM: Wenn viele Tests Fehlalarme häufen

Qualitätsanalyst betrachtet unbeschriftete Prozessdiagramme auf einem Bildschirm in einem modernen industriellen Arbeitsbereich.
GrandEdu Media · NewsQualitätsanalyst betrachtet unbeschriftete Prozessdiagramme auf einem Bildschirm in einem modernen industriellen Arbeitsbereich.

Ein Auswertungsprogramm liefert viele p-Werte, mehrere davon liegen unter 0,05. Das wirkt wie ein überzeugender Hinweis auf Prozessprobleme. Doch je mehr statistische Fragen gleichzeitig geprüft werden, desto leichter entsteht schon durch Zufall mindestens ein auffälliger Befund. Wer im Qualitätsmanagement Ergebnisse beurteilt, sollte deshalb nicht nur den einzelnen Test, sondern auch die gesamte Testserie betrachten.

Die Bonferroni-Korrektur macht diesen Unterschied greifbar. An einer selbst entwickelten Lernrechnung zeigen wir, warum zwanzig Tests nicht dieselbe Fehlalarmwahrscheinlichkeit haben wie einer, wie die Entscheidungsschwelle angepasst wird und wo die Methode Grenzen hat. Alle Zahlen sind Modellannahmen; der Beitrag legt keinen betrieblichen Prüf- oder Freigabestandard fest.

Fünf Prozent beziehen sich zunächst auf einen Test

Ein statistischer Test prüft eine festgelegte Nullhypothese. Sie könnte beispielsweise besagen, dass der Mittelwert eines Prozessmerkmals einem vorgegebenen Referenzwert entspricht. Ein Fehler erster Art liegt vor, wenn diese tatsächlich wahre Nullhypothese verworfen wird. Das Signifikanzniveau α begrenzt die Wahrscheinlichkeit dieses Fehlers unter den Voraussetzungen des gewählten Verfahrens.

Bei α = 0,05 beträgt dieses Risiko höchstens fünf Prozent pro Test. Das ist weder eine zulässige Ausschussquote noch die Wahrscheinlichkeit, dass ein konkretes Ergebnis falsch ist. Das NIST-Handbuch zu p-Werten und Entscheidungsschwellen erläutert die Bedeutung des Niveaus unter einer wahren Nullhypothese. Ein p-Wert wird unter dieser Hypothese berechnet; er ist nicht ihre Wahrheitswahrscheinlichkeit.

Unsere Lernrechnung: zwanzig Gelegenheiten für einen Fehlalarm

Ein fiktives Qualitätsteam plant zwanzig verschiedene Tests auf Prozessabweichungen. Im Gedankenexperiment sind sämtliche zwanzig Nullhypothesen wahr: Es gibt keine der untersuchten Abweichungen. Für die Rechnung nehmen wir außerdem unabhängige Testentscheidungen an und setzen das Fehlerrisiko jedes Tests exakt auf fünf Prozent. Diese Annahmen dienen allein der Veranschaulichung.

Ein einzelner Test bleibt damit mit 95 Prozent Wahrscheinlichkeit ohne Fehlalarm. Unter der angenommenen Unabhängigkeit ist die Wahrscheinlichkeit, dass alle zwanzig ohne Fehlalarm bleiben, das Produkt aus zwanzig Faktoren von 0,95:

0,9520 ≈ 35,8 Prozent.

Das Gegenereignis ist mindestens ein Fehlalarm in der gesamten Serie: 1 − 0,9520 ≈ 64,2 Prozent. Obwohl jeder einzelne Test nur fünf Prozent Fehlerrisiko hat, meldet die Serie in unserem Modell also häufig etwas Auffälliges.

Eigene Modellrechnung: unabhängige Tests, alle Nullhypothesen wahr
Anzahl Tests Mindestens ein Fehlalarm
1 5,0 %
5 22,6 %
20 64,2 %

Die 64,2 Prozent dürfen nicht als Wahrscheinlichkeit ausgegeben werden, dass ein bestimmter beobachteter Befund falsch ist. Sie beschreiben das Auftreten mindestens eines Fehlalarms bei wiederholten Serien unter unseren festgelegten Bedingungen. Bei abhängigen Tests gilt die Produktrechnung nicht einfach weiter. NIST erklärt das grundsätzliche Mehrfachvergleichsproblem im Kapitel über multiple Vergleiche.

Bonferroni-Korrektur im QM: das Risiko auf die Testfamilie verteilen

Die gemeinsam betrachteten Hypothesen bilden eine Testfamilie. Soll deren Risiko für mindestens eine fälschliche Verwerfung auf höchstens fünf Prozent begrenzt werden, verteilt die einfache Bonferroni-Korrektur dieses Niveau gleichmäßig auf die geplanten Tests. Bei zwanzig Tests ergibt sich:

0,05 ÷ 20 = 0,0025 = 0,25 Prozent je Test.

Verglichen wird der jeweilige p-Wert nun mit 0,0025 statt mit 0,05. Weder die Messwerte noch die Zahl der geprüften Teile werden durch zwanzig geteilt. Die Änderung betrifft die statistische Entscheidungsschwelle.

Die im NIST-Kapitel zur Bonferroni-Methode dargestellte allgemeine Wahrscheinlichkeitsungleichung begründet die Absicherung: Die Wahrscheinlichkeit mindestens eines Fehlers ist höchstens die Summe der einzelnen Fehlerwahrscheinlichkeiten. Sind diese jeweils auf 0,0025 begrenzt, ergibt die Summe höchstens 0,05. Dieser obere Grenzwert benötigt keine Unabhängigkeit, wohl aber gültige einzelne Testverfahren.

Ein p-Wert von 0,012 bekommt eine andere Einordnung

Nehmen wir für eine zusätzliche, rein fiktive Ergebnisübung p = 0,012 an. Bei der unbereinigten Schwelle 0,05 würde die betreffende Nullhypothese verworfen. In unserer vorab festgelegten Familie von zwanzig Tests unterschreitet der Wert die korrigierte Schwelle 0,0025 dagegen nicht.

Das bedeutet nicht, dass die Nullhypothese bewiesen oder der Prozess garantiert unverändert ist. Es bedeutet nur, dass dieser Test nach der gewählten gemeinsamen Entscheidungsregel keinen ausreichenden Verwerfungsgrund liefert. Auch ein sehr kleiner p-Wert sagt allein noch nichts darüber aus, ob eine Abweichung praktisch bedeutsam ist.

Was gehört zur Familie – und was zählt nicht als Test?

Die Anzahl der Tests ist nicht automatisch die Anzahl der Messwerte. Hundert Messungen können Grundlage eines einzigen Tests sein. Umgekehrt entstehen beim Vergleich von fünf Gruppen untereinander zehn verschiedene Paarvergleiche, nicht fünf: Jede Gruppe wird mit vier anderen verglichen, wobei jedes Paar nur einmal zählt.

Die Familie sollte aus der Fragestellung vor der Auswertung festgelegt werden. Wer zwanzig Hypothesen untersucht, aber anschließend nur den auffälligsten Befund zeigt, hat nicht plötzlich nur einen Test durchgeführt. Nachträgliches Auswählen verändert die ursprüngliche Suchaktivität nicht. Eine nachvollziehbare Planung benennt deshalb alle gemeinsam zu bewertenden Hypothesen und die zugehörige Entscheidungsregel.

Die strengere Schwelle hat einen Preis

Eine kleinere Schwelle reduziert Fehlalarme, kann bei unverändertem Untersuchungsumfang aber auch echte Abweichungen schwerer erkennbar machen. NIST unterscheidet im Überblick über statistische Tests zwischen dem Fehler erster Art und dem Übersehen einer falschen Nullhypothese, dem Fehler zweiter Art. Die Bonferroni-Korrektur ist deshalb nicht pauschal die beste Lösung jeder Auswertung.

Sie repariert außerdem weder eine verzerrte Datenauswahl noch ungeeignete Messungen oder ein falsch gewähltes Testmodell. Auch fortlaufende Regelkarten sind nicht automatisch eine abgeschlossene Familie von zwanzig Tests. Ihre Überwachungslogik muss gesondert fachlich ausgelegt werden; Eingriffsgrenzen werden nicht nach dieser Lernrechnung einfach durch zwanzig geteilt.

FAQ zur Bonferroni-Korrektur

Sind fünf Prozent je Test auch fünf Prozent für die Serie?

Nein. In unserem unabhängigen Modell steigt das Risiko mindestens eines Fehlalarms mit der Testzahl. Einzelrisiko und gemeinsames Risiko beantworten unterschiedliche Fragen.

Braucht Bonferroni unabhängige Tests?

Die allgemeine Fehlerbegrenzung nicht. Unabhängigkeit war eine Annahme unserer Produktrechnung, nicht Voraussetzung der zugrunde liegenden Bonferroni-Ungleichung.

Ist ein nicht signifikanter Befund ein Nachweis für Fehlerfreiheit?

Nein. Eine nicht verworfene Hypothese beweist weder Abwesenheit einer Abweichung noch Produktkonformität. Statistische Auswertung und fachliche Freigabe bleiben getrennte Aufgaben.

Fazit: vor dem ersten p-Wert die gemeinsame Frage klären

Die wichtigste Lernfrage lautet: Betrachte ich einen einzelnen Test oder eine ganze Familie? Die Bonferroni-Korrektur bietet für eine festgelegte Familie eine verständliche Fehlerbegrenzung. Dokumentiere dafür Hypothesen, Testzahl, gemeinsames Niveau und daraus abgeleitete Schwelle – nicht nur die am Ende auffälligen Werte.

Wenn Du Qualitätswissen systematisch ausbauen möchtest, informiere Dich über Qualitätsmanager inklusive TÜV-Zertifizierung. Die veröffentlichte Kursbeschreibung nennt unter anderem Qualitätsprüfung sowie die Messung und Überwachung von Prozessen und Produkten. Dieser Artikel ist eine eigenständige Lernanregung, kein zugesagter Kursbaustein. Über den Kontakt zu GrandEdu Media kannst Du passende Inhalte für Deine berufliche Aufgabe klären.

Quellen geprüft am 10. Oktober 2026. Sämtliche Rechen- und Ergebnisbeispiele sind fiktiv.

Wissen wird wertvoll, wenn es Dich weiterbringt.

Welcher Bildungsweg passt zu Deinem nächsten Schritt?

Wir verbinden Deine beruflichen Ziele mit einer Weiterbildung, die fachlich, förderorientiert und persönlich zu Dir passt.

Beratungsgespräch