Zum Inhalt springen
Beyond Prompt AI Studio
AI-Modelle richtig vergleichen

Wissens- und Reasoning-Benchmarks: MMLU, GPQA & die Sättigungsfalle

„Wie man AI-Performance überhaupt misst“ hat objektiv-korrekte Benchmarks als ersten von drei Mess-Paradigmen vorgestellt. Die bekanntesten Vertreter – MMLU und GPQA – zeigen dabei ein wiederkehrendes Muster: Ein Benchmark erscheint, wird zum Standard, und verliert dann innerhalb weniger Jahre an Aussagekraft.

Einschätzung Stand: Juli 2026 – Forschung entwickelt sich schnell, diese Einordnung kann sich ändern.

Tippe auf einen Meilenstein, um mehr zu erfahren.

Vier Beispiele – zum Merken

Wie MMLU und GPQA funktionieren

MMLU (Massive Multitask Language Understanding) besteht aus Multiple-Choice-Fragen über 57 Fachgebiete, von Jura bis Medizin. GPQA (Graduate-Level Google-Proof Q&A) geht einen Schritt weiter: Die Fragen aus Biologie, Chemie und Physik sind so anspruchsvoll formuliert, dass selbst Promovierte außerhalb des jeweiligen Fachgebiets nur etwa 34% richtig beantworten – ein bewusst hoch angesetzter menschlicher Vergleichswert.

Die Sättigungsfalle

MMLU sättigt inzwischen bei über 88% für führende Modelle – der Benchmark unterscheidet Spitzenmodelle kaum noch voneinander. GPQA Diamond, die schwierigste Teilmenge, lag lange deutlich darunter, erreicht aber inzwischen ebenfalls hohe Werte bei führenden Modellen und nähert sich der Sättigung. Ein gesättigter Benchmark beantwortet die Frage „ist Modell A besser als Modell B?“ kaum noch, weil beide nahe am Maximum liegen.

Ein sich wiederholendes Muster

Dasselbe ist bereits einmal passiert: Der Sprachverständnis-Benchmark GLUE erschien 2018 – bereits etwa ein Jahr später übertrafen Modelle die menschliche Vergleichsmarke. Als Reaktion erschien 2019 der bewusst schwierigere Nachfolger SuperGLUE. Auch dort zeigte sich schnell: Bei einem Großteil der Teilaufgaben lagen Modelle bereits auf oder über dem Niveau menschlicher Crowdworker. Das Feld wechselte daraufhin zu MMLU und später zu GPQA – demselben Muster folgend, das sich mit MMLU und GPQA gerade wiederholt.

Warum das für dich als Entscheider zählt

Ein einzelner MMLU- oder GPQA-Wert, der zwei Spitzenmodelle vergleicht, sagt heute deutlich weniger aus als noch vor wenigen Jahren – beide liegen oft nah beieinander nahe am Maximum. Wer eine Anbieter-Behauptung auf Basis eines bekannten, weit verbreiteten Benchmarks bewertet, sollte prüfen, ob dieser Benchmark für die verglichenen Modelle überhaupt noch differenziert oder bereits gesättigt ist.

Das Wichtigste in Kürze

  • MMLU und GPQA sind objektiv-korrekte Wissens-/Reasoning-Benchmarks mit Multiple-Choice-Fragen und einer bekannten richtigen Antwort.
  • MMLU sättigt bei über 88% für führende Modelle; GPQA Diamond erreicht ebenfalls hohe Werte und nähert sich der Sättigung.
  • Ein gesättigter Benchmark unterscheidet Spitzenmodelle kaum noch voneinander.
  • Dasselbe Muster ist bereits einmal passiert: GLUE (2018) wurde binnen etwa einem Jahr übertroffen, der Nachfolger SuperGLUE (2019) sättigte ebenfalls schnell.
  • Ein Anbieter-Vergleich auf Basis eines weit verbreiteten Benchmarks sollte prüfen, ob dieser für die verglichenen Modelle noch differenziert oder bereits gesättigt ist.

Kurz-Check: Hast du es verstanden?

1 / 3

Warum sind GPQA-Fragen laut diesem Modul bewusst so schwierig formuliert?

Neugierig, wie aussagekräftig gängige Benchmarks wirklich noch sind?