Zum Inhalt springen
Beyond Prompt AI Studio
AI-Modelle richtig vergleichen

Wie man AI-Performance überhaupt misst: die Bausteine, die du kennen musst

„Modell A schlägt Modell B“ klingt nach einer einfachen Tatsache. Um eine solche Aussage wirklich einordnen zu können, reichen vier Bausteine – ohne Formeln, mit Beispielen zum Anfassen.

Vier Beispiele – zum Merken

Probier es aus: Die Mess-Paradigmen im Vergleich

Tippe eine Dimension an und vergleiche die Mess-Paradigmen.

Objektiv korrekt

Eindeutige richtige Antwort, keine Interpretation nötig

Urteilsbasiert (Mensch oder KI)

Bewertung hängt vom Urteilsvermögen des Menschen oder der bewertenden KI ab

Baustein 1: Was ist überhaupt ein Benchmark?

Ein Benchmark ist im Kern nichts anderes als ein Fragebogen mit bekannten richtigen Antworten: eine feste Menge an Testaufgaben, bei denen vorher klar ist, was „richtig“ ist. Ein Modell bearbeitet diese Aufgaben, und ein Auswertungsverfahren zählt, wie oft die Antwort mit der bekannten richtigen übereinstimmt. Genau dieses einfache Prinzip steckt hinter den meisten „Wissens“-Benchmarks.

Baustein 2: Drei grundverschiedene Arten zu messen

Nicht jeder Benchmark misst auf dieselbe Art. Drei Typen erklären fast die gesamte Landschaft: Bei objektiv korrekten Benchmarks gibt es eine eindeutig richtige Antwort – eine Mathe-Aufgabe, eine Multiple-Choice-Frage, ob ein Code-Fix die Tests besteht. Bei menschlicher Präferenz gibt es keine „richtige“ Antwort, sondern Menschen vergleichen zwei Antworten und sagen, welche ihnen besser gefällt. Und bei KI als Richter bewertet ein anderes Sprachmodell die Antwort nach einem vorgegebenen Kriterienraster – genutzt, weil das deutlich günstiger und schneller ist als menschliche Bewertung.

Jeder dieser drei Typen hat eigene Schwächen, die in den folgenden Modulen im Detail behandelt werden.

Baustein 3: Warum die Stichprobengröße zählt

Ein Modell beantwortet 10 Testfragen, 8 davon richtig – „80%“. Wirft man eine faire Münze 10-mal, landet man aber auch relativ häufig bei 8 oder mehr Treffern, rein durch Zufall. Erst bei ausreichend vielen Testfragen – bei echten Benchmarks meist Hunderte bis Tausende – wird eine Prozentzahl überhaupt aussagekräftig.

Baustein 4: Warum ein kleiner Unterschied oft kein echter Unterschied ist

71% vs. 73% klingt nach einem klaren Sieger. Ist die zugrundeliegende Stichprobe aber klein oder die Aufgabe schwierig, kann dieser Abstand komplett im Bereich des Zufalls liegen. Genau das drückt ein Konfidenzintervall aus, ohne dass man die Formel dahinter kennen muss: Es sagt im Kern „die wahre Punktzahl liegt mit hoher Wahrscheinlichkeit irgendwo in diesem Bereich“ – und wenn sich die Bereiche zweier Modelle überschneiden, ist der behauptete Sieger nicht gesichert.

Warum das für dich als Entscheider zählt

Diese vier Bausteine reichen aus, um jede Benchmark-Zahl kritisch zu lesen, noch bevor man einen konkreten Benchmark im Detail kennt. Die folgenden Module schauen sich die drei Mess-Paradigmen aus Baustein 2 einzeln an – und zeigen, wo jedes davon in der Praxis an seine Grenzen stößt.

Das Wichtigste in Kürze

  • Ein Benchmark ist im Kern ein Fragebogen mit bekannten richtigen Antworten plus einem Auswertungsverfahren.
  • Drei grundverschiedene Mess-Arten prägen die Landschaft: objektiv korrekt, menschliche Präferenz und KI als Richter.
  • Eine Prozentzahl ist nur aussagekräftig, wenn die zugrundeliegende Stichprobe groß genug ist – bei zu wenigen Testfragen kann ein hoher Wert reiner Zufall sein.
  • Ein kleiner Unterschied zwischen zwei Werten ist oft kein echter Unterschied, wenn sich die Konfidenzintervalle beider Werte überschneiden.
  • Diese vier Bausteine reichen aus, um jede Benchmark-Zahl kritisch einzuordnen, bevor man den jeweiligen Benchmark im Detail kennt.

Kurz-Check: Hast du es verstanden?

1 / 3

Welche drei grundverschiedenen Mess-Arten nennt dieses Modul?

Willst du Benchmark-Zahlen künftig selbst kritisch einordnen?