AI-Modelle richtig vergleichen
Lernziel
Wie man Modell-Performance seriös misst, warum Benchmark-Zahlen oft weniger sagen als sie vorgeben, und wie du Anbieter-Vergleiche selbst einordnen kannst.
01
Wie man AI-Performance überhaupt misst: die Bausteine, die du kennen musst
Modul starten →
02
Warum „Modell A schlägt Modell B“ fast nie die ganze Wahrheit ist
Modul starten →
03
Wissens- und Reasoning-Benchmarks: MMLU, GPQA & die Sättigungsfalle
Modul starten →
04
Wenn Menschen urteilen: Chatbot Arena, Elo-Wertung und ihre blinden Flecken
Modul starten →
05
Der Richter ist auch nur ein Modell: Wenn AI die AI bewertet
Modul starten →
06
Warum gute Testwerte täuschen können: Kontamination und der Trainingsdaten-Fluch
Modul starten →
07
Der Praxistest: Agenten-Benchmarks, Zeit-Horizonte und wie du selbst vergleichst
Modul starten →