Benchmark

Auch: Benchmark-Test · SWE-bench · Elo-Score

Ein Benchmark ist ein standardisierter Test, mit dem die Fähigkeiten von KI-Modellen gemessen und verglichen werden. Dabei löst ein Modell eine feste Sammlung von Aufgaben – etwa Matheprobleme, Programmieraufgaben oder Fragen aus verschiedenen Fachgebieten – und erhält einen Punktwert, der sich mit anderen Modellen vergleichen lässt.

Zwei Namen tauchen in den News besonders oft auf: SWE-bench ist der Standardtest für reale Programmieraufgaben – das Modell muss echte Fehler in echten Software-Projekten beheben, und der Prozentwert sagt, wie viele davon gelingen. Der Elo-Score stammt aus dem Schach: Modelle treten in Blindvergleichen gegeneinander an, Menschen wählen die bessere Antwort, und aus vielen solcher Duelle entsteht eine Rangliste.

Benchmarks sind nützlich, um grobe Leistungsunterschiede sichtbar zu machen, sollten aber mit Vorsicht gelesen werden. Ein hoher Wert in einem Test bedeutet nicht zwangsläufig, dass ein Modell auch in deiner konkreten Aufgabe besser ist. Zudem können Modelle unbeabsichtigt auf beliebte Benchmarks «hintrainiert» werden, was die Werte verzerrt. Für die Praxis gilt deshalb: Benchmarks geben eine erste Orientierung, das eigene Ausprobieren mit realen Aufgaben ist aber oft aussagekräftiger.

VERWANDTE BEGRIFFE