Eval-Set
Eine Sammlung echter Fälle mit erwartetem Ergebnis, die sich auf Knopfdruck erneut durchrechnen lässt. Sie ist der einzige Weg, eine Änderung an Prompt, Daten oder Modell zu bewerten, ohne zu raten.
Deutsch: Testfallsammlung
Ein Eval-Set besteht aus echten Fällen, nicht aus ausgedachten. Jeder Eintrag trägt die Eingabe, das erwartete Ergebnis und den Grund, warum es das erwartete ist. Der dritte Teil wird am häufigsten weggelassen und fehlt am schmerzhaftesten: ohne ihn lässt sich ein halbes Jahr später nicht mehr entscheiden, ob ein abweichendes Ergebnis ein Fehler ist oder eine Verbesserung.
Der Nutzen liegt nicht im ersten Durchlauf, sondern im zweiten. Wer einen Prompt ändert, ein Modell wechselt oder eine Quelle ergänzt, hat ohne Testfallsammlung nur einen Eindruck davon, ob es besser geworden ist — und Eindrücke bestätigen zuverlässig das, was man ohnehin vermutet hat. Mit ihr wird aus der Änderung eine Aussage mit Zahl.
Die Sammlung entsteht vor der ersten Optimierung, nicht danach, und sie wächst im Betrieb weiter: Jeder Fehler, der es bis zum Anwender geschafft hat, wird als Fall aufgenommen. Damit misst das Set nach einem Jahr genau die Schwächen, die dieses System in dieser Organisation tatsächlich hat — und nicht die, die ein allgemeiner Benchmark für wichtig hält.
Alle Begriffe stehen im KI-Glossar, dieser dort unter Eval-Set.