Evaluation (Eval-Harness)
Definition
Evaluation macht die Qualität einer KI-Anwendung messbar: Ein fester Satz repräsentativer Fälle mit bekannten Sollantworten prüft jede Änderung — neuer Prompt, neues Modell, neue Datenquelle.
Ohne Evaluation bleibt Qualität Gefühlssache: „Es funktioniert eigentlich ganz gut" ist keine Grundlage für Entscheidungen. Ein Eval-Harness ist die Testinfrastruktur, die eine Sammlung von Beispielen automatisiert durchspielt und die Ergebnisse gegen die erwarteten Antworten bewertet — teils per Regel, teils per LLM-as-a-Judge. So sieht man schwarz auf weiß, ob eine Änderung besser oder schlechter macht.
Diese systematische Messung ist zugleich das Rückgrat der Compliance. Wer belegen muss, dass ein KI-System zuverlässig arbeitet — etwa im Rahmen des EU AI Act —, braucht genau solche nachvollziehbaren, wiederholbaren Prüfungen. Evaluation verwandelt KI-Entwicklung von Ausprobieren in messbares Ingenieurhandwerk.
Von der Definition zur Umsetzung?
Lassen Sie uns besprechen, wie sich das konkret in Ihrem Unternehmen anwenden lässt.
Projekt anfragen