Inferenz (Inference)
Definition
Inferenz ist das Ausführen eines fertig trainierten Modells, um aus einer Eingabe eine Antwort zu erzeugen. Anders als das einmalige Training fällt Inferenz bei jeder einzelnen Anfrage an — sie bestimmt die laufenden Kosten.
Man unterscheidet zwei Phasen: das Training, bei dem ein Modell einmal (sehr teuer) lernt, und die Inferenz, bei der es danach millionenfach benutzt wird. Für die meisten Unternehmen, die fertige Modelle einsetzen, sind allein die Inferenzkosten relevant — sie werden pro verarbeitetem Token abgerechnet und skalieren mit der Nutzung.
Weil Inferenz bei jeder Anfrage anfällt, entscheidet ihre Effizienz über die Wirtschaftlichkeit einer KI-Anwendung. Hebel sind kürzere Prompts, Prompt-Caching für wiederkehrende Bausteine, kleinere Modelle für einfache Aufgaben (Distillation) und LLM-Routing. Auch die Antwortzeit — spürbar für Nutzer — ist eine Frage der Inferenz.
Passend dazu
Passende Leistung
Von der Definition zur Umsetzung?
Lassen Sie uns besprechen, wie sich das konkret in Ihrem Unternehmen anwenden lässt.
Projekt anfragen