RAG oder Fine-Tuning? Eine Entscheidungshilfe für den Mittelstand
Sobald ein Unternehmen ein Sprachmodell auf die eigenen Daten ansetzen will, fällt schnell eines der beiden Schlagwörter: „Retrieval-Augmented Generation" (RAG) oder „Fine-Tuning". Beide lösen unterschiedliche Probleme — und die teuerste Variante ist selten die richtige. Diese Entscheidungshilfe ordnet die Optionen so ein, dass Sie ohne KI-Studium eine tragfähige Wahl treffen können.
Veröffentlicht am
Was ist RAG — in einem Satz?
Retrieval-Augmented Generation bedeutet: Bevor das Sprachmodell antwortet, sucht das System in Ihren eigenen Dokumenten nach den passenden Stellen und legt sie dem Modell als Kontext bei. Das Modell formuliert die Antwort dann aus diesen mitgelieferten Auszügen — nicht aus vagem Trainingsgedächtnis.
Der Vergleich, der hängen bleibt: Fine-Tuning ist, als würde jemand für eine Prüfung auswendig lernen. RAG ist eine Open-Book-Prüfung — das Wissen liegt aufgeschlagen daneben und wird bei jeder Frage neu nachgeschlagen. Deshalb kann RAG mit Wissen umgehen, das sich täglich ändert, ohne dass das Modell neu trainiert werden muss.
Was Fine-Tuning wirklich verändert
Fine-Tuning trainiert ein bestehendes Basismodell mit zusätzlichen Beispielen weiter und verändert dabei die Gewichte des Modells selbst. Das ist stark, wenn Sie Verhalten prägen wollen: einen bestimmten Antwortstil, ein festes Ausgabeformat, die Fachsprache Ihrer Branche oder das zuverlässige Befolgen eines komplexen Musters, das sich in einem Prompt nur mühsam beschreiben lässt.
Was Fine-Tuning dagegen schlecht kann: aktuelles Faktenwissen aufnehmen. Ein am Montag eingelerntes Preisverzeichnis ist am Dienstag veraltet — und das Nachtrainieren ist aufwendiger, als eine Datei im RAG-Index auszutauschen. Wer Fine-Tuning für „das Modell soll unsere Handbücher kennen" einsetzt, wählt fast immer das teurere, sprödere Werkzeug.
Ein verwandter Ansatz ist Distillation: Ein großes, teures Modell bringt einem kleineren, günstigeren Modell eine eng umrissene Aufgabe bei. Das senkt im Dauerbetrieb die Kosten und die Antwortzeit — lohnt sich aber erst, wenn die Aufgabe stabil und das Volumen hoch ist.
Die Entscheidung in vier Fragen
Statt einer Grundsatzdebatte helfen vier konkrete Fragen. Sie führen in den allermeisten Fällen zu einer klaren Empfehlung:
- Ändern sich die Fakten häufig (Preise, Bestände, Richtlinien, Tickets)? → RAG.
- Müssen Antworten auf konkrete Quellen verweisen und prüfbar sein? → RAG.
- Geht es um Stil, Format, Ton oder ein schwer beschreibbares Verhalten? → Fine-Tuning.
- Läuft eine eng umrissene Aufgabe in hohem Volumen und soll billiger werden? → Distillation eines kleinen Modells.
Kosten, Zeit und Pflege — ehrlich betrachtet
RAG ist in der Regel schneller live und günstiger im Einstieg, weil kein Trainingslauf nötig ist. Der Aufwand steckt in der Datenaufbereitung: saubere Quellen, sinnvolles Zerteilen der Dokumente und eine gute Suche. Genau hier entscheidet sich die Qualität — ein schlechter Index liefert dem Modell die falschen Auszüge, und keine noch so gute Formulierung rettet dann die Antwort.
Fine-Tuning verursacht einmalige Trainingskosten und, wichtiger, laufende Pflegekosten: Jede Modell-Generation, jede fachliche Änderung kann ein erneutes Training bedeuten. Diese Folgekosten werden in Angeboten gern unterschätzt. Als Faustregel gilt: mit RAG starten, messen, und Fine-Tuning erst ergänzen, wenn ein konkretes Verhaltensproblem übrig bleibt, das sich mit Prompting und Retrieval nicht lösen lässt.
Fazit für Entscheider
Für den Mittelstand ist RAG fast immer der richtige erste Schritt: Es macht Ihr vorhandenes Wissen nutzbar, bleibt aktuell, liefert nachvollziehbare Quellen und ist ohne teures Training produktiv. Fine-Tuning und Distillation sind wertvolle Ergänzungen — aber als gezielte zweite Stufe, nicht als Startpunkt.
Der teuerste Fehler ist, mit der aufwendigsten Methode zu beginnen, weil sie am fortschrittlichsten klingt. Die richtige Reihenfolge spart Wochen und fünfstellige Beträge.
Passend dazu
Verwandte Leistung
Individualsoftware mit GenAI-Anbindung
Maßgeschneiderte Software vom Prototyp bis zur Produktionsreife – mit nahtloser GenAI-Integration.
Zur Leistung →AI-Usecases in Cloud-Umgebungen
KI-Anwendungsfälle auf führenden Cloud-Plattformen – von der Konzeption bis zum produktiven Betrieb.
Zur Leistung →Weiterlesen
Mehr aus dem Wissens-Bereich
- 12-Factor-Agents: KI-Agenten, die in Produktion haltenBeeindruckende Demo, aber im Alltag unzuverlässig? Die 12-Factor-Prinzipien zeigen, was einen KI-Agenten vom Prototyp zum produktionsreifen System macht.
- Wann halluziniert Ihre KI? Guardrails & LLM-as-a-Judge erklärtWarum Sprachmodelle überzeugend Falsches behaupten — und mit welchen Schutzmechanismen sich KI-Antworten prüfbar und verlässlich machen lassen.
Von der Theorie zur Umsetzung?
Lassen Sie uns besprechen, wie sich das in Ihrem Unternehmen konkret anwenden lässt.
Projekt anfragen