Sicherheit

Red Teaming

Definition

Red Teaming ist das systematische Angreifen des eigenen KI-Systems, um Schwachstellen, unerwünschte Ausgaben und Umgehungsmöglichkeiten aufzudecken, bevor echte Angreifer oder Nutzer sie finden.

Ein internes „rotes Team" schlüpft in die Rolle des Gegners und versucht gezielt, das System zu Fehlverhalten zu bewegen: Prompt Injection, Jailbreaks, das Herauslocken sensibler Daten, das Provozieren gefährlicher oder falscher Ausgaben. Was dabei gelingt, wird dokumentiert und behoben — und fließt als neuer Testfall in die laufende Evaluation ein.

Für KI-Anwendungen ist Red Teaming kein einmaliges Audit, sondern ein wiederkehrender Vorgang, weil sich Modelle, Daten und Angriffsmuster ändern. In regulierten Kontexten wird es zunehmend erwartet: Der EU AI Act verlangt für risikoreiche Systeme den Nachweis, dass Risiken erkannt und gemindert werden — Red Teaming liefert genau diese Belege.

← Alle Begriffe im Glossar

Von der Definition zur Umsetzung?

Lassen Sie uns besprechen, wie sich das konkret in Ihrem Unternehmen anwenden lässt.

Projekt anfragen