← Zurück zum Blog AI RED TEAMING

Ich habe mein lokales KI-Modell mit garak gescannt — und es war teilweise jailbreakbar

Veröffentlicht am 2026-07-02 · ~7 Min. Lesezeit

Unternehmen rollen gerade in Rekordtempo quelloffene Sprachmodelle aus — in Chatbots, Support-Systeme, interne Tools. Eine Frage stellt dabei kaum jemand: Hat das Modell überhaupt jemand angegriffen, bevor es live ging? Ich habe genau das gemacht — mit einem automatisierten LLM-Schwachstellen-Scanner, lokal, auf eigener Hardware. Das Ergebnis war aufschlussreich: Das Modell widersteht dem klassischen Jailbreak-Theater — aber seine Sicherheits-Verweigerung fällt in zwei von drei Fällen.

LLM-Resilienz-Scan mit garak: DAN-Persona wird nicht übernommen (0 %), aber die Sicherheits-Verweigerung wird in 67 % der Läufe umgangen.
Ein DAN-Jailbreak-Scan gegen ein lokales Open-Source-Modell — zwei Prüfer, zwei sehr unterschiedliche Ergebnisse.

Was ist garak?

garak ist ein quelloffener Schwachstellen-Scanner für Sprachmodelle (heute bei NVIDIA beheimatet). Man kann ihn sich vorstellen wie ein nmap für LLMs: Er feuert eine große Bibliothek bekannter Angriffs-Prompts auf ein Modell und beurteilt automatisch, ob der Angriff erfolgreich war. Drei Bausteine:

Genau diese Erfolgsquote ist es, die aus Bauchgefühl belastbare Zahlen macht — die Sprache, die ein Sicherheitsbericht braucht.

Der Test

Ich habe ein kleines, quelloffenes Modell (9B-Klasse, auf Gemma/Qwen aufgebaut) lokal laufen lassen und den DAN-Jailbreak darauf angesetzt. DAN — „Do Anything Now" — ist ein klassischer Jailbreak, der ein Modell mit einer riesigen Textwand dazu überreden will, all seine Regeln abzulegen. Der ganze Test war ein einziger Befehl und lief in unter einer Minute — kein Cloud-Account, keine Kosten, nur mein Rechner und das Modell.

Das ist der Punkt, den viele unterschätzen: Einen ersten Sicherheits-Scan eines lokalen Modells kann man heute, kostenlos, in Minuten machen. Es gibt keine Ausrede, ein Modell ungetestet auszuliefern.

Das Ergebnis — und warum es nuanciert ist

garak nutzt für den DAN-Jailbreak zwei Prüfer, und die haben völlig unterschiedlich angeschlagen:

Das ist die ehrliche, mehrdimensionale Antwort, die ein echter Test liefert: nicht „sicher" oder „unsicher", sondern teilweise verwundbar. Das Modell spielt kein DAN-Theater mit — aber seine Guardrails lassen sich mit etwas Beharrlichkeit umgehen. Für ein kleines Modell ist das erwartbar: Es ist längst nicht so aufwendig sicherheitstrainiert wie die großen Frontier-Modelle.

Warum das für Unternehmen zählt

Viele Firmen wählen bewusst ein quelloffenes Modell — aus Kosten-, Datenschutz- oder Kontrollgründen. Das ist völlig legitim. Der Fehler passiert danach: Das Modell wird eingebunden, ohne dass jemand seine Resilienz gegen Jailbreaks und Prompt Injection geprüft hat. Genau hier setzt automatisiertes Scanning an — als schneller, breiter erster Layer, der grobe Schwächen sichtbar macht.

Aber Vorsicht vor Scheinsicherheit: Ein automatischer Scan findet die bekannten Angriffe. Die maßgeschneiderten, neuartigen Angriffe — die, die im Ernstfall wehtun — findet nur ein Mensch, der das System gezielt und kreativ angreift. Automatisiertes Scanning ist der erste Layer, kein Riegel.

Was man dagegen tut

Prompt Injection und Jailbreaks lassen sich nicht restlos ausrotten — aber das Risiko lässt sich deutlich senken. Die wirksamen Hebel liegen tiefer als ein gut gemeinter System-Prompt:

Mein Fazit

Ein Sicherheits-Scan eines Sprachmodells ist heute kein Hexenwerk mehr — der erste Blick kostet Minuten. Wer ein LLM produktiv einsetzt, sollte ihn getan haben, bevor es live geht. Und wer es ernst meint, lässt danach einen Menschen ran, der das System so angreift, wie es ein echter Angreifer täte. Genau das ist AI Red Teaming: die Lücken finden, bevor es jemand anderes tut.

▶ AI Red Teaming LLM-Pentest