← Zurück zum Blog LERNREISE · TRYHACKME

Ein KI-System absichern heißt die Architektur absichern — nicht nur das Modell

Veröffentlicht am 2026-06-18 · ~8 Min. Lesezeit

Die meisten Diskussionen über KI-Sicherheit drehen sich um das Modell: Jailbreaks, Prompt Injection, Halluzinationen. Dieser Raum hat meinen Blick verschoben — auf etwas Größeres und für Unternehmen Wichtigeres: Ein produktives KI-System ist kein Modell, sondern eine Architektur aus vielen Komponenten. Und jede Komponente ist eine potenzielle Schwachstelle, die klassische Sicherheitswerkzeuge gar nicht im Blick haben.

Kein Spoiler: Dieser Beitrag erklärt die Konzepte in eigenen Worten und verrät keine Aufgaben-Lösungen oder Flags.
TryHackMe-Abschlussbildschirm: Raum „Sicherung der KI-Systeme“ abgeschlossen — 7 Aufgaben, 104 Punkte.
Station der Lernreise: der Raum „Sicherung der KI-Systeme", abgeschlossen.

1. Der entscheidende Unterschied: von strukturiert zu unstrukturiert

Eine klassische Web-App ist berechenbar: Eingaben fließen von der Oberfläche über die API in die Datenbank und zurück. Sicherheitsteams wissen genau, wo sie Kontrollen platzieren. Kommt eine KI-Komponente dazu, ändert sich das Bild grundlegend:

Der Sprung von strukturierter zu unstrukturierter Eingabe ist die folgenreichste Änderung. Ein klassisches Eingabefeld erwartet ein Datum, eine Zahl, eine Auswahl. Ein KI-System akzeptiert jeden beliebigen Text. Das allein entwertet die meisten bestehenden Eingabe-Validierungs-Strategien.

2. Die „Chatbox-Iceberg": neun Komponenten, fünf Vertrauensgrenzen

Der Nutzer sieht nur eine Chatbox. Der Sicherheitsarchitekt sieht das Fundament darunter: User Interface, API-Gateway, Orchestrierungsschicht, Prompt-Konstruktion, das LLM, einen Tool-Layer, Output-Processing, Logging/Monitoring und einen Vektorspeicher (RAG). Neun Komponenten — und dazwischen fünf Vertrauensgrenzen, an denen Daten von einem Sicherheitskontext in den nächsten übergehen. Jede ist eine Angriffsfläche:

Die Kernfrage eines Audits lautet damit nicht „ist das Modell sicher?", sondern: Welche dieser Grenzen haben Kontrollen — und welche sind ungeschützt?

3. Die fünf systemischen Bedrohungen — je Grenze eine

Genau an diesen Grenzen setzen fünf Bedrohungsklassen aus den OWASP LLM Top 10 (2025) an:

Das gemeinsame Vokabular dafür liefern drei Frameworks, die zusammengehören: OWASP LLM Top 10 (die Risiken), MITRE ATLAS (die Angreifer-Techniken) und NIST AI RMF (die organisatorische Antwort).

4. Wie das in echt aussieht: ein über-privilegierter Assistent

Im praktischen Teil habe ich einen KI-Assistenten „interviewt" — und er hat freiwillig offengelegt, wie gefährlich seine Konfiguration war: voller db_admin-Zugriff (inklusive DROP/DELETE) auf die Produktionsdatenbank, automatisches Mergen von Pull Requests ohne menschliche Freigabe, Lese-/Schreibzugriff auf alle Slack-Channels, und Logging aller Gespräche ohne PII-Filterung.

Das ist Excessive Agency und Sensitive Information Disclosure zum Anfassen. Wie ein gekaperter Assistent so etwas in einem realen Angriff ausnutzt, habe ich im Fall West Tech durchgespielt — dort wurde genau so eine Architektur zum Einfallstor.

5. Die Verteidigung: vier Prinzipien

Die gute Nachricht: Man kann diese Systeme absichern — aber nicht mit einem einzelnen Werkzeug, sondern mit Prinzipien an jeder Grenze:

Mein Fazit

Zwei Erkenntnisse nehme ich mit. Erstens: Sicherheit muss von Anfang an mitgebaut werden (Security by Design) — sie nachträglich aufzusetzen, wenn die Architektur schon steht, ist viel teurer und lückenhaft. Zweitens: Rechte und Tool-Zugriffe nur so weit vergeben, wie sie wirklich gebraucht werden — Least Privilege ist der wirksamste einzelne Hebel, weil er den Schaden begrenzt, wenn (nicht falls) das Modell manipuliert wird.

Die übergeordnete Wahrheit: Klassische Anwendungssicherheit ist notwendig, aber nicht ausreichend. Firewalls, WAFs und Input-Sanitization fangen die neuen Komponenten — LLM, Tool-Layer, Prompt-Konstruktion, Vektorspeicher — nicht ab. Ein KI-System abzusichern heißt, die Architektur abzusichern, nicht nur das Modell. Genau dort setze ich mit meinen Audits an.

▶ KI-Architektur prüfen lassen Mehr aus dem Blog