Was ich im TryHackMe-Raum „AI/ML Security Threats" gelernt habe
Ich dokumentiere meinen Weg in die KI-Sicherheit öffentlich — und der erste Schritt war der TryHackMe-Raum „AI/ML Security Threats". Sieben Aufgaben, abgeschlossen. Statt einer Zusammenfassung des Raums teile ich hier die fünf Erkenntnisse, die ich mitgenommen habe und die für jeden relevant sind, der KI im Unternehmen einsetzt oder absichern will.
1. AI, ML, DL, LLM — die Begriffe sind ineinander verschachtelt
Die wichtigste Aufräumarbeit gleich zu Beginn: Diese vier Begriffe werden oft synonym benutzt, sind es aber nicht. Sie sind wie ineinanderliegende Kreise:
- KI (Künstliche Intelligenz) — das Oberfeld: Maschinen, die Aufgaben lösen, die sonst menschliches Denken erfordern.
- ML (Machine Learning) — ein Teilbereich der KI: Systeme lernen Muster aus Daten, ohne explizit programmiert zu werden.
- DL (Deep Learning) — ein Teilbereich des ML, der mit neuronalen Netzen arbeitet und auch unstrukturierte, ungelabelte Daten verarbeiten kann — quasi „skalierbares ML".
- LLM (Large Language Model) — fortgeschrittene DL-Modelle, die auf einer speziellen Architektur (Transformer) basieren und menschenähnlichen Text erzeugen.
Warum das für Sicherheit zählt: Jede dieser Ebenen hat eigene Angriffsflächen. Wer sie nicht auseinanderhält, kann Risiken nicht sauber zuordnen.
2. Ein LLM „denkt" nicht — es sagt das nächste Wort voraus
Hinter dem beeindruckenden Output steckt ein erstaunlich einfaches Grundprinzip: Vorhersage des nächsten Tokens. Ein LLM bekommt Text und schätzt, welches Wort am wahrscheinlichsten folgt — und das milliardenfach.
Der Weg dorthin in drei Schritten:
- Pre-Training: Das Modell verarbeitet riesige Textmengen und justiert über Backpropagation seine Parameter, bis es Wörter zuverlässig vorhersagt.
- Transformer & Attention: Die 2017 von Google vorgestellte Transformer-Architektur („Attention Is All You Need") erlaubt es, Text parallel statt Wort für Wort zu verarbeiten und jedem Wort eine „Aufmerksamkeit" zuzuweisen — so versteht das Modell Kontext.
- RLHF: Anschließend bewerten Menschen die Antworten (Reinforcement Learning from Human Feedback), um das Modell hilfreicher und sicherer zu machen.
Diese Architektur ist auch der Grund, warum Prompt Injection so hartnäckig ist: Für das Modell sind Anweisung und Daten am Ende nur Tokens im selben Kontext.
3. KI bringt völlig neue Schwachstellen mit
Der spannendste Teil für mich: Mit KI entstehen Angriffsklassen, die es vorher schlicht nicht gab. Der Raum orientiert sich dabei am MITRE ATLAS-Framework — dem KI-Pendant zu MITRE ATT&CK. Die wichtigsten Modell-Schwachstellen:
- Prompt Injection — die ursprünglichen Anweisungen des Modells werden überschrieben, um z. B. mehr Infos preiszugeben oder schädlichen Output zu erzeugen.
- Data Poisoning — Angreifer manipulieren die Trainingsdaten, sodass das Modell falsch oder verzerrt entscheidet (z. B. ein Spamfilter, der Spam durchlässt).
- Model Theft — durch massenhaftes Abfragen der API wird ein Klon-Modell trainiert, das das Original nachahmt (Diebstahl geistigen Eigentums).
- Privacy Leakage — das Modell verrät versehentlich sensible Trainingsdaten (man denke an Patientendaten).
- Model Drift — die Leistung sinkt über die Zeit, weil sich die realen Daten ändern — Monitoring und Retraining sind Pflicht.
Das deckt sich stark mit den OWASP LLM Top 10, die ich in einem eigenen Beitrag aufschlüssle.
4. Klassische Angriffe werden durch KI gefährlicher
KI erfindet nicht nur neue Angriffe — sie macht alte effektiver:
- Malware: generative KI kann Schadcode auf Knopfdruck erzeugen und senkt so die Einstiegshürde für Angreifer.
- Deepfakes: Stimme und Aussehen einer Person lassen sich überzeugend fälschen — ein direkter Angriff auf Authentifizierung („Bist du wirklich, wer du vorgibst zu sein?"). Es gibt bereits Fälle gefälschter Video-Interviews.
- Phishing: Früher verrieten holprige Formulierungen viele Phishing-Mails. Heute schreibt generative KI fehlerfreie, kontextbezogene Mails — der „Bauchgefühl"-Filter funktioniert nicht mehr verlässlich.
5. Die beste Verteidigung gegen KI ist … KI
Klingt paradox, ist aber der Kern: Laut dem zitierten IBM-Report sparten Unternehmen, die KI in ihre Sicherheit einbauten, im Schnitt deutlich an Breach-Kosten und entdeckten Vorfälle spürbar schneller. KI hilft uns vor allem beim Analysieren (Anomalien im Netzwerkverkehr), Vorhersagen/Automatisieren (Phishing erkennen und blocken), Zusammenfassen (Incident-Reports in Minuten) und Untersuchen (Logs erklären, Threat-Hunting-Ideen brainstormen).
Aber: Die eingesetzte KI muss selbst abgesichert sein — laut Report ist nur ein Bruchteil der Gen-AI-Initiativen wirklich geschützt. Konkrete Maßnahmen:
- Zugriff streng kontrollieren (RBAC + MFA)
- Trainingsdaten wie sensible Daten behandeln und verschlüsseln
- Standards anwenden (z. B. ISO/IEC 27090 für KI-spezifische Bedrohungen)
- Modelle überwachen — auch mit Explainability-Tools wie SHAP und LIME
Mein Fazit
Dieser erste Raum war genau das richtige Fundament: Er ordnet die Begriffe, zeigt wie die Technik funktioniert und macht greifbar, warum KI gleichzeitig Risiko und wirksamstes Verteidigungswerkzeug ist. Genau dieses Spannungsfeld — KI absichern und KI zur Verteidigung nutzen — ist der Bereich, auf den ich mich spezialisiere.
Das war Station eins meiner Lernreise. Die nächsten Schritte gehen tiefer in die Praxis: konkrete Angriffe wie Prompt Injection an verwundbaren LLM-Apps. Ich dokumentiere alles hier weiter.
▶ Lernreise auf YouTube verfolgen KI-System absichern lassen