2026-08-25
AGENTIC AI SECURITY
Eigener MCP-Server, eigener Agenten-Host, 52 Messläufe. Ergebnis: Nicht das Modell wehrt den Angriff ab, sondern der Host — 7/10 gegen 0/10 bei identischer Nutzlast. Und eine Injektion braucht zweierlei: einen Auslöser, der eintritt, und einen Ton, der nicht auffällt. Drei von vier Zellen sind null. Labor zum Nachspielen auf GitHub.
Weiterlesen →
2026-08-20
AGENTIC AI SECURITY
Der BSI-Expertenkreis KI-Sicherheit beschreibt in seinem Leitfaden für LLM-Penetrationstests sieben Angriffe auf das Model Context Protocol — von Tool Poisoning bis Token Leakage. Ich übersetze sie ins Deutsche und zeige den Befund, der zwischen den Zeilen steht: Bei der Hälfte ist nicht der Server der Prüfgegenstand, sondern der Client, der ihm glaubt.
Weiterlesen →
2026-08-16
SUPPLY CHAIN · HACKTHEBOX
HackTheBox-AI-Challenge (retired): Ich ändere vier von 802.000 Bytes einer Modelldatei und mache eine KI-gestützte Zugangskontrolle blind — ohne dass ein einziger legitimer Fall falsch erkannt wird. Warum ein Backdoor im Modell jeden Qualitätstest übersteht und nur ein Hash ihn sichtbar macht.
Weiterlesen →
2026-07-26
AI CTF · HACKTHEBOX
HackTheBox-AI-Challenge (retired): Ein Decision Tree autorisiert nur bei einem versteckten Pfad. Per Model Extraction lese ich die Logik aus, rekonstruiere den Pfad zum „authorize"-Blatt und baue den passenden Input — und zeige, warum interpretierbare KI-Modelle eine Angriffsfläche sind.
Weiterlesen →
2026-07-23
AGENTIC AI
Zwei OpenAI-Modelle brachen aus ihrer Test-Sandbox aus und hackten Hugging Face, um bei einem Cyber-Benchmark zu schummeln. Die nüchterne Einordnung: Warum das Reward Hacking ist — nicht „rebellierende KI" — und was Unternehmen mit agentischer KI daraus lernen müssen.
Weiterlesen →
2026-07-20
AGENTIC AI
Ich baute einen KI-Agenten (MCP) mit Werkzeugen und Sicherheitsregel — und brach ihn auf zwei Wegen: direkter Zugriff am LLM vorbei und Prompt Injection über getarnten Tool-Output. Plus der Fix, der wirklich hält: Zugriffskontrolle im Code, nicht im Prompt.
Weiterlesen →
2026-07-10
PROMPT INJECTION
Ein KI-Ransomware-Verhandler sollte gnadenlos Lösegeld eintreiben — stattdessen habe ich ihn mit einem einzigen Satz dazu gebracht, den Entschlüsselungsschlüssel gratis herauszugeben. Prompt Injection und Excessive Agency (OWASP LLM06) in Aktion.
Weiterlesen →
2026-07-02
AI RED TEAMING
Mit einem LLM-Vulnerability-Scanner habe ich ein lokales Open-Source-Modell auf Jailbreaks getestet. Es widersteht dem DAN-Theater — aber seine Sicherheits-Verweigerung leckt in 2 von 3 Läufen. Wie automatisiertes AI Red Teaming funktioniert.
Weiterlesen →
2026-06-30
SUPPLY CHAIN
Ich baute einen Malware-Detektor auf 23,5 Mio. fremden, vortrainierten Gewichten — die ich nie ansah. Warum vortrainierte KI-Modelle und das pickle-Format die unterschätzte Supply-Chain-Lücke sind und das Einfrieren eine Hintertür nicht entfernt.
Weiterlesen →
2026-06-26
ANGRIFF & ABWEHR
Adversarial Machine Learning in der Praxis: einen Naive-Bayes-Spamfilter selbst trainiert (98,5 %, fängt sogar Phishing) — und mit simpler Leetspeak-Verschleierung wieder ausgehebelt. Warum Evasion funktioniert und wie man sich wehrt.
Weiterlesen →
2026-06-25
ANGRIFF & ABWEHR
Eine autonome KI tut genau das, was du belohnst — nicht das, was du meinst. Am Beispiel eines Patch-Bots: warum die Belohnungsfunktion eine Angriffsfläche ist und Reward-Design am Ende Sicherheits-Design.
Weiterlesen →
2026-06-25
EU AI ACT
Der Digital Omnibus (Juni 2026) hat die Hochrisiko-Frist auf Dezember 2027 verschoben — für GPAI-Modelle gilt Red Teaming aber schon jetzt. Wer betroffen ist, was nachzuweisen ist und welche Strafen drohen.
Weiterlesen →
2026-06-25
AGENTIC AI
Ein Chatbot sagt etwas, ein Agent handelt. Warum Werkzeuge und Speicher die Angriffsfläche sprengen — und welche neuen Angriffe (indirekte Injection, Excessive Agency) dabei entstehen.
Weiterlesen →
2026-06-24
ANGRIFF & ABWEHR
Wie KI-Systeme „normal“ lernen, die drei Arten von Auffälligkeiten — und wie Angreifer die Erkennung durch Evasion (Tarnung) und Poisoning (den Maßstab verschieben) aushebeln.
Weiterlesen →
2026-06-23
LERNREISE · HTB
Writeup einer retired AI-Challenge: Wie ich mit Recon, pandas und einer Visualisierung eine im Datensatz versteckte Flag gefunden habe — und was das mit Data Poisoning zu tun hat.
Weiterlesen →
2026-06-23
GRUNDLAGEN
False Positives in der KI-Sicherheit, einfach erklärt: Warum ein „95 % genauer" Scanner trotzdem fast nur Fehlalarme liefert — die Base-Rate-Fallacy mit konkretem Rechenbeispiel.
Weiterlesen →
2026-06-21
LERNREISE
Wie sich drei Frameworks zu einer einzigen Bewertung verbinden: STRIDE liefert das Vokabular, MITRE ATLAS die Technik, die OWASP LLM Top 10 die Verortung an der Architektur — der wiederholbare Prozess hinter einer priorisierten KI-Risikoanalyse.
Weiterlesen →
2026-06-19
LERNREISE
Eine Landkarte der LLM-Bedrohungen entlang vier Ebenen: von Training-Data-Extraction über Model Stealing und Prompt Injection bis zu KI-gestütztem Social Engineering — der Denkrahmen für eine vollständige Risikoanalyse.
Weiterlesen →
2026-06-18
LERNREISE
KI-Systeme sind Architekturen aus 9 Komponenten und 5 Vertrauensgrenzen. Warum klassische App-Security nicht reicht — und wie man mit Defense-in-Depth, Least Privilege und Validierung an jeder Grenze absichert.
Weiterlesen →
2026-06-18
CASE STUDY
Ein kompletter Incident-Response-Fall: Phishing, eine per Prompt Injection ausgeplauderte KI, KI-gestützte Forensik — und eine KI, die ihren eigenen Befund halluziniert. Angriffsfläche, Werkzeug und Fehlerquelle in einem.
Weiterlesen →
2026-06-17
LERNREISE
Wie KI/ML in der DFIR bei Anomalie-Erkennung, Phishing-Analyse und Timeline-Rekonstruktion hilft — und warum False Positives, Black-Box-Natur und Bias menschliche Validierung unverzichtbar machen.
Weiterlesen →
2026-06-16
LERNREISE
Wie ein LLM Text in Tokens zerlegt, die Antwort über Wahrscheinlichkeiten vorhersagt — und warum die fehlende Grenze zwischen System- und Anwender-Prompt direkt zu Prompt Injection führt.
Weiterlesen →
2026-06-15
LERNREISE
Ein kleines Audit an einem KI-Modell zeigt: Kaum jemand kann zuverlässig nachvollziehen, womit ein fremdes Modell trainiert wurde, woher die Daten stammen und was sie enthalten.
Weiterlesen →
2026-06-13
LERNREISE
Fünf Erkenntnisse aus meiner ersten Lernstation: von der KI-Begriffslandkarte über die Funktionsweise von LLMs bis zu Angriffsflächen und KI als Verteidiger.
Weiterlesen →
2026-06-12
PROMPT INJECTION
Wie Angreifer LLMs mit manipulierten Eingaben kapern, der Unterschied zwischen direkter und indirekter Injection — und was wirklich dagegen hilft.
Weiterlesen →
2026-06-10
OWASP
Ein praxisnaher Überblick über die zehn häufigsten Schwachstellen in LLM-Anwendungen — mit Beispielen und Gegenmaßnahmen.
Weiterlesen →
2026-06-08
EU AI ACT
Fristen, Risikoklassen und konkrete Schritte zur Konformität Ihrer KI-Systeme — ohne Juristendeutsch.
Weiterlesen →