← Zurück zum Blog GRUNDLAGEN

Warum dein „99 % genauer" KI-Scanner im Fehlalarm ertrinkt

Veröffentlicht am 2026-06-23 · ~6 Min. Lesezeit

Fast jedes KI-Sicherheitstool wirbt mit beeindruckenden Genauigkeitswerten. Doch hohe Genauigkeit und nützliche Alarme sind zwei verschiedene Dinge. Der Grund ist ein statistischer Denkfehler, der in der KI-Sicherheit ständig unterschätzt wird: die Base-Rate-Fallacy. Wer False Positives in der KI-Sicherheit verstehen will, muss diesen einen Effekt kennen — sonst kauft man Tools, die im echten Betrieb mehr Lärm als Schutz erzeugen.

Base-Rate-Fallacy in der KI-Sicherheit — Rechenbeispiel: von 590 Alarmen sind nur 95 echt (16 %).
Bei seltenen Angriffen dominieren die Fehlalarme — selbst bei einem sehr guten Modell.

Das Versprechen klingt großartig — bis man nachrechnet

Stell dir vor, ein Anbieter verkauft dir einen KI-gestützten Angriffs-Scanner und sagt: „Unser Modell erkennt 95 % aller Angriffe und hat nur 5 % Fehlalarmrate." Klingt nach einem klaren Kauf. Aber genau hier schnappt die Falle zu. Denn die entscheidende Frage ist nicht „wie genau ist das Modell?", sondern: Wenn das Tool Alarm schlägt — wie wahrscheinlich ist es dann, dass wirklich ein Angriff vorliegt?

Das Rechenbeispiel: 10.000 Verbindungen an einem Tag

Nehmen wir einen normalen Tag mit 10.000 Netzwerkverbindungen. Echte Angriffe sind — zum Glück — selten. Sagen wir, 1 % davon sind bösartig. Das ist die sogenannte Basisrate:

Jetzt lassen wir unseren „95-%-Scanner" darüberlaufen:

Und damit zur entscheidenden Rechnung:

Alarme insgesamt = 95 (echt) + 495 (falsch) = 590
Davon echt       = 95 / 590  ≈  16 %

Obwohl der Scanner „95 % genau" ist, sind nur rund 16 % seiner Alarme echte Angriffe. Vier von fünf Alarmen sind Fehlalarme. Das ist die Base-Rate-Fallacy in Reinform.

Warum passiert das? Die seltene Nadel im riesigen Heuhaufen

Der Effekt hat einen einfachen Kern: Wenn das Gesuchte selten ist, dominieren die Fehlalarme — selbst bei einem sehr guten Modell. Die 5 % Fehlalarmrate klingen winzig. Aber 5 % von 9.900 harmlosen Verbindungen sind eben 495 Fehlalarme — deutlich mehr als die 95 echten Treffer. Die wenigen echten Angriffe gehen im Rauschen unter. Je seltener die Angriffe (also je kleiner die Basisrate), desto schlimmer wird das Verhältnis.

Deshalb ist „Accuracy" (Gesamtgenauigkeit) bei seltenen Ereignissen eine irreführende Kennzahl. Die ehrlicheren Metriken heißen Precision (wie viele Alarme sind echt?) und Recall (wie viele echte Angriffe werden gefunden?) — und genau die verschweigen Marketing-Folien gern.

Was False Positives in der Praxis anrichten

Diese 16 % sind kein akademisches Detail. Sie sind der Grund, warum so viele Security-Teams mit KI-Tools unglücklich werden:

Und für Angreifer ist das eine Einladung: Wer weiß, dass ein System in Fehlalarmen ertrinkt, kann seinen echten Angriff gezielt im Rauschen verstecken. Dass dieselbe False-Positive-Problematik auch die KI-gestützte Forensik ausbremst, habe ich an anderer Stelle beschrieben.

Was das für die Auswahl von KI-Sicherheitstools bedeutet

Wenn du KI-gestützte Erkennung einkaufst oder bewertest, stell die richtigen Fragen:

Ein gutes KI-Sicherheitskonzept beginnt nicht beim Tool, sondern beim Verständnis der eigenen Zahlen. Genau dieses Verständnis trennt teure Regallösungen von echtem Schutz.

Mein Fazit

„99 % genau" ist ein Verkaufsargument, kein Sicherheitsversprechen. Sobald das Gesuchte selten ist — und echte Angriffe sind selten — sorgt die Base-Rate-Fallacy dafür, dass die meisten Alarme Fehlalarme sind. Wer False Positives in der KI-Sicherheit ernst nimmt, fragt nach Precision und Recall, kennt die eigene Basisrate und plant den Prozess nach dem Alarm. Erst dann wird aus einem beeindruckenden Datenblatt echter Schutz.

▶ KI-System realistisch prüfen lassen LLM-Pentest