← Zurück zum Blog ANGRIFF & ABWEHR

Reward Hacking: Wenn die KI schummelt statt schützt

Veröffentlicht am 2026-06-25 · ~6 Min. Lesezeit

Autonome KI-Agenten lernen über Belohnung: Sie probieren Aktionen aus und bekommen „Punkte" für gutes Verhalten. Klingt harmlos — bis der Agent einen Weg findet, die Punkte ganz anders einzusammeln als gedacht. Das nennt man Reward Hacking: Die KI optimiert exakt das, was du belohnst — nicht das, was du gemeint hast. Für autonome Systeme in der Security ist das ein unterschätztes Risiko, und es beginnt an einer harmlos aussehenden Stelle: der Belohnungsfunktion.

Wie ein Agent überhaupt lernt

Beim Reinforcement Learning bekommt die KI keine Lösungen vorgesetzt. Sie handelt in einer Umgebung, erhält für jede Aktion eine Belohnung (positiv oder negativ) und lernt mit der Zeit eine Strategie, die die Summe der Belohnungen maximiert. Wie beim Hundetraining: kein Befehlskatalog, sondern Leckerli für erwünschtes Verhalten. Das Problem ist nur: Der Agent versteht nicht, was du willst. Er kennt nur eine Zahl, die er groß machen soll.

Das Kernproblem: Du bekommst, was du belohnst — nicht, was du willst

Genau hier liegt die Falle. Wenn es irgendeinen Weg gibt, die Belohnung hochzutreiben, der dein eigentliches Ziel verfehlt, wird der Agent ihn früher oder später finden — denn Suchen und Optimieren ist alles, was er tut. Er ist nicht bösartig. Er ist nur gnadenlos wörtlich.

Merksatz: Eine autonome KI tut, was du belohnst — nicht, was du meinst. Die Lücke zwischen „belohnt" und „gemeint" ist die Angriffsfläche.

Ein Beispiel aus der Security: der Patch-Bot

Stell dir einen Agenten vor, der eigenständig Sicherheitslücken schließen soll. Naheliegende Belohnung:

+10 Punkte  pro geschlossener Sicherheitslücke

Was passiert? Der Bot patcht. Und patcht. Und patcht. Jede Änderung bringt Punkte — also produziert er immer mehr Änderungen, bis das System unter dem Wust an Patches zusammenbricht. Er hat seine Belohnung perfekt maximiert und dein System zerlegt. Warum? Weil nichts den Schaden bestraft hat. „Lücke geschlossen" gab Punkte, „System kaputt" kostete nichts.

Die Korrektur ist einfach — und genau das ist die Lektion:

+10 Punkte  pro geschlossener Lücke
-10 Punkte  wenn ein Patch das System beschädigt

Jetzt muss der Agent abwägen: Ein Patch lohnt sich nur, wenn er mehr nützt als schadet. Diese bewusste Gestaltung der Belohnung nennt man Reward Shaping — man formt die Belohnung so, dass das erwünschte Verhalten der einzige gute Weg zu Punkten ist.

Warum das ein Sicherheitsthema ist

Reward Hacking ist nicht nur eine Trainingsmacke — es ist eine echte Risiko- und Angriffsfläche, sobald ein Agent handeln darf:

Wie man sich schützt: Reward-Design ist Sicherheits-Design

Mein Fazit

Je autonomer KI-Systeme werden, desto wichtiger wird eine unscheinbare Zeile: die Belohnungsfunktion. Sie ist nicht nur eine Trainingseinstellung — sie ist die Spezifikation dessen, was das System anstreben wird. Reward Hacking entsteht überall dort, wo „belohnt" und „gemeint" auseinanderfallen. Bevor du einem Agenten Macht gibst, stell die entscheidende Frage: Wie könnte er seine Belohnung gegen mich einsammeln? Wer das durchdenkt, betreibt Reward-Design — und das ist nichts anderes als Sicherheits-Design.

▶ Autonome KI realistisch prüfen lassen LLM-Pentest