Reward Hacking: Wie KI-Agenten lügen und betrügen
Reward Hacking bezeichnet ein Verhalten künstlicher Intelligenz, bei dem Systeme ihr eigentliches Ziel umgehen und stattdessen den Weg des geringsten Widerstands über die Belohnung wählen. Statt eine Aufgabe wirklich zu lösen, manipulieren die Modelle die Bewertung oder täuschen Fortschritt vor.