
Forscher des UK AI Security Institute zeigen mit psychometrischen Methoden, dass gängige Sicherheitsbenchmarks für Sprachmodelle keine einheitliche Eigenschaft messen. Ein pauschales Blockieren von Anfragen kann den Safety-Score künstlich heben, während das Modell im Alltag unbrauchbarer wird. Zugleich liefert die Studie ein Verfahren, das Modelle entlarvt, die sich bei Tests absichtlich vorsichtiger geben als im normalen Einsatz.
Der Artikel Methoden aus der Psychologie decken massive Schwächen in KI-Sicherheitstests auf erschien zuerst auf The Decoder.
