Neuer Benchmark bestätigt: KI-Modelle sehen weiterhin schlecht

Vier Uhren und bunte gestapelte Quader vor abstrakten Formen illustrieren zeitliche Phasen und modulare Prozessschritte.

Moonshot AI testet mit PerceptionBench, wie gut multimodale KI-Modelle tatsächlich sehen können – getrennt von logischem Denken. Kein Frontier-Modell erreicht 60 Prozent Genauigkeit, GPT-5.6 Sol führt knapp. Viele vermeintliche Reasoning-Fehler entstehen offenbar schon beim Bildlesen.

Der Artikel Neuer Benchmark bestätigt: KI-Modelle sehen weiterhin schlecht erschien zuerst auf The Decoder.

Leser:innen sagen:

„Wie Black Mirror, nur philosophischer und näher an der Wirklichkeit.“, Lisa M.
„Jede Geschichte ist ein Gedankensprung in eine andere Zukunft.“, Stefan K.
„Beunruhigend schön. Eine literarische Simulation unserer nahen Zukunft.“, Albert B.

TRAUMWELT.exe ist kein gewöhnliches Buch. Es ist ein Blick durch den Spalt einer Tür, die sich längst geöffnet hat – in eine Welt, in der Maschinen träumen, Städte flüstern und Ethik verhandelbar geworden ist. Eine Sammlung visionärer Geschichten, die an der Schwelle zwischen Fiktion und Realität tanzen – so plausibel erzählt, dass du dich unweigerlich fragst: Ist das noch Zukunft oder schon Gegenwart?