
Moonshot AI testet mit PerceptionBench, wie gut multimodale KI-Modelle tatsächlich sehen können – getrennt von logischem Denken. Kein Frontier-Modell erreicht 60 Prozent Genauigkeit, GPT-5.6 Sol führt knapp. Viele vermeintliche Reasoning-Fehler entstehen offenbar schon beim Bildlesen.
Der Artikel Neuer Benchmark bestätigt: KI-Modelle sehen weiterhin schlecht erschien zuerst auf The Decoder.
