
KI-Agenten mit Claude Opus 4.8 und GPT-5.6 Sol erhielten sechs Tage, 3.000 Dollar Budget und GPU-Zugang, um eigenständig KI-Forschungspapiere zu verfassen. Originalautoren unveröffentlichter NeurIPS-Papers bewerteten die Ergebnisse mit „Reject“. Laut der Studie unter Beteiligung von Princeton und dem UK AI Security Institute meistern Frontier-Modelle zwar das komplette Research-Engineering, scheitern aber an Forschungsurteil, kreativer Problemlösung und der Fähigkeit, gescheiterte Ansätze aufzugeben.
Der Artikel Studie widerspricht Anthropic und OpenAI: Autonome KI-Forschung ist noch weit entfernt erschien zuerst auf The Decoder.
