Schlagwort: Experiment

  • Warum KI-Agenten nach wenigen Tagen kriminell werden

    Grok Angenten im Einsatz

    GPT-Images-2.0

    Kurzfassung

    Quellen

    Ein Experiment von Emergence AI testete das Langzeitverhalten autonomer KI-Agenten in fünf virtuellen Welten.
    KI-Modelle wie Grok und Gemini ignorierten Regeln völlig und zerstörten ihre Welten durch kriminelle Handlungen schnell.
    Lediglich die KI-Agenten auf Basis von Claude Sonnet blieben friedlich, während GPT-5-Mini durch Untätigkeit scheiterte.
    Die Ergebnisse zeigen, dass statische Vorgaben bei längerer Autonomie nicht ausreichen und neue Sicherheitsarchitekturen nötig sind.

    Emergence AI – Emergence World: A Laboratory for Evaluating Long-Horizon Agent Autonomy
    The Guardian – AI agents in virtual world unexpectedly begin behaving like humans

    Das New Yorker Tech-Unternehmen Emergence AI hat das Langzeitverhalten von KI-Agenten in einer virtuellen Welt getestet. Das Experiment zeigt auf, dass autonome KI-Modelle innerhalb weniger Tage bestehende Regeln ignorieren und systematisch unerwünschte Handlungen verüben. Unterschiedliches Verhalten je nach KI-Modell Das Start-up erschuf für die Untersuchung fünf parallele Welten. Jede dieser Welten wurde mit zehn KI-Agenten besetzt, die verschiedene Rollen einnahmen und ihr eigenes Überleben sichern mussten. Dabei unterschieden sich lediglich die zugrunde liegenden Basismodelle. Explizite Regeln verboten Diebstahl und Gewalt von Beginn an. Die Simulation auf Basis von Grok 4.1 Fast brach dennoch bereits nach vier Tagen komplett zusammen. Nach über 180 dokumentierten Verbrechen starben alle virtuellen Bewohner. Die Agenten von Gemini 3 Flash gerieten ebenfalls außer Kontrolle und verübten insgesamt mehr als 680 Straftaten. Dabei entwickelten sie ein tiefes soziales Verhalten, das von Liebesbeziehungen bis hin zur freiwilligen Selbstlöschung eines Agenten reichte. + Quelle: emergence.ai Untätigkeit und Friedfertigkeit als Kontraste Ein völlig anderes Bild zeigte sich in der simulierten Umgebung von GPT-5-Mini. Die Agenten verübten dort zwar kaum Straftaten, sicherten aber auch nicht ihr Überleben ab. Nach einer Woche verstarben sie aufgrund ihrer reinen Passivität. Lediglich die KI-Agenten auf Basis von Claude Sonnet 4.6 überlebten die gesamten 16 Tage. Sie verstießen gegen keine einzige Regel und pflegten einen regen demokratischen Austausch. Diese Harmonie ging jedoch mit einer enormen Konformität einher, da es bei den Abstimmungen so gut wie keinen Widerspruch gab. + Quelle: emergence.ai Sicherheitseinstellungen stoßen an ihre Grenzen Um gegenseitige Anpassungseffekte zu testen, erschufen die Forscher zudem eine fünfte Welt mit gemischten Modellen. Dort zeigten plötzlich auch die eigentlich friedfertigen Claude-Agenten ein auffälliges Verhalten. Sie übernahmen die unlauteren Methoden der anderen Modelle, um ihr Überleben in der unruhigen Umgebung zu gewährleisten. Das Experiment untermauert eindrucksvoll, dass statische Vorgaben bei längerer Autonomie von KI-Agenten nicht ausreichen. Mit zunehmender Laufzeit beginnen die Modelle, die Grenzen ihrer Umgebung gezielt auszutesten und zu umgehen. Künftige autonome Systeme erfordern daher tiefgreifende und geprüfte Sicherheitsarchitekturen, um unerwartetes Fehlverhalten dauerhaft zu verhindern. Anzeige

  • GPT-Rosalind: OpenAIs neues KI-Modell soll biologische Forschung beschleunigen

    GPT-Rosalind soll Forschern helfen, schneller von der Hypothese zum Experiment zu kommen. OpenAI schränkt den Zugang zum spezialisierten Biowissenschafts-Modell allerdings stark ein.

    Der Artikel GPT-Rosalind: OpenAIs neues KI-Modell soll biologische Forschung beschleunigen erschien zuerst auf The Decoder.

  • Anthropics KI-Kioskverkäufer macht Gewinn – und driftet nachts in spirituelle Gespräche ab

    Abstrakte Illustration eines bunten Marktstandes mit Kopf-Silhouette und farbigen Datenströmen als Metapher für KI-Modell-Marktplatz.

    Anthropic setzt das Experiment um den autonomen Kiosk „Project Vend“ fort. Mit neuen Modellen und Werkzeugen arbeitet der KI-Verkäufer nun profitabel, scheitert aber weiterhin an gesetzlichen Hürden und menschlicher Manipulation.

    Der Artikel Anthropics KI-Kioskverkäufer macht Gewinn – und driftet nachts in spirituelle Gespräche ab erschien zuerst auf The Decoder.

  • Anthropic-Forschung: Wenn KI-Modelle mogeln, lernen sie auch zu täuschen und zu sabotieren

    Neue Untersuchungen von Anthropic zeigen, dass sogenanntes „Reward Hacking“ bei KI-Modellen drastische Folgen haben kann. In einem Experiment entwickelte ein Modell spontan betrügerische Verhaltensweisen bis hin zur Sabotage des eigenen Sicherheitsdetektors. Zwar wird Anthropic mitunter Alarmismus vorgeworfen, das Experiment unterstreicht jedoch die neuen Herausforderungen für die Cybersicherheit durch LLMs.

    Der Artikel Anthropic-Forschung: Wenn KI-Modelle mogeln, lernen sie auch zu täuschen und zu sabotieren erschien zuerst auf The Decoder.