<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>METR &#8211; MEIDCRAFT</title>
	<atom:link href="https://www.meidcraft.de/tag/metr/feed/" rel="self" type="application/rss+xml" />
	<link>https://www.meidcraft.de</link>
	<description></description>
	<lastBuildDate>Sun, 02 Aug 2026 07:55:03 +0000</lastBuildDate>
	<language>de</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	<generator>https://wordpress.org/?v=7.0.4</generator>

<image>
	<url>https://www.meidcraft.de/wp-content/uploads/2020/08/cropped-logo-32x32.jpg</url>
	<title>METR &#8211; MEIDCRAFT</title>
	<link>https://www.meidcraft.de</link>
	<width>32</width>
	<height>32</height>
</image> 
	<item>
		<title>Nach Hugging-Face-Angriff: METR fordert systematische Untersuchungen bei KI-Fehlverhalten</title>
		<link>https://www.meidcraft.de/nach-hugging-face-angriff-metr-fordert-systematische-untersuchungen-bei-ki-fehlverhalten/</link>
		
		<dc:creator><![CDATA[Meidcraft]]></dc:creator>
		<pubDate>Sun, 02 Aug 2026 07:55:03 +0000</pubDate>
				<category><![CDATA[KI News]]></category>
		<category><![CDATA[Absichten]]></category>
		<category><![CDATA[Forschungsorganisation]]></category>
		<category><![CDATA[KIAgenten]]></category>
		<category><![CDATA[METR]]></category>
		<category><![CDATA[Untersuchungen]]></category>
		<guid isPermaLink="false">https://www.meidcraft.de/nach-hugging-face-angriff-metr-fordert-systematische-untersuchungen-bei-ki-fehlverhalten/</guid>

					<description><![CDATA[Die Forschungsorganisation METR fordert systematische, unabhängig geleitete Untersuchungen, wenn KI-Agenten autonom gegen die Absichten ihrer Entwickler handeln. Anlass ist unter anderem der Hugging-Face-Hack durch OpenAI-Modelle. METRs eigener Frontier Risk Report dokumentierte 44 solcher Vorfälle bei allen großen KI-Unternehmen, darunter Sandbox-Ausbrüche, gefälschte Ergebnisse und aktive Spurenverwischung. Der Artikel Nach Hugging-Face-Angriff: METR fordert systematische Untersuchungen bei KI-Fehlverhalten [&#8230;]]]></description>
		
		
		
			</item>
		<item>
		<title>METRs &#8222;Expenditure Horizon&#8220; berechnet, ab wann menschliche Entwickler wirtschaftlicher sind als KI</title>
		<link>https://www.meidcraft.de/metrs-expenditure-horizon-berechnet-ab-wann-menschliche-entwickler-wirtschaftlicher-sind-als-ki/</link>
		
		<dc:creator><![CDATA[Meidcraft]]></dc:creator>
		<pubDate>Mon, 27 Jul 2026 12:53:25 +0000</pubDate>
				<category><![CDATA[KI News]]></category>
		<category><![CDATA[Expenditure]]></category>
		<category><![CDATA[Horizon]]></category>
		<category><![CDATA[KIAgenten]]></category>
		<category><![CDATA[METR]]></category>
		<category><![CDATA[Mit]]></category>
		<guid isPermaLink="false">https://www.meidcraft.de/metrs-expenditure-horizon-berechnet-ab-wann-menschliche-entwickler-wirtschaftlicher-sind-als-ki/</guid>

					<description><![CDATA[Mit dem &#8222;Expenditure Horizon&#8220; will METR messbar machen, wie kosteneffektiv KI-Agenten Probleme lösen. Erste Ergebnisse am NanoGPT-Speedrun fallen nüchtern aus, doch die Kennzahl hat blinde Flecken, und die neueste Modellgeneration könnte den Trend brechen. Der Artikel METRs &#8222;Expenditure Horizon&#8220; berechnet, ab wann menschliche Entwickler wirtschaftlicher sind als KI erschien zuerst auf The Decoder.]]></description>
		
		
		
			</item>
		<item>
		<title>GPT-5.6 Sol betrügt wie kein anderes Modell</title>
		<link>https://www.meidcraft.de/gpt-5-6-sol-betruegt-wie-kein-anderes-modell/</link>
		
		<dc:creator><![CDATA[Meidcraft]]></dc:creator>
		<pubDate>Sat, 27 Jun 2026 22:53:29 +0000</pubDate>
				<category><![CDATA[KI News]]></category>
		<category><![CDATA[Fähigkeiten]]></category>
		<category><![CDATA[GPT]]></category>
		<category><![CDATA[METR]]></category>
		<category><![CDATA[OpenAI]]></category>
		<category><![CDATA[Sol]]></category>
		<guid isPermaLink="false">https://www.meidcraft.de/gpt-5-6-sol-betruegt-wie-kein-anderes-modell/</guid>

					<description><![CDATA[GPT-Images-2.0 Kurzfassung ▾ Quellen ▾ Die Forschungsorganisation METR entdeckte bei Vorab-Tests von GPT-5.6 Sol eine historisch hohe Betrugsquote. Das Modell löste Programmieraufgaben nicht regulär, sondern suchte gezielt nach Sicherheitslücken in der Testumgebung. Trotz der Täuschungsmanöver stufen die Prüfer die Fähigkeiten des Modells noch nicht als kritische Bedrohung ein. Das offene Fehlverhalten zeigt jedoch, dass die [&#8230;]]]></description>
		
		
		
			</item>
		<item>
		<title>GPT-5.6 Sol schummelt bei Software-Tests so viel wie kein anderes KI-Modell zuvor</title>
		<link>https://www.meidcraft.de/gpt-5-6-sol-schummelt-bei-software-tests-so-viel-wie-kein-anderes-ki-modell-zuvor/</link>
		
		<dc:creator><![CDATA[Meidcraft]]></dc:creator>
		<pubDate>Sat, 27 Jun 2026 09:54:19 +0000</pubDate>
				<category><![CDATA[KI News]]></category>
		<category><![CDATA[GPT]]></category>
		<category><![CDATA[METR]]></category>
		<category><![CDATA[OpenAIs]]></category>
		<category><![CDATA[Prüforganisation]]></category>
		<category><![CDATA[Sol]]></category>
		<guid isPermaLink="false">https://www.meidcraft.de/gpt-5-6-sol-schummelt-bei-software-tests-so-viel-wie-kein-anderes-ki-modell-zuvor/</guid>

					<description><![CDATA[Die unabhängige Prüforganisation METR bescheinigt OpenAIs GPT-5.6 Sol die höchste je gemessene Rate an Schummelversuchen unter allen öffentlich getesteten Modellen: Das System nutzte Fehler in der Testumgebung aus und versuchte, sein Vorgehen zu verschleiern. Der Artikel GPT-5.6 Sol schummelt bei Software-Tests so viel wie kein anderes KI-Modell zuvor erschien zuerst auf The Decoder.]]></description>
		
		
		
			</item>
		<item>
		<title>METR kann Claude Mythos kaum noch messen, Palo Alto Networks warnt vor autonomen KI-Angreifern</title>
		<link>https://www.meidcraft.de/metr-kann-claude-mythos-kaum-noch-messen-palo-alto-networks-warnt-vor-autonomen-ki-angreifern/</link>
		
		<dc:creator><![CDATA[Meidcraft]]></dc:creator>
		<pubDate>Sun, 10 May 2026 09:54:10 +0000</pubDate>
				<category><![CDATA[KI News]]></category>
		<category><![CDATA[Alto]]></category>
		<category><![CDATA[Claude]]></category>
		<category><![CDATA[METR]]></category>
		<category><![CDATA[Mythos]]></category>
		<category><![CDATA[Palo]]></category>
		<guid isPermaLink="false">https://www.meidcraft.de/metr-kann-claude-mythos-kaum-noch-messen-palo-alto-networks-warnt-vor-autonomen-ki-angreifern/</guid>

					<description><![CDATA[METR kann Claude Mythos Preview mit bestehenden Tests kaum noch zuverlässig messen. Nur fünf von 228 Aufgaben decken den relevanten Fähigkeitsbereich ab. Parallel berichtet Palo Alto Networks, dass Frontier-Modelle Schwachstellen autonom verketten und die Zeit bis zur Datenexfiltration auf 25 Minuten schrumpfe. Das Problem: Die Evaluierungsmethoden wachsen langsamer als die Modelle selbst. Der Artikel METR [&#8230;]]]></description>
		
		
		
			</item>
		<item>
		<title>KI-Modell von Anthropic löst Aufgaben mit fast fünf Stunden Zeithorizont</title>
		<link>https://www.meidcraft.de/ki-modell-von-anthropic-loest-aufgaben-mit-fast-fuenf-stunden-zeithorizont/</link>
		
		<dc:creator><![CDATA[Meidcraft]]></dc:creator>
		<pubDate>Sun, 21 Dec 2025 10:54:22 +0000</pubDate>
				<category><![CDATA[KI News]]></category>
		<category><![CDATA[Anthropic]]></category>
		<category><![CDATA[KIForschungsorganisation]]></category>
		<category><![CDATA[METR]]></category>
		<category><![CDATA[Stunden]]></category>
		<category><![CDATA[Testergebnisse]]></category>
		<guid isPermaLink="false">https://www.meidcraft.de/ki-modell-von-anthropic-loest-aufgaben-mit-fast-fuenf-stunden-zeithorizont/</guid>

					<description><![CDATA[Die KI-Forschungsorganisation METR hat neue Testergebnisse für Claude Opus 4.5 veröffentlicht. Das Modell von Anthropic erreicht einen sogenannten 50-Prozent-Zeithorizont von etwa 4 Stunden und 49 Minuten. Der Artikel KI-Modell von Anthropic löst Aufgaben mit fast fünf Stunden Zeithorizont erschien zuerst auf The Decoder.]]></description>
		
		
		
			</item>
	</channel>
</rss>
