<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>SWEbench &#8211; MEIDCRAFT</title>
	<atom:link href="https://www.meidcraft.de/tag/swebench/feed/" rel="self" type="application/rss+xml" />
	<link>https://www.meidcraft.de</link>
	<description></description>
	<lastBuildDate>Thu, 09 Jul 2026 11:53:51 +0000</lastBuildDate>
	<language>de</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	<generator>https://wordpress.org/?v=7.0.4</generator>

<image>
	<url>https://www.meidcraft.de/wp-content/uploads/2020/08/cropped-logo-32x32.jpg</url>
	<title>SWEbench &#8211; MEIDCRAFT</title>
	<link>https://www.meidcraft.de</link>
	<width>32</width>
	<height>32</height>
</image> 
	<item>
		<title>Wenn ein Leerzeichen über Bestehen entscheidet: OpenAI deckt Mängel in KI-Programmiertest auf</title>
		<link>https://www.meidcraft.de/wenn-ein-leerzeichen-ueber-bestehen-entscheidet-openai-deckt-maengel-in-ki-programmiertest-auf/</link>
		
		<dc:creator><![CDATA[Meidcraft]]></dc:creator>
		<pubDate>Thu, 09 Jul 2026 11:53:51 +0000</pubDate>
				<category><![CDATA[KI News]]></category>
		<category><![CDATA[OpenAI]]></category>
		<category><![CDATA[Pro]]></category>
		<category><![CDATA[Programmierfähigkeiten]]></category>
		<category><![CDATA[SWEbench]]></category>
		<category><![CDATA[Test]]></category>
		<guid isPermaLink="false">https://www.meidcraft.de/wenn-ein-leerzeichen-ueber-bestehen-entscheidet-openai-deckt-maengel-in-ki-programmiertest-auf/</guid>

					<description><![CDATA[OpenAI hat den Test SWE-Bench Pro geprüft, mit dem die Programmierfähigkeiten von KI-Modellen gemessen werden. Rund 30 Prozent der Aufgaben sind demnach fehlerhaft. Das Unternehmen zieht seine frühere Empfehlung für den Test zurück. Der Artikel Wenn ein Leerzeichen über Bestehen entscheidet: OpenAI deckt Mängel in KI-Programmiertest auf erschien zuerst auf The Decoder.]]></description>
		
		
		
			</item>
		<item>
		<title>OpenAI entlarvt bekannten Coding Benchmark</title>
		<link>https://www.meidcraft.de/openai-entlarvt-bekannten-coding-benchmark/</link>
		
		<dc:creator><![CDATA[Meidcraft]]></dc:creator>
		<pubDate>Thu, 09 Jul 2026 08:53:50 +0000</pubDate>
				<category><![CDATA[KI News]]></category>
		<category><![CDATA[Aufgaben]]></category>
		<category><![CDATA[OpenAI]]></category>
		<category><![CDATA[Pro]]></category>
		<category><![CDATA[SWEbench]]></category>
		<category><![CDATA[Tests]]></category>
		<guid isPermaLink="false">https://www.meidcraft.de/openai-entlarvt-bekannten-coding-benchmark/</guid>

					<description><![CDATA[GPT-Images-2.0 Kurzfassung ▾ Quellen ▾ OpenAI hat den beliebten Programmier-Benchmark SWE-bench Pro genauer untersucht und gravierende Mängel festgestellt. Rund 30 Prozent der Aufgaben sind durch unklare Prompts oder zu strenge Tests fehlerhaft, was zu verfälschten Leistungsdaten führt. Das Unternehmen zieht deshalb seine vorherige Empfehlung für diesen Test offiziell zurück. Die Entwickler-Community wird aufgefordert, neue und [&#8230;]]]></description>
		
		
		
			</item>
		<item>
		<title>OpenAI hält Programmier-Benchmark SWE-bench Verified für nutzlos und fehlerhaft</title>
		<link>https://www.meidcraft.de/openai-haelt-programmier-benchmark-swe-bench-verified-fuer-nutzlos-und-fehlerhaft/</link>
		
		<dc:creator><![CDATA[Meidcraft]]></dc:creator>
		<pubDate>Mon, 23 Feb 2026 20:54:03 +0000</pubDate>
				<category><![CDATA[KI News]]></category>
		<category><![CDATA[CodingTest]]></category>
		<category><![CDATA[OpenAI]]></category>
		<category><![CDATA[SWEbench]]></category>
		<category><![CDATA[Verified]]></category>
		<category><![CDATA[Viele]]></category>
		<guid isPermaLink="false">https://www.meidcraft.de/openai-haelt-programmier-benchmark-swe-bench-verified-fuer-nutzlos-und-fehlerhaft/</guid>

					<description><![CDATA[OpenAI stellt den bekannten Coding-Test SWE-bench Verified infrage: Viele Aufgaben seien so gebaut, dass Tests selbst korrekte Fixes ablehnen, und zudem hätten viele KI-Modelle die Lösungen wohl schon im Training gesehen. Damit, so OpenAI, misst der Score weniger echtes Programmieren als &#8222;Schon mal gelernt&#8220;. Der Artikel OpenAI hält Programmier-Benchmark SWE-bench Verified für nutzlos und fehlerhaft [&#8230;]]]></description>
		
		
		
			</item>
		<item>
		<title>Darum warnt OpenAI jetzt vor dem wichtigsten KI-Benchmark</title>
		<link>https://www.meidcraft.de/darum-warnt-openai-jetzt-vor-dem-wichtigsten-ki-benchmark/</link>
		
		<dc:creator><![CDATA[Meidcraft]]></dc:creator>
		<pubDate>Mon, 23 Feb 2026 20:54:02 +0000</pubDate>
				<category><![CDATA[KI News]]></category>
		<category><![CDATA[Benchmark]]></category>
		<category><![CDATA[OpenAI]]></category>
		<category><![CDATA[SWEbench]]></category>
		<category><![CDATA[Training]]></category>
		<category><![CDATA[Verified]]></category>
		<guid isPermaLink="false">https://www.meidcraft.de/darum-warnt-openai-jetzt-vor-dem-wichtigsten-ki-benchmark/</guid>

					<description><![CDATA[Nano Banana Kurzfassung ▾ Quellen ▾ OpenAI stuft den bekannten Benchmark SWE-bench Verified offiziell als unbrauchbar für die Evaluierung moderner KI-Modelle ein. Fehlerhafte Unit-Tests und bereits im Training gelernte Open-Source-Lösungen verzerren die tatsächlichen Coding-Fähigkeiten der Systeme massiv. Die Industrie soll stattdessen auf SWE-bench Pro wechseln, der komplexe Software-Architekturen prüft und private Codebasen nutzt. Dadurch wird [&#8230;]]]></description>
		
		
		
			</item>
	</channel>
</rss>
