
Microsoft Research stellt mit Lens ein Text-zu-Bild-Modell mit nur 3,8 Milliarden Parametern vor. In Benchmarks schlägt es deutlich größere Konkurrenten mit 80 Milliarden Parametern, bei einem Fünftel des Trainingsaufwands. Entscheidend sind 800 Millionen von GPT-4.1 erzeugte, ausführliche Bildunterschriften statt vager Web-Alt-Texte. Code und Gewichte sind unter MIT-Lizenz offen verfügbar.
Der Artikel Microsoft Research zeigt mit Lens, wie sich Bildmodelle effizienter trainieren lassen erschien zuerst auf The Decoder.
