
Alibaba legt den technischen Bericht zu Qwen-Image-2.0 offen: Das Bildmodell komprimiert Bilder doppelt so stark wie üblich, stabilisiert das Training durch einen umgebauten Transformer und nutzt ein eigenes Modul, das knappe Nutzereingaben automatisch in detaillierte Prompts übersetzt. Eine schnelle Variante braucht nur noch vier statt 40 Rechenschritte pro Bild. In der LMArena, einer Plattform für Blindvergleiche durch Nutzer, landet Qwen-Image-2.0 auf Rang 9.
Der Artikel Qwen-Image-2.0: Weniger Rechenschritte, stärkere Kompression, bessere Prompts erschien zuerst auf The Decoder.