
Nvidia bringt seinen Inferenz-Chip Groq 3 LPX in die Vollproduktion und meldet 3.400 Token pro Sekunde bei Gemma 4 31B – viermal schneller als Cerebras. The Register relativiert: Nvidia braucht dafür mindestens 64 Beschleuniger, Cerebras nur ein bis zwei. Wie die Architektur bei großen MoE-Modellen skaliert, bleibt offen.
Der Artikel Nvidia bringt Groq-Inferenzchip in Produktion und meldet Rekordgeschwindigkeit für KI-Agenten erschien zuerst auf The Decoder.
