
AMD übernimmt das kanadische Startup Taalas, das Modellgewichte fest in Inferenz-Chips einbrennt: extrem schnell, aber nur für ein einziges Modell nutzbar. Ein Demo-Chip erreichte über 16.000 Tokens pro Sekunde pro Nutzer mit Llama 3.1-8B. Auch Google soll an einem ähnlichen Ansatz für Gemini arbeiten.
Der Artikel AMD kauft Taalas: Startup brennt KI-Modelle fest in Chips ein für schnelle Inferenz erschien zuerst auf The Decoder.
