Neue Technik macht ChatGPT Betrieb plötzlich extrem günstig

Ein OpenAI Chip

GPT-Images-2.0

Kurzfassung

Quellen

OpenAI hat durch interne Optimierungen die Betriebskosten für bestehende KI-Modelle um über 50 Prozent gesenkt.
Zeitweise benötigte ChatGPT für unangemeldete Nutzer nur noch wenige hundert Nvidia-GPUs, was einen enormen Effizienzsprung darstellt.
Die Kosteneinsparungen helfen dem Unternehmen, sein Margenziel von 52 Prozent bis Jahresende zu erreichen und lindern den akuten Hardware-Mangel.
Als direkte Reaktion auf den schrumpfenden Hardware-Bedarf von OpenAI fielen die Kurse amerikanischer Halbleiter-Aktien deutlich.

The Information – OpenAI Discovers New Way to Cut Inference Costs in Half
The Information auf X – OpenAI engineers recently found optimizations that more than halved the cost of running some existing models

OpenAI hat die Inferenzkosten seiner bestehenden Sprachmodelle offenbar um mehr als die Hälfte gesenkt. Wie aus internen Berichten von Ingenieuren hervorgeht, lief ChatGPT für unangemeldete Besucher zeitweise auf nur noch wenigen hundert Nvidia-GPUs. Eingriffe in die Berechnungsabläufe Auf welche technische Methode das Team dabei setzt, nannten die Ingenieure bei der internen Verkündung des Erfolgs nicht im Detail. Beobachter gehen von etablierten Verfahren wie Quantisierung, Key-Value-Caching oder Batching aus. Zudem liegt nahe, dass einfache Nutzeranfragen künftig routinemäßig an kleinere, günstigere Modelle delegiert werden. Solche Kniffe sind jedoch riskant. Eine Quantisierung reduziert die Präzision der Modellgewichte, was Textausgaben ungenauer machen kann. Wenn das System komplexe Aufgaben fälschlich als simpel einstuft und an zu kleine Modelle übergibt, bricht die Antwortqualität ein. Wird zudem der Kontext zu stark komprimiert, übersehen die Modelle in langen Chatverläufen womöglich wichtige Sicherheitsvorgaben. Anzeige Entlastung für Entwickler, Schock für den Aktienmarkt Für OpenAI lindert der geringere Rechenaufwand vor allem den Kostendruck. Im ersten Quartal lag die Bruttomarge im API-Geschäft bei 39 Prozent. Bis zum Jahresende muss das Unternehmen 52 Prozent erreichen. Der neu gewonnene Puffer bietet OpenAI Handlungsspielraum. Das Unternehmen könnte die Preise für API-Zugriffe senken oder die strengen Nutzungslimits für ChatGPT-Abonnenten lockern. Davon profitieren auch europäische Unternehmen, für die der produktive Einsatz großer Sprachmodelle dadurch schlicht billiger wird. Gleichzeitig macht eine effizientere Architektur unabhängiger von knapper Hardware. Wie akut der Mangel an Rechenleistung in der Branche ist, zeigte zuletzt Google, als es den Zugang zu Gemini limitieren musste.

Leser:innen sagen:

„Wie Black Mirror, nur philosophischer und näher an der Wirklichkeit.“, Lisa M.
„Jede Geschichte ist ein Gedankensprung in eine andere Zukunft.“, Stefan K.
„Beunruhigend schön. Eine literarische Simulation unserer nahen Zukunft.“, Albert B.

TRAUMWELT.exe ist kein gewöhnliches Buch. Es ist ein Blick durch den Spalt einer Tür, die sich längst geöffnet hat – in eine Welt, in der Maschinen träumen, Städte flüstern und Ethik verhandelbar geworden ist. Eine Sammlung visionärer Geschichten, die an der Schwelle zwischen Fiktion und Realität tanzen – so plausibel erzählt, dass du dich unweigerlich fragst: Ist das noch Zukunft oder schon Gegenwart?