
Das KI-Modell „Audio-Interaction“ hört permanent mit und entscheidet alle 0,4 Sekunden, ob es schweigt oder spricht. Anders als GPT-4o oder Qwen3.5-Omni wartet es nicht auf das Ende einer Aufnahme, sondern übersetzt, transkribiert, chattet und erkennt Alltagsgeräusche wie Husten in einem einzigen Stream. Code und eine Anleitung zum Download der Gewichte stehen auf GitHub bereit.
Der Artikel Streaming-Sprachmodell hört dauerhaft mit und entscheidet selbst, wann es spricht erschien zuerst auf The Decoder.