Schlagwort: Audio

  • Seedance 2.5: ByteDances neues Videomodell liefert 30-Sekunden-Clips mit integriertem Audio

    ByteDance veröffentlicht mit Seedance 2.5 ein KI-Videomodell, das Video und Audio in einem Durchgang erzeugt, mit bis zu 30 Sekunden pro Clip, dreimal so viel wie Googles Gemini Omni Flash. Nutzer können Dutzende Bilder, Videos und Audiodateien als Referenz hochladen. Für Werbeproduktionen könnte das die Einzelclip-Montage überflüssig machen.

    Der Artikel Seedance 2.5: ByteDances neues Videomodell liefert 30-Sekunden-Clips mit integriertem Audio erschien zuerst auf The Decoder.

  • Googles Gemma 4 12B bringt multimodale KI mit Text, Bild und Audio auf handelsübliche Laptops

    Google DeepMind veröffentlicht mit Gemma 4 12B ein Open-Source-Modell, das Text, Bild und Audio nativ verarbeitet und dabei auf Laptops mit nur 16 GB RAM läuft. In Benchmarks erreicht es fast die Leistung des doppelt so großen 26B-Modells. Die Apache-2.0-Lizenz erlaubt auch kommerzielle Nutzung.

    Der Artikel Googles Gemma 4 12B bringt multimodale KI mit Text, Bild und Audio auf handelsübliche Laptops erschien zuerst auf The Decoder.

  • Stable Audio 3.0 erscheint mit offenen Gewichten und voll lizenzierten Trainingsdaten

    Porträt einer Person mit Kopfhörern und geschlossenen Augen neben dem Schriftzug „Stable Audio 3.0“ und den Slogans „Remix it. Tune it. Own it.“

    Stability AI stellt mit Stable Audio 3.0 vier neue Musikmodelle vor, drei davon mit offenen Gewichten. Das Medium-Modell erzeugt mit 1,4 Milliarden Parametern Tracks von über sechs Minuten – trainiert ausschließlich auf lizenzierten Daten. Angesichts laufender Urheberrechtsklagen gegen Konkurrenten wie Suno und Udio setzt Stability AI damit gezielt auf rechtliche Absicherung als Wettbewerbsvorteil.

    Der Artikel Stable Audio 3.0 erscheint mit offenen Gewichten und voll lizenzierten Trainingsdaten erschien zuerst auf The Decoder.

  • Google bringt mit Gemini Embedding 2 Text, Bild, Video und Audio in einen gemeinsamen Vektorraum

    Schwarzer Hintergrund mit buntem Stern-Logo und 'Gemini Embedding 2'-Schriftzug, umgeben von Wellen aus farbigen Punkten.

    Google stellt sein erstes nativ multimodales Embedding-Modell vor. Gemini Embedding 2 soll Text, Bilder, Videos, Audio und Dokumente in einem einzigen semantischen Raum abbilden und damit komplexe KI-Pipelines vereinfachen.

    Der Artikel Google bringt mit Gemini Embedding 2 Text, Bild, Video und Audio in einen gemeinsamen Vektorraum erschien zuerst auf The Decoder.

  • Metas neues KI-Modell SAM Audio lässt Nutzer Töne in Videos anklicken

    Frau telefoniert im Straßenszenario, Audiosegmentierung hebt vorbeifahrenden Zug mit grüner Kontur hervor und zeigt Wellenform

    Hundegebell aus dem Straßenlärm filtern oder per Mausklick im Video eine Tonquelle isolieren: Mit SAM Audio bringt Meta sein bewährtes visuelles Segmentierungskonzept in die Audiowelt. Das Modell vereinfacht Audio-Bearbeitung durch Text, Klicks oder Zeitmarkierungen. Code und Gewichte sind frei verfügbar.

    Der Artikel Metas neues KI-Modell SAM Audio lässt Nutzer Töne in Videos anklicken erschien zuerst auf The Decoder.

  • Alibaba Qwen3-Omni: KI-Modell verarbeitet Text, Audio und Video in Echtzeit

    Das chinesische Technologieunternehmen Alibaba hat mit Qwen3-Omni ein nativ multimodales KI-Modell vorgestellt, das Text, Bilder, Audio und Video verarbeitet und dabei in Echtzeit antwortet.

    Der Artikel Alibaba Qwen3-Omni: KI-Modell verarbeitet Text, Audio und Video in Echtzeit erschien zuerst auf THE-DECODER.de.

  • Musik in Sekunden: Diese Audio-KI ersetzt das Tonstudio

    Ein futuristisches AI-Musik-Studio

    Musik in Sekunden: Diese Audio-KI ersetzt das Tonstudio Stable Audio 2.5 generiert Tracks in Studioqualität – und braucht dafür nur zwei Sekunden. Kurzfassung | Andreas Becker, 11.09.25
    gpt-image-1 | All-AI.de EINLEITUNG Stability AI geht mit seiner Audio-KI in die nächste Runde – und spricht jetzt gezielt Unternehmen an. Stable Audio 2.5 erzeugt komplette Musikstücke in Studioqualität und braucht dafür weniger Zeit, als ein Track zum Laden braucht. Möglich macht das eine neue Trainingsmethode namens ARC. Gleichzeitig bringt das Update Funktionen, die das Modell für professionelle Audio-Workflows interessant machen sollen – etwa das nahtlose Ergänzen bestehender Aufnahmen. NEWS Was das Modell kann Stable Audio 2.5 generiert bis zu drei Minuten lange Tracks in unter zwei Sekunden – zumindest auf den dafür optimierten Nvidia H100-GPUs. Dabei sind die Strukturen komplexer als bisher: Intros, Spannungsbögen, Breaks und Outros lassen sich gezielt erzeugen. Auch auf Stimmungen und Genres reagiert das Modell jetzt feinfühliger. Prompts wie „epischer Soundtrack“ oder „uplifting Electro mit breiten Synths“ liefern laut Stability AI hörbar bessere Ergebnisse. Ein Highlight ist die neue Inpainting-Funktion. Nutzer laden einen Audioschnipsel hoch, markieren den Einstiegspunkt – und die KI ergänzt den Rest des Tracks passend dazu. Das ist praktisch, wenn etwa ein Loop verlängert oder ein halbfertiger Jingle fertiggestellt werden soll. Auch Text-zu-Audio bleibt möglich. Die generierten Dateien lassen sich direkt in kreative Workflows integrieren.

    Tempo durch neue Methode Das Geschwindigkeits-Upgrade kommt durch ARC, kurz für „Adversarial Relativistic-Contrastive“. Statt den generativen Prozess durch ein zweites Modell zu verlangsamen, trainiert ARC direkt auf Relevanz und Kontrast. Das spart Rechenzeit und verbessert die Ausgabegenauigkeit – bei deutlich weniger Inferenzschritten. Schon in der mobilen Version „Stable Audio Open Small“ war diese Methode im Einsatz. Die Kombination aus Geschwindigkeit, Qualität und Flexibilität macht das Modell interessant für professionelle Audioproduktion – etwa in Agenturen oder internen Content-Teams. Stability AI stellt Stable Audio 2.5 über eine API, Partner-Plattformen und als Enterprise-Modell bereit. Laut Anbieter wurde der Trainingsdatensatz vollständig lizenziert, zudem prüft ein internes System automatisch die Einhaltung von Urheberrechten. Sound als Markenidentität Das Ziel: Unternehmen sollen mit wenigen Klicks eine eigene Klangsprache entwickeln – für Werbespots, Spiele, UX-Sounds oder sogar Kreditkartentöne. Dafür kooperiert Stability AI mit der Soundbranding-Agentur Amp, die zur WPP-Gruppe gehört. Die neueste Version von Stable Audio soll über WPP Open bereitgestellt werden – und so direkt in die Audiostrategie globaler Marken einfließen. Damit wird klar: Nach dem Boom der Bild-KIs verschiebt sich der Fokus zunehmend Richtung Audio. Und Stability AI setzt alles daran, nicht nur mitzuspielen, sondern die Regeln zu schreiben. DEIN VORTEIL – DEINE HILFE Kostenlose News und Tutorials – mit minimaler Werbung und maximalem Mehrwert. Damit das so bleibt und wir uns stetig verbessern können, freuen wir uns über deine Unterstützung. Teile diesen Beitrag Folge uns auf Social Media Keine KI-News mehr verpassen und direkt kommentieren! Mastodon X Bluesky Facebook LinkedIn Youtube Unterstütze uns direkt Mit einer YouTube-Mitgliedschaft (ab 0,99 €) oder einmalig über PayPal. So helft ihr uns, unabhängig neue Tools zu testen und noch mehr Tutorials für euch zu erstellen. Vielen Dank für euren Support! Youtube – Kanal PayPal – Kaffee KURZFASSUNG
    Stability AI veröffentlicht Stable Audio 2.5 für Enterprise-Sound-Produktion mit dreiminütigen Tracks in unter zwei Sekunden.
    Neu sind Audio-Inpainting, bessere Songstrukturen und präzisere Reaktionen auf Stimmungs- und Genre-Prompts.
    Die ARC-Methode beschleunigt die Generierung deutlich; Verfügbarkeit über API und Partnerplattformen.
    Mit WPP/amp peilt Stability AI skalierbares Sound-Branding über WPP Open an.
    QUELLEN
    Stability AI – Produktankündigung zu Stable Audio 2.5
    VentureBeat – Hintergründe zu ARC und Enterprise-Fokus
    Stability AI Research – ARC-Erklärung
    fal.ai – Verfügbarkeit und Features

  • Stable Audio 2.5 soll professionelle Sound-Produktion ermöglichen

    Glitch-art Hintergrund mit pulsierender Wellenform und Schriftzug „Stable Audio 2.5“ in leuchtendem Cyan.

    Stability AI hat Stable Audio 2.5 vorgestellt, nach eigenen Angaben das erste Audio-Generierungsmodell, das speziell für professionelle Sound-Produktion in Unternehmen entwickelt wurde. Mit dem Modell sollen Kreativteams hochwertige, anpassbare Audioinhalte in großem Maßstab erstellen.

    Der Artikel Stable Audio 2.5 soll professionelle Sound-Produktion ermöglichen erschien zuerst auf THE-DECODER.de.

  • Schon wieder Signal: Unbekannte imitieren mit KI-Stimme US-Außenminister Rubio in Chats

    „Du brauchst nur 15 bis 20 Sekunden Audio – und plötzlich spricht Marco Rubio genau das, was du willst.“

    Der Artikel Schon wieder Signal: Unbekannte imitieren mit KI-Stimme US-Außenminister Rubio in Chats erschien zuerst auf THE-DECODER.de.

  • Google startet Audio Overviews in Suchergebnissen

    Google testet in seinen Labs die Funktion Audio Overviews.

    Der Artikel Google startet Audio Overviews in Suchergebnissen erschien zuerst auf THE-DECODER.de.