Fish Audio, offiziell Hanabi AI Inc., hat eine Seed-Finanzierung in Höhe von 50 Millionen US-Dollar abgeschlossen. Das 2024 in Palo Alto gegründete Unternehmen wird die Mittel für die Weiterentwicklung seiner generativen Sprachmodelle und den Ausbau der Enterprise-Präsenz einsetzen.
Führung und Hintergrund
CEO und Mitbegründerin ist Rissa Cao. Chief Scientist und Mitbegründer Shijia Liao, ehemaliger Nvidia-Forscher, initiierte das Open-Source-Projekt Fish Speech, das auf GitHub mehr als 31.000 Sterne erreicht hat.
Finanzierung und Traktion
Die Runde wurde von Coreline Ventures und Capital Today angeführt. Weitere Investoren sind unter anderem 359 Capital, HF0 founder residency, 645 Ventures und mehrere Angel-Investoren. Fish Audio hatte bereits 2025 eine Venture-Runde über 30 Millionen US-Dollar abgeschlossen, die das Unternehmen mit 500 Millionen US-Dollar bewertete.
Das Unternehmen verzeichnet mehr als 8 Millionen Nutzer der Open-Source- und gehosteten Modelle. Die jährlich wiederkehrenden Einnahmen (ARR) liegen derzeit bei 21 Millionen US-Dollar und zeigen ein kontinuierliches Wachstum.
Technische Architektur
Fish Audio entwickelt latenzarme, hochgradig anpassbare Text-to-Speech- und Stimmklonierungs-Systeme. Die Flaggschiff-Modelle der Fish-Speech- und S2-Serie ermöglichen Wort-ebene Steuerung, Multi-Sprecher-Dialoge und unterstützen über 80 Sprachen. Das aktuelle Modell S2.1 Pro ist über die API verfügbar. Die Plattform basiert auf dem Fish-Speech-Framework, das große Sprachmodelle mit fortschrittlichen Vocodern kombiniert und Latenzen von etwa 150 ms erreicht. Zusätzlich existieren Speech-to-Text-Funktionen.
Ein Community-Marktplatz erlaubt Entwicklern und Kreativen, eigene Sprachmodelle zu teilen und zu monetarisieren.
Quelle: TechCrunch AI
FAQ
Welches Ziel verfolgt Fish Audio mit der neuen Finanzierung?
Die Mittel dienen der Beschleunigung der Entwicklung fortschrittlicherer KI-Sprachmodelle und der Expansion in den Unternehmensmarkt.
Welche Sprachfunktionen bietet die Plattform?
Neben latenzarmer Text-to-Speech-Synthese und realistischer Stimmklonierung aus kurzen Audiobeispielen unterstützt sie auch Speech-to-Text sowie Multi-Sprecher-Dialoge.
Welche weiteren Systeme stehen auf der Roadmap?
Geplant sind ein Audio-Verständnissystem, ein Speech-to-Speech-Modell für den Voice-Agent-Stack sowie Story Studio V2 mit Multi-Track- und kollaborativen Bearbeitungsfunktionen.