← Terug naar kennisbank

AI Nieuws

Fish Audio krijgt 50 miljoen dollar om realistische stemmen met kunstmatige intelligentie te maken

Fish Audio krijgt 50 miljoen dollar om realistische stemmen met kunstmatige intelligentie te maken

·

Leestijd: 4 min

Fish Audio, een bedrijf uit Palo Alto, bouwt AI-modellen die menselijke stemmen kunnen nadoen en aansturen. Het bedrijf richt zich zowel op creatieve makers als op bedrijven die telefoongesprekken en klantenservice willen automatiseren. Deze week kondigde Fish Audio aan 50 miljoen dollar aan startkapitaal te hebben opgehaald om verder te groeien.

Wat maakt Fish Audio anders?

Fish Audio werkt met een uitgebreide bibliotheek van meer dan 15.000 natuurlijke taalbesturingen — dat zijn instructies die bepalen hoe een stem klinkt en spreekt. Sinds de lancering gebruikt een grote groep mensen de modellen: meer dan 8 miljoen gebruikers van de open-source (open-source, vrij beschikbaar en aanpasbaar) of gehoste versies, volgens het bedrijf.

Het bedrijf heeft in het afgelopen jaar vijf modellen uitgebracht: vier modellen voor spraakgeneratie en één model voor spraak-naar-tekst. Drie van de spraakmodellen zijn vrijgegeven als open-source, maar het nieuwste model, S2.1 Pro, is alleen beschikbaar via een betaalde API (API, een manier waarop software op afstand functies of data kan gebruiken).

Fish Audio biedt maandabonnementen voor individuele makers en teams waarmee een bepaald aantal minuten spraak gegenereerd kan worden en functies zoals stemklonen vrijgeschakeld worden. Daarnaast is er een enterprise-versie van de platform- en API-diensten, die geschikt is voor grotere organisaties. Bedrijven als HeyGen, Sanas en Plaud gebruiken die diensten al.

Geld, groei en investeerders

Het nieuwe kapitaalbedrag van 50 miljoen dollar werd geleid door Coreline Ventures en Capital Today. Andere investeerders die deelnamen zijn onder meer:

  • 359 Capital

  • Parable

  • Play Time

  • Alphalist Partners

  • Bayhouse Ventures

  • Carya Venture Partners

  • HF0

Fish Audio zegt dat het op jaarbasis ongeveer 21 miljoen dollar aan terugkerende inkomsten (ARR) genereert. De extra financiering moet helpen om technisch sterkere modellen te bouwen en om beter te bedienen wat grotere bedrijven nodig hebben.

Stemdata en problemen rond toestemming

De groei van Fish Audio kwam deels door stemmen van gebruikers te verzamelen. Makers konden hun eigen stem inzenden en werden betaald als die stem werd gebruikt voor training. Dat zorgde voor controverse: enkele makers beweerden dat opnames van hun stemmen zonder hun toestemming op het platform waren gezet.

Het bedrijf had een verwijderingsprocedure voor inhoud, maar die verliep aanvankelijk traag. Volgens de CEO en medeoprichter is dat proces nu geautomatiseerd. Makers kunnen aantonen dat een stem van hen is door een korte geluidsopname of een contract te uploaden, waarna de stem binnen drie minuten van het platform verwijderd zou worden.

Toch blijft er een risico: iemand kan een stem uploaden zonder dat een artiest dat direct merkt. In de tijd dat de stem onopgemerkt op het platform staat, kan deze door anderen worden gebruikt.

Een investeerder van Coreline Ventures benadrukt dat vertrouwen van makers cruciaal is voor dit soort platforms. Volgens hem moeten toestemming, transparantie en herkenning van eigenaarschap ingebouwd zijn in het product. Hij noemt ook zaken als gecontroleerd bewijs van stembezit, duidelijke licentievoorwaarden, eenvoudig melden en verwijderen, en modellen waarbij makers financieel meedelen in de opbrengsten als hun stem commercieel wordt gebruikt.

Concurrentie en technische focus

De markt voor AI-stemmen is druk bezet. Andere bedrijven die concurreren om zowel creatieve makers als zakelijke klanten zijn onder meer ElevenLabs, WellSaid, Cartesia, Speechify, Async (voorheen Podcastle) en Krisp.

Investeerders zeggen dat Fish Audio zich kan onderscheiden door gedetailleerde bedieningsmogelijkheden voor ontwikkelaars en efficiënte modeltraining. Volgens een partner van 359 Capital tonen de modellen en het team aan dat Fish Audio technische vooruitgang heeft geboekt in het verkleinen van het verschil tussen kunstmatig klinkende stemmen en echt menselijke stemmen.

Vooruitblik

Fish Audio werkt verder aan nieuwe functies. Dit jaar staat de uitgave gepland van een model voor audio-understanding (het begrijpen van geluid en spraak), en het bedrijf bouwt ook aan een spraak-naar-spraakmodel.

Als jij een maker bent, biedt Fish Audio mogelijkheden voor realistische en aanpasbare stemmen. Voor bedrijven kan het platform ingezet worden voor natuurlijke spraak in klantencontacten of voor geautomatiseerde avatars. Tegelijk blijft het belangrijk dat platforms als deze duidelijke regels en goede middelen hebben om misbruik te voorkomen.

Conclusie

Met 50 miljoen dollar nieuw kapitaal wil Fish Audio zijn technologie versnellen en meer zakelijke klanten aantrekken. Het bedrijf groeit snel en heeft al miljoenen gebruikers, maar staat ook voor uitdagingen rond toestemming en vertrouwen van makers. Hoe goed Fish Audio die problemen oplost, zal meebepalen of het zich kan onderscheiden in een krappe markt van spraaktechnologie.

Vul je e-mail in om dit artikel te lezen

Gratis, geen spam. Je kunt je altijd weer uitschrijven.

Je e-mailadres wordt uitsluitend gebruikt voor updates over de Kennisbank en belangrijke berichten van Relue.