Een nieuw bedrijf voor generatieve audio, opgericht door veteranen van TikTok’s ai- en muziekteams, heeft een financieringsronde van 11 miljoen dollar afgerond om modellen te ontwikkelen die muziek en soundeffects op maat van het beeld genereren.
Sonilo, gevestigd in San Francisco, leidde de ronde met deelname van B Capital en Redpoint. Het kapitaal wordt gebruikt voor extra rekenkracht om de modellen te laten groeien en om de bereik onder creators, developerplatforms en muzieklicentiepartners uit te breiden.
De kerntechnologie van het bedrijf, het Sound World Model, is een multimodaal systeem dat video-inzicht direct koppelt aan audiogeneratie en precieze timing. In plaats van muziek en effecten als losse elementen te behandelen, analyseert het model de beweging, emotionele veranderingen en narratieve stroom van een scène om audio te produceren die past bij de specifieke beelden. Gebruikers kunnen video uploaden, tekstbeschrijvingen geven of beide combineren om een gesynchroniseerde soundtrack te krijgen die geschikt is voor commercieel gebruik.
We hebben Sonilo gebouwd om het visuele verhaal te begrijpen. Je geeft ons de beelden en Sonilo begrijpt wat er frame voor frame gebeurt, inclusief het ritme, de emotie en het verhaal, en genereert muziek en soundeffects die natuurlijk bij de scène passen.
Ceo Shawn Song, afgestudeerd aan Carnegie Mellon University, leidde eerder multimodale ai-technologie bij TikTok. Daar werkte hij samen met cto Alex Yin, die een doctoraat in computermuziek heeft van de University of York. Coo Keli Li bouwde en beheerde eerder TikTok’s wereldwijde muziekoperaties met expertise in rechten en partnerschappen. Cmo Trista Taylor is verantwoordelijk voor product en marktintroductie en heeft bijgedragen aan consumenten-ai-toepassingen die zijn opgenomen in de Top 50 van a16z.
Het platform richt zich op short-form videomakers, producenten van korte drama’s, developerplatforms die ai-videotools bouwen en enterprise-productieteams. Het biedt ook ai-dubbing met lip-sync, zodat studios content kunnen lokaliseren in extra talen zonder handmatige nabewerking. Vroege distributiepartners zijn TapNow en ComfyUI.
We geloven dat generatieve audio een essentieel onderdeel wordt van de ai-native videostack. Sonilo onderscheidt zich omdat de multimodale technologie creators twee manieren biedt om muziek en soundeffects te genereren: beschrijf wat ze willen in tekst, of lever een video aan en laat het model audio maken die bij de scène past.
Shutterstock fungeert als vroege licentiepartner. Sonilo stelt dat de modellen worden getraind op gelicentieerde muziek, waarbij artiesten en rechthebbenden licentievergoedingen plus een aandeel in de omzet ontvangen. Het bedrijf rondt momenteel publishing- en masteropnameovereenkomsten af met grote rechtenorganisaties, die naar verwachting binnen enkele weken worden gesloten.
Een consumentenapplicatie staat gepland voor het vierde kwartaal, zodat individuele creators direct toegang krijgen tot de video-naar-muziektool. B Capital, opgericht in 2015, beheert meer dan 9 miljard dollar via teams op negen locaties in de VS en Azië.