Fellowi

Het geluid is al klaar: AI-video zonder audioronde

Door The Fellowi Team · · 6 min leestijd

Abstract beeld van een golfvorm van amberkleurig licht die als één band over een donkere ondergrond loopt

Wie ooit een korte video heeft gemaakt, weet dat de video pas de eerste helft is. Dan komt de andere: exporteren, een editor openen, muziek zoeken die past en die je mag gebruiken, een paar effecten opsporen, ze uitlijnen op het beeld, ontdekken dat de timing net niet klopt, dat herstellen, opnieuw exporteren. Het duurt geregeld langer dan het maken van het beeld zelf.

Die helft hoort hier niet bij. Een clip uit Fellowi Video komt terug met zijn geluid er al in, gemaakt op hetzelfde moment als het beeld en voor dezelfde scène.

Wat er werkelijk aankomt

Eén MP4, met een videospoor en een audiospoor die er al in samengevoegd zijn. Geen video plus een losse soundtrack om uit te lijnen, geen set stems om te mixen. Eén bestand dat met geluid afspeelt in elke speler, naar elk platform gaat en zonder uitleg naar iedereen te sturen is.

De schakelaar staat in de studio standaard aan en verandert de prijs niet. De kosten zijn model maal resolutie maal duur; geluid komt in die rekensom nergens voor. Vier seconden 720p turbo kost 500 coins met geluid en 500 coins zonder, dus aanlaten is gratis en uitzetten bespaart niets.

Dat is het waard hardop te zeggen, want de reflex uit andere gereedschappen is het tegenovergestelde aan te nemen: er is geen apart audiotegoed, geen extra geluidsgeneratiestap om op te wachten, en geen tweede render.

De prompt is het mengpaneel

Omdat het geluid voor dezelfde scène wordt gemaakt, stuurt dezelfde zin het aan. Onze gids voor videoprompts noemt geluid als het vijfde wat een goede prompt beantwoordt, en daarom: een zin over wat je moet horen is net zoveel waard als een zin over wat beweegt.

Zeg niets en het model kiest iets aannemelijks voor de scène, wat vaak prima is en soms niet wat je voor ogen had. Zeg één ding en het luistert meestal:

  • “rain against the window, muffled traffic below”
  • “a quiet room, a clock ticking, nothing else”
  • “wind through pines, distant water”
  • “low ambient music, no percussion”
  • “a busy cafe behind her, cups and conversation, no music”

Twee gewoontes zijn het lenen waard van de beeldkant. Benoem één ding in plaats van vijf: het klanklandschap heeft hetzelfde aandachtsbudget als het beeld, en een lijst van zes geluiden levert een modderig gemiddelde van allemaal. En benoem de afwezigheid wanneer die telt, want “no music” en “nothing else” zijn de zeldzame gevallen waarin zeggen wat je niet wilt wél werkt: stilte is een echte toestand van een geluidsspoor en geen object dat getekend moet worden.

Wanneer je het uitzet

Er zijn drie eerlijke gevallen, en geen ervan gaat over kwaliteit.

Je doet de muziek zelf. Gaat de clip een montage in met eigen muziek, dan vecht gegenereerde ambiance eronder alleen maar met het spoor dat je koos. Zet het uit en houd de tijdlijn schoon.

Je hebt een specifiek stuk nodig. De geluidsidentiteit van een merk, een nummer waarvoor je licentie hebt, een liedje waar het geheel omheen is gebouwd. Niets gegenereerds vervangt een bepaalde opname, en dat moet het ook niet proberen.

Niemand gaat het horen. Verticale sociale video speelt gedempt af en de meeste kijkers zetten het geluid nooit aan. Ons stuk over verticale video voor sociale media zegt hetzelfde van de andere kant: moet de eerste seconde het in stilte doen, besteed je prompt dan aan wat beweegt in plaats van aan hoe het klinkt.

Wat het niet vervangt

Behandel wat terugkomt als het eigen geluid van de scène, niet als een stemacteur die met jouw tekst werkt. Hangt een clip af van precieze woorden op precieze momenten, of van een montage die exact op een beat valt, dan doe je dat nog steeds in een editor, en terecht. De eerlijke beschrijving van deze functie is dat ze de routineuze helft van het geluidswerk wegneemt, niet alles.

Ze neemt er niettemin het meeste van weg. Voor het enorme aantal clips dat gewoon niet stil hoeft te zijn, kost de stap die vroeger een uur vroeg nu niets en gebeurt hij terwijl jij niet kijkt.

Beide routes geven het je: een scène vanaf nul beschrijven met tekst naar video, of een still animeren die je al hebt. Weet je niet welke je wilt, dan beslecht de vergelijking dat in één zin. De volledige set knoppen, inclusief de vier modellen en duur tot dertig seconden, staat in het stuk over de bedieningsopties. Speel hoe dan ook het resultaat met het geluid aan af voordat je besluit iets te veranderen.

Probeer het zelf

Een warme, private AI-companion: 7 dagen gratis met 30 berichten, zonder kaart.

Prijzen en limieten

Verder lezen