Ljudet är redan klart: AI-video utan separat ljudpass
Av The Fellowi Team · · 6 min läsning

De flesta som gjort en kort video vet att videon bara är första halvan. Sedan kommer den andra: exportera, öppna ett redigeringsprogram, leta musik som passar och är fri att använda, spåra upp ett par effekter, lägga dem mot bilden, upptäcka att tajmingen är lite fel, rätta det, exportera igen. Det tar regelbundet längre tid än att göra materialet.
Den halvan ingår inte här. Ett klipp från Fellowi Video kommer tillbaka med ljudet redan i sig, gjort samtidigt som bilden och för samma scen.
Vad som faktiskt kommer
En MP4, med ett videospår och ett ljudspår redan sammanfogade inuti. Inte en video plus ett separat ljudspår att passa in, inte en uppsättning stems att mixa ner. En fil som spelas med ljud i vilken spelare som helst, laddas upp till vilken plattform som helst och skickas till vem som helst utan instruktioner.
Reglaget är påslaget som standard i studion och ändrar inte priset. Kostnaden är modell gånger upplösning gånger längd; ljudet finns inte någonstans i den aritmetiken. Fyra sekunder 720p turbo kostar 500 coins med ljud och 500 coins utan, så att låta det vara på är gratis och att stänga av det sparar ingenting.
Värt att säga rakt ut, eftersom reflexen från andra verktyg är att anta motsatsen: det finns ingen separat ljudkredit, inget separat ljudgenereringssteg att vänta ut och ingen andra rendering.
Prompten är mixerbordet
Eftersom ljudet skapas för samma scen styrs det av samma mening. Vår guide till videoprompter listar ljud som den femte saken en bra prompt besvarar, och det är därför: en sats om vad man ska höra är värd lika mycket som en om vad som rör sig.
Säg ingenting och modellen väljer något rimligt för scenen, vilket ofta duger och ibland inte alls är vad du tänkte dig. Säg en sak och den lyssnar oftast:
- ”rain against the window, muffled traffic below”
- ”a quiet room, a clock ticking, nothing else”
- ”wind through pines, distant water”
- ”low ambient music, no percussion”
- ”a busy cafe behind her, cups and conversation, no music”
Två vanor är värda att låna från bildsidan. Namnge en sak i stället för fem: ljudbilden har samma uppmärksamhetsbudget som bilden, och en lista med sex ljud ger dig ett grumligt medelvärde av alla. Och namnge frånvaron när den betyder något, för ”no music” och ”nothing else” är de sällsynta fall där det fungerar att säga vad man inte vill ha: tystnad är ett verkligt tillstånd hos ett ljudspår, inte ett föremål som måste ritas.
När man stänger av det
Det finns tre ärliga fall, och inget av dem handlar om kvalitet.
Du lägger musiken själv. Ska klippet in i en klippning med egen musik kommer genererat rumsljud under bara att slåss med spåret du valt. Stäng av och håll tidslinjen ren.
Du behöver ett bestämt stycke. Ett varumärkes ljudidentitet, ett licensierat spår, en låt som hela stycket är byggt kring. Inget genererat ersätter en viss inspelning, och det ska det inte heller försöka.
Ingen kommer att höra det. Vertikal video på sociala medier spelas tyst, och de flesta tittare slår aldrig på ljudet. Vårt inlägg om vertikal video för sociala medier säger detsamma från andra hållet: måste första sekunden fungera i tystnad, lägg prompten på det som rör sig i stället för på hur det låter.
Vad det inte ersätter
Behandla det som kommer tillbaka som scenens eget ljud, inte som en skådespelare som arbetar efter ditt manus. Hänger ett klipp på exakta ord i exakta ögonblick, eller på en klippning som landar precis på ett slag, gör du fortfarande det i ett redigeringsprogram, och så bör det vara. Den ärliga beskrivningen av funktionen är att den tar bort den rutinmässiga halvan av ljudarbetet, inte allt.
Den tar ändå bort merparten. För det enorma antal klipp som bara behöver slippa vara tysta kostar steget som förr tog en timme numera ingenting och sker medan du tittar bort.
Båda vägarna ger dig det: beskriv en scen från grunden med text till video, eller animera en stillbild du redan har. Är du osäker avgör jämförelsen det på en mening. Hela uppsättningen reglage, inklusive de fyra modellerna och längder upp till trettio sekunder, finns i inlägget om kontrollytan. Hur som helst: spela upp resultatet med ljudet på innan du bestämmer dig för att ändra något.