Att göra ett kort klipp, från tomt blad till färdig fil
Av The Fellowi Team · · 8 min läsning

Jag ville ha ett tio sekunder långt klipp: en kvinna på en balkong om natten, staden bakom henne, den sortens bild som skulle inleda något. Inget ambitiöst. Det tog fyrtio minuter och 3 150 coins, och att skriva ner vart de tog vägen är nyttigare än någon prydlig handledning, eftersom största delen av de fyrtio minuterna inte gick åt till att skriva.
Att välja väg först, vilket jag nästan gjorde fel
Min impuls var att beskriva alltihop i text och låta modellen hitta på. Det hade varit fel val, och skälet är det enda man behöver veta innan man börjar: text till video hittar på personen också, och en ny för varje körning.
Eftersom jag ville ha ett bestämt utseende som skulle överleva hela klippet var svaret att först göra en stillbild och animera den. Hade jag velat ha vågor mot en pir eller nattrafik hade text räckt och jag hade sparat ett steg. Hela det beslutet ryms i en mening, och jämförelseinlägget ger den.
Stillbilden: fyra bilder, 160 coins
Standardkvalitet, 40 coins styck. Den första var för ljus, på den andra tittade hon in i kameran när jag ville ha blicken bortvänd, den tredje stämde men var för vitt beskuren, den fjärde var den rätta.
En sak gjorde jag med flit, efter att ha lärt mig den dyrt: jag skrev stillbilden som en startbild, inte som ett bra fotografi. Det betyder att motivet vilar i stället för att vara mitt i en gest, eftersom en stillbild som redan ser ut att vara mitt i en rörelse inte lämnar videomodellen någonstans att gå. Och bakgrunden är oskarp, eftersom drift syns där först.
Första klippet: fyra sekunder, 500 coins, fel
Skiss på fyra sekunder och 720p på en turbomodell, den billigaste användbara kombinationen som finns. Min prompt beskrev scenen: balkongen, stadsljusen, håret, stämningen.
Det kom tillbaka som om stillbilden hade knuffats till lite. Knappt någon rörelse, och den som fanns kändes planlös.
Felet är uppenbart i efterhand och jag gör det varje gång jag varit borta från video en vecka. Stillbilden hade redan sagt hur scenen ser ut. Att upprepa det i prompten gjorde av med hela min instruktionsbudget på information modellen redan hade. En videoprompt ska handla om vad som rör sig.
Andra klippet: fyra sekunder, 500 coins, nästan
Skrev om till att bara beskriva rörelse: ett långsamt andetag, håret lyfter något i vinden, stadsljusen skiftar mjukt i skärpa bakom henne, kameran stilla. Fyra satser, alla om förändring över tid.
Enorm skillnad. Nu var det en bild och inte ett vinglande fotografi. Ändå inte rätt: den stilla kameran fick det att kännas som övervakningsmaterial. Nyttigt att lära sig, för det betydde att variabeln var kameran, och den hade jag inte rört.
Tredje klippet: fyra sekunder, 500 coins, det är det
Ändrade exakt en sak. Stilla kamera blev ”very slow push in”. Allt annat identiskt.
Det var bilden. En liten rörelse mot motivet gör något med uppmärksamheten som ingenting i bildrutan kan göra på egen hand, och det kostade en sats.
Samma disciplin som med bilder: en variabel per försök. Med video är den viktigare, inte mindre viktig, eftersom varje försök kostar tolv gånger så mycket.
Att binda upp sig på längden: tio sekunder, 1 250 coins
Först nu, med rörelsen och kameran fastlagda, körde jag om det på tio sekunder. Samma prompt, samma startbild, längre varaktighet.
Det här är den del av flödet som faktiskt sparar pengar. Tio sekunder är 1 250 coins i 720p turbo; jag körde försöken på 500 och betalade tiosekunderspriset en gång, på slutet. Att göra det tvärtom är hur ett enda klipp äter upp ett stort paket, och pristrappan är brant nog att disciplinen betalar sig direkt.
En ärlig notering: den längre versionen är inte helt enkelt fyrasekundersversionen förlängd. Den genereras om, så rörelsen liknar men är inte identisk. Ibland blir den längre tagningen sämre och man kör om. Räkna med den möjligheten i stället för att bli överraskad.
Ljud: ingenting
Bokstavligen ingenting att göra. Klippet kom som en MP4 med ett ljudspår redan i sig, skapat för samma scen, och priset ändrades inte. Jag hade skrivit ”distant traffic, wind” i prompten och ungefär det var vad som fanns där.
Det här är steget som förr var halva arbetet, och nu är steget som inte finns. Mer om varför i inlägget om genererat ljud.
Slutsumman
- 4 stillbilder à 40 coins: 160
- 3 skissklipp på fyra sekunder: 1 500
- 1 slutklipp på tio sekunder: 1 250
- Totalt: 3 150 coins, ungefär fyrtio minuter
Av de fyrtio minuterna var kanske sex skrivande. Resten var väntan på renderingar som går i minuter i stället för sekunder, och att gå omkring och avgöra om den förra dugde. Den rytmen är den verkliga skillnaden mot bildarbete: man kan inte iterera snabbt, så varje försök måste vara värt att göra.
Vad jag skulle säga till mig själv före start: skriv stillbilden som en startbild, beskriv bara rörelse, ändra en variabel, och rör inte längden förrän fyrasekundersversionen är den bild du vill ha. Allt annat är tålamod. Det sker i Fellowi Video, och guiden till videoprompter är den komprimerade versionen av de två klipp jag slösade bort.