Text till video eller bild till video: vilket du faktiskt vill ha
Av The Fellowi Team · · 6 min läsning

Fellowi kör fyra videomodeller. Två utgår från en mening och två från en bild, och varje par finns i en snabb turboversion och en långsammare full. Det är hela katalogen, och det enda val som verkligen ändrar vad du får tillbaka är det första: räcker du modellen en stillbild eller en beskrivning?
Vi bör erkänna att vi beskrev det här fel ett tag. Tre inlägg på den här bloggen slog fast att det inte fanns någon väg med enbart text. Det var felaktigt, och vi har rättat dem. Läste du här i början av september att bild till video var enda alternativet, är det den meningen vi lagade.
Regeln som avgör de flesta fall
Måste ett bestämt ansikte komma ut i andra änden, börja med en bild.
Det här är ingen smaksak. En textbeskrivning kan inte bära ett ansikte. ”En kvinna i sena tjugoårsåldern med mörkt hår och gröna ögon” smalnar av kategorin en aning och lämnar tusentals ansikten kvar i den, och modellen plockar ett nytt varje gång. Att lämna in en stillbild tar bort gissandet helt: vem som är i bild är redan avgjort, och modellens uppgift krymper till att röra personen. Vi har skrivit om varför identiteten bor i en referensbild och inte i ord, och video är den skarpaste versionen av det problemet, eftersom en avvikelse över tjugofyra bilder i sekunden syns långt mer än mellan två separata bilder.
Text till video gör sig förtjänt av sin plats när motivet är generiskt och det är scenen som gäller. Vågor mot en pir, trafik i natten, ett ljus som brinner ner, en översiktsbild av en gata. Ingen i publiken vet hur det ska se ut, så det finns inget att vara inkonsekvent mot, och du hoppar över hela steget att först göra en stillbild.
Vad varje väg kräver av dig
Text till video vill ha en prompt som bär hela världen: motiv, plats, ljus, kamera och rörelse. Det är den svårare prompten att skriva, eftersom ingenting är låst åt dig, och en vag ger ett medelmåttigt klipp som luktar bildbank.
Bild till video vill nästan tvärtom. Stillbilden har redan sagt hur scenen ser ut, så att upprepa något av det i prompten är bortkastat, och att motsäga den är värre än bortkastat. Lägg varje ord på rörelse: vad som rör sig, hur snabbt, och vad kameran gör. Vår guide till videoprompter är byggd precis kring den disciplinen, och en av våra färdiga prompter är skriven just för att bli en bra startbild.
Bildvägen kan en tredje sak som textvägen inte kan: ta emot en slutbild utöver startbilden. Ge båda och den renderar rörelsen mellan två stillbilder du valt, den starkaste kontroll över ett klipp som finns här. För en kort vertikal där du vet exakt var bilden ska landa är det det självklara verktyget.
Turbo eller full är en egen fråga
När vägen är vald väljer du fortfarande familj, och där handlar det om tak och pris, inte om trohet mot idén.
Turbo-modellerna är det snabba, billiga paret. De erbjuder 720p och 1080p, och fyra sekunder i 720p kostar 500 coins. De fulla modellerna är långsammare och når längre: de lägger till 480p i botten och 4K i toppen, och deras 720p är synbart bättre, vilket är varför samma fyra sekunder kostar 900 coins i stället för 500. Med upplösningen växer gapet snabbt, för det här är sekundpriser och 4K är en enorm mängd pixlar: fyra sekunder full 4K är 4 400 coins, och trettio sekunder av den 33 000.
Det ärliga rådet är att skissa i turbo. Få rörelsen och utsnittet rätt i 720p för 500 coins, och avgör först därefter om just det här klippet förtjänar en rendering i en full modell. Allt prissätts per sekund, så vad det kostar att upptäcka att du ville ha en annan kamerarörelse beror helt på vilken modell du upptäckte det på.
Inställningarna som båda vägarna delar
Längden går från fyra till trettio sekunder. Det finns sju bildformat, däribland 9:16 för vertikal video för sociala medier, plus ett automatläge som behåller startbildens eget utsnitt i stället för att tvinga på den en form. Ljud är en kryssruta, genereras tillsammans med klippet och ändrar inte priset. Mer om varje reglage finns i inlägget om kontrollytan.
En praktisk notering om priset: det är linjärt i längden och sätts av modell och upplösning, så det är identiskt oavsett vilken väg du kom in. Att välja text till video sparar ingenting, och att välja bild till video kostar inget extra. Välj på sakskäl.
En generering som misslyckas ger tillbaka dina coins automatiskt. Det billiga experimentet är alltså det som ska köras först: gör en stillbild i Fellowi Images för 40 coins, ta den till Fellowi Video, och beskriv bara det som rör sig. Visar det sig att motivet inte behövde något ansikte alls har du just lärt dig att ett steg gick att hoppa över, och det är en billig läxa.