Tekst naar video of beeld naar video: wat je echt wilt
Door The Fellowi Team · · 6 min leestijd

Fellowi draait vier videomodellen. Twee beginnen bij een zin en twee bij een beeld, en elk van die paren bestaat in een snelle turboversie en een tragere volledige. Dat is de hele catalogus, en de enige keuze die echt verandert wat je terugkrijgt is de eerste: geef je het model een still, of een beschrijving?
We moeten toegeven dat we dit een tijd verkeerd hebben beschreven. Drie stukken op deze blog stelden botweg dat er geen route met alleen tekst bestond. Dat was onjuist, en we hebben ze gecorrigeerd. Als je hier begin september las dat beeld naar video de enige optie was, dan is dat de zin die we hebben hersteld.
De ene regel die de meeste gevallen beslecht
Moet er een specifiek gezicht uitkomen, begin dan met een beeld.
Dit is geen voorkeur. Een tekstbeschrijving kan geen gezicht dragen. “Een vrouw van eind twintig met donker haar en groene ogen” versmalt de categorie een beetje en laat er duizenden gezichten in over, en het model pakt er elke run een ander uit. Een still meegeven haalt het gokken er volledig uit: wie er in beeld staat is al beslist, en de taak van het model krimpt tot die persoon laten bewegen. We schreven al waarom identiteit in een referentiebeeld woont en niet in woorden, en video is daarvan de scherpste versie, want een afwijking over vierentwintig beelden per seconde valt veel meer op dan tussen twee losse plaatjes.
Tekst naar video verdient zijn plek wanneer het onderwerp algemeen is en het om de scène gaat. Golven op een pier, verkeer bij nacht, een kaars die opbrandt, een overzichtsshot van een straat. Niemand in het publiek weet hoe dat eruit hoort te zien, dus er is niets om inconsistent mee te zijn, en je slaat de hele stap van een still maken over.
Wat elke route van je vraagt
Tekst naar video wil een prompt die de hele wereld draagt: onderwerp, plek, licht, camera en beweging. Dat is de moeilijkere prompt, want niets ligt voor je vast, en een vage levert een gemiddelde clip op die naar stockbeeld ruikt.
Beeld naar video wil bijna het omgekeerde. De still heeft al gezegd hoe de scène eruitziet, dus daar iets van herhalen in de prompt is verspild, en het tegenspreken is erger dan verspild. Besteed elk woord aan beweging: wat beweegt, hoe snel, en wat de camera doet. Onze gids voor videoprompts is precies rond die discipline gebouwd, en een van onze kant-en-klare prompts is speciaal geschreven om een goed startbeeld te zijn.
De beeldroute kan iets derds dat de tekstroute niet kan: naast een startbeeld ook een eindbeeld aannemen. Geef ze allebei en hij rendert de beweging tussen twee stills die jij koos, de meeste controle over een clip die hier bestaat. Voor een korte verticale waarvan je precies weet waar het shot moet landen is dat het logische gereedschap.
Turbo of volledig is een aparte vraag
Als de route gekozen is, kies je nog een familie, en dat gaat over plafond en prijs, niet over trouw aan het idee.
De turbo-modellen zijn het snelle, goedkope paar. Ze bieden 720p en 1080p, en vier seconden in 720p kost 500 coins. De volledige modellen zijn trager en reiken verder: ze voegen 480p onderaan en 4K bovenaan toe, en hun 720p is zichtbaar beter, vandaar 900 coins voor dezelfde vier seconden in plaats van 500. Met de resolutie loopt het gat snel op, want dit zijn prijzen per seconde en 4K is een enorme hoeveelheid pixels: vier seconden volledige 4K is 4.400 coins, en dertig seconden ervan 33.000.
Het eerlijke advies is om in turbo te schetsen. Krijg de beweging en de kadrering goed op 720p voor 500 coins, en beslis pas dan of juist deze clip een render met een volledig model verdient. Alles is per seconde geprijsd, dus wat het kost om te ontdekken dat je een andere camerabeweging wilde, hangt volledig af van het model waarop je het ontdekte.
De instellingen die beide routes delen
De duur loopt van vier tot dertig seconden. Er zijn zeven beeldverhoudingen, waaronder 9:16 voor verticale sociale video, plus een automatische stand die de kadrering van het startbeeld behoudt in plaats van er een vorm op te leggen. Geluid is een vinkje, wordt met de clip gegenereerd en verandert de prijs niet. Meer over elke knop staat in het stuk over de bedieningsopties.
Een praktische noot over de prijs: die is lineair in de duur en wordt bepaald door model en resolutie, dus identiek langs welke route je ook binnenkwam. Tekst naar video kiezen bespaart je niets, en beeld naar video kiezen kost niets extra. Kies op inhoud.
Een mislukte generatie geeft je coins automatisch terug. Het goedkope experiment is dus het eerste dat je draait: maak een still in Fellowi Images voor 40 coins, neem hem mee naar Fellowi Video, en beschrijf alleen wat beweegt. Blijkt je onderwerp helemaal geen gezicht nodig te hebben, dan heb je net geleerd dat een stap overbodig was, en dat is een goedkope les.