Text na video, nebo obrázek na video: co doopravdy potřebujete
Autor: The Fellowi Team · · 6 min čtení

Fellowi provozuje čtyři modely na video. Dva vycházejí z věty a dva z obrázku, a každá z těch dvojic existuje v rychlé turbo verzi a v pomalejší plné. To je celý katalog a jediná volba, která doopravdy mění, co dostanete zpátky, je ta první: podáváte modelu snímek, nebo popis?
Je namístě přiznat, že jsme to nějakou dobu popisovali špatně. Tři články na tomhle blogu natvrdo tvrdily, že cesta jen z textu neexistuje. Nebyla to pravda a opravili jsme je. Pokud jste tu začátkem září četli, že obrázek na video je jediná možnost, je to přesně ta věta, kterou jsme spravili.
Jedno pravidlo, které vyřeší většinu případů
Má-li na druhém konci vyjít konkrétní tvář, začněte obrázkem.
Tohle není otázka vkusu. Textový popis nedokáže nést tvář. „Žena kolem třicítky, tmavé vlasy, zelené oči“ kategorii jen mírně zúží a nechá v ní tisíce tváří, přičemž model pokaždé sáhne po jiné. Podání snímku hádání úplně odstraní: kdo je v záběru, je už rozhodnuto, a úkol modelu se scvrkne na to, aby s ním pohnul. Psali jsme, proč totožnost bydlí v referenčním obrázku, a ne ve slovech, a video je nejostřejší verze toho problému: nesoulad přes dvacet čtyři snímků za sekundu je vidět mnohem víc než mezi dvěma samostatnými obrázky.
Text na video si své místo zaslouží tam, kde je námět obecný a jde o scénu. Vlny na vlnolamu, noční provoz, dohořívající svíčka, celkový záběr ulice. Nikdo z diváků neví, jak by to mělo vypadat, takže není s čím být v rozporu, a vy přeskočíte celý krok s výrobou snímku.
Co po vás každá cesta chce
Text na video chce prompt, který unese celý svět: námět, místo, světlo, kameru a pohyb. Je to těžší prompt, protože za vás není nic zafixované, a mlhavý dá zprůměrovaný klip jako z fotobanky.
Obrázek na video chce skoro opak. Snímek už řekl, jak scéna vypadá, takže cokoli z toho v promptu opakovat je vyplýtvané a odporovat mu je horší než vyplýtvané. Utraťte každé slovo za pohyb: co se hýbe, jak rychle a co dělá kamera. Náš průvodce videoprompty je postavený přesně kolem téhle kázně a jeden z našich hotových promptů je napsaný schválně tak, aby byl dobrým počátečním snímkem.
Cesta od obrázku umí ještě třetí věc, kterou textová neumí: přijmout kromě počátečního i koncový snímek. Dejte oba a vyrenderuje pohyb mezi dvěma snímky, které jste vybrali, což je nejsilnější kontrola nad klipem, jaká tu je. Pro krátkou výšku, u níž přesně víte, kde má záběr přistát, je to přirozený nástroj.
Turbo, nebo plný, to je samostatná otázka
Když je cesta zvolená, pořád vybíráte rodinu, a tady jde o strop a cenu, ne o věrnost nápadu.
Turbo modely jsou ta rychlá a levná dvojice. Nabízejí 720p a 1080p a čtyři sekundy v 720p stojí 500 mincí. Plné modely jsou pomalejší a sahají dál: přidávají 480p dole a 4K nahoře a jejich 720p je viditelně lepší, proto stejné čtyři sekundy stojí 900 mincí místo 500. S rozlišením se propast rozevírá rychle, protože jsou to ceny za sekundu a 4K je ohromné množství pixelů: čtyři sekundy plného 4K jsou 4400 mincí a třicet sekund 33 000.
Poctivá rada zní skicovat v turbu. Vyřešte pohyb a výřez v 720p za 500 mincí a teprve pak se rozhodněte, jestli si zrovna tenhle klip zaslouží render plným modelem. Všechno se počítá po sekundách, takže cena zjištění, že jste chtěli jiný pohyb kamery, závisí výhradně na tom, na jakém modelu jste to zjistili.
Nastavení, která obě cesty sdílejí
Délka jde od čtyř do třiceti sekund. Poměrů stran je sedm, včetně 9:16 pro svislé video na sítě, plus automatika, která zachová výřez počátečního obrázku, místo aby mu vnucovala tvar. Zvuk je zaškrtávátko, generuje se spolu s klipem a cenu nemění. Víc o každém ovládacím prvku je v článku o ovládací ploše.
Praktická poznámka k ceně: je lineární v délce a určuje ji model a rozlišení, takže je stejná, ať jste přišli kteroukoli cestou. Volbou textu na video nic neušetříte a volbou obrázku na video nic nepřiplatíte. Vybírejte podle věci.
Neúspěšné generování vrátí mince automaticky. První by tedy měl běžet levný pokus: udělejte snímek v Fellowi Images za 40 mincí, odneste ho do Fellowi Video a popište jen to, co se hýbe. Pokud se ukáže, že váš námět žádnou tvář nepotřebuje, právě jste zjistili, že jeden krok šel vynechat, a to je levné poučení.