Fellowi

Text-to-video чи image-to-video: що вам насправді потрібно

Автор: The Fellowi Team · · 6 хв читання

Абстрактна графіка: дві паралельні світлові доріжки сходяться до яскравої рамки на темному тлі

У Fellowi працюють чотири відеомоделі. Дві починають з фрази, дві - з картинки, і кожна пара існує у швидкій turbo-версії та в повільній повній. Це весь каталог, і по-справжньому на результат впливає лише перший вибір: ви даєте моделі кадр чи опис?

Варто визнати: якийсь час ми описували це неправильно. Три пости в цьому блозі прямо стверджували, що шляху лише з тексту не існує. Це була неправда, і ми їх виправили. Якщо ви читали тут на початку вересня, що image-to-video - єдиний варіант, то це та сама фраза, яку ми полагодили.

Правило, яке вирішує більшість випадків

Якщо на виході має бути конкретне обличчя - починайте з картинки.

Це не смаківщина. Текстовий опис не може нести обличчя. «Жінка під тридцять, темне волосся, зелені очі» трохи звужує категорію і лишає всередині тисячі облич, а модель щоразу бере нове. Готовий кадр прибирає вгадування цілком: хто в кадрі, вже вирішено, і завдання моделі стискається до того, щоб це зрушити. Ми писали, чому особистість живе в референсній картинці, а не в словах, і відео - найгостріша версія цієї проблеми: розбіжність на двадцяти чотирьох кадрах на секунду помітна значно сильніше, ніж між двома окремими зображеннями.

Text-to-video виправдовує себе там, де суб’єкт типовий, а важлива сцена. Хвилі об хвилеріз, нічний трафік, свічка, що догоряє, загальний план вулиці. Ніхто з глядачів не знає, як це «має» виглядати, отже, і розходитися нема з чим, - а ви пропускаєте цілий етап виготовлення кадру.

Чого кожен шлях від вас вимагає

Text-to-videoхоче промпт, який несе цілий світ: суб’єкт, місце, світло, камеру і рух. Це складніший промпт, бо нічого за вас не закріплено, а розпливчастий дасть усереднений сток.

Image-to-video хоче майже протилежного. Кадр уже сказав, як виглядає сцена, тому повторювати це в промпті - витрачені слова, а суперечити кадру - гірше, ніж витрачені. Витрачайте все на рух: що рухається, з якою швидкістю і що робить камера. Наш гайд з відеопромптів побудований саме навколо цієї дисципліни, а один із наших готових промптів написано спеціально як добрий стартовий кадр.

У шляху від картинки є і третя можливість, якої немає в текстового: прийняти фінальний кадр на додачу до стартового. Дайте обидва - і модель відмалює рух між двома обраними вами кадрами. Це максимальний контроль над роликом із доступних і природний інструмент для короткої вертикалки, де ви точно знаєте, чим кадр має завершитися.

Turbo чи повна - це окреме питання

Обравши шлях, ви все ще обираєте родину, і тут ідеться про стелю й ціну, а не про вірність задуму.

Turbo - швидка й дешева пара. Вони дають 720p і 1080p, чотири секунди у 720p коштують 500 монет. Повні моделі повільніші й ідуть далі: додають 480p знизу і 4K зверху, а їхній 720p помітно кращий - тому ті самі чотири секунди коштують 900 монет, а не 500. Зі зростанням роздільної здатності розрив росте швидко, бо ціна посекундна, а 4K - це величезна кількість пікселів: чотири секунди повного 4K обійдуться в 4400 монет, а тридцять секунд - у 33 000.

Чесна порада: чернетки робіть на turbo. Спіймайте рух і кадрування у 720p за 500 монет і лише потім вирішуйте, чи заслуговує саме цей ролик на повну модель. Усе рахується посекундно, тож ціна відкриття «мені був потрібен інший проїзд камери» цілком залежить від того, на якій моделі ви це відкрили.

Налаштування, спільні для обох шляхів

Тривалість - від чотирьох до тридцяти секунд. Пропорцій сім, включно з 9:16 для вертикального відео в соцмережі, плюс режим «авто», який зберігає кадрування вихідної картинки, а не нав’язує форму. Звук - це галочка, він генерується разом із роликом і не змінює ціну. Докладніше про кожну ручку - у пості про панель керування генерацією.

Практичне зауваження про ціну: вона лінійна за тривалістю і задається моделлю та роздільною здатністю, тому однакова, яким би шляхом ви не прийшли. Text-to-video нічого не заощаджує, а image-to-video нічого не додає. Обирайте по суті.

Невдала генерація повертає монети автоматично. Отже, першим варто ставити дешевий експеримент: зробіть кадр у Fellowi Images за 40 монет, віднесіть його у Fellowi Video і опишіть тільки рух. А якщо виявиться, що обличчя в сюжеті взагалі не потрібне, ви просто дізналися, що один крок можна було пропустити, - і дізналися дешево.

Спробуйте самі

Теплий приватний ші-компаньйон: 7 днів безкоштовно і 30 повідомлень, без картки.

Ціни та ліміти

Читати далі