Один короткий ролик: від порожньої сторінки до готового файлу
Автор: The Fellowi Team · · 8 хв читання

Мені був потрібен один десятисекундний ролик: жінка на балконі вночі, місто позаду, кадр, яким можна щось відкрити. Нічого амбітного. Пішло хвилин сорок і 3150 монет, і записати, куди вони поділися, корисніше за будь-який охайний туторіал, бо більша частина цих сорока хвилин пішла не на набір тексту.
Вибір шляху, де я мало не помилився
Першим поривом було описати все текстом і дати моделі вигадати. Це було б хибно, і причина - те єдине, що варто знати до початку: text-to-video вигадує і людину теж, причому щоразу нову.
Раз мені була потрібна конкретна зовнішність, яка переживе весь ролик, відповідь була така: спершу кадр, потім оживити. Якби я хотів хвилі об хвилеріз або нічний трафік, тексту вистачило б і я зекономив би крок. Усе це рішення вкладається в одну фразу, і пост-порівняння її дає.
Кадр: чотири картинки, 160 монет
Стандартна якість, по 40 монет. Перша була надто світла, на другій вона дивилася в камеру, а мені треба було вбік, третя правильна, але надто загальний план, четверта - та сама.
Одне я зробив навмисно, навчившись цього дорогим шляхом: я писав кадр як стартовий, а не як гарну фотографію. Тобто героїня в спокої, а не всередині жесту, - бо кадр, який уже виглядає серединою руху, не лишає відеомоделі, куди йти. І тло розмите, бо дрейф найперше помітний на тлі.
Перший ролик: чотири секунди, 500 монет, мимо
Чернетка - чотири секунди, 720p, turbo: найдешевше з корисних поєднань. Промпт описував сцену: балкон, вогні міста, волосся, настрій.
Повернулося так, ніби кадр злегка потривожили. Руху майже немає, а той, що є, безцільний.
Помилка заднім числом очевидна, і я роблю її щоразу, коли тиждень не підходив до відео. Кадр уже сказав, як виглядає сцена. Повторюючи це в промпті, я витратив увесь бюджет інструкцій на інформацію, яку модель і так мала. Відеопромпт має бути про те, що рухається.
Другий ролик: чотири секунди, 500 монет, майже
Переписав тільки про рух: повільний вдих, волосся трохи піднімає вітер, вогні міста м’яко міняють різкість позаду неї, камера статична. Чотири частини, усі про зміну в часі.
Різниця величезна. Тепер це був кадр, а не фотографія, що тремтить. Але все ще не те: статична камера зробила це схожим на запис із камери спостереження. Що було корисно дізнатися, бо означало: змінна - камера, а я її не чіпав.
Третій ролик: чотири секунди, 500 монет, ось він
Поміняв рівно одне. Статична камера стала «very slow push in». Усе інше ідентичне.
Це і був кадр. Легкий рух до героя робить з увагою те, чого не зробить ніщо всередині рамки, і коштувало це однієї фрази.
Та сама дисципліна, що й з картинками: одна змінна за спробу. З відео вона важливіша, а не навпаки, бо кожна спроба коштує вдванадцятеро дорожче.
Зважуємося на тривалість: десять секунд, 1250 монет
Лише тепер, коли рух і камера усталилися, я перезапустив на десяти секундах. Той самий промпт, той самий стартовий кадр, інша тривалість.
Ось ця частина процесу і заощаджує справжні гроші. Десять секунд - 1250 монет у 720p turbo; я ставив експерименти по 500 і заплатив десятисекундну ціну один раз, наприкінці. Якщо робити навпаки, один ролик з’їдає великий пакет, а драбина цін достатньо крута, щоб дисципліна окупилася одразу.
Чесне застереження: довга версія - це не розтягнута чотирисекундна. Вона генерується заново, тому рух схожий, але не ідентичний. Іноді довгий дубль виходить гірший, і його ганяють знову. Закладайтеся на це, а не дивуйтеся.
Звук: нічого
Робити буквально нема чого. Ролик прийшов одним MP4 зі звуковою доріжкою всередині, згенерованою під ту саму сцену, і ціна не змінилася. Я вписав у промпт «distant traffic, wind» - приблизно це там і було.
Раніше цей крок був половиною роботи, а тепер його просто немає. Докладніше - у пості про згенерований звук.
Підсумковий рахунок
- 4 кадри по 40 монет: 160
- 3 чернеткові ролики по чотири секунди: 1500
- 1 фінальний ролик на десять секунд: 1250
- Разом: 3150 монет, близько сорока хвилин
Із цих сорока хвилин набором тексту було зайнято, може, шість. Решта - очікування рендерів, які йдуть хвилини, а не секунди, і ходіння довкола з рішенням, чи достатньо добрий попередній дубль. Цей ритм і є справжня відмінність від роботи з картинками: швидко ітерувати не можна, отже, кожна спроба має вартувати того, щоб її робити.
Що б я сказав собі перед стартом: пишіть кадр як стартовий, описуйте лише рух, міняйте одну змінну і не чіпайте тривалість, доки чотирисекундна версія не стане тим самим кадром. Усе інше - терпіння. Відбувається це у Fellowi Video, а гайд із відеопромптів - стисла версія тих двох роликів, які я змарнував.