Fellowi

Один короткий ролик: от пустой страницы до готового файла

Автор: The Fellowi Team · · 8 мин чтения

Абстрактная графика: одна полоса синего света растягивается и размывается по тёмному кадру

Мне нужен был один десятисекундный ролик: женщина на балконе ночью, город позади, кадр, которым можно что-то открыть. Ничего амбициозного. Ушло минут сорок и 3150 монет, и записать, куда они делись, полезнее любого аккуратного туториала, потому что большая часть этих сорока минут ушла не на набор текста.

Выбор пути, где я чуть не ошибся

Первым порывом было описать всё текстом и дать модели придумать. Это было бы неверно, и причина - то единственное, что стоит знать до начала: text-to-video придумывает и человека тоже, причём каждый раз нового.

Раз мне нужна была конкретная внешность, которая переживёт весь ролик, ответ был такой: сначала кадр, потом оживить. Если бы я хотел волны о волнорез или ночной трафик, текста хватило бы и я сэкономил бы шаг. Всё это решение укладывается в одну фразу, и пост-сравнение её даёт.

Кадр: четыре картинки, 160 монет

Стандартное качество, по 40 монет. Первая была слишком светлая, на второй она смотрела в камеру, а мне нужно было в сторону, третья верная, но слишком общий план, четвёртая - та самая.

Одно я сделал намеренно, научившись этому дорогим путём: я писал кадр как стартовый, а не как хорошую фотографию. То есть героиня в покое, а не в середине жеста, - потому что кадр, который уже выглядит серединой движения, не оставляет видеомодели, куда идти. И фон размыт, потому что дрейф первым делом заметен на фоне.

Первый ролик: четыре секунды, 500 монет, мимо

Черновик - четыре секунды, 720p, turbo: самое дешёвое из полезных сочетаний. Промпт описывал сцену: балкон, огни города, волосы, настроение.

Вернулось так, будто кадр слегка потревожили. Движения почти нет, а то, что есть, бесцельное.

Ошибка задним числом очевидна, и я делаю её каждый раз, когда неделю не подходил к видео. Кадр уже сказал, как выглядит сцена. Повторяя это в промпте, я потратил весь бюджет инструкций на информацию, которая у модели и так была. Видеопромпт должен быть про то, что движется.

Второй ролик: четыре секунды, 500 монет, почти

Переписал только про движение: медленный вдох, волосы чуть поднимает ветер, огни города мягко меняют резкость позади неё, камера статична. Четыре части, все про изменение во времени.

Разница огромная. Теперь это был кадр, а не подрагивающая фотография. Но всё ещё не то: статичная камера сделала это похожим на запись с камеры наблюдения. Что было полезно узнать, потому что значило: переменная - камера, а я её не трогал.

Третий ролик: четыре секунды, 500 монет, вот он

Поменял ровно одно. Статичная камера стала «very slow push in». Всё остальное идентично.

Это и был кадр. Лёгкое движение к герою делает с вниманием то, чего не сделает ничто внутри рамки, и стоило это одной фразы.

Та же дисциплина, что и с картинками: одна переменная за попытку. С видео она важнее, а не наоборот, потому что каждая попытка стоит в двенадцать раз дороже.

Решаемся на длительность: десять секунд, 1250 монет

Только теперь, когда движение и камера устоялись, я перезапустил на десяти секундах. Тот же промпт, тот же стартовый кадр, другая длительность.

Вот эта часть процесса и экономит настоящие деньги. Десять секунд - 1250 монет в 720p turbo; я ставил эксперименты по 500 и заплатил за десятисекундную цену один раз, в конце. Если делать наоборот, один ролик съедает большой пакет, а лестница цен достаточно крутая, чтобы дисциплина окупилась сразу.

Честная оговорка: длинная версия - это не растянутая четырёхсекундная. Она генерируется заново, поэтому движение похожее, но не идентичное. Иногда длинный дубль выходит хуже, и его гоняют снова. Закладывайтесь на это, а не удивляйтесь.

Звук: ничего

Делать буквально нечего. Ролик пришёл одним MP4 со звуковой дорожкой внутри, сгенерированной под ту же сцену, и цена не изменилась. Я вписал в промпт «distant traffic, wind» - примерно это там и было.

Раньше этот шаг был половиной работы, а теперь его просто нет. Подробнее - в посте про сгенерированный звук.

Итоговый счёт

  • 4 кадра по 40 монет: 160
  • 3 черновых ролика по четыре секунды: 1500
  • 1 финальный ролик на десять секунд: 1250
  • Итого: 3150 монет, около сорока минут

Из этих сорока минут набором текста было занято, может, шесть. Остальное - ожидание рендеров, которые идут минуты, а не секунды, и хождение вокруг с решением, достаточно ли хорош прошлый дубль. Этот ритм и есть настоящее отличие от работы с картинками: быстро итерировать нельзя, значит, каждая попытка должна стоить того, чтобы её делать.

Что бы я сказал себе перед стартом: пишите кадр как стартовый, описывайте только движение, меняйте одну переменную и не трогайте длительность, пока четырёхсекундная версия не станет тем самым кадром. Всё остальное - терпение. Происходит это в Fellowi Video, а гайд по видеопромптам - сжатая версия тех двух роликов, которые я потратил зря.

Попробуйте сами

Тёплый приватный ии-компаньон: 7 дней бесплатно и 30 сообщений, без карты.

Цены и лимиты

Читать дальше