Text-to-video или image-to-video: что вам на самом деле нужно
Автор: The Fellowi Team · · 6 мин чтения

В Fellowi работают четыре видеомодели. Две начинают с фразы, две - с картинки, и каждая пара существует в быстрой turbo-версии и в медленной полной. Это весь каталог, и по-настоящему на результат влияет только первый выбор: вы даёте модели кадр или описание?
Стоит признать: какое-то время мы описывали это неверно. Три поста в этом блоге прямо утверждали, что пути только из текста не существует. Это было неправдой, и мы их исправили. Если вы читали здесь в начале сентября, что image-to-video - единственный вариант, то это та самая фраза, которую мы починили.
Правило, которое решает большинство случаев
Если на выходе должно быть конкретное лицо - начинайте с картинки.
Это не вкусовщина. Текстовое описание не может нести лицо. «Женщина под тридцать, тёмные волосы, зелёные глаза» немного сужает категорию и оставляет внутри тысячи лиц, а модель каждый раз берёт новое. Готовый кадр убирает угадывание целиком: кто в кадре, уже решено, и задача модели сжимается до того, чтобы это подвинуть. Мы писали, почему личность живёт в референсной картинке, а не в словах, и видео - самая острая версия этой проблемы: несовпадение на двадцати четырёх кадрах в секунду заметно куда сильнее, чем между двумя отдельными изображениями.
Text-to-video оправдывает себя там, где субъект типовой, а важна сцена. Волны о волнорез, ночной трафик, догорающая свеча, общий план улицы. Никто из зрителей не знает, как это «должно» выглядеть, значит, и расходиться не с чем, - а вы пропускаете целый этап изготовления кадра.
Что каждый путь от вас требует
Text-to-video хочет промпт, который несёт весь мир: субъект, место, свет, камеру и движение. Это более сложный промпт, потому что ничего за вас не закреплено, и расплывчатый даст усреднённый сток.
Image-to-video хочет почти обратного. Кадр уже сказал, как выглядит сцена, поэтому повторять это в промпте - потраченные слова, а противоречить кадру - хуже, чем потраченные. Тратьте всё на движение: что движется, с какой скоростью и что делает камера. Наш гайд по видеопромптам построен ровно вокруг этой дисциплины, а один из наших готовых промптов написан специально как хороший стартовый кадр.
У пути от картинки есть и третья возможность, которой нет у текстового: принять финальный кадр вдобавок к стартовому. Дайте оба - и модель отрисует движение между двумя выбранными вами кадрами. Это максимальный контроль над роликом из доступных, и естественный инструмент для короткой вертикалки, где вы точно знаете, чем кадр должен закончиться.
Turbo или полная - это отдельный вопрос
Выбрав путь, вы всё ещё выбираете семейство, и здесь речь о потолке и цене, а не о верности замыслу.
Turbo - быстрая и дешёвая пара. Они дают 720p и 1080p, четыре секунды в 720p стоят 500 монет. Полные модели медленнее и идут дальше: добавляют 480p снизу и 4K сверху, а их 720p заметно лучше - поэтому те же четыре секунды стоят 900 монет, а не 500. С ростом разрешения разрыв растёт быстро, потому что цена посекундная, а 4K - это огромное количество пикселей: четыре секунды полного 4K обойдутся в 4400 монет, а тридцать секунд - в 33 000.
Честный совет: черновики делайте на turbo. Поймайте движение и кадрирование в 720p за 500 монет и только потом решайте, заслуживает ли именно этот ролик полной модели. Всё считается посекундно, так что цена открытия «мне нужен был другой проезд камеры» целиком зависит от того, на какой модели вы это открыли.
Настройки, общие для обоих путей
Длительность - от четырёх до тридцати секунд. Пропорций семь, включая 9:16 для вертикального видео в соцсети, плюс режим «авто», который сохраняет кадрирование исходной картинки, а не навязывает форму. Звук - это галочка, он генерируется вместе с роликом и не меняет цену. Подробнее о каждой ручке - в посте про панель управления генерацией.
Практическое замечание о цене: она линейна по длительности и задаётся моделью и разрешением, поэтому одинакова, каким бы путём вы ни пришли. Text-to-video ничего не экономит, а image-to-video ничего не добавляет. Выбирайте по существу.
Неудачная генерация возвращает монеты автоматически. Значит, первым стоит ставить дешёвый эксперимент: сделайте кадр в Fellowi Images за 40 монет, отнесите его в Fellowi Video и опишите только движение. А если окажется, что лицо в сюжете вообще не нужно, вы просто узнали, что один шаг можно было пропустить, - и узнали дёшево.