Почему картинки нейросети видно сразу и какими словами это лечится
Автор: The Fellowi Team · · 7 мин чтения

Обычно это видно. Не потому, что картинка сделана плохо, а потому, что она сделана слишком хорошо: у кожи нет пор, обе половины лица совпадают, свет идёт ниоткуда конкретно, и ничто на заднем плане не потёрто. Читается как фотография места, которого не существует, - чем она, собственно, и является.
Причина достаточно простая, чтобы быть полезной. Модель целится в среднее по огромному числу хорошо снятых фотографий и усредняет прочь всё, что различалось. А различается между реальными снимками как раз несовершенство: тут пятнышко, там жёсткая тень, объектив, мылящий в одном углу. Усредните всё это - получите гладкое, симметричное и мёртвое.
Значит, реализм - это не то, о чём просят. Это то, во что модель приходится уговаривать, по одному конкретному изъяну за раз.
Пять признаков и фраза против каждого
Пластиковая кожа.Встроенная ретушь. Портретные датасеты забиты отретушированными лицами, поэтому у среднего лица пор нет вовсе. Просите фактуру обратно прямым текстом: «visible skin texture, fine pores, a few freckles across the nose, unretouched». Просить несовершенство непривычно - и это самое сильное улучшение, доступное сгенерированному лицу.
Симметрия.Настоящие лица несимметричны, а настоящие комнаты не отцентрованы. Среднее по всему - симметрично, потому что асимметрии взаимно гасятся. Ломайте намеренно: «head turned slightly, weight on one hip, the composition off-centre with more space on her left».
Свет ниоткуда. Самое частое и самое легко исправимое. Если не сказать, откуда падает свет, модель усредняет все схемы освещения разом, и выходят мягкие тени во все стороны - такого в природе не бывает нигде. Один названный источник с одним направлением снимает это мгновенно.
Слишком чистое окружение. В настоящих комнатах есть провод, потёртость, куртка на спинке стула. Одна названная деталь беспорядка даёт достоверности больше, чем ещё одно предложение про героя, и стоит дешевле всего.
Мёртвые глаза.Сложнее, и полезно понимать почему: глаза читаются живыми из-за блика - маленького отражения того, что их освещает. У усреднённого лица блики тоже усреднённые, по центру и симметричные, а это взгляд манекена. Просите конкретный: «a single window catchlight in her eyes, slightly off to the left».
Оптические слова, которые работают, и которые нет
Словарь камеры работает, когда называет физическое следствие, и не работает, когда просто звучит профессионально. Разницу стоит усвоить, потому что половина промптов, которые люди переписывают друг у друга, - второго типа.
Отрабатывает: фокусное расстояние - оно меняет, сколько фона попадёт в кадр и как сожмётся лицо. Диафрагма - она решает, что резко. Время суток. Названная плёнка или цветовой сдвиг - они ограничивают палитру. Зерно. Конкретный дефект оптики: виньетирование, мыло в углу.
Не отрабатывает:«8k», «ultra detailed», «masterpiece», «award winning», «professional photography», «hyperrealistic». Это описание того, что вы хотели бы почувствовать от результата, а мнение модель нарисовать не может. Хуже того, эти слова занимают внимание, которое могла бы использовать настоящая фраза.
Удобная проверка: смог бы фотограф, стоящий в комнате, выполнить это слово? «35mm, снято чуть снизу» - инструкция, которую можно исполнить. «Гиперреалистично» - нет.
Назовите реальную световую ситуацию
Если после этого текста поменяете одну вещь, пусть это будет она. Не «хороший свет», не «кинематографичный свет», а ситуация, которая правда могла бы случиться:
- «late afternoon sun through a west-facing window, long shadow across the floor»
- «overcast noon, flat soft light, no visible shadows»
- «one bedside lamp to her right, the rest of the room falling into dark»
- «street lamp overhead at night, hard shadows under the eyes, wet pavement reflecting it»
Каждая задаёт направление, жёсткость и цвет, и каждая исключает то самое ощущение «всё сразу», по которому картинку опознают как сгенерированную. Это тот же принцип, что и порядок частей в наших готовых промптах: свет - та часть, которую пропускают чаще всего, и та, что несёт больше всего.
Разрешение - это не реализм
Высокое качество рисует в большем разрешении, и это покупает детализацию, а не достоверность. Пластиковую кожу оно отрисует в 2K ровно так же добросовестно, как в 1.5K, просто из большего числа пикселей. Сначала доведите промпт на стандарте за 40 монет, потом перезапустите понравившийся вариант в высоком за 60, если вам правда нужен размер. Полное сравнение - в посте про качество и форматы.
Ещё две честные границы. Руки и лица - самые трудные сюжеты, потому что в них разбирается каждый зритель и поймает ошибку, которую сам бы не описал. А если нужно одно и то же лицо на нескольких картинках, никакой словарь реализма этого не даст: это работа для референсной картинки, как разобрано в тексте про постоянство персонажа. Слова не несут лицо.
Тренируйтесь на поверхностях, а не на людях. Ткань, потёртый металл, еда, мокрый камень. Они отзываются на тот же словарь, никто не эксперт по тому, как выглядит конкретная кастрюля, и вы поймёте, что делает «жёсткий свет слева», куда быстрее, чем на портрете. Потом несите это в Fellowi Images и меняйте по одной части за раз. Неудачная генерация возвращает монеты, так что настоящая цена эксперимента - минута.