Все статьи

Почему нейросеть не похожа на вас — и как это исправить

Пять причин, по которым ИИ-видео выходит непохожим, и что с каждой делать. Из практики: разбор реальных жалоб.

Самая частая претензия к ИИ-видео

«Загрузил фото — получил чужого человека». Это не каприз модели и не случайность: почти всегда причина конкретная и устранимая. Ниже — пять причин по частоте, из реальных разборов.

1. Загружен один портрет

По одному селфи модель видит лицо в одном ракурсе и одном освещении. Всё остальное — форму головы сбоку, рост, пропорции, посадку одежды — она додумывает. Результат похож «в анфас» и разваливается, как только человек поворачивается.

Решение: три-пять кадров с разных сторон плюс обязательно один в полный рост. Ростовой снимок даёт пропорции, без него нейросеть придумает свои.

2. В промпте описана внешность

Если в тексте сценария написано «девушка с длинными тёмными волосами», это указание перебивает вашу фотографию. Какое фото ни загружай — в кадре будет брюнетка. То же самое с возрастом: «мальчик 5–6 лет» превратит трёхлетнего малыша в дошкольника постарше.

Решение: в описании сцены не должно быть цвета волос, возраста и телосложения. Внешность берётся с фотографий, текст задаёт только действие и обстановку. Мы вычистили такие формулировки из своих шаблонов — и сходство заметно выросло.

3. Потерялась текстура волос

Кудри — самое хрупкое. Если явно не сказать «сохрани тип волос», модель по умолчанию рисует прямые: их проще и они чаще встречаются в обучающих данных. Кудрявый ребёнок выходит с гладкой причёской, и сходство пропадает мгновенно.

Решение: загружайте кадры, где волосы хорошо видны — сбоку и сзади тоже.

4. Мало света или мелкое лицо

Тёмное фото, контровой свет, лицо на четверть кадра — всё это уменьшает количество информации. Модель достраивает недостающее «средним человеком».

Решение: ровный дневной свет, лицо крупно, без очков и головных уборов, нейтральное выражение.

5. Слишком длинная сцена

Чем дольше ролик и чем больше в нём смен действия, тем сильнее «дрейф»: к концу лицо уплывает. Особенно если герой уходит вглубь кадра и возвращается — на дистанции модель теряет черты и на возврате может подставить другие.

Решение: для важных кадров берите ролики покороче или выбирайте шаблоны, где герой всё время близко к камере.

Как это устроено у нас

Мы не отдаём ваши фотографии прямо в видеомодель. Сначала отдельным шагом собирается карта персонажа — одно изображение, где вы показаны в пяти ракурсах при одинаковом свете: крупный портрет, три четверти, профиль, со спины и в полный рост. Уже эта карта идёт в генерацию видео.

Такой промежуточный шаг решает сразу две задачи: собирает разрозненные фото в один согласованный образ и удерживает его на протяжении всего ролика. Если в сюжете двое — например, вы и ребёнок, — карты строятся раздельно, чтобы лица не смешались.

Чек-лист перед загрузкой

  • Минимум 3 кадра, лучше 5–8.
  • Обязательно один в полный рост.
  • Ровный свет, лицо крупно, без очков и кепки.
  • Один и тот же человек и примерно один период жизни — не мешайте фото десятилетней давности со свежими.
  • Если в шаблоне двое — загружайте их в разные поля, а не вперемешку.

Частые вопросы

Сколько фото — оптимально?

Пять-восемь. Дальше прирост сходства небольшой.

Подойдут фото с разной причёской?

Лучше нет: модель усреднит. Берите кадры с той причёской, которую хотите видеть.

А если человек в очках?

Загрузите и с очками, и без. Если очки — часть образа, они должны быть на большинстве кадров.

Почему на 480p сходство хуже?

На низком разрешении лицо занимает меньше пикселей, и черты размываются на общих планах. Для важного результата берите 720p — разница особенно заметна, когда фигура мелкая в кадре.

Где попробовать

Все наши шаблоны собирают карту персонажа автоматически — отдельно ничего включать не нужно:

Нейросеть не похожа на меня: 5 причин и решения | VeonGen.Ai