Pragmatic Terminal

Первая попытка генерации: что пошло не так

После всей подготовительной работы — выбора формата, проработки промта, фиксации визуального подхода — наконец-то дошло до генерации.

Я ожидал, что теперь всё пойдёт относительно гладко: есть сценарий, есть правила, есть палитра. Осталось только начать.

Первое изображение действительно получилось хорошим.

Атмосфера: заброшенный вычислительный центр, ретро-футуризм, мрачный свет.

Я подумал: «Вот оно. Работает».

А потом начались проблемы.

Сначала проблема была в размере.

Изображение не соответствовало экрану телефона.

Я указал модель — S25 Ultra. Но формулировка вроде «на весь экран телефона» не дала нужного результата.

Когда я задал точное соотношение сторон, результат стал соответствовать задаче.

Это было первое полезное наблюдение:

для конкретной технической характеристики общее бытовое описание оказалось менее эффективным, чем точное числовое ограничение.

Казалось бы, мелочь.

Но для комикса это важно: если формат кадра заранее определён, его нужно задавать как техническое требование, а не надеяться, что модель правильно интерпретирует описание.

Дальше — персонаж.

Я попытался прописать его максимально подробно:

кепка, очки, шеврон, портупея, рюкзак, фонарь.

Логика была простой:

чем точнее описание, тем стабильнее должен получаться персонаж.

Но результат оказался другим.

При увеличении количества обязательных деталей стабильность не улучшилась. Некоторые элементы исчезали, менялись или начинали конфликтовать друг с другом.

Кепка съезжала.

Шеврон исчезал.

Аксессуары менялись от генерации к генерации.

В итоге я начал убирать детали.

Оставил только несколько основных элементов:

плащ, свитер, ботинки.

Персонаж стал стабильнее.

Но на этом этапе я уже потратил довольно много времени.

Сцена вышла ещё сложнее.

Здесь проблема стала ещё заметнее.

Я пытался описывать сцену почти как режиссёр:

труба, пропасть, луч фонаря, положение героя, направление света, масштаб объектов.

Но генерации продолжали нарушать отдельные элементы.

То рука получалась неправильной.

То фонарь освещал не то место.

То масштаб героя относительно пространства менялся.

Я пытался исправлять результат дополнительными инструкциями.

Но чем больше деталей добавлял, тем сложнее становилось получить одновременно правильную сцену.

В какой-то момент я понял, что проблема уже не в отсутствии инструкций.

Инструкций стало слишком много.

И здесь произошло самое интересное.

Первое удачное изображение было создано довольно простым, почти интуитивным промтом.

А дальше я начал пытаться контролировать каждый элемент изображения.

И именно тогда результат стал хуже.

Получается парадокс:

я добавлял инструкции, чтобы получить больше контроля, но увеличение количества инструкций контроля не дало.

Более того, некоторые дополнительные ограничения начали мешать друг другу.

Это заставило меня пересмотреть первоначальное предположение.

Возможно, проблема не в том, что промт недостаточно подробный.

Возможно, сам способ управления визуальной частью через подробный промт оказался слишком директивным для этой задачи.

На чём я остановился

После десятков итераций я так и не получил сцену, которая устраивала бы меня целиком.

Можно было продолжать.

Ещё один промт.

Ещё одна генерация.

Ещё одна попытка исправить предыдущую.

Но в этот момент продолжение эксперимента превращалось бы просто в попытку случайно получить хороший результат.

А это уже не исследование.

Поэтому я остановился.

Что я из этого вынес

Первоначальная гипотеза была примерно такой:

чем подробнее я опишу изображение, тем больше контроля получу над результатом.

На этой серии генераций она не подтвердилась.

Конечно, из этого не следует, что подробные промты вообще не работают.

Я проверял конкретный способ управления визуальной частью конкретного workflow.

И получил конкретный результат:

увеличение количества директивных деталей не дало ожидаемого увеличения контроля.

Разница существенная.

Следующая гипотеза

Теперь я хочу попробовать противоположный подход.

Не пытаться описать каждую деталь.

Задать:

общее настроение, композицию, несколько ключевых объектов, отношения между ними.

А второстепенные детали оставить генератору.

Возможно, более свободное описание даст больше стабильности.

Возможно, нет.

Это как раз следующая проверка.

Первый результат оказался не тем, который я хотел получить.

Но это не провал.

Гипотеза не подтвердилась. Следующая гипотеза — впереди.