Pragmatic Terminal

Pragmatic Terminal

Один хороший кадр — ещё не комикс. Теперь мне нужно проверить, можно ли повторить этот результат не один раз, а построить из таких кадров последовательную историю.

После первой попытки стало понятно, что проблема была не только в качестве отдельных изображений.

Я слишком сильно пытался управлять нейросетью.

Чем подробнее становились описания персонажа, сцены, света, позы и деталей, тем менее предсказуемым становился результат.

При этом самое первое изображение, которое мне действительно понравилось, было сделано с гораздо более простым описанием.

Поэтому я решил не просто продолжать генерировать новые картинки, а вернуться на один шаг назад и пересмотреть сам инструмент, которым я описываю будущий комикс.

У меня получилось два варианта.

Условно назову их Промт 2 и Промт 3.

Общее у них вот что.

Оба решают одну и ту же задачу.

Они должны помочь построить вертикальный scroll-комикс и описать его не как набор отдельных изображений, а как последовательное визуальное повествование.

В обоих есть: логика сюжета, последовательность сцен, кинематографический язык, типы планов, композиция, движение взгляда, работа с текстом, цвет, свет, технические ограничения, процесс от концепции до раскадровки, формат описания кадров, ограничения.

То есть Промт 3 не является новой концепцией.

Это попытка адаптировать уже разработанный подход к тому, с чем я столкнулся на практике.

Здесь появилась важная разница.

Промт 2 оказался слишком универсальным.

Он получился серьёзным — хорошо проработана сценарная сторона.

Например, он заставляет проверять:

что происходит в сцене,

почему это происходит,

как одно действие приводит к следующему,

какую функцию выполняет каждый кадр,

как развивается эпизод,

не возникает ли логических дыр.

Есть даже подробный пример микро-сцены, показывающий, как эту структуру применять.

Это сильная сторона.

Для создания истории такой подход мне нравится.

Но после первой генерации я увидел проблему.

Промт 2 почти не учитывает, в каких условиях я реально работаю.

Я не строю сейчас производство комиксов с профессиональной командой и дорогими инструментами.

Моя задача намного скромнее:

бесплатные или доступные нейросети, смартфон, вертикальный формат и возможность самостоятельно пройти весь путь от сценария до готовой публикации.

И здесь некоторые требования Промта 2 становятся скорее недостатком.

Первая проблема — размер.

В Промте 2 используется условный стандарт Webtoon с шириной холста 800 px.

Для моей задачи это не то, что мне нужно.

Я хочу создавать отдельные вертикальные кадры непосредственно под экран смартфона.

Поэтому в Промте 3 появляется конкретное техническое ограничение:

1440 × 3120 px, соотношение сторон 19.5:9.

И это должно быть не пожеланием, а обязательным параметром.

Первый эксперимент уже показал мне простую вещь:

если написать нейросети «изображение на весь экран телефона», она может интерпретировать это слишком свободно.

Когда я указал конкретное соотношение сторон, результат стал гораздо предсказуемее.

Значит, бытовое описание нужно заменить техническим.

Дальше — детали.

Это, пожалуй, главный урок предыдущей генерации.

Я пытался подробно описывать персонажа:

кепка, очки, шеврон, портупея, рюкзак, фонарь и другие элементы.

Логика казалась очевидной:

чем точнее я опишу персонажа, тем лучше нейросеть его сохранит.

На практике получилось наоборот.

Чем больше деталей я добавлял, тем чаще модель начинала путаться.

Что-то исчезало.

Что-то менялось.

Что-то появлялось там, где не должно было быть.

Поэтому в Промте 3 появляется противоположный принцип:

не пытайся контролировать каждую деталь.

Нейросети задаются:

общее настроение, композиция, несколько ключевых объектов, основные характеристики персонажа.

А мелкие детали остаются на её усмотрение.

В описании сцены — не больше 3–5 ключевых элементов.

Без длинных списков аксессуаров.

Без сложных поз.

Без попытки одновременно задать анатомию, направление взгляда, положение каждой руки и десяток объектов на заднем плане.

Это не означает, что модели нужно полностью довериться.

Контроль остаётся.

Но он должен быть иерархическим:

сначала главное, потом второстепенное.

Третье: сценарий и промт для генерации — не одно и то же.

Здесь я тоже изменил подход.

В Промте 2 описание кадра одновременно содержит:

драматургическую функцию, композицию, свет, движение, окружение, визуальные связи, детали персонажа.

Получается довольно большой текст.

Его можно использовать человеку для понимания сцены.

Но если попытаться почти целиком отправить его в нейросеть, возникает та же проблема, с которой я уже столкнулся:

слишком много инструкций.

Поэтому в Промте 3 я разделил два уровня.

Описание кадра — это информация для человека.

Здесь можно объяснить:

что происходит, зачем нужен кадр, какая эмоция, какой план, какое место он занимает в истории.

Промт для генерации — это уже короткая техническая инструкция непосредственно для модели.

Например:

вертикальное изображение 1440×3120, нуарная атмосфера, заброшенное помещение, человек в плаще, один источник света, влажный пол, высокий контраст.

То есть сценарист сначала понимает сцену, а потом переводит её в гораздо более короткую инструкцию.

Это разные задачи.

И, похоже, их не стоит смешивать.

Что я поменял.

Таким образом, я не стал выбрасывать Промт 2.

Я оставил в нём то, что оказалось полезным:

сценарную логику и последовательность повествования.

А техническую часть упростил и адаптировал под реальные ограничения.

В Промте 3 появились:

обязательный вертикальный формат 1440×3120,

соотношение сторон 19.5:9,

отдельное поле для промта генерации,

ограничение количества ключевых объектов,

короткие предложения,

запрет на перегруженные описания,

отказ от сложных поз без необходимости,

отказ от избыточных аксессуаров,

принцип упрощения после неудачной генерации вместо бесконечного добавления новых инструкций.

Последний пункт особенно важен.

Раньше логика была:

не получилось — добавить деталей.

Теперь хочу проверить другую:

не получилось — упростить.

При этом я не считаю Промт 3 автоматически лучшим.

Здесь есть важная оговорка.

Пока это только гипотеза.

Я не знаю, будет ли Промт 3 работать лучше.

Он выглядит более подходящим для моих условий, потому что учитывает уроки предыдущей генерации.

Но это ещё не результат.

Вполне возможно, что я обнаружу новую проблему.

Например:

персонаж станет стабильнее, но сцены потеряют выразительность.

Или формат будет правильным, но композиция окажется слишком однообразной.

Или отдельные кадры будут выглядеть хорошо, но при последовательном просмотре не возникнет ощущения истории.

Последний вариант особенно важен.

Потому что я всё ещё решаю первоначальную задачу:

получить не несколько красивых изображений, а последовательное визуальное повествование.

Поэтому следующий тест будет важнее предыдущего.

Смогу ли я повторить результат несколько раз и сохранить между кадрами связь?

Именно здесь начинается настоящий эксперимент.

Мне нужно проверить сразу несколько вещей.

Персонаж — будет ли это один и тот же человек?

Пространство — будет ли ощущаться, что сцены происходят в одном мире?

Визуальный язык — сохранится ли свет, цвет, контраст и общее настроение?

Композиция — смогу ли я менять планы и ракурсы, не разрушая визуальную систему?

Нарратив — будет ли кадр №2 продолжать кадр №1, а не просто существовать рядом с ним?

И наконец:

процесс — смогу ли я повторять это без того, чтобы каждая новая сцена превращалась в отдельную борьбу с нейросетью?

Что получилось в итоге.

Промт 2 оказался полезным.

Он хорошо решает задачу построения истории, но оказался недостаточно адаптирован к моим реальным техническим ограничениям.

Промт 3 — попытка исправить это.

Он не должен сделать модель умнее.

Он должен сделать мою инструкцию проще и реалистичнее.

Разница существенная.

Я не пытаюсь заставить нейросеть понять всё.

Я пытаюсь понять, что ей действительно необходимо сообщить, чтобы получить управляемый результат.

Теперь это можно проверить только практикой.

Следующий этап — взять Промт 3 и попробовать построить несколько связанных кадров.

Если получится — двигаемся дальше.

Если снова возникнут проблемы — значит, появилась следующая информация о том, как на самом деле работает этот процесс.

Пока у меня есть только гипотеза.

Теперь нужен следующий эксперимент.