Pragmatic Terminal

Можно ли поручить нейросети придумать, как сделать комикс?

Первым делом я не стал сразу генерировать изображения.

Нужно было сначала понять, можно ли вообще построить рабочий процесс создания последовательного комикса с помощью AI.

Поэтому я сделал то, что казалось самым очевидным: попросил нейросеть разработать для меня промт для работы над комиксом.

AI выдал амбициозный промт

Нейросеть должна была одновременно выступать в роли сценариста, визуального режиссёра, редактора и критика. Для этого в промт были добавлены подходы и имена известных авторов комиксов — от Стэна Ли и Джека Кирби до Алана Мура и Майка Миньолы.

Получился очень убедительный текст.

Настолько убедительный, что сначала он мне понравился.

А потом я начал разбирать его по частям.

И обнаружил несколько проблем.

Слишком много разных подходов. Кто тут вообще главный?

Первая проблема — в самой конструкции.

В промте были собраны авторы, работавшие совершенно по-разному.

Например, Marvel Method Стэна Ли предполагал гораздо большую свободу художника, тогда как сценарии Алана Мура известны детальной проработкой сцен. Джек Кирби вообще был настолько самостоятельным визуальным автором, что его рисунок мог существенно менять первоначальный замысел истории.

Я фактически попросил одну модель одновременно работать по нескольким разным философиям создания комикса.

Получилась не команда специалистов, а смесь требований.

И здесь первая проблема:

количество авторитетных имён ещё не превращает промт в рабочую методологию.

Можно перечислить десять великих авторов и получить очень впечатляющую инструкцию.

Но инструкция от этого не становится лучше.

«Визуальный режиссёр» оказался слишком красивым названием

Вторая проблема оказалась интереснее.

Промт предлагал модели «мыслить кадрами», как визуальный режиссёр.

Но текстовая модель не видит готовую страницу так, как её видит человек-художник или режиссёр.

Она может описать: крупный план, свет слева, персонаж смотрит вправо, на заднем плане окно, камера снизу.

Это действительно полезно.

Но подробное описание кадра ещё не является визуальной проверкой самого кадра.

Можно идеально описать каждую панель отдельно и обнаружить после генерации, что две соседние панели плохо работают вместе.

Персонаж может оказаться слишком далеко.

Направление взгляда может нарушить движение глаза по странице.

Композиция одного кадра может конфликтовать со следующим.

А отдельные изображения, каждое из которых само по себе выглядит хорошо, могут вообще не восприниматься как последовательная история.

Разница вот в чём:

описание кадра не равно визуальная проверка последовательности.

Поэтому вместо абстрактного требования «мыслить как визуальный режиссёр» гораздо честнее дать модели конкретные параметры, которые она действительно может описать:

план, точку зрения, положение персонажей, направление взгляда, источник света, фон, действие, эмоцию, связь с предыдущим и следующим кадром.

Это не заменяет визуального мышления человека. Но хотя бы не делает вид, что заменяет.

Может ли AI быть собственным критиком?

Третья проблема появилась в разделе, где нейросети предлагалось критически оценивать собственные решения.

На первый взгляд идея разумная.

Попросить модель:

«Если видишь проблему — скажи. Если сцена слабая — предложи другой вариант».

Но здесь есть ловушка.

Модель может очень убедительно сформулировать критику.

Это ещё не означает, что критика правильная.

Она может сказать, что поворот «слишком банальный», что сцена «не имеет эмоционального веса», что диалог «не достаточно выразительный».

Но откуда я знаю, что это действительно так?

Если я сам не понимаю, почему решение плохое, красивое объяснение модели не превращается автоматически в доказательство.

Поэтому я решил сузить её роль. Не просить AI определять, что является «гениальным», «сильным» или «работает как у великого автора».

А просить находить то, что можно проверить:

логические противоречия, несоответствия между сценами, нарушение заданных ограничений, повторения, потерю информации, проблемы с последовательностью действий.

То есть не:

«Скажи, хорошее ли это искусство».

А:

«Найди то, что не соответствует заданным условиям».

Это гораздо более скромная задача.

И, возможно, поэтому более полезная.

Ещё одна проблема — слишком много ролей

В исходном промте AI должен был одновременно быть:

сценаристом, режиссёром, художником, редактором, критиком.

Проблема здесь не в том, что AI не может выполнять разные задачи.

Может.

Проблема в другом.

Когда все эти задачи объединены в одну инструкцию, становится трудно понять, какой именно этап сейчас выполняется и почему получился именно такой результат.

Если сценарист одновременно думает о цвете, художник — о драматургии, а критик — о стиле конкретного автора, роли начинают смешиваться.

Вместо производственного процесса получается один огромный промт.

А мне нужен не впечатляющий промт. Мне нужен процесс, которым можно управлять.

И последний вопрос: кто здесь принимает решение?

Это оказалось самым важным.

Допустим, я даю модели концепцию.

Она предлагает структуру.

Потом раскадровку.

Потом описания кадров.

Потом варианты диалогов.

Всё выглядит профессионально.

Но кто решил, что именно этот вариант нужно использовать?

Не AI.

Он просто предложил следующий вариант.

Решение всё равно принимаю я.

И это нормально.

Более того, именно это я и хочу проверить в этом проекте.

Мне не нужен AI, который изображает из себя автономного автора.

Мне нужен инструмент, который помогает мне пройти сложную работу быстрее и качественнее.

Что изменилось после этой первой попытки

Я начинал с мысли:

«Нужно найти хороший промт для создания комикса».

Теперь думаю иначе.

Нужно найти рабочую последовательность действий.

Не:

один огромный промт → готовый комикс.

А, возможно:

идея → сценарий → проверка логики → персонаж → визуальная система → раскадровка → тестовые кадры → проверка последовательности → генерация → редактирование → текст → сборка.

И каждый этап должен иметь понятную задачу.

Если какой-то этап не работает — это нужно обнаружить отдельно, а не пытаться исправить всё новым промтом.

Пока я ничего не сгенерировал

И это тоже оказалось полезным результатом.

Первоначально мне хотелось сразу перейти к изображениям.

Но после этой проверки стало понятно, что красивый первый кадр сейчас ничего не докажет.

Мне нужно сначала понять, можно ли вообще построить повторяемую последовательность, которая позволит получить не одну хорошую картинку, а последовательную историю.

Потому что один удачный кадр — давно не проблема.

Проблема начинается со второго.

А потом с третьего.

И особенно с момента, когда все они должны стать одной историей.

Поэтому следующий шаг — не генерация.

Сначала я попробую разобраться, какие инструменты и способы работы сегодня действительно позволяют создавать последовательный визуальный рассказ, а не просто набор отдельных изображений.

И уже после этого попробую сделать первые тестовые кадры.

Пока результат такой:

Я не получил готовый способ создания комикса.

Зато обнаружил, что первый очевидный способ — попросить нейросеть написать один «идеальный промт» — оказался гораздо сложнее и менее надёжным, чем выглядел сначала.

Возможно, проблема вообще не в том, насколько умный промт мы напишем.

Возможно, важнее то, как мы разделим работу между человеком и AI.

Это я и хочу проверить дальше.