Когда я начинал этот эксперимент, я планировал сделать небольшой комикс из восьми сцен. Довольно простой: человек в офисе, компьютеры, графики, схемы, несколько диалогов. Никакой сложной архитектуры, никаких больших панорам. Мне казалось, этого будет достаточно.
Не хватило. Получилось скучно до скрежета зубов. И тогда я понял: если уж делать эксперимент, нет смысла специально упрощать историю до состояния, когда мне самому неинтересно на неё смотреть.
Так появился другой вариант — прагматичный нуар, промышленная архитектура, ретро-футуристические элементы и гораздо больше пространства для визуального повествования. Вместо восьми сцен получилось восемнадцать. И это, пожалуй, самое интересное, что произошло с этим экспериментом.
Я думал, что буду генерировать картинки. На самом деле пришлось заниматься постановкой.
Нейросеть сегодня сама по себе легко создаёт красивый кадр. Гораздо сложнее заставить несколько кадров работать как одну историю. Она любит очевидные решения: неон, симметрию, футуристические здания, слишком много деталей, эффектный свет. Всё это может выглядеть впечатляюще. Но если дать модели слишком много свободы, довольно быстро получается не история, а набор красивых картинок.
Поэтому мне пришлось постепенно выстраивать собственные ограничения: не киберпанк, не глянцевый футуризм, не огромные симметричные здания. Вместо этого — промышленная архитектура, металл, старые конструкции, неровный свет. Меньше декоративности, больше фактуры.
История осталась прежней
Я взял за основу свой текст из поста «Pragmatic Terminal» — исследование о том, почему я пока отложил идею искать, где именно бизнес теряет деньги. Мне хотелось проверить простую вещь: можно ли из текста, который не был написан как сценарий, сделать самостоятельную визуальную историю. Не иллюстрировать отдельные абзацы, а рассказать ту же мысль другим способом.
И тут неожиданно ключевым оказался ритм, то, что я сначала считал просто технической задачей. Если герой должен идти, это один кадр. Если он остановился, нужен другой. Если вокруг него появляется пространство, камера должна отойти. Если происходит что-то важное, наоборот, нужно приблизиться. Постепенно я начал мыслить не абзацами, а сценами и логичными переходами между ними. Где читатель должен задержаться? Где быстро проскочить? Где оставить пустоту? Где нужен общий план? Где достаточно детали?
Вертикальный формат оказался здесь очень кстати. Я мог строить историю сверху вниз, буквально управляя расстоянием между сценами. Пустое пространство стало частью повествования.
Как я разговаривал с нейросетью
Для работы я использовал бесплатные нейросети на смартфоне. Одну для подготовки описаний будущих кадров, другую непосредственно для генерации изображений.
Сначала я попытался поручить текстовой модели написать саму историю, реплики и сцены. Не получилось. Точнее, технически получилось, но результат мне не понравился: слишком гладкий, предсказуемый, банальный. Возможно, с точки зрения самой нейросети он был даже лучше моего первоначального текста, но это не имело значения — мне он не нравился.
Поэтому я оставил текстовую модель в другой роли: она стала инструментом для подготовки промтов. И вот здесь результат оказался неожиданно хорошим. Поставил бы ей 9 из 10. Один балл снимаю за то, что небольшие правки всё-таки приходилось делать вручную. Повторяемость сцен оказалась достаточно высокой: я генерировал несколько вариантов (чаще всего три), выбирал лучший и переходил к следующей сцене. Были сцены, которые не получались, но иногда проблема была даже не в нейросети — я сам не мог нормально сформулировать, что именно хочу увидеть. И это оказалось полезным наблюдением: иногда проблема не в том, что AI «не понимает задачу», а в том, что человек сам ещё не понял, какую задачу ставит.
С генерацией картинок оказалось проще, чем я думал. В большинстве случаев хватало одного подготовленного описания, без длинной серии дополнительных инструкций. Это особенно интересно в сравнении с моим первым экспериментом, когда я пытался контролировать буквально всё и только усложнял результат. Теперь я задавал настроение, композицию, несколько ключевых объектов и технические ограничения. А детали оставлял модели. Именно это, похоже, и сработало лучше — не лезть в каждую мелочь.
Что я сознательно оставил «ручным»
Текст (баблы и реплики) я не стал генерировать вместе с изображениями. Не потому, что уверен, что модель с этим не справилась бы, я просто этого не проверял. Мне понравился сам процесс создания сцен, и не хотелось рисковать хорошим изображением ради эксперимента с типографикой. Кроме того, с самого начала я решил, что хочу собрать комикс вручную, поэтому текст появится уже на этапе склейки отдельных сцен в единую вертикальную ленту. Это тоже часть эксперимента: AI создаёт отдельные элементы, а человек собирает из них произведение.
В одной из сцен я использовал фотографию, которую сам когда-то сделал для блога, обычную чашку кофе. Она неожиданно очень хорошо подошла к атмосфере сцены. Я немного изменил освещение, чтобы фотография не выпадала из общего визуального ряда, и оставил её. Мне понравилась сама идея такого смешения: не всё в работе обязательно должно быть сгенерировано нейросетью. Если реальная фотография подходит лучше, почему бы её не использовать?
А ещё я специально оставил немного ручной работы. Для небольших правок я использовал Jump, но не потому, что без него сцена была бы непригодна. Скорее наоборот: некоторые изображения мне настолько понравились, что захотелось самому немного вмешаться в них, добавить небольшую деталь, что-то изменить, оставить пасхалку. В какой-то момент я понял, что мне вообще нравится эта часть процесса. Это важно: я не хотел, чтобы AI сделал всё за меня. Мне не нужна была кнопка «Создать комикс». Мне было интересно самому собрать его из разных частей.
Где теперь проходит граница?
Первоначально я ставил довольно техническую задачу: можно ли с помощью AI создать последовательный вертикальный комикс? Теперь вопрос стал немного другим: где проходит граница между генерацией и авторской работой?
Нейросеть может создать сцену. Но не она решила, что история должна состоять из восемнадцати сцен, а не восьми. Не она сменила офис на промышленную архитектуру. Не она написала окончательный текст. Не она выбрала, какой из трёх вариантов оставить. Не она добавила фотографию с чашкой. И не она решила, где оставить пустое пространство между сценами.
Получается странная конструкция: AI сделал значительную часть визуальной работы, но чем больше я с ним работал, тем меньше этот процесс напоминал автоматическую генерацию и тем больше — обычную работу режиссёра, редактора и монтажёра. Только часть инструментов теперь находится внутри нейросети.
Что получилось в итоге
Комикс сейчас практически готов: осталось собрать финальную ленту и сделать титры. Вместо первоначальных восьми сцен — восемнадцать. И, неожиданно для меня самого, простой текст превратился в историю, которую мне действительно интересно смотреть.
В начале эксперимента я вообще сомневался, что из моего поста от 11.08.2026 получится сделать что-то не банальное. Сейчас у меня уже есть несколько идей, которые хочется попробовать в следующем комиксе. Возможно, он будет совсем другим: длиннее, более продуманным, с большим количеством сцен. И, скорее всего, с теми же принципами: меньше автоматизации ради автоматизации, больше осознанных ограничений и ручных решений.
Пока я не знаю, станет ли этот формат частью проекта. Но теперь я точно знаю одну вещь: AI действительно может быть инструментом создания последовательного визуального повествования. По крайней мере, в моём случае этот эксперимент дошёл до результата.
Теперь осталось проверить самое интересное: захочет ли кто-нибудь это читать?
Pragmatic Terminal
Один хороший кадр — ещё не комикс. Теперь мне нужно проверить, можно ли повторить этот результат не один раз, а построить из таких кадров последовательную историю.
После первой попытки стало понятно, что проблема была не только в качестве отдельных изображений.
Я слишком сильно пытался управлять нейросетью.
Чем подробнее становились описания персонажа, сцены, света, позы и деталей, тем менее предсказуемым становился результат.
При этом самое первое изображение, которое мне действительно понравилось, было сделано с гораздо более простым описанием.
Поэтому я решил не просто продолжать генерировать новые картинки, а вернуться на один шаг назад и пересмотреть сам инструмент, которым я описываю будущий комикс.
У меня получилось два варианта.
Условно назову их Промт 2 и Промт 3.
Общее у них вот что.
Оба решают одну и ту же задачу.
Они должны помочь построить вертикальный scroll-комикс и описать его не как набор отдельных изображений, а как последовательное визуальное повествование.
В обоих есть: логика сюжета, последовательность сцен, кинематографический язык, типы планов, композиция, движение взгляда, работа с текстом, цвет, свет, технические ограничения, процесс от концепции до раскадровки, формат описания кадров, ограничения.
То есть Промт 3 не является новой концепцией.
Это попытка адаптировать уже разработанный подход к тому, с чем я столкнулся на практике.
Здесь появилась важная разница.
Промт 2 оказался слишком универсальным.
Он получился серьёзным — хорошо проработана сценарная сторона.
Например, он заставляет проверять:
что происходит в сцене,
почему это происходит,
как одно действие приводит к следующему,
какую функцию выполняет каждый кадр,
как развивается эпизод,
не возникает ли логических дыр.
Есть даже подробный пример микро-сцены, показывающий, как эту структуру применять.
Это сильная сторона.
Для создания истории такой подход мне нравится.
Но после первой генерации я увидел проблему.
Промт 2 почти не учитывает, в каких условиях я реально работаю.
Я не строю сейчас производство комиксов с профессиональной командой и дорогими инструментами.
Моя задача намного скромнее:
бесплатные или доступные нейросети, смартфон, вертикальный формат и возможность самостоятельно пройти весь путь от сценария до готовой публикации.
И здесь некоторые требования Промта 2 становятся скорее недостатком.
Первая проблема — размер.
В Промте 2 используется условный стандарт Webtoon с шириной холста 800 px.
Для моей задачи это не то, что мне нужно.
Я хочу создавать отдельные вертикальные кадры непосредственно под экран смартфона.
Поэтому в Промте 3 появляется конкретное техническое ограничение:
1440 × 3120 px, соотношение сторон 19.5:9.
И это должно быть не пожеланием, а обязательным параметром.
Первый эксперимент уже показал мне простую вещь:
если написать нейросети «изображение на весь экран телефона», она может интерпретировать это слишком свободно.
Когда я указал конкретное соотношение сторон, результат стал гораздо предсказуемее.
Значит, бытовое описание нужно заменить техническим.
Дальше — детали.
Это, пожалуй, главный урок предыдущей генерации.
Я пытался подробно описывать персонажа:
кепка, очки, шеврон, портупея, рюкзак, фонарь и другие элементы.
Логика казалась очевидной:
чем точнее я опишу персонажа, тем лучше нейросеть его сохранит.
На практике получилось наоборот.
Чем больше деталей я добавлял, тем чаще модель начинала путаться.
Что-то исчезало.
Что-то менялось.
Что-то появлялось там, где не должно было быть.
Поэтому в Промте 3 появляется противоположный принцип:
не пытайся контролировать каждую деталь.
Нейросети задаются:
общее настроение, композиция, несколько ключевых объектов, основные характеристики персонажа.
А мелкие детали остаются на её усмотрение.
В описании сцены — не больше 3–5 ключевых элементов.
Без длинных списков аксессуаров.
Без сложных поз.
Без попытки одновременно задать анатомию, направление взгляда, положение каждой руки и десяток объектов на заднем плане.
Это не означает, что модели нужно полностью довериться.
Контроль остаётся.
Но он должен быть иерархическим:
сначала главное, потом второстепенное.
Третье: сценарий и промт для генерации — не одно и то же.
Здесь я тоже изменил подход.
В Промте 2 описание кадра одновременно содержит:
драматургическую функцию, композицию, свет, движение, окружение, визуальные связи, детали персонажа.
Получается довольно большой текст.
Его можно использовать человеку для понимания сцены.
Но если попытаться почти целиком отправить его в нейросеть, возникает та же проблема, с которой я уже столкнулся:
слишком много инструкций.
Поэтому в Промте 3 я разделил два уровня.
Описание кадра — это информация для человека.
Здесь можно объяснить:
что происходит, зачем нужен кадр, какая эмоция, какой план, какое место он занимает в истории.
Промт для генерации — это уже короткая техническая инструкция непосредственно для модели.
Например:
вертикальное изображение 1440×3120, нуарная атмосфера, заброшенное помещение, человек в плаще, один источник света, влажный пол, высокий контраст.
То есть сценарист сначала понимает сцену, а потом переводит её в гораздо более короткую инструкцию.
Это разные задачи.
И, похоже, их не стоит смешивать.
Что я поменял.
Таким образом, я не стал выбрасывать Промт 2.
Я оставил в нём то, что оказалось полезным:
сценарную логику и последовательность повествования.
А техническую часть упростил и адаптировал под реальные ограничения.
В Промте 3 появились:
обязательный вертикальный формат 1440×3120,
соотношение сторон 19.5:9,
отдельное поле для промта генерации,
ограничение количества ключевых объектов,
короткие предложения,
запрет на перегруженные описания,
отказ от сложных поз без необходимости,
отказ от избыточных аксессуаров,
принцип упрощения после неудачной генерации вместо бесконечного добавления новых инструкций.
Последний пункт особенно важен.
Раньше логика была:
не получилось — добавить деталей.
Теперь хочу проверить другую:
не получилось — упростить.
При этом я не считаю Промт 3 автоматически лучшим.
Здесь есть важная оговорка.
Пока это только гипотеза.
Я не знаю, будет ли Промт 3 работать лучше.
Он выглядит более подходящим для моих условий, потому что учитывает уроки предыдущей генерации.
Но это ещё не результат.
Вполне возможно, что я обнаружу новую проблему.
Например:
персонаж станет стабильнее, но сцены потеряют выразительность.
Или формат будет правильным, но композиция окажется слишком однообразной.
Или отдельные кадры будут выглядеть хорошо, но при последовательном просмотре не возникнет ощущения истории.
Последний вариант особенно важен.
Потому что я всё ещё решаю первоначальную задачу:
получить не несколько красивых изображений, а последовательное визуальное повествование.
Поэтому следующий тест будет важнее предыдущего.
Смогу ли я повторить результат несколько раз и сохранить между кадрами связь?
Именно здесь начинается настоящий эксперимент.
Мне нужно проверить сразу несколько вещей.
Персонаж — будет ли это один и тот же человек?
Пространство — будет ли ощущаться, что сцены происходят в одном мире?
Визуальный язык — сохранится ли свет, цвет, контраст и общее настроение?
Композиция — смогу ли я менять планы и ракурсы, не разрушая визуальную систему?
Нарратив — будет ли кадр №2 продолжать кадр №1, а не просто существовать рядом с ним?
И наконец:
процесс — смогу ли я повторять это без того, чтобы каждая новая сцена превращалась в отдельную борьбу с нейросетью?
Что получилось в итоге.
Промт 2 оказался полезным.
Он хорошо решает задачу построения истории, но оказался недостаточно адаптирован к моим реальным техническим ограничениям.
Промт 3 — попытка исправить это.
Он не должен сделать модель умнее.
Он должен сделать мою инструкцию проще и реалистичнее.
Разница существенная.
Я не пытаюсь заставить нейросеть понять всё.
Я пытаюсь понять, что ей действительно необходимо сообщить, чтобы получить управляемый результат.
Теперь это можно проверить только практикой.
Следующий этап — взять Промт 3 и попробовать построить несколько связанных кадров.
Если получится — двигаемся дальше.
Если снова возникнут проблемы — значит, появилась следующая информация о том, как на самом деле работает этот процесс.
Пока у меня есть только гипотеза.
Теперь нужен следующий эксперимент.
Pragmatic Terminal
Первая попытка генерации: что пошло не так
После всей подготовительной работы — выбора формата, проработки промта, фиксации визуального подхода — наконец-то дошло до генерации.
Я ожидал, что теперь всё пойдёт относительно гладко: есть сценарий, есть правила, есть палитра. Осталось только начать.
Первое изображение действительно получилось хорошим.
Атмосфера: заброшенный вычислительный центр, ретро-футуризм, мрачный свет.
Я подумал: «Вот оно. Работает».
А потом начались проблемы.
Сначала проблема была в размере.
Изображение не соответствовало экрану телефона.
Я указал модель — S25 Ultra. Но формулировка вроде «на весь экран телефона» не дала нужного результата.
Когда я задал точное соотношение сторон, результат стал соответствовать задаче.
Это было первое полезное наблюдение:
для конкретной технической характеристики общее бытовое описание оказалось менее эффективным, чем точное числовое ограничение.
Казалось бы, мелочь.
Но для комикса это важно: если формат кадра заранее определён, его нужно задавать как техническое требование, а не надеяться, что модель правильно интерпретирует описание.
Дальше — персонаж.
Я попытался прописать его максимально подробно:
кепка, очки, шеврон, портупея, рюкзак, фонарь.
Логика была простой:
чем точнее описание, тем стабильнее должен получаться персонаж.
Но результат оказался другим.
При увеличении количества обязательных деталей стабильность не улучшилась. Некоторые элементы исчезали, менялись или начинали конфликтовать друг с другом.
Кепка съезжала.
Шеврон исчезал.
Аксессуары менялись от генерации к генерации.
В итоге я начал убирать детали.
Оставил только несколько основных элементов:
плащ, свитер, ботинки.
Персонаж стал стабильнее.
Но на этом этапе я уже потратил довольно много времени.
Сцена вышла ещё сложнее.
Здесь проблема стала ещё заметнее.
Я пытался описывать сцену почти как режиссёр:
труба, пропасть, луч фонаря, положение героя, направление света, масштаб объектов.
Но генерации продолжали нарушать отдельные элементы.
То рука получалась неправильной.
То фонарь освещал не то место.
То масштаб героя относительно пространства менялся.
Я пытался исправлять результат дополнительными инструкциями.
Но чем больше деталей добавлял, тем сложнее становилось получить одновременно правильную сцену.
В какой-то момент я понял, что проблема уже не в отсутствии инструкций.
Инструкций стало слишком много.
И здесь произошло самое интересное.
Первое удачное изображение было создано довольно простым, почти интуитивным промтом.
А дальше я начал пытаться контролировать каждый элемент изображения.
И именно тогда результат стал хуже.
Получается парадокс:
я добавлял инструкции, чтобы получить больше контроля, но увеличение количества инструкций контроля не дало.
Более того, некоторые дополнительные ограничения начали мешать друг другу.
Это заставило меня пересмотреть первоначальное предположение.
Возможно, проблема не в том, что промт недостаточно подробный.
Возможно, сам способ управления визуальной частью через подробный промт оказался слишком директивным для этой задачи.
На чём я остановился
После десятков итераций я так и не получил сцену, которая устраивала бы меня целиком.
Можно было продолжать.
Ещё один промт.
Ещё одна генерация.
Ещё одна попытка исправить предыдущую.
Но в этот момент продолжение эксперимента превращалось бы просто в попытку случайно получить хороший результат.
А это уже не исследование.
Поэтому я остановился.
Что я из этого вынес
Первоначальная гипотеза была примерно такой:
чем подробнее я опишу изображение, тем больше контроля получу над результатом.
На этой серии генераций она не подтвердилась.
Конечно, из этого не следует, что подробные промты вообще не работают.
Я проверял конкретный способ управления визуальной частью конкретного workflow.
И получил конкретный результат:
увеличение количества директивных деталей не дало ожидаемого увеличения контроля.
Разница существенная.
Следующая гипотеза
Теперь я хочу попробовать противоположный подход.
Не пытаться описать каждую деталь.
Задать:
общее настроение, композицию, несколько ключевых объектов, отношения между ними.
А второстепенные детали оставить генератору.
Возможно, более свободное описание даст больше стабильности.
Возможно, нет.
Это как раз следующая проверка.
Первый результат оказался не тем, который я хотел получить.
Но это не провал.
Гипотеза не подтвердилась. Следующая гипотеза — впереди.
Pragmatic Terminal
Почему я решил делать вертикальный комикс, а не классический
В прошлый раз я остановился на том, что один большой промт — не решение. Нужен не «идеальный текст для AI», а понятный производственный процесс.
Дальше вопрос: а какой именно комикс мы пытаемся сделать?
Можно было бы пойти привычным путём — классическая страница с несколькими панелями, развороты, Z-образное чтение. Но почти сразу я упёрся в несколько проблем, которые для моей ситуации оказались решающими.
И все они указывали в сторону вертикальной ленты — формата, который часто называют scroll-comic. При этом сам способ постановки кадров я хочу строить с использованием кинематографического языка.
С классической страницей одна проблема: слишком много переменных
В классическом комиксе страница — сложная конструкция.
Панели разного размера и формы, их взаимное расположение, баланс текста и пустот, направляющие линии для взгляда — всё это должно работать вместе.
Если ошибиться в одной панели, может рассыпаться вся страница.
Для AI это означает ещё один уровень сложности на этапе сборки. Можно получить несколько хороших отдельных сцен, но собрать из них работающую страницу — уже отдельная задача.
Мне нужно было найти способ уменьшить количество переменных, не потеряв при этом выразительность.
Вертикальный скроллинг: меньше сборки, больше контроля
Вертикальная лента устроена принципиально иначе.
Вместо сложной страницы — последовательность кадров, расположенных сверху вниз. Читатель просто движется по истории скроллингом.
Для моей задачи — проще.
Исчезает сложная вёрстка страницы.
Не нужно собирать панели в мозаику и одновременно контролировать всю геометрию страницы.
Кадры можно создавать и исправлять отдельно, а затем располагать последовательно.
Это должно уменьшить количество зависимостей между отдельными сценами.
Темп можно задавать пространством
В классическом комиксе пауза создаётся размером и формой панели.
В вертикальной ленте эту функцию может выполнять пространство между кадрами.
Небольшой отступ — быстрый переход.
Большой — пауза.
Пустота между двумя сценами может стать частью повествования.
Для сценария это тоже проще: вместо сложной геометрии страницы можно управлять последовательностью и расстоянием между сценами.
Меняется контроль внимания
На экране смартфона читатель обычно видит только часть истории.
Следующий кадр появляется по мере движения вниз.
Это позволяет использовать паузы, постепенное раскрытие информации и смену масштаба без необходимости заранее показывать читателю всю страницу.
Я пока не утверждаю, что это автоматически делает формат лучше. Это гипотеза, которую ещё предстоит проверить на практике.
Кинематографичность без лишней сложности
Я хочу использовать вертикальную ленту не просто как последовательность картинок, а как визуальный рассказ с элементами киноязыка.
Условно:
средний план, диалог, крупный план, деталь, общий план.
Такой подход мне кажется удобным ещё и потому, что у кино уже существует достаточно понятный язык визуального повествования.
Не нужно писать:
«Сделай красивую драматическую сцену».
Можно задать более конкретную задачу:
«Средний план. Персонаж находится у стола. Затем крупный план его лица. Затем общий план комнаты».
Это не гарантирует успех, но даёт хоть какую-то систему.
Для моего эксперимента это именно то, что сейчас нужно.
Почему я решил делать комикс прямо на Hugo
Здесь выбор формата неожиданно оказался связан с самим сайтом.
Hugo генерирует страницы из текстовых файлов, а сам комикс в выбранном формате не требует сложной журнальной вёрстки.
Последовательность изображений можно вывести вертикально, управляя расстояниями между ними.
То есть я могу построить отдельный тип страницы для комиксов и полностью контролировать:
порядок кадров, размеры изображений, расстояния между сценами, текст, структуру страницы, способ публикации.
И самое важное — не зависеть от отдельной платформы для самого произведения.
Мне не обязательно загружать комикс на Webtoon, Tapas или другую площадку только потому, что там предусмотрен такой формат.
Я могу сначала создать его в собственной среде и уже потом решать, где ещё его показывать.
Это хорошо совпадает с тем, что я параллельно исследую в других частях проекта: насколько много цифровой инфраструктуры человек может контролировать самостоятельно.
Что изменилось после выбора формата
Теперь задача стала значительно конкретнее.
Мне не нужно создавать универсальный промт, который умеет делать любые виды комиксов.
Мне нужно построить процесс для одного конкретного типа визуального повествования:
вертикальная лента
кадры идут последовательно
пространство между кадрами используется для управления темпом
текст добавляется отдельно или поверх изображения
постановка сцен опирается на понятный киноязык
визуальная система должна сохраняться от кадра к кадру.
Это гораздо более ограниченная задача.
Поэтому она выглядит проверяемой.
Я пока не знаю, действительно ли выбранный формат упростит производство.
Не знаю, насколько хорошо AI сможет удерживать последовательность персонажей и пространства.
Не знаю, сколько времени займёт создание одной законченной истории.
Но теперь у меня хотя бы есть конкретная система, которую можно проверить.
Следующий вопрос уже не о формате.
Можно ли пройти весь путь — от сценария до готовой ленты — с помощью AI, и повторить это снова?
Pragmatic Terminal
Можно ли поручить нейросети придумать, как сделать комикс?
Первым делом я не стал сразу генерировать изображения.
Нужно было сначала понять, можно ли вообще построить рабочий процесс создания последовательного комикса с помощью AI.
Поэтому я сделал то, что казалось самым очевидным: попросил нейросеть разработать для меня промт для работы над комиксом.
AI выдал амбициозный промт
Нейросеть должна была одновременно выступать в роли сценариста, визуального режиссёра, редактора и критика. Для этого в промт были добавлены подходы и имена известных авторов комиксов — от Стэна Ли и Джека Кирби до Алана Мура и Майка Миньолы.
Получился очень убедительный текст.
Настолько убедительный, что сначала он мне понравился.
А потом я начал разбирать его по частям.
И обнаружил несколько проблем.
Слишком много разных подходов. Кто тут вообще главный?
Первая проблема — в самой конструкции.
В промте были собраны авторы, работавшие совершенно по-разному.
Например, Marvel Method Стэна Ли предполагал гораздо большую свободу художника, тогда как сценарии Алана Мура известны детальной проработкой сцен. Джек Кирби вообще был настолько самостоятельным визуальным автором, что его рисунок мог существенно менять первоначальный замысел истории.
Я фактически попросил одну модель одновременно работать по нескольким разным философиям создания комикса.
Получилась не команда специалистов, а смесь требований.
И здесь первая проблема:
количество авторитетных имён ещё не превращает промт в рабочую методологию.
Можно перечислить десять великих авторов и получить очень впечатляющую инструкцию.
Но инструкция от этого не становится лучше.
«Визуальный режиссёр» оказался слишком красивым названием
Вторая проблема оказалась интереснее.
Промт предлагал модели «мыслить кадрами», как визуальный режиссёр.
Но текстовая модель не видит готовую страницу так, как её видит человек-художник или режиссёр.
Она может описать: крупный план, свет слева, персонаж смотрит вправо, на заднем плане окно, камера снизу.
Это действительно полезно.
Но подробное описание кадра ещё не является визуальной проверкой самого кадра.
Можно идеально описать каждую панель отдельно и обнаружить после генерации, что две соседние панели плохо работают вместе.
Персонаж может оказаться слишком далеко.
Направление взгляда может нарушить движение глаза по странице.
Композиция одного кадра может конфликтовать со следующим.
А отдельные изображения, каждое из которых само по себе выглядит хорошо, могут вообще не восприниматься как последовательная история.
Разница вот в чём:
описание кадра не равно визуальная проверка последовательности.
Поэтому вместо абстрактного требования «мыслить как визуальный режиссёр» гораздо честнее дать модели конкретные параметры, которые она действительно может описать:
план, точку зрения, положение персонажей, направление взгляда, источник света, фон, действие, эмоцию, связь с предыдущим и следующим кадром.
Это не заменяет визуального мышления человека. Но хотя бы не делает вид, что заменяет.
Может ли AI быть собственным критиком?
Третья проблема появилась в разделе, где нейросети предлагалось критически оценивать собственные решения.
На первый взгляд идея разумная.
Попросить модель:
«Если видишь проблему — скажи. Если сцена слабая — предложи другой вариант».
Но здесь есть ловушка.
Модель может очень убедительно сформулировать критику.
Это ещё не означает, что критика правильная.
Она может сказать, что поворот «слишком банальный», что сцена «не имеет эмоционального веса», что диалог «не достаточно выразительный».
Но откуда я знаю, что это действительно так?
Если я сам не понимаю, почему решение плохое, красивое объяснение модели не превращается автоматически в доказательство.
Поэтому я решил сузить её роль. Не просить AI определять, что является «гениальным», «сильным» или «работает как у великого автора».
А просить находить то, что можно проверить:
логические противоречия, несоответствия между сценами, нарушение заданных ограничений, повторения, потерю информации, проблемы с последовательностью действий.
То есть не:
«Скажи, хорошее ли это искусство».
А:
«Найди то, что не соответствует заданным условиям».
Это гораздо более скромная задача.
И, возможно, поэтому более полезная.
Ещё одна проблема — слишком много ролей
В исходном промте AI должен был одновременно быть:
Проблема здесь не в том, что AI не может выполнять разные задачи.
Может.
Проблема в другом.
Когда все эти задачи объединены в одну инструкцию, становится трудно понять, какой именно этап сейчас выполняется и почему получился именно такой результат.
Если сценарист одновременно думает о цвете, художник — о драматургии, а критик — о стиле конкретного автора, роли начинают смешиваться.
Вместо производственного процесса получается один огромный промт.
А мне нужен не впечатляющий промт. Мне нужен процесс, которым можно управлять.
И последний вопрос: кто здесь принимает решение?
Это оказалось самым важным.
Допустим, я даю модели концепцию.
Она предлагает структуру.
Потом раскадровку.
Потом описания кадров.
Потом варианты диалогов.
Всё выглядит профессионально.
Но кто решил, что именно этот вариант нужно использовать?
Не AI.
Он просто предложил следующий вариант.
Решение всё равно принимаю я.
И это нормально.
Более того, именно это я и хочу проверить в этом проекте.
Мне не нужен AI, который изображает из себя автономного автора.
Мне нужен инструмент, который помогает мне пройти сложную работу быстрее и качественнее.
Что изменилось после этой первой попытки
Я начинал с мысли:
«Нужно найти хороший промт для создания комикса».
Теперь думаю иначе.
Нужно найти рабочую последовательность действий.
Не:
один огромный промт — готовый комикс.
А, возможно:
идея — сценарий — проверка логики — персонаж — визуальная система — раскадровка — тестовые кадры — проверка последовательности — генерация — редактирование — текст — сборка.
И каждый этап должен иметь понятную задачу.
Если какой-то этап не работает — это нужно обнаружить отдельно, а не пытаться исправить всё новым промтом.
Пока я ничего не сгенерировал
И это тоже оказалось полезным результатом.
Первоначально мне хотелось сразу перейти к изображениям.
Но после этой проверки стало понятно, что красивый первый кадр сейчас ничего не докажет.
Мне нужно сначала понять, можно ли вообще построить повторяемую последовательность, которая позволит получить не одну хорошую картинку, а последовательную историю.
Потому что один удачный кадр — давно не проблема.
Проблема начинается со второго.
А потом с третьего.
И особенно с момента, когда все они должны стать одной историей.
Поэтому следующий шаг — не генерация.
Сначала я попробую разобраться, какие инструменты и способы работы сегодня действительно позволяют создавать последовательный визуальный рассказ, а не просто набор отдельных изображений.
И уже после этого попробую сделать первые тестовые кадры.
Пока результат такой:
Я не получил готовый способ создания комикса.
Зато обнаружил, что первый очевидный способ — попросить нейросеть написать один «идеальный промт» — оказался гораздо сложнее и менее надёжным, чем выглядел сначала.
Возможно, проблема вообще не в том, насколько умный промт мы напишем.
Возможно, важнее то, как мы разделим работу между человеком и AI.
Это я и хочу проверить дальше.
Pragmatic Terminal
Почему я пока отложил идею искать, где бизнес теряет деньги
Есть проблемы, которые действительно существуют.
Есть проблемы, за решение которых бизнес готов платить.
А есть проблемы, которые выглядят очень привлекательными, но требуют такого доступа к внутренней информации компании, что возникает другой вопрос:
а могу ли я вообще начать решать эту проблему из своей текущей точки?
Это я и решил проверить.
Гипотеза
Одна из проблем, которая давно меня интересует:
бизнес тратит деньги на привлечение клиентов, получает заявки, но не всегда понимает, где именно теряет потенциальные продажи.
Человек увидел рекламу.
Перешёл на сайт.
Оставил заявку.
Кто-то должен ответить.
Потом должен состояться разговор.
Потом предложение.
Потом решение о покупке.
На каждом этапе потенциальный клиент может исчезнуть.
При этом предприниматель может видеть стоимость рекламы и количество заявок, но не видеть всей цепочки целиком.
На первый взгляд это очень подходящая задача для AI.
AI может анализировать большие объёмы переписки, звонков, CRM-данных и искать закономерности, которые человеку трудно заметить.
Тут я спросил себя кое-что другое:
Что мне понадобится, чтобы действительно найти эту утечку?
Первый фильтр — ACCESS
У меня есть простой фильтр.
ACCESS означает не только «существует ли проблема», а:
могу ли я получить доступ к информации и среде, необходимым для её исследования, не обладая заранее репутацией, должностью или внутренним мандатом?
В данном случае потенциально полезны: данные рекламных кабинетов, CRM, статусы сделок, время первого ответа, переписка, записи звонков, конверсии между этапами, причины отказов, средний чек, стоимость привлечения клиента.
Но тут появилась первая сложность.
Не обязательно иметь всё это сразу.
Даже рекламные расходы вместе с данными CRM уже могут показать некоторые закономерности.
Например, можно увидеть, что один канал приводит много дешёвых лидов, но почти не приводит к продажам.
Можно обнаружить задержки между заявкой и первым контактом.
Можно увидеть провалы на определённом этапе воронки.
То есть проблема не бинарная:
«либо полный доступ, либо ничего».
Может существовать постепенный доступ к данным — от минимального набора к более глубокому анализу.
И это существенно меняет картину.
Дальше вопрос такой.
Если частичных данных достаточно для первой гипотезы, почему бы просто не получить их у предпринимателя?
И здесь начинается уже не техническая, а экономическая проблема.
Чтобы владелец бизнеса дал постороннему человеку даже часть внутренней информации, должна быть причина доверять.
Это может быть: личное знакомство, рекомендация, уже существующий клиентский контакт, репутация, предыдущие кейсы, бесплатный эксперимент с ограниченным доступом.
То есть доступ возможен.
Но у меня сейчас нет потока таких компаний.
Не хочу притворяться, что этого барьера не существует.
А можно создать собственный полигон?
Да.
Это ещё один вариант, который я сначала недооценил.
Можно создать собственный небольшой бизнес или проект:
Затем самому провести эксперимент и показать, как AI обнаруживает проблему в воронке.
Это действительно позволяет получить первый кейс без доступа к чужой компании.
Но здесь появляется другое ограничение.
Собственный эксперимент докажет, что метод работает в моей собственной контролируемой системе.
Он ещё не докажет, что тот же метод работает в совершенно другом бизнесе — с другим продуктом, клиентами, рекламой, менеджерами и процессами.
Кроме того, чтобы получить достаточно данных для серьёзного эксперимента, нужно сначала создать сам поток клиентов.
А значит, я уже начинаю строить отдельный бизнес только для того, чтобы получить полигон для другого бизнеса.
Это возможно.
Но это уже совсем другая цена вопроса.
Можно пойти через знакомых
Ещё один очевидный вариант — найти несколько предпринимателей через личные связи или рекомендации и предложить провести ограниченный эксперимент.
Это, вероятно, самый реалистичный способ проверить гипотезу доступа.
И здесь я должен быть честным:
пока не проверял.
Поэтому утверждать, что доступ невозможен, было бы неправильно.
Возможно, первый предприниматель согласится.
Возможно, второй.
Возможно, после первого эксперимента появится кейс и следующий доступ станет значительно проще.
Так почему же я всё-таки не берусь за неё в первую очередь?
Потому что мой вопрос сейчас немного другой.
Я не пытаюсь доказать, что эту проблему невозможно решить.
Я пытаюсь найти проблему, с которой человек из моей текущей точки может начать экспериментировать самостоятельно.
Тут появляется важная разница.
Есть проблемы, где необходимый материал находится снаружи:
у чужого бизнеса, в его CRM, рекламных кабинетах, разговорах и внутренних процессах.
А есть проблемы, где весь необходимый материал я могу создать или получить самостоятельно.
Для первого типа проблем мне сначала нужно получить доступ.
Для второго я могу начать эксперимент завтра.
И если у меня есть несколько потенциальных направлений, это становится важным экономическим фактором.
Что я понял
Первоначально я сформулировал вывод слишком жёстко:
«Нет доступа к данным — значит, проблема не решается».
Это неправильно.
Правильнее:
Чем больше ценность решения зависит от закрытых данных, тем больше сама точка входа зависит от доверия и доступа.
Это не делает проблему плохой.
Это делает её дорогой для входа.
Поэтому статус этой гипотезы
Я не убиваю саму проблему.
И не утверждаю, что бизнес на её решении невозможен.
Я пока убираю её из числа первых экспериментов.
Мой текущий статус:
Проблема — GO.
AI как инструмент — GO.
Доступ — потенциально возможен, но требует отдельного эксперимента.
Как первая точка входа для меня сейчас — пока откладываю и просто наблюдаю.
Возможно, позже я вернусь к ней через собственный кейс или через предпринимателя, готового предоставить ограниченный доступ к данным.
Но сейчас мне важнее проверить следующие гипотезы.
Не потому, что эта проблема плохая.
А потому, что хорошая проблема ещё не означает хорошую точку входа.
В книге есть такая мысль: обучение гостей спешелти кофе — ключ к выживанию.
Но я бы перефразировал: сначала учимся сами. Вода, помол, первая заливка. Понимать, где что пошло не так. Как с исинским чайником — каждый пролив оставляет след.
Главное, что вынес: не гнаться за «правильно», а искать свой путь. Даже если на старте кажется, что вложился не туда. Страсть к делу заметна всегда. Она важнее холодного бизнес-плана.
Мы привыкли, что глаза все делают сами. Но смотреть и видеть не одно и то же. Нас учат читать, писать, считать. А видеть? Не уверен.
Эту книгу я купил в 2006 году.
Думаю, я все еще учусь видеть. Замечать, как падает свет, как лежит тень. Книга не дает ответов, она просто показывает, что вопрос есть. И задать его себе уже половина дела.
Главное, что я понял: видеть не талант, а привычка. Привычка останавливаться. Не пролистывать, а всматриваться. Понять, почему именно так. И в этом смысле книга работает как тренажер. Не для глаз, а для внимания.
И теперь, когда я смотрю на старую вещь или просто на свет за окном, я иногда ловлю себя на мысли: «А что я на самом деле вижу?»