Итеративное рисование LLM: поиск искренности в генерации изображений
Hacker News · оригинал
Материал подготовлен автоматизированной редакционной системой. Факты можно сверить по указанному первоисточнику.

Разработчик создал приложение, заставляющее языковые модели рисовать по одному мазку, чтобы проверить, добавляет ли этот процесс художественной искренности. Эксперимент показал, что модели часто разрушают начатое полотно из-за слабости пространственного мышления, что автор сравнивает с хрупкостью кода, генерируемого ИИ.
Ценность: Материал демонстрирует фундаментальные ограничения текущих мультимодальных моделей в последовательных задачах и предлагает новую метафору для понимания проблем при разработке ПО с помощью ИИ.
Языковые модели обладают поразительной способностью генерировать изображения по текстовому описанию за один шаг, создавая убедительные имитации различных художественных стилей. Однако автор проекта, разработчик из сферы программного обеспечения, отмечает, что этот процесс кажется ему художественно неудовлетворительным из-за его производного характера и мгновенности результата. Вдохновленный эссе Льва Толстого «Что такое искусство», где утверждается, что подлинное искусство должно быть доступным и передавать искренний моральный посыл, автор предпринял попытку изменить подход к генерации. Вместо однократного запроса он разработал приложение, которое заставляет модель-зрение (VLM) создавать картину итеративно, добавляя по одному мазку за раз и объясняя свои действия на каждом этапе.
Технически приложение работает в цикле: модель анализирует текущее состояние холста и концепцию, решает, какой следующий штрих будет наиболее уместным, и применяет его. Этот процесс повторяется до тех пор, пока модель не решит, что работа завершена, или не достигнет лимита итераций. Автор создал также веб-интерфейс, позволяющий просматривать каждый шаг создания изображения вместе с рассуждениями модели. Например, при создании «Пятнистого слона» в стиле детской иллюстрации модель Claude Opus 4.6 на 285-м шаге сосредоточилась на создании выразительного глаза, что демонстрирует логику ее действий.
Результаты эксперимента оказались неоднозначными и сильно зависели от мощности модели. Мелкие локальные модели часто генерировали неразборчивые каракули, тогда как фронтирные модели Anthropic, такие как Claude Opus 4.6 и 4.7, создавали узнаваемые изображения, соответствующие заданной теме. Однако даже лучшие модели демонстрировали эффект «ошибки композиции»: они отлично справлялись с глобальными задачами, но значительно хуже — с детализацией в малых масштабах. Модель Mistral Large, например, справлялась лучше при генерации пачками по 50 мазков, чем по 5, что указывает на проблемы с последовательным планированием.
Наиболее важным открытием автора стала визуализация хрупкости артефактов, созданных ИИ. В процессе итеративного рисования модели часто приходили к хорошим результатам, а затем необратимо разрушали их одним неудачным штрихом. Например, при создании иллюстрации джунглей модель Claude 4.6 на 300-м шаге создала узнаваемый абстрактный образ слона, но в последующие 150 шагов добавила хаотичные детали: «призрачное лицо», обезьяну с десятками глаз и разорванное тело попугая. Это произошло из-за того, что модели плохо владеют пространственным мышлением и тонкой моторикой, пытаясь исправить мелкие недочеты.
Автор проводит прямую параллель между этим художественным процессом и своим опытом ревью кода, сгенерированного LLM. В обоих случаях модель видит лишь ограниченный контекст (окно контекста) и стремится решить текущую проблему, часто жертвуя общей архитектурой. Как в рисовании, где один плохой мазок может испортить всю картину, так и в коде один плохо продуманный коммит может разрушить качество всего приложения. Восстановление такого состояния крайне затруднено, поскольку контент в обоих случаях носит преимущественно аддитивный характер.
Несмотря на то что автор не нашел искомой «искренности» в результатах, считая их бездушными производными иллюстрациями, он признает эстетическую ценность наблюдения за борьбой модели. Этот процесс борьбы между сохранением порядка и стремлением к прогрессу может рассматриваться как форма искусства по критериям Толстого: он доступен, не является «высоким искусством» и позволяет зрителю проецировать на него собственные смыслы. Проект остается открытым для экспериментов, позволяя пользователям или другим языковым моделям взаимодействовать с холстом через предоставленный API.