Архив рубрики ~Лента новостей~

Как контроллер диффузии объединяет и упрощает генерацию изображений с помощью ИИ.

Как контроллер диффузии объединяет и упрощает генерацию изображений с помощью ИИ.
Как контроллер диффузии объединяет и упрощает генерацию изображений с помощью ИИ.

Представляем Diffusion Controller — облегченную сеть «демпфера управления», которая точно направляет генерацию изображений для достижения значительно лучшего выравнивания подсказок. Она легко подключается даже к моделям с ограниченным доступом и закрытым исходным кодом, повышая качество изображения без нарушения базовой стабильности.

Быстрые ссылки

Быстрое развитие моделей искусственного интеллекта для преобразования текста в изображения, таких как Nano Banana, Stable Diffusion и Flux, коренным образом изменило креативный дизайн, позволив любому создавать фотореалистичные изображения высокой точности на основе текстовых описаний. Однако управление этими масштабными моделями в соответствии с точными намерениями пользователя, конечными целями или строгими визуальными ограничениями остается сложной и непредсказуемой задачей. Например, представьте, что вы задаете модели запрос «ящерица в солнцезащитных очках». Модель может сгенерировать реалистичную ящерицу без солнцезащитных очков. Или же, принудительное включение солнцезащитных очков может исказить лицо ящерицы, ухудшив качество изображения.

Существующие методики, управляющие или дорабатывающие генерацию изображений, сильно разобщены. С одной стороны, разработчики используют методы, работающие на этапе вывода (например, управление диффузией без использования классификаторов), для корректировки влияния текстового запроса и управления процессом генерации изображений в режиме реального времени. С другой стороны, они полагаются на сложную доработку с использованием параметрически эффективных адаптеров, таких как LoRA, регрессии с учетом вознаграждения или градиенты политики, для изменения поведения модели.

Поскольку эти инструменты исторически рассматривались как отдельные и не связанные между собой решения, в этой области отсутствовал единый, основанный на принципах математический язык для объединения, анализа и оптимизации способов управления генеративными моделями. Такой фрагментарный подход часто вынуждает инженеров полагаться на догадки при балансировании между соответствием предпочтениям пользователя и качеством изображения.

Для решения этой задачи балансировки мы представляем структуру Diffusion Controller. Вместо того чтобы рассматривать генерацию изображений как жесткую последовательность изолированных шагов, Diffusion Controller переосмысливает весь процесс шумоподавления как плавную, непрерывную задачу управления. Наши результаты показывают, что облегченная дополнительная сеть Diffusion Controller превзошла отраслевой стандарт по соответствию человеческим предпочтениям. Более того, ее полностью разблокированная версия (т.е., тонко настроенная модель с «белым ящиком» или неограниченным доступом к изменению внутренних весов модели) достигла 90% успеха по сравнению с базовой моделью.

Структура контроллера диффузии

В рамках концепции Diffusion Controller процесс генерации изображений (когда модель ИИ начинает с произвольного шума и постепенно улучшает его, превращая в четкое изображение) рассматривается как плавно управляемый процесс. Представьте себе базовую предварительно обученную модель как огромный, мощный мотоцикл; перестройка его основного двигателя для изменения его характеристик неэффективна и рискованна. Вместо этого Diffusion Controller действует как легкий демпфер рулевого управления, прикрепленный к нему, в то время как основная модель (мотоцикл) остается полностью неподвижной и безопасно нетронутой.

Вместо того чтобы гадать, как управлять процессом генерации на каждом этапе, основной механизм контроллера диффузии (демпфер управления) динамически корректирует траекторию генерации по мере создания изображения. Он плавно перенастраивает стандартное поведение модели по умолчанию, придавая больший вес направлениям, которые максимизируют заданную пользователем цель (например, достижение художественного стиля или контекстного выравнивания).

Визуальная матрица, отображающая результаты базовых предварительно обученных моделей, LoRA и контроллера диффузии при обработке сложных запросов.

Благодаря математической оптимизации этих изменений в траектории генерации с использованием обратной связи, структура Diffusion Controller достигает баланса, успешно направляя процесс генерации модели в соответствии с новыми предпочтениями пользователя, полностью сохраняя при этом четкое визуальное изображение базовой модели и ее базовую стабильность. Возвращаясь к приведенному выше примеру с ящерицей, это означает, что демпфер управления направляет модель таким образом, чтобы солнцезащитные очки были включены, но срабатывает ограничительный механизм, предотвращающий искажение системой естественных чешуек и пропорций ящерицы для достижения этой цели.

От теории к практике

Чтобы превратить эту теоретическую задачу управления в практический инструмент, мы преодолели разрыв между абстрактными и потенциально трудноразрешимыми уравнениями, объединив их в два эффективных метода тонкой настройки, основанных исключительно на итоговом показателе вознаграждения:

  • Метод 1: Градиент политики и PPO (оптимизатор устойчивого состояния): Этот подход итеративно направляет модель посредством вычисленных, инкрементальных корректировок. Он включает в себя встроенное «правило отсечения», которое действует как ограничитель скорости, предотвращая внесение системой масштабных, непредсказуемых изменений в поведение модели, чтобы обеспечить плавное и стабильное обучение.
  • Метод 2: Функция потерь, взвешенная по вознаграждению (кратчайший путь): Этот метод функционирует как прямой путь оптимизации. Он щедро вознаграждает процессы генерации, дающие высококачественные результаты, обеспечивая математическую гарантию того, что модель надежно научится генерировать именно те типы изображений, которые задумали пользователи.

Сеть «демпферов рулевого управления»

Фреймворк Diffusion Controller работает как демпфер рулевого управления, решая масштабную реальную бизнес-задачу. Обычно для изменения поведения модели требуется доступ к «белому ящику», позволяющий проникнуть в её ядро и изменить внутренние настройки. Однако лучшие в мире модели генерации изображений часто являются корпоративными секретами (их называют «чёрными ящиками» или «серыми ящиками»).

Сеть демпфирования рулевого управления основана на идеальной инструкции по управлению движением, представляющей собой сочетание знаний базовой модели и небольшой коррекции. Она отслеживает изображение в процессе его очистки от статического шума и вносит точные, микроскопические корректировки рулевого управления. Это позволяет инженерам идеально контролировать и настраивать даже жестко запертые модели с закрытым исходным кодом, не затрагивая при этом базовый код.

Схема архитектуры системы, иллюстрирующая поток данных от входа через замороженную предварительно обученную базовую сеть и обучаемую боковую сеть диффузионного контроллера для получения комбинированного результата.

Схема высокого уровня, иллюстрирующая, как замороженная базовая сеть передает промежуточное обратное среднее значение в сеть контроллера диффузии для вычисления суммарного балла.

Эксперименты и результаты

Мы оценили возможности фреймворка Diffusion Controller, используя базовую архитектуру Stable Diffusion v1.4 в трех режимах тонкой настройки: контролируемая тонкая настройка (SFT), взвешенная по вознаграждению функция потерь (RWL) и PPO. Производительность измерялась с помощью стандартизированной оценки человеческих предпочтений (HPS-v2), чтобы определить, насколько хорошо сгенерированные изображения соответствуют запросам пользователя и его эстетическим предпочтениям.

В рамках системы Diffusion Controller мы реализовали четыре сетевые структуры:

  • Диффузионный контроллер: наша сеть демпфирования рулевого управления для доступа через «серый ящик» с промежуточным реверсивным средним значением в качестве входного сигнала и предлагаемым потоком бокового адаптера.
  • Наивный диффузионный контроллер: наивная конструкция сети демпфирующих устройств рулевого управления, в которой отсутствуют как промежуточный обратный поток, так и боковой адаптерный поток.
  • Диффузионный контроллер-J: наше решение на основе модели «белого ящика», предполагающее совместное обучение сети демпфирования рулевого управления и базовой модели.
  • Diffusion Controller-S: еще одно решение типа «белый ящик», предполагающее раздельное обучение сети демпфирования рулевого управления и базовой модели.
Три линейных графика, отображающие процент побед HPS в зависимости от количества шагов обучения, демонстрируют, что различные модели диффузионного контроллера стабильно превосходят базовую модель LoRA с течением времени.

Показатель побед HPS-v2 над предварительно обученной моделью на тестовом наборе подсказок HPS-v2 для всех настроек (каждая на своей контрольной точке): SFT ( сверху ), RWL ( посередине ) и PPO ( снизу ).

Результаты показали, что контроллер диффузии превосходно работает как в полностью доступных средах типа «белый ящик», так и в средах типа «серый ящик» с жесткими ограничениями, неизменно превосходя соответствующие базовые показатели и обеспечивая лучший компромисс между качеством и эффективностью.

В тестах SFT и RWL сеть демпфирования рулевого управления Diffusion Controller, разработанная по принципу «серого ящика», превзошла LoRA — передовой, параметрически эффективный подход «белого ящика» — по показателям побед в HPPS-v2. Это значительный шаг вперед, учитывая, что Diffusion Controller достиг этого, обрабатывая значительно меньше внутренних слоев модели, чем LoRA. Кроме того, в ходе всесторонней оценки экспертами Diffusion Controller показал лучшие субъективные результаты по качеству и соответствию заданию в сложных тестовых заданиях с множеством атрибутов.

Четыре столбчатые диаграммы, сравнивающие показатели успешности различных моделей диффузионного контроллера с базовыми показателями при использовании разных методов обучения и оценки.

Показатель побед в конце обучения в сравнении с базовыми показателями. На каждом графике представлены три парных сравнения: (серый прямоугольник) Диффузионный контроллер против Диффузионного контроллера-Naive; (белый прямоугольник) Диффузионный контроллер-J против LoRA; (белый прямоугольник) Диффузионный контроллер-S против LoRA. ( a — c ): показатели побед HPSv2 для SFT/RWL/PPO с оранжевыми полосами погрешностей, показывающими стандартное отклонение; ( d ): показатель побед, оцененный человеком, для PPO.

Ключевой особенностью фреймворка является его гибкость во время выполнения. Регулируя единственный параметр интенсивности управления на этапе вывода, пользователи могут динамически увеличивать или уменьшать интенсивность ограничений управления. Это позволяет плавно и точно настраивать выравнивание в режиме реального времени, не нарушая стабильность базового изображения и не вызывая визуальных искажений, характерных для более старых методов управления.

Заключение

Сочетая математическое управление с моделью генерации изображений, Diffusion Controller преодолевает разрыв между чистой математикой и современными инструментами для творчества. Вместо того чтобы полагаться на набор догадок и быстрых решений для настройки модели, он предоставляет единую, математически обоснованную систему для управления генерацией изображений. Более того, он предлагает практичный, легкий шаблон «демпфера управления», который отлично работает даже с моделями с ограниченным доступом и закрытым исходным кодом.

В перспективе эта единая платформа открывает захватывающие новые направления для исследований. Поскольку слой управления полностью отделен от основного движка модели, будущие разработчики смогут использовать Diffusion Controller не только для сопоставления текстовых подсказок. В ближайшие шаги можно будет использовать платформу для создания передовых инструментов персонализации, разработки надежных механизмов безопасности для предотвращения генерации вредоносного контента, а также адаптации сети демпфирования рулевого управления для управления сложными видеомоделями следующего поколения.

Благодарности

Мы хотели бы поблагодарить наших соавторов и коллег из Google Research, Google DeepMind и академических кругов за их вклад в эту работу.

Источник: research.google

Оцените материал:

Поделиться
Понравилась статья? Расскажите другим
ВКонтакте
Читайте также
Новости робототехники Компания Sanofi передала Cheplapharm 20 препаратов, находящихся на стадии разработки, NVIDIA поддержала Verily, Roche заключила сделку с Dualitas на сумму 1 миллиард долларов по разработке биспецифических препаратов. Архив рубрики ~Коротко из Telegram~ Amazon Web Services запустила программу по возвращению бывших сотрудников, в… Архив рубрики ~Коротко из Telegram~ ЮKassa запустила MCP-сервер, который позволяет подключать ИИ-агентов к платежной системе… Архив рубрики ~Коротко из Telegram~ В России могут расширить требования к предустановке отечественных ИИ-помощников на… Архив рубрики ~Коротко из Telegram~ AutoDraw — генерирует рисунок из каракулей Искусственный интеллект и машинное… Архив рубрики ~Коротко из Telegram~ Casberry — позволяет создавать визуальные 3D-эффекты в пару кликов. —… Архив рубрики ~Коротко из Telegram~ Agency Agent — целая армия ИИ-агентов, готовых решать любые задачи… Архив рубрики ~Коротко из Telegram~ «Яндекс» с нуля разработал Alice AI Foundation LLM — большую… Новости робототехники Skild научила робота играть в футбол — через 140 лет… Архив рубрики ~Коротко из Telegram~ В ChatGPT нашли «режим зверя» — он включается, если сказать… Архив рубрики ~Коротко из Telegram~ 🎬 У Seedance появился серьёзный соперник — Kling 4.0 Kling… Архив рубрики ~Коротко из Telegram~ 🩺 Skill Doctor — аудитор для ваших ИИ-агентов Если вы… Архив рубрики ~Коротко из Telegram~ Telegram-mcp — сервер MCP для управления Telegram через ИИ-агентов Проект… Архив рубрики ~Коротко из Telegram~ 🎬 Tesseract — бесплатный видеоредактор, который управляется через ChatGPT и… Новости робототехники Компания Sanofi передала Cheplapharm 20 препаратов, находящихся на стадии разработки, NVIDIA поддержала Verily, Roche заключила сделку с Dualitas на сумму 1 миллиард долларов по разработке биспецифических препаратов. Архив рубрики ~Коротко из Telegram~ Amazon Web Services запустила программу по возвращению бывших сотрудников, в… Архив рубрики ~Коротко из Telegram~ ЮKassa запустила MCP-сервер, который позволяет подключать ИИ-агентов к платежной системе… Архив рубрики ~Коротко из Telegram~ В России могут расширить требования к предустановке отечественных ИИ-помощников на… Архив рубрики ~Коротко из Telegram~ AutoDraw — генерирует рисунок из каракулей Искусственный интеллект и машинное… Архив рубрики ~Коротко из Telegram~ Casberry — позволяет создавать визуальные 3D-эффекты в пару кликов. —… Архив рубрики ~Коротко из Telegram~ Agency Agent — целая армия ИИ-агентов, готовых решать любые задачи… Архив рубрики ~Коротко из Telegram~ «Яндекс» с нуля разработал Alice AI Foundation LLM — большую… Новости робототехники Skild научила робота играть в футбол — через 140 лет… Архив рубрики ~Коротко из Telegram~ В ChatGPT нашли «режим зверя» — он включается, если сказать… Архив рубрики ~Коротко из Telegram~ 🎬 У Seedance появился серьёзный соперник — Kling 4.0 Kling… Архив рубрики ~Коротко из Telegram~ 🩺 Skill Doctor — аудитор для ваших ИИ-агентов Если вы… Архив рубрики ~Коротко из Telegram~ Telegram-mcp — сервер MCP для управления Telegram через ИИ-агентов Проект… Архив рубрики ~Коротко из Telegram~ 🎬 Tesseract — бесплатный видеоредактор, который управляется через ChatGPT и…

Оставить комментарий