Sat Jun 27 2026 20:00:00 GMT-0400 (Eastern Daylight Time)

Stable Diffusion 3 в 2026: Запуск SD3 локально и через API

Stable Diffusion 3 использует архитектуру MMDiT для более четкого текста и лучшего соответствия промптам. Узнайте, как я запускаю SD3 локально, через Stability API и сравнение с SDXL.

Stable Diffusion 3 в 2026: Запуск SD3 локально и через API

Последнее обновление: June 28, 2026

На этой неделе я запустил один и тот же набор из 40 промптов через Stable Diffusion 3 и через SDXL, и то, что действительно улучшилось: короткий текст на изображении рендерится разборчиво примерно в два раза чаще, а промпты с тремя или четырьмя объектами перестали сливаться в одну расплавленную фигуру. SD3 — это текущее семейство моделей text-to-image с открытыми весами от Stability AI, и варианты 3.5 Large и Large Turbo — те, к которым вы будете обращаться в 2026 году.

Краткий ответ: что такое Stable Diffusion 3 и стоит ли переходить на него?

Stable Diffusion 3 — это модель text-to-image от Stability AI, построенная на основе MMDiT (Multimodal Diffusion Transformer), а не U-Net, используемого в SDXL и SD 1.5. Текущими релизами являются чекпоинт 3.5 Large и дистиллированный 3.5 Large Turbo; оба доступны для скачивания по лицензии сообщества или коммерческой лицензии Stability. Вы можете запустить их локально с помощью ComfyUI или Diffusers, или вызвать через API Stability.

Переходите на него, если вам нужен читаемый текст, более строгое соблюдение промпта или сцены с несколькими субъектами. Оставайтесь на SDXL, если вам нужна самая широкая экосистема тонкой настройки (fine-tune), минимальный порог VRAM или проверенный стек ControlNet. Объявление Stability описывает линейку моделей, а официальное представление SD3 подробно освещает историю выпуска.

Что изменилось в архитектуре MMDiT?

Главный технический сдвиг касается основы. Более старые модели Stable Diffusion использовали сверточный U-Net, который обрабатывал изображение как сетку пикселей. SD3 заменяет это на трансформер, который совместно обрабатывает как токены изображения, так и токены текста, благодаря чему улучшилось соответствие промпту и орфография текста.

Аспект U-Net (SDXL, SD 1.5) MMDiT (SD3 / 3.5)
Основной блок Convolutional U-Net Multimodal transformer
Текст и изображение В основном отдельные пути Совместно обрабатываются в общих слоях
Рендеринг текста Обычно искаженным Короткие слова часто читаемы
Сигнал обучения Единая цель Rectified-flow плюс выравнивание текста
Масштабирование Меньше, дешевле Больше, требует больше VRAM

Простыми словами: старая модель рассматривала изображение и подпись отдельно, а затем пыталась их склеить. SD3 считывает их за один проход, поэтому у фразы "красный знак со словом STOP" есть реальный шанс правильно написать слово STOP. Цена — это размер и скорость: MMDiT требует больше памяти и больше шагов, если вы не используете Turbo distillation.

Как запустить SD3 локально?

Я протестировал генерацию локально на одном GPU мощностью 24 GB с использованием ComfyUI и библиотеки Diffusers Python. SD3.5 Large подходит, но это сложно; SD3.5 Large Turbo — более удобный вариант для домашней машины, потому что он работает примерно за четыре шага.

  • Установите ComfyUI и загрузите официальный рабочий процесс SD3.5 из менеджера.
  • Скачайте веса из stabilityai HuggingFace org и сначала примите лицензию.
  • Выберите Large Turbo для скорости (около 4 шагов) или Large для качества (28–30 шагов).
  • Для Large сохраните не менее 16 GB VRAM; для Turbo с fp8 достаточно 8 GB.
  • Совместите точность с чекпоинтом: fp16 для Large, fp8 для Turbo с низкой VRAM.

Крупный план цветного программного кода на экране с ноутбуком и блокнотом на творческом столе

Реалистичный рабочий процесс в Diffusers: загрузить StableDiffusion3Pipeline.from_pretrained("stabilityai/stable-diffusion-3.5-large"), переместить его в CUDA, установить guidance около 4.0 для Large или 1.0 для Turbo и запустить. Я сгенерировал тестовую сетку из 50 изображений таким образом, и Large усреднилось примерно до 12 секунд на изображение при разрешении 1024x1024; Turbo снизило это значение до менее чем 3 секунд ценой мелкой детализации.

Как вызвать SD3 через Stability API?

Если вы не хотите управлять весами и VRAM, Stability REST API предоставляет SD3 и 3.5 в качестве конечных точек (endpoints). Вы отправляете POST запрос с промптом, соотношением сторон и seed, и получаете обратно PNG-файлы. Стоимость рассчитывается за каждую генерацию и списывается с кредитов вашего аккаунта.

Типичный запрос принимает prompt, negative_prompt, aspect_ratio, seed и output_format. Держите seed фиксированным при A/B-тестировании правок промпта, чтобы единственной переменной было ваше словесное описание (wording). Для размещенного пути, который обрабатывает «сантехнику» модели (model plumbing), наш обзор text-to-image AI демонстрирует ту же идею для разных провайдеров.

Рабочее место современного дизайнера с двумя мониторами, отображающее креативное ПО на обоих экранах

Когда вы переходите от разовых изображений к продукту, API превосходит локальный инференс по надежности и масштабируемости, даже несмотря на то, что стоимость одного изображения выше, чем самостоятельное размещение на уже имеющемся у вас оборудовании.

Как писать промты для SD3: что работает, а что нет?

SD3 лучше реагирует на промты естественным языком, чем на списки тегов, разделенные запятыми, к написанию которых нас приучил SD 1.5. Опишите сцену предложениями, а затем добавьте ограничения.

  • Начните с объекта одним простым предложением.
  • Укажите носитель: редакционная фотография, 3D-рендер, чертеж тушью.
  • Указывайте освещение и камеру только в том случае, если это меняет результат.
  • Приведите цитату текста, который вы хотите получить, например знак с надписью "OPEN".
  • Держите негативные промты короткими; SD3 больше полагается на свою тренировку, чем на негативы.
  • Используйте один и тот же сид при итерациях, чтобы менялись только ваши правки.

Конкретный промт, который сработал для меня: an editorial product photo of a matte black kettle on a concrete ledge, soft window light, shallow depth of field, a small label that reads "BREW" — guidance 4.0. Чайник выглядел правильно, а надпись "BREW" была написана верно с первого раза, чего SDXL почти никогда не добивался для меня. Для более широкой логики промтинга, которая передается между моделями, см. наш обзор AI Art Generator.

Как SD3 сравнивается с SDXL и SD 1.5?

У каждой модели все еще есть свое место. Выбор должен основываться на сценарии использования, а не на новизне, чтобы поддерживать высокое качество результатов.

Параметр SD 1.5 SDXL SD3 / 3.5
Текст на изображении Poor Rarely works Often legible, short
Соответствие промпту Loose Moderate Strongest
Минимальный объем VRAM About 6 GB About 8 GB About 16 GB (Large)
Экосистема дообучения Largest Large and mature Still growing
Скорость Fast Moderate Slowest without Turbo
Лучше всего подходит для LoRAs, ControlNet General work Text and multi-subject

Я провел прямое сравнение по промпту для постера с большим количеством текста, и только SD3.5 Large был единственным, который правильно написал заголовок более чем в половине случаев. SDXL по-прежнему выигрывает для стилизованных LoRAs и быстрой итерации, а SD 1.5 остается королем легковечных пайплайнов ControlNet. Для закрытых альтернатив наши Midjourney v7 guide и разбор Adobe Firefly охватывают облачную сторону.

Яркая геометрическая 3D-фигура с радужными цветами на темном фоне, демонстрирующая абстрактное генеративное искусство

Лицензирование и что вы можете законно распространять?

SD3.5 распространяется по лицензии Community от Stability для использования с низким доходом и требует коммерческого соглашения при превышении определенного порога дохода. Ознакомьтесь с фактическими условиями на карточке модели — порог и определение "организации" важны для фрилансеров и небольших студий.

  • В пределах лимита дохода вы можете использовать результаты коммерчески по лицензии Community.
  • При превышении лимита договоритесь о корпоративной или коммерческой лицензии со Stability.
  • Не перераспределяйте исходные веса; делитесь производными данными, а не файлами модели.
  • Записывайте, какой контрольный пункт сгенерировал каждый распространяемый актив, для ваших собственных записей.
  • Перепроверьте условия перед передачей клиенту, потому что лицензирование изменилось между SD3 и 3.5.

Это реальный компромисс по сравнению с действительно разрешительными моделями. Если простота лицензии важнее преимуществ MMDiT, взвесьте это, прежде чем внедрять конвейер (pipeline). Для старта с существующей фотографии наше руководство AI Art Generator From Photo держит вопрос лицензирования в центре внимания.

Обзор

SD3 и 3.5 — самые мощные открытые модели Stable Diffusion для рендеринга текста и соблюдения запросов с несколькими субъектами, а SD3.5 Large Turbo является практичным локальным выбором по скорости. Запускайте их в ComfyUI или Diffusers для контроля затрат при самостоятельной установке, или вызывайте Stability API, когда надежность важнее цены за изображение. Честное предупреждение: ловушки — это VRAM и лицензирование. Large требует примерно 16 GB, общественная лицензия имеет ограничение дохода, а экосистема fine-tune и ControlNet все еще отстает от SDXL, поэтому не отказывайтесь от работающего пайплайна SDXL, пока не протестируете свои конкретные запросы от начала до конца.

Часто задаваемые вопросы

Чем отличается Stable Diffusion 3 от SDXL?

SD3 использует архитектуру Multimodal Diffusion Transformer (MMDiT), которая обрабатывает текстовые и графические токены вместе, поэтому он генерирует читабельные слова на изображениях и следует многосубъектным запросам точнее, чем SDXL. Цена выше из-за VRAM (Large требует ~16 GB против ~8 GB у SDXL) и меньшей экосистемы для тонкой настройки. Для LoRA и разнообразия ControlNet до сих пор лидирует SDXL.

Может ли SD3 действительно писать слова на изображениях?

Да — это было его главное улучшение. Короткий текст с высоким контрастом (знаки, этикетки, плакаты) отображается читабельно там, где более ранние модели выдавали бессмыслицу. Длинные предложения и маленький или стилизованный текст по-прежнему не работают, поэтому относитесь к нему как к надежному инструменту для нескольких слов, а не для параграфов.

Является ли Stable Diffusion 3 бесплатным для коммерческого использования?

Только в рамках общественной лицензии, которая ограничивает коммерческое использование годовым доходом (обычно $1M). Выше этого предела или если вы не согласны с условиями, вам потребуется платная корпоративная или коммерческая лицензия Stability. Условия изменились между SD3 и 3.5, поэтому перепроверьте перед передачей клиенту.

Источники изображений

Используйте бесплатные инструменты, следуя руководству.

Обложка статьи «Как добавить водяной знак на фотографии (защита авторских прав)»

Tue Mar 24 2026 20:00:00 GMT-0400 (Eastern Daylight Time)

Как добавить водяной знак на фотографии (защита авторских прав)

Добавьте водяной знак на фотографии для защиты авторских прав: размещение в углу, сеткой или по центру; как делать пакетную обработку и баланс между защитой и качеством изображения.

Обложка статьи «AI Action Figure Trend: Как подготовить фото для студийного портрета»

Thu Jul 09 2026 20:00:00 GMT-0400 (Eastern Daylight Time)

AI Action Figure Trend: Как подготовить фото для студийного портрета

Тренд AI экшн-фигурок превращает фото в коллекционный игрушечный портрет. Мы расскажем о работе промпта и точных шагах по кадрированию, фону и разрешению, чтобы ваша фигурка выглядела реалистично, а не как фейк.