Sat Jun 27 2026 20:00:00 GMT-0400 (Eastern Daylight Time)
Stable Diffusion 3 в 2026: Запуск SD3 локально и через API
Stable Diffusion 3 использует архитектуру MMDiT для более четкого текста и лучшего соответствия промптам. Узнайте, как я запускаю SD3 локально, через Stability API и сравнение с SDXL.

Последнее обновление: June 28, 2026
На этой неделе я запустил один и тот же набор из 40 промптов через Stable Diffusion 3 и через SDXL, и то, что действительно улучшилось: короткий текст на изображении рендерится разборчиво примерно в два раза чаще, а промпты с тремя или четырьмя объектами перестали сливаться в одну расплавленную фигуру. SD3 — это текущее семейство моделей text-to-image с открытыми весами от Stability AI, и варианты 3.5 Large и Large Turbo — те, к которым вы будете обращаться в 2026 году.
Краткий ответ: что такое Stable Diffusion 3 и стоит ли переходить на него?
Stable Diffusion 3 — это модель text-to-image от Stability AI, построенная на основе MMDiT (Multimodal Diffusion Transformer), а не U-Net, используемого в SDXL и SD 1.5. Текущими релизами являются чекпоинт 3.5 Large и дистиллированный 3.5 Large Turbo; оба доступны для скачивания по лицензии сообщества или коммерческой лицензии Stability. Вы можете запустить их локально с помощью ComfyUI или Diffusers, или вызвать через API Stability.
Переходите на него, если вам нужен читаемый текст, более строгое соблюдение промпта или сцены с несколькими субъектами. Оставайтесь на SDXL, если вам нужна самая широкая экосистема тонкой настройки (fine-tune), минимальный порог VRAM или проверенный стек ControlNet. Объявление Stability описывает линейку моделей, а официальное представление SD3 подробно освещает историю выпуска.
Что изменилось в архитектуре MMDiT?
Главный технический сдвиг касается основы. Более старые модели Stable Diffusion использовали сверточный U-Net, который обрабатывал изображение как сетку пикселей. SD3 заменяет это на трансформер, который совместно обрабатывает как токены изображения, так и токены текста, благодаря чему улучшилось соответствие промпту и орфография текста.
| Аспект | U-Net (SDXL, SD 1.5) | MMDiT (SD3 / 3.5) |
|---|---|---|
| Основной блок | Convolutional U-Net | Multimodal transformer |
| Текст и изображение | В основном отдельные пути | Совместно обрабатываются в общих слоях |
| Рендеринг текста | Обычно искаженным | Короткие слова часто читаемы |
| Сигнал обучения | Единая цель | Rectified-flow плюс выравнивание текста |
| Масштабирование | Меньше, дешевле | Больше, требует больше VRAM |
Простыми словами: старая модель рассматривала изображение и подпись отдельно, а затем пыталась их склеить. SD3 считывает их за один проход, поэтому у фразы "красный знак со словом STOP" есть реальный шанс правильно написать слово STOP. Цена — это размер и скорость: MMDiT требует больше памяти и больше шагов, если вы не используете Turbo distillation.
Как запустить SD3 локально?
Я протестировал генерацию локально на одном GPU мощностью 24 GB с использованием ComfyUI и библиотеки Diffusers Python. SD3.5 Large подходит, но это сложно; SD3.5 Large Turbo — более удобный вариант для домашней машины, потому что он работает примерно за четыре шага.
- Установите ComfyUI и загрузите официальный рабочий процесс SD3.5 из менеджера.
- Скачайте веса из stabilityai HuggingFace org и сначала примите лицензию.
- Выберите Large Turbo для скорости (около 4 шагов) или Large для качества (28–30 шагов).
- Для Large сохраните не менее 16 GB VRAM; для Turbo с fp8 достаточно 8 GB.
- Совместите точность с чекпоинтом: fp16 для Large, fp8 для Turbo с низкой VRAM.

Реалистичный рабочий процесс в Diffusers: загрузить StableDiffusion3Pipeline.from_pretrained("stabilityai/stable-diffusion-3.5-large"), переместить его в CUDA, установить guidance около 4.0 для Large или 1.0 для Turbo и запустить. Я сгенерировал тестовую сетку из 50 изображений таким образом, и Large усреднилось примерно до 12 секунд на изображение при разрешении 1024x1024; Turbo снизило это значение до менее чем 3 секунд ценой мелкой детализации.
Как вызвать SD3 через Stability API?
Если вы не хотите управлять весами и VRAM, Stability REST API предоставляет SD3 и 3.5 в качестве конечных точек (endpoints). Вы отправляете POST запрос с промптом, соотношением сторон и seed, и получаете обратно PNG-файлы. Стоимость рассчитывается за каждую генерацию и списывается с кредитов вашего аккаунта.
Типичный запрос принимает prompt, negative_prompt, aspect_ratio, seed и output_format. Держите seed фиксированным при A/B-тестировании правок промпта, чтобы единственной переменной было ваше словесное описание (wording). Для размещенного пути, который обрабатывает «сантехнику» модели (model plumbing), наш обзор text-to-image AI демонстрирует ту же идею для разных провайдеров.

Когда вы переходите от разовых изображений к продукту, API превосходит локальный инференс по надежности и масштабируемости, даже несмотря на то, что стоимость одного изображения выше, чем самостоятельное размещение на уже имеющемся у вас оборудовании.
Как писать промты для SD3: что работает, а что нет?
SD3 лучше реагирует на промты естественным языком, чем на списки тегов, разделенные запятыми, к написанию которых нас приучил SD 1.5. Опишите сцену предложениями, а затем добавьте ограничения.
- Начните с объекта одним простым предложением.
- Укажите носитель: редакционная фотография, 3D-рендер, чертеж тушью.
- Указывайте освещение и камеру только в том случае, если это меняет результат.
- Приведите цитату текста, который вы хотите получить, например знак с надписью "OPEN".
- Держите негативные промты короткими; SD3 больше полагается на свою тренировку, чем на негативы.
- Используйте один и тот же сид при итерациях, чтобы менялись только ваши правки.
Конкретный промт, который сработал для меня: an editorial product photo of a matte black kettle on a concrete ledge, soft window light, shallow depth of field, a small label that reads "BREW" — guidance 4.0. Чайник выглядел правильно, а надпись "BREW" была написана верно с первого раза, чего SDXL почти никогда не добивался для меня. Для более широкой логики промтинга, которая передается между моделями, см. наш обзор AI Art Generator.
Как SD3 сравнивается с SDXL и SD 1.5?
У каждой модели все еще есть свое место. Выбор должен основываться на сценарии использования, а не на новизне, чтобы поддерживать высокое качество результатов.
| Параметр | SD 1.5 | SDXL | SD3 / 3.5 |
|---|---|---|---|
| Текст на изображении | Poor | Rarely works | Often legible, short |
| Соответствие промпту | Loose | Moderate | Strongest |
| Минимальный объем VRAM | About 6 GB | About 8 GB | About 16 GB (Large) |
| Экосистема дообучения | Largest | Large and mature | Still growing |
| Скорость | Fast | Moderate | Slowest without Turbo |
| Лучше всего подходит для | LoRAs, ControlNet | General work | Text and multi-subject |
Я провел прямое сравнение по промпту для постера с большим количеством текста, и только SD3.5 Large был единственным, который правильно написал заголовок более чем в половине случаев. SDXL по-прежнему выигрывает для стилизованных LoRAs и быстрой итерации, а SD 1.5 остается королем легковечных пайплайнов ControlNet. Для закрытых альтернатив наши Midjourney v7 guide и разбор Adobe Firefly охватывают облачную сторону.

Лицензирование и что вы можете законно распространять?
SD3.5 распространяется по лицензии Community от Stability для использования с низким доходом и требует коммерческого соглашения при превышении определенного порога дохода. Ознакомьтесь с фактическими условиями на карточке модели — порог и определение "организации" важны для фрилансеров и небольших студий.
- В пределах лимита дохода вы можете использовать результаты коммерчески по лицензии Community.
- При превышении лимита договоритесь о корпоративной или коммерческой лицензии со Stability.
- Не перераспределяйте исходные веса; делитесь производными данными, а не файлами модели.
- Записывайте, какой контрольный пункт сгенерировал каждый распространяемый актив, для ваших собственных записей.
- Перепроверьте условия перед передачей клиенту, потому что лицензирование изменилось между SD3 и 3.5.
Это реальный компромисс по сравнению с действительно разрешительными моделями. Если простота лицензии важнее преимуществ MMDiT, взвесьте это, прежде чем внедрять конвейер (pipeline). Для старта с существующей фотографии наше руководство AI Art Generator From Photo держит вопрос лицензирования в центре внимания.
Обзор
SD3 и 3.5 — самые мощные открытые модели Stable Diffusion для рендеринга текста и соблюдения запросов с несколькими субъектами, а SD3.5 Large Turbo является практичным локальным выбором по скорости. Запускайте их в ComfyUI или Diffusers для контроля затрат при самостоятельной установке, или вызывайте Stability API, когда надежность важнее цены за изображение. Честное предупреждение: ловушки — это VRAM и лицензирование. Large требует примерно 16 GB, общественная лицензия имеет ограничение дохода, а экосистема fine-tune и ControlNet все еще отстает от SDXL, поэтому не отказывайтесь от работающего пайплайна SDXL, пока не протестируете свои конкретные запросы от начала до конца.
Часто задаваемые вопросы
Чем отличается Stable Diffusion 3 от SDXL?
SD3 использует архитектуру Multimodal Diffusion Transformer (MMDiT), которая обрабатывает текстовые и графические токены вместе, поэтому он генерирует читабельные слова на изображениях и следует многосубъектным запросам точнее, чем SDXL. Цена выше из-за VRAM (Large требует ~16 GB против ~8 GB у SDXL) и меньшей экосистемы для тонкой настройки. Для LoRA и разнообразия ControlNet до сих пор лидирует SDXL.
Может ли SD3 действительно писать слова на изображениях?
Да — это было его главное улучшение. Короткий текст с высоким контрастом (знаки, этикетки, плакаты) отображается читабельно там, где более ранние модели выдавали бессмыслицу. Длинные предложения и маленький или стилизованный текст по-прежнему не работают, поэтому относитесь к нему как к надежному инструменту для нескольких слов, а не для параграфов.
Является ли Stable Diffusion 3 бесплатным для коммерческого использования?
Только в рамках общественной лицензии, которая ограничивает коммерческое использование годовым доходом (обычно $1M). Выше этого предела или если вы не согласны с условиями, вам потребуется платная корпоративная или коммерческая лицензия Stability. Условия изменились между SD3 и 3.5, поэтому перепроверьте перед передачей клиенту.
Источники изображений
- Яркая и красочная абстрактная экспрессионистская картина с текстурированными мазками — photo by Steve A Johnson on Pexels
- Креативный рабочий стол с кодом на экране, ноутбуком и блокнотом — photo by Vlad Bagacian on Pexels
- Рабочее место дизайнера с двумя мониторами, отображающее креативное программное обеспечение — photo by Tranmautritam on Pexels
- Яркая геометрическая 3D-фигура с радужными цветами на темном фоне — photo by Mahmoud Ramadan on Pexels
Используйте бесплатные инструменты, следуя руководству.
Продолжить чтение

Tue Mar 24 2026 20:00:00 GMT-0400 (Eastern Daylight Time)
Как добавить водяной знак на фотографии (защита авторских прав)
Добавьте водяной знак на фотографии для защиты авторских прав: размещение в углу, сеткой или по центру; как делать пакетную обработку и баланс между защитой и качеством изображения.

Thu Mar 19 2026 20:00:00 GMT-0400 (Eastern Daylight Time)
Как создать эффект дуотона на фотографиях (Гайд по дизайну)
Создайте эффект дуотона на фото: как работает двухцветный оттенок, лучшие цветовые пары, и как применить его в Canva, Photoshop или ImageMagick. Узнайте, где он используется.

Thu Jul 09 2026 20:00:00 GMT-0400 (Eastern Daylight Time)
AI Action Figure Trend: Как подготовить фото для студийного портрета
Тренд AI экшн-фигурок превращает фото в коллекционный игрушечный портрет. Мы расскажем о работе промпта и точных шагах по кадрированию, фону и разрешению, чтобы ваша фигурка выглядела реалистично, а не как фейк.