Sat Jun 27 2026 20:00:00 GMT-0400 (北美东部夏令时间)

Stable Diffusion 3 em 2026: Rodando SD3 Localmente e via API

Stable Diffusion 3 usa MMDiT para texto mais nítido e melhor aderência ao prompt. Veja como rodar SD3 localmente, via Stability API, e compará-lo com o SDXL.

Stable Diffusion 3 em 2026: Rodando SD3 Localmente e via API

Última atualização: June 28, 2026

Executei o mesmo conjunto de 40 prompts através do Stable Diffusion 3 e através do SDXL esta semana, e a parte que realmente avançou foi: texto curto na imagem renderizado legivelmente cerca de duas vezes mais frequentemente, e prompts com três ou quatro sujeitos pararam de se fundir em uma figura derretida. SD3 é a família atual de text-to-image open-weights da Stability AI, e as variantes 3.5 Large e Large Turbo são aquelas que você deve usar em 2026.

Resposta rápida: o que é Stable Diffusion 3 e devo mudar?

Stable Diffusion 3 é o modelo text-to-image da Stability AI construído sobre um backbone MMDiT (Multimodal Diffusion Transformer) em vez do U-Net usado pelo SDXL e SD 1.5. Os checkpoints 3.5 Large e 3.5 Large Turbo destilado são os lançamentos atuais, ambos baixáveis sob licença comunitária ou comercial da Stability. Você executa-os localmente com ComfyUI ou Diffusers, ou chama-os através da API da Stability.

Mude se você precisar de texto legível, aderência mais rigorosa ao prompt ou cenas multi-sujeito. Permaneça no SDXL se você precisar do ecossistema de fine-tune mais amplo, do menor piso VRAM ou de um stack ControlNet comprovado. O anúncio da Stability detalha a linha, e o introdução oficial do SD3 cobre o histórico de lançamento em detalhes.

O que mudou na arquitetura MMDiT?

A mudança técnica principal é o backbone. Modelos mais antigos do Stable Diffusion usavam um U-Net convolucional que processava a imagem como uma grade de pixels. SD3 substitui isso por um transformer que atende conjuntamente tanto aos tokens da imagem quanto aos tokens de texto, razão pela qual a aderência ao prompt e a ortografia do texto melhoraram.

Aspecto U-Net (SDXL, SD 1.5) MMDiT (SD3 / 3.5)
Bloco principal U-Net Convolucional Transformer multimodal
Texto e imagem Vias em grande parte separadas Atendido conjuntamente em camadas compartilhadas
Renderização de texto Geralmente embaralhado Palavras curtas frequentemente legíveis
Sinal de treinamento Objetivo único Rectified-flow mais alinhamento de texto
Escalabilidade Menor, mais barato Maior, mais consumidor de VRAM

Em termos simples: o modelo antigo olhava para a foto e para a legenda separadamente e tentava colá-los juntos. SD3 lê ambos na mesma passagem, então "um sinal vermelho que diz PARE" tem uma chance real de soletrar STOP. O custo é tamanho e velocidade — MMDiT precisa de mais memória e mais passos, a menos que você use a destilação Turbo.

Como executar o SD3 localmente?

Testei geração local em uma única GPU de 24 GB usando ComfyUI e a biblioteca Python Diffusers. SD3.5 Large cabe, mas é apertado; SD3.5 Large Turbo é a escolha mais amigável para uma máquina doméstica porque roda em aproximadamente quatro passos.

  • Instale o ComfyUI e baixe o workflow oficial do SD3.5 do gerenciador.
  • Baixe os pesos da org HuggingFace stabilityai e aceite a licença primeiro.
  • Escolha Large Turbo para velocidade (cerca de 4 passos) ou Large para qualidade (28 a 30 passos).
  • Mantenha pelo menos 16 GB de VRAM para Large; 8 GB é possível para Turbo com fp8.
  • Combine a precisão com o checkpoint: fp16 para Large, fp8 para Turbo de baixa VRAM.

Close-up of colorful programming code on a screen with a laptop and notebook on a creative desk

Um workflow realista no Diffusers: carregar StableDiffusion3Pipeline.from_pretrained("stabilityai/stable-diffusion-3.5-large"), movê-lo para CUDA, definir guidance em torno de 4.0 para Large ou 1.0 para Turbo, e executar. Gerei uma grade de teste de 50 imagens dessa forma e o Large teve em média cerca de 12 segundos por imagem em 1024x1024; o Turbo reduziu isso para menos de 3 segundos ao custo de detalhes finos.

Como chamar o SD3 através da Stability API?

Se você não quiser gerenciar pesos e VRAM, a Stability REST API expõe SD3 e 3.5 como endpoints. Você envia um prompt, uma proporção de aspecto e uma seed, e recebe PNGs de volta. O preço é por geração, cobrado em créditos da sua conta.

Uma requisição típica exige um prompt, negative_prompt, aspect_ratio, seed e output_format. Mantenha o seed fixo ao fazer A/B-testing de edições de prompt, para que a única variável seja a sua redação. Para um caminho hospedado que lida com os mecanismos do modelo, nosso guia text-to-image AI mostra a mesma ideia em vários provedores.

Modern designer dual-monitor workstation displaying creative software on both screens

Quando você passa de imagens únicas para um produto, a API supera a inferência local em confiabilidade e escalabilidade, mesmo que o custo por imagem seja maior do que auto-hospedar em uma máquina que você já possui.

Como dar prompts ao SD3: o que funciona e o que não funciona?

SD3 recompensa mais os prompts de linguagem natural do que as listas de tags separadas por vírgulas que o SD 1.5 nos treinou a escrever. Descreva a cena em frases, e depois adicione restrições.

  • Comece com o sujeito em uma frase simples.
  • Nomeie o meio: foto editorial, renderização 3D, desenho à tinta.
  • Especifique iluminação e câmera apenas quando eles mudarem o resultado.
  • Cite o texto que você deseja renderizar, por exemplo um sinal que diz "ABERTO".
  • Mantenha os negative prompts curtos; SD3 confia mais em seu treinamento do que nos negações.
  • Mantenha a mesma seed ao iterar para que apenas suas edições variem.

Um prompt concreto que funcionou para mim: an editorial product photo of a matte black kettle on a concrete ledge, soft window light, shallow depth of field, a small label that reads "BREW" — guidance 4.0. A chaleira estava correta, e "BREW" foi soletrado corretamente no primeiro rolo, o que o SDXL quase nunca conseguiu para mim. Para uma lógica de prompt mais ampla que transfere entre modelos, veja nosso guia gerador de arte AI.

Como o SD3 se compara ao SDXL e SD 1.5?

Cada modelo ainda tem um trabalho a fazer. Escolher por caso de uso, não por novidade, é o que mantém a alta qualidade da saída.

Dimensão SD 1.5 SDXL SD3 / 3.5
Texto na imagem Ruim Raramente funciona Frequentemente legível, curto
Aderência ao prompt Solta Moderada Mais forte
Piso VRAM Cerca de 6 GB Cerca de 8 GB Cerca de 16 GB (Large)
Ecossistema de fine-tune Maior Grande e maduro Ainda crescendo
Velocidade Rápido Moderado Mais lento sem Turbo
Melhor para LoRAs, ControlNet Trabalho geral Texto e multi-sujeito

Executei um confronto em um prompt de pôster com muito texto e o SD3.5 Large foi o único que soletrou o título corretamente mais da metade das vezes. O SDXL ainda vence para LoRAs estilizadas e iteração rápida, e o SD 1.5 permanece o rei dos pipelines ControlNet leves. Para alternativas fechadas, nosso guia Midjourney v7 e a análise do Adobe Firefly cobrem o lado hospedado.

Vibrant geometric 3D shape with rainbow colors on a dark background showing abstract generative art

Licenciamento e o que você pode legalmente distribuir?

SD3.5 é distribuído sob a licença Community da Stability para uso de baixa receita e requer um acordo comercial acima de um limite de receita definido. Leia os termos reais na model card — o limite e a definição de "organização" importam para freelancers e pequenos estúdios.

  • Abaixo do limite de receita, você pode usar as saídas comercialmente sob a licença comunitária.
  • Acima do limite, negocie uma licença Enterprise ou comercial com a Stability.
  • Não redistribua os pesos brutos; compartilhe derivados, não os arquivos do modelo.
  • Registre qual checkpoint gerou cada ativo distribuído, para seus próprios registros.
  • Verifique os termos antes da entrega ao cliente, porque o licenciamento mudou entre SD3 e 3.5.

Este é o verdadeiro trade-off versus modelos verdadeiramente permissivos. Se a simplicidade da licença for mais importante do que os ganhos MMDiT, pondere isso antes de comprometer um pipeline. Para começar a partir de uma foto existente, nosso guia Gerador de Arte AI a Partir de Foto mantém a questão do licenciamento em primeiro plano.

Resumo

SD3 e 3.5 são os modelos Stable Diffusion open mais fortes para renderização de texto e aderência de prompts multi-sujeito, e o SD3.5 Large Turbo é a escolha local prática para velocidade. Execute-os no ComfyUI ou Diffusers para controle de custo auto-hospedado, ou chame a API da Stability quando a confiabilidade for mais importante do que o preço por imagem. O aviso honesto: VRAM e licenciamento são os pontos fracos — Large precisa de aproximadamente 16 GB, a licença comunitária tem um limite de receita, e o ecossistema de fine-tune e ControlNet ainda fica atrás do SDXL, então não retire um pipeline SDXL funcional até ter testado seus prompts específicos de ponta a ponta.

Perguntas frequentes

Como o Stable Diffusion 3 é diferente do SDXL?

SD3 usa uma arquitetura Multimodal Diffusion Transformer (MMDiT) que lida com tokens de texto e imagem juntos, então ele renderiza palavras legíveis em imagens e segue prompts multi-sujeito de forma mais precisa do que o SDXL. O custo é maior VRAM (Large precisa de ~16 GB versus ~8 GB do SDXL) e um ecossistema de fine-tune menor. O SDXL ainda vence para variedade de LoRA e ControlNet.

O SD3 realmente consegue soletrar palavras em imagens?

Sim — esse foi seu principal avanço. Texto curto e de alto contraste (sinais, rótulos, pôsteres) renderiza legivelmente onde modelos anteriores produziam gibberish. Frases longas e texto pequeno ou estilizado ainda falham, então trate-o como confiável para algumas palavras, não parágrafos.

O Stable Diffusion 3 é gratuito para uso comercial?

Apenas sob a licença comunitária, que limita o uso comercial por receita anual (comumente $1M). Acima do limite, ou se você não puder aceitar os termos, você precisa de uma licença Enterprise ou comercial paga da Stability. Os termos mudaram entre SD3 e 3.5, então verifique novamente antes da entrega ao cliente.

Créditos das imagens

Use as ferramentas gratuitas enquanto segue o guia.

Imagem de capa de Como Adicionar Marca D'água em Fotos (Proteção de Direitos Autorais)

Tue Mar 24 2026 20:00:00 GMT-0400 (北美东部夏令时间)

Como Adicionar Marca D'água em Fotos (Proteção de Direitos Autorais)

Adicione uma marca d'água às suas fotos para proteger direitos autorais: compare posicionamento em canto, mosaico ou centro discreto, aprenda a aplicar marcas em lote e entenda o equilíbrio entre proteção e qualidade da imagem.

Imagem de capa de Como Criar um Efeito Duotonal em Fotos (Guia de Design)

Thu Mar 19 2026 20:00:00 GMT-0400 (北美东部夏令时间)

Como Criar um Efeito Duotonal em Fotos (Guia de Design)

Crie um efeito duotonal em fotos: como funciona o tom de duas cores, os melhores pares de cores, como aplicá-lo no Canva, Photoshop ou ImageMagick, e onde ele é usado.