2026-06-28 · Aggiornato il 2026-06-30

Stable Diffusion 3 nel 2026: Esecuzione locale e tramite API di SD3

Stable Diffusion 3 utilizza un'architettura MMDiT per testo più nitido e migliore aderenza ai prompt. Scopri come eseguo SD3 localmente, tramite la Stability API, e confrontandolo con SDXL.

Stable Diffusion 3 nel 2026: Esecuzione locale e tramite API di SD3

Ultimo aggiornamento: June 30, 2026

Ho eseguito lo stesso set di 40 prompt con Stable Diffusion 3 e con SDXL questa settimana, e la parte che è effettivamente migliorata: il testo breve nell'immagine viene reso leggibile circa due volte più spesso, e i prompt con tre o quattro soggetti hanno smesso di fondersi in una singola figura fusa. SD3 è l'ultima famiglia open-weights text-to-image di Stability AI, e le varianti 3.5 Large e Large Turbo sono quelle che dovresti usare nel 2026.

Risposta rapida: cos'è Stable Diffusion 3 e dovrei passare a quello?

Stable Diffusion 3 è il modello text-to-image di Stability AI costruito su un backbone MMDiT (Multimodal Diffusion Transformer) invece del U-Net utilizzato da SDXL e SD 1.5. I checkpoint 3.5 Large e 3.5 Large Turbo distillato sono le uscite attuali, entrambi scaricabili sotto licenza community o commerciale di Stability. Li esegui localmente con ComfyUI o Diffusers, oppure li chiami tramite l'API di Stability.

Passa a SD3 se hai bisogno di testo leggibile, aderenza più rigorosa ai prompt o scene con più soggetti. Rimani su SDXL se hai bisogno dell'ecosistema di fine-tune più ampio, del VRAM floor più basso o di uno stack ControlNet collaudato. L'annuncio di Stability descrive la linea, e l'introduzione ufficiale di SD3 copre lo storico delle uscite in dettaglio.

Cosa è cambiato nell'architettura MMDiT?

Il cambiamento tecnico principale riguarda il backbone. I modelli precedenti di Stable Diffusion utilizzavano un U-Net convoluzionale che elaborava l'immagine come una griglia di pixel. SD3 sostituisce questo con un transformer che presta attenzione congiunta sia ai token immagine che a quelli testuali, motivo per cui è migliorata l'aderenza al prompt e l'ortografia del testo.

Aspetto U-Net (SDXL, SD 1.5) MMDiT (SD3 / 3.5)
Blocco principale U-Net convoluzionale Transformer multimodale
Testo e immagine Percorsi per lo più separati Attenti congiuntamente in livelli condivisi
Resa del testo Solitamente illeggibile Parole brevi spesso leggibili
Segnale di training Singolo obiettivo Rectified-flow più allineamento del testo
Scaling Più piccolo, più economico Più grande, più affamato di VRAM

In termini semplici: il vecchio modello guardava la foto e la didascalia separatamente e cercava di incollarle insieme. SD3 le legge nello stesso passaggio, quindi un "cartello rosso con scritto STOP" ha una reale possibilità di scrivere STOP correttamente. Il costo è dimensione e velocità — MMDiT richiede più memoria e più passaggi a meno che tu non usi la distillazione Turbo.

Come si esegue SD3 localmente?

Ho testato la generazione locale su un singolo GPU da 24 GB utilizzando ComfyUI e la libreria Python Diffusers. SD3.5 Large sta, ma è al limite; SD3.5 Large Turbo è la scelta più adatta per una macchina domestica perché gira in circa quattro passaggi.

  • Installa ComfyUI e scarica il workflow ufficiale SD3.5 dal manager.
  • Scarica i pesi dall'org HuggingFace di stabilityai e accetta prima la licenza.
  • Scegli Large Turbo per la velocità (circa 4 passaggi) o Large per la qualità (28-30 passaggi).
  • Mantieni almeno 16 GB di VRAM per Large; 8 GB sono possibili per Turbo con fp8.
  • Abbina la precisione al checkpoint: fp16 per Large, fp8 per Turbo a bassa VRAM.

Primo piano di codice di programmazione colorato su uno schermo con un laptop e un quaderno su una scrivania creativa

Un workflow realistico in Diffusers: carica StableDiffusion3Pipeline.from_pretrained("stabilityai/stable-diffusion-3.5-large"), spostalo su CUDA, imposta la guidance intorno a 4.0 per Large o 1.0 per Turbo, ed esegui. Ho generato una griglia di test da 50 immagini in questo modo e Large ha avuto in media circa 12 secondi per immagine a 1024x1024; Turbo ha ridotto quel tempo a meno di 3 secondi a costo di dettagli fini.

Come si chiama SD3 tramite l'API di Stability?

Se non vuoi gestire i pesi e la VRAM, la Stability REST API espone SD3 e 3.5 come endpoint. POSTi un prompt, un rapporto d'aspetto e un seed, e ricevi PNG in cambio. Il prezzo è per generazione, fatturato sui crediti del tuo account.

Una richiesta tipica richiede un prompt, negative_prompt, aspect_ratio, seed e output_format. Mantieni il seed fisso quando stai facendo A/B-test delle modifiche ai prompt, in modo che l'unica variabile sia la tua formulazione. Per un percorso ospitato che gestisce i collegamenti del modello, la nostra guida text-to-image AI mostra la stessa idea tra diversi provider.

Stazione di lavoro moderna per designer con doppio monitor che visualizza software creativo su entrambi gli schermi

Quando passi da immagini singole a un prodotto, l'API batte l'inferenza locale in affidabilità e scalabilità, anche se il costo per immagine è più alto rispetto all'auto-hosting su un box che possiedi già.

Come si scrive un prompt per SD3: cosa funziona e cosa no?

SD3 premia i prompt in linguaggio naturale più dei listati di tag separati da virgole che SD 1.5 ci ha insegnato a scrivere. Descrivi la scena con frasi, quindi aggiungi vincoli.

  • Inizia con il soggetto in una singola frase semplice.
  • Indica il mezzo: foto editoriale, render 3D, disegno a inchiostro.
  • Specifica illuminazione e telecamera solo quando cambiano il risultato.
  • Cita il testo che vuoi visualizzato, ad esempio un cartello con scritto "OPEN".
  • Mantieni i negative prompt brevi; SD3 si affida di più al suo addestramento che ai negs.
  • Mantieni lo stesso seed mentre iteri in modo che varino solo le tue modifiche.

Un prompt concreto che ha funzionato per me: an editorial product photo of a matte black kettle on a concrete ledge, soft window light, shallow depth of field, a small label that reads "BREW" — guidance 4.0. Il bollitore era giusto, e "BREW" scritto correttamente sul primo tentativo, cosa che SDXL quasi mai riusciva a fare per me. Per una logica di prompting più ampia che si trasferisce tra i modelli, vedi la nostra panoramica AI Art Generator.

Come si confronta SD3 con SDXL e SD 1.5?

Ogni modello ha ancora un suo ruolo. Scegliere in base all'uso, non alla novità, è ciò che mantiene alta la qualità dell'output.

Dimension SD 1.5 SDXL SD3 / 3.5
Testo nell'immagine Scarso Funziona raramente Spesso leggibile, corto
Adesione al prompt Lasca Moderata La più forte
VRAM minima Circa 6 GB Circa 8 GB Circa 16 GB (Large)
Ecosistema di fine-tune Il più vasto Grande e maturo Ancora in crescita
Velocità Veloce Moderata La più lenta senza Turbo
Ideale per LoRA, ControlNet Lavoro generico Testo e soggetti multipli

Ho eseguito un confronto diretto su un prompt per poster ad alta densità testuale e SD3.5 Large è stato l'unico che ha scritto correttamente il titolo più della metà delle volte. SDXL vince ancora per i LoRA stilizzati e le iterazioni veloci, e SD 1.5 rimane il re dei pipeline ControlNet leggeri. Per alternative chiuse, la nostra guida Midjourney v7 e lo schema Adobe Firefly coprono il lato ospitato.

Forma 3D geometrica vibrante con colori arcobaleno su sfondo scuro che mostra arte generativa astratta

Licenze e cosa puoi distribuire legalmente?

SD3.5 viene fornito sotto la licenza Community di Stability per usi a basso ricavo e richiede un accordo commerciale al superamento di una soglia di ricavi definita. Leggi i termini effettivi sulla model card — la soglia e la definizione di "organizzazione" contano per freelance e piccoli studi.

  • Sotto il limite di ricavi, puoi usare gli output commercialmente sotto la licenza community.
  • Sopra il limite, negozia una licenza Enterprise o commerciale con Stability.
  • Non ridistribuire i raw weights; condividi derivati, non i file del modello.
  • Registra quale checkpoint ha generato ogni asset distribuito, per i tuoi archivi.
  • Rivedi i termini prima della consegna al cliente, perché la licenza è cambiata tra SD3 e 3.5.

Questo è il vero compromesso rispetto ai modelli veramente permissivi. Se la semplicità della licenza conta più dei guadagni MMDiT, valuta questo prima di impegnare un pipeline. Per partire da una foto esistente, la nostra guida AI Art Generator From Photo mantiene la questione della licenza in primo piano.

Riepilogo

SD3 e 3.5 sono i modelli open Stable Diffusion più potenti per il rendering di testo e l'aderenza ai prompt multi-soggetto, e SD3.5 Large Turbo è la scelta locale pratica per la velocità. Esegulali in ComfyUI o Diffusers per un controllo dei costi self-hosted, oppure chiama l'API di Stability quando l'affidabilità conta più del prezzo per immagine. L'onesto avvertimento: VRAM e licenze sono i colli di bottiglia — Large richiede circa 16 GB, la licenza community ha un limite di ricavi, e l'ecosistema fine-tune e ControlNet è ancora in ritardo rispetto a SDXL, quindi non rimuovere un pipeline SDXL funzionante finché non hai testato i tuoi specifici prompt dall'inizio alla fine.

Domande frequenti

Come è diverso Stable Diffusion 3 da SDXL?

SD3 utilizza un'architettura Multimodal Diffusion Transformer (MMDiT) che gestisce insieme token testo e immagine, quindi rende parole leggibili nelle immagini e segue i prompt multi-soggetto più accuratamente di SDXL. Il costo è una VRAM maggiore (Large richiede ~16 GB contro gli ~8 GB di SDXL) e un ecosistema fine-tune più piccolo. SDXL vince ancora per la varietà di LoRA e ControlNet.

SD3 riesce davvero a scrivere parole nelle immagini?

Sì — questo è stato il suo miglioramento principale. Testo breve ad alto contrasto (cartelli, etichette, poster) viene reso leggibile dove i modelli precedenti producevano un pasticcio. Frasi lunghe e testo piccolo o stilizzato falliscono ancora, quindi trattalo come affidabile per poche parole, non per paragrafi.

Stable Diffusion 3 è gratuito per uso commerciale?

Solo sotto la licenza community, che limita l'uso commerciale in base al ricavo annuale (comunemente $1M). Sopra il limite, o se non puoi accettare i termini, hai bisogno di una licenza Enterprise o commerciale a pagamento da Stability. I termini sono cambiati tra SD3 e 3.5, quindi ri-controlla prima della consegna al cliente.

Crediti immagine

Usa gli strumenti gratuiti mentre segui la guida.