2026-06-28 · Aggiornato il 2026-06-30
Stable Diffusion 3 nel 2026: Esecuzione locale e tramite API di SD3
Stable Diffusion 3 utilizza un'architettura MMDiT per testo più nitido e migliore aderenza ai prompt. Scopri come eseguo SD3 localmente, tramite la Stability API, e confrontandolo con SDXL.

Ultimo aggiornamento: June 30, 2026
Ho eseguito lo stesso set di 40 prompt con Stable Diffusion 3 e con SDXL questa settimana, e la parte che è effettivamente migliorata: il testo breve nell'immagine viene reso leggibile circa due volte più spesso, e i prompt con tre o quattro soggetti hanno smesso di fondersi in una singola figura fusa. SD3 è l'ultima famiglia open-weights text-to-image di Stability AI, e le varianti 3.5 Large e Large Turbo sono quelle che dovresti usare nel 2026.
Risposta rapida: cos'è Stable Diffusion 3 e dovrei passare a quello?
Stable Diffusion 3 è il modello text-to-image di Stability AI costruito su un backbone MMDiT (Multimodal Diffusion Transformer) invece del U-Net utilizzato da SDXL e SD 1.5. I checkpoint 3.5 Large e 3.5 Large Turbo distillato sono le uscite attuali, entrambi scaricabili sotto licenza community o commerciale di Stability. Li esegui localmente con ComfyUI o Diffusers, oppure li chiami tramite l'API di Stability.
Passa a SD3 se hai bisogno di testo leggibile, aderenza più rigorosa ai prompt o scene con più soggetti. Rimani su SDXL se hai bisogno dell'ecosistema di fine-tune più ampio, del VRAM floor più basso o di uno stack ControlNet collaudato. L'annuncio di Stability descrive la linea, e l'introduzione ufficiale di SD3 copre lo storico delle uscite in dettaglio.
Cosa è cambiato nell'architettura MMDiT?
Il cambiamento tecnico principale riguarda il backbone. I modelli precedenti di Stable Diffusion utilizzavano un U-Net convoluzionale che elaborava l'immagine come una griglia di pixel. SD3 sostituisce questo con un transformer che presta attenzione congiunta sia ai token immagine che a quelli testuali, motivo per cui è migliorata l'aderenza al prompt e l'ortografia del testo.
| Aspetto | U-Net (SDXL, SD 1.5) | MMDiT (SD3 / 3.5) |
|---|---|---|
| Blocco principale | U-Net convoluzionale | Transformer multimodale |
| Testo e immagine | Percorsi per lo più separati | Attenti congiuntamente in livelli condivisi |
| Resa del testo | Solitamente illeggibile | Parole brevi spesso leggibili |
| Segnale di training | Singolo obiettivo | Rectified-flow più allineamento del testo |
| Scaling | Più piccolo, più economico | Più grande, più affamato di VRAM |
In termini semplici: il vecchio modello guardava la foto e la didascalia separatamente e cercava di incollarle insieme. SD3 le legge nello stesso passaggio, quindi un "cartello rosso con scritto STOP" ha una reale possibilità di scrivere STOP correttamente. Il costo è dimensione e velocità — MMDiT richiede più memoria e più passaggi a meno che tu non usi la distillazione Turbo.
Come si esegue SD3 localmente?
Ho testato la generazione locale su un singolo GPU da 24 GB utilizzando ComfyUI e la libreria Python Diffusers. SD3.5 Large sta, ma è al limite; SD3.5 Large Turbo è la scelta più adatta per una macchina domestica perché gira in circa quattro passaggi.
- Installa ComfyUI e scarica il workflow ufficiale SD3.5 dal manager.
- Scarica i pesi dall'org HuggingFace di stabilityai e accetta prima la licenza.
- Scegli Large Turbo per la velocità (circa 4 passaggi) o Large per la qualità (28-30 passaggi).
- Mantieni almeno 16 GB di VRAM per Large; 8 GB sono possibili per Turbo con fp8.
- Abbina la precisione al checkpoint: fp16 per Large, fp8 per Turbo a bassa VRAM.

Un workflow realistico in Diffusers: carica StableDiffusion3Pipeline.from_pretrained("stabilityai/stable-diffusion-3.5-large"), spostalo su CUDA, imposta la guidance intorno a 4.0 per Large o 1.0 per Turbo, ed esegui. Ho generato una griglia di test da 50 immagini in questo modo e Large ha avuto in media circa 12 secondi per immagine a 1024x1024; Turbo ha ridotto quel tempo a meno di 3 secondi a costo di dettagli fini.
Come si chiama SD3 tramite l'API di Stability?
Se non vuoi gestire i pesi e la VRAM, la Stability REST API espone SD3 e 3.5 come endpoint. POSTi un prompt, un rapporto d'aspetto e un seed, e ricevi PNG in cambio. Il prezzo è per generazione, fatturato sui crediti del tuo account.
Una richiesta tipica richiede un prompt, negative_prompt, aspect_ratio, seed e output_format. Mantieni il seed fisso quando stai facendo A/B-test delle modifiche ai prompt, in modo che l'unica variabile sia la tua formulazione. Per un percorso ospitato che gestisce i collegamenti del modello, la nostra guida text-to-image AI mostra la stessa idea tra diversi provider.

Quando passi da immagini singole a un prodotto, l'API batte l'inferenza locale in affidabilità e scalabilità, anche se il costo per immagine è più alto rispetto all'auto-hosting su un box che possiedi già.
Come si scrive un prompt per SD3: cosa funziona e cosa no?
SD3 premia i prompt in linguaggio naturale più dei listati di tag separati da virgole che SD 1.5 ci ha insegnato a scrivere. Descrivi la scena con frasi, quindi aggiungi vincoli.
- Inizia con il soggetto in una singola frase semplice.
- Indica il mezzo: foto editoriale, render 3D, disegno a inchiostro.
- Specifica illuminazione e telecamera solo quando cambiano il risultato.
- Cita il testo che vuoi visualizzato, ad esempio un cartello con scritto "OPEN".
- Mantieni i negative prompt brevi; SD3 si affida di più al suo addestramento che ai negs.
- Mantieni lo stesso seed mentre iteri in modo che varino solo le tue modifiche.
Un prompt concreto che ha funzionato per me: an editorial product photo of a matte black kettle on a concrete ledge, soft window light, shallow depth of field, a small label that reads "BREW" — guidance 4.0. Il bollitore era giusto, e "BREW" scritto correttamente sul primo tentativo, cosa che SDXL quasi mai riusciva a fare per me. Per una logica di prompting più ampia che si trasferisce tra i modelli, vedi la nostra panoramica AI Art Generator.
Come si confronta SD3 con SDXL e SD 1.5?
Ogni modello ha ancora un suo ruolo. Scegliere in base all'uso, non alla novità, è ciò che mantiene alta la qualità dell'output.
| Dimension | SD 1.5 | SDXL | SD3 / 3.5 |
|---|---|---|---|
| Testo nell'immagine | Scarso | Funziona raramente | Spesso leggibile, corto |
| Adesione al prompt | Lasca | Moderata | La più forte |
| VRAM minima | Circa 6 GB | Circa 8 GB | Circa 16 GB (Large) |
| Ecosistema di fine-tune | Il più vasto | Grande e maturo | Ancora in crescita |
| Velocità | Veloce | Moderata | La più lenta senza Turbo |
| Ideale per | LoRA, ControlNet | Lavoro generico | Testo e soggetti multipli |
Ho eseguito un confronto diretto su un prompt per poster ad alta densità testuale e SD3.5 Large è stato l'unico che ha scritto correttamente il titolo più della metà delle volte. SDXL vince ancora per i LoRA stilizzati e le iterazioni veloci, e SD 1.5 rimane il re dei pipeline ControlNet leggeri. Per alternative chiuse, la nostra guida Midjourney v7 e lo schema Adobe Firefly coprono il lato ospitato.

Licenze e cosa puoi distribuire legalmente?
SD3.5 viene fornito sotto la licenza Community di Stability per usi a basso ricavo e richiede un accordo commerciale al superamento di una soglia di ricavi definita. Leggi i termini effettivi sulla model card — la soglia e la definizione di "organizzazione" contano per freelance e piccoli studi.
- Sotto il limite di ricavi, puoi usare gli output commercialmente sotto la licenza community.
- Sopra il limite, negozia una licenza Enterprise o commerciale con Stability.
- Non ridistribuire i raw weights; condividi derivati, non i file del modello.
- Registra quale checkpoint ha generato ogni asset distribuito, per i tuoi archivi.
- Rivedi i termini prima della consegna al cliente, perché la licenza è cambiata tra SD3 e 3.5.
Questo è il vero compromesso rispetto ai modelli veramente permissivi. Se la semplicità della licenza conta più dei guadagni MMDiT, valuta questo prima di impegnare un pipeline. Per partire da una foto esistente, la nostra guida AI Art Generator From Photo mantiene la questione della licenza in primo piano.
Riepilogo
SD3 e 3.5 sono i modelli open Stable Diffusion più potenti per il rendering di testo e l'aderenza ai prompt multi-soggetto, e SD3.5 Large Turbo è la scelta locale pratica per la velocità. Esegulali in ComfyUI o Diffusers per un controllo dei costi self-hosted, oppure chiama l'API di Stability quando l'affidabilità conta più del prezzo per immagine. L'onesto avvertimento: VRAM e licenze sono i colli di bottiglia — Large richiede circa 16 GB, la licenza community ha un limite di ricavi, e l'ecosistema fine-tune e ControlNet è ancora in ritardo rispetto a SDXL, quindi non rimuovere un pipeline SDXL funzionante finché non hai testato i tuoi specifici prompt dall'inizio alla fine.
Domande frequenti
Come è diverso Stable Diffusion 3 da SDXL?
SD3 utilizza un'architettura Multimodal Diffusion Transformer (MMDiT) che gestisce insieme token testo e immagine, quindi rende parole leggibili nelle immagini e segue i prompt multi-soggetto più accuratamente di SDXL. Il costo è una VRAM maggiore (Large richiede ~16 GB contro gli ~8 GB di SDXL) e un ecosistema fine-tune più piccolo. SDXL vince ancora per la varietà di LoRA e ControlNet.
SD3 riesce davvero a scrivere parole nelle immagini?
Sì — questo è stato il suo miglioramento principale. Testo breve ad alto contrasto (cartelli, etichette, poster) viene reso leggibile dove i modelli precedenti producevano un pasticcio. Frasi lunghe e testo piccolo o stilizzato falliscono ancora, quindi trattalo come affidabile per poche parole, non per paragrafi.
Stable Diffusion 3 è gratuito per uso commerciale?
Solo sotto la licenza community, che limita l'uso commerciale in base al ricavo annuale (comunemente $1M). Sopra il limite, o se non puoi accettare i termini, hai bisogno di una licenza Enterprise o commerciale a pagamento da Stability. I termini sono cambiati tra SD3 e 3.5, quindi ri-controlla prima della consegna al cliente.
Crediti immagine
- Pittura astratta espressionista colorata con pennellate testurizzate — foto di Steve A Johnson su Pexels
- Scrivania creativa con codice sullo schermo, un laptop e un quaderno — foto di Vlad Bagacian su Pexels
- Stazione di lavoro moderna per designer con doppio monitor che visualizza software creativo — foto di Tranmautritam su Pexels
- Forma 3D geometrica vibrante con colori arcobaleno su sfondo scuro — foto di Mahmoud Ramadan su Pexels
Usa gli strumenti gratuiti mentre segui la guida.
Continua a leggere

2026-07-28
Tendenza AI Action Figure: Prepara la tua foto per un ritratto giocattolo professionale
La tendenza AI trasforma foto in ritratti giocattolo da collezione. Scopri come funziona il prompt e i passaggi esatti di crop, sfondo e risoluzione per creare una figura convincente e professionale.

2026-07-26
Guida all'AI Anime Generator: Prompt, Stili ed Esportazioni Sicure
Un flusso di lavoro pratico per l'AI anime generator dedicato a ritratti, avatar, banner e post social. Include template di prompt, controlli di stile e regole di esportazione.

2026-07-26
IA Text-to-Image nel 2026: Come Funziona la Creazione di Prompts
L'intelligenza artificiale Text-to-image trasforma un prompt scritto in un'immagine finita. Scopri come si combinano modelli, prompt e impostazioni dietro la generazione di immagini nel 2026.