Sat Jun 27 2026 20:00:00 GMT-0400 (北美东部夏令时间)
Stable Diffusion 3 nel 2026: Esecuzione locale e tramite API di SD3
Stable Diffusion 3 utilizza un'architettura MMDiT per testo più nitido e migliore aderenza ai prompt. Scopri come eseguo SD3 localmente, tramite la Stability API, e confrontandolo con SDXL.

Ultimo aggiornamento: June 28, 2026
Ho eseguito lo stesso set di 40 prompt con Stable Diffusion 3 e con SDXL questa settimana, e la parte che è effettivamente migliorata: il testo breve nell'immagine viene reso leggibile circa due volte più spesso, e i prompt con tre o quattro soggetti hanno smesso di fondersi in una singola figura fusa. SD3 è l'ultima famiglia open-weights text-to-image di Stability AI, e le varianti 3.5 Large e Large Turbo sono quelle che dovresti usare nel 2026.
Risposta rapida: cos'è Stable Diffusion 3 e dovrei passare a quello?
Stable Diffusion 3 è il modello text-to-image di Stability AI costruito su un backbone MMDiT (Multimodal Diffusion Transformer) invece del U-Net utilizzato da SDXL e SD 1.5. I checkpoint 3.5 Large e 3.5 Large Turbo distillato sono le uscite attuali, entrambi scaricabili sotto licenza community o commerciale di Stability. Li esegui localmente con ComfyUI o Diffusers, oppure li chiami tramite l'API di Stability.
Passa a SD3 se hai bisogno di testo leggibile, aderenza più rigorosa ai prompt o scene con più soggetti. Rimani su SDXL se hai bisogno dell'ecosistema di fine-tune più ampio, del VRAM floor più basso o di uno stack ControlNet collaudato. L'annuncio di Stability descrive la linea, e l'introduzione ufficiale di SD3 copre lo storico delle uscite in dettaglio.
Cosa è cambiato nell'architettura MMDiT?
Il cambiamento tecnico principale riguarda il backbone. I modelli precedenti di Stable Diffusion utilizzavano un U-Net convoluzionale che elaborava l'immagine come una griglia di pixel. SD3 sostituisce questo con un transformer che presta attenzione congiunta sia ai token immagine che a quelli testuali, motivo per cui è migliorata l'aderenza al prompt e l'ortografia del testo.
| Aspect | U-Net (SDXL, SD 1.5) | MMDiT (SD3 / 3.5) |
|---|---|---|
| Core block | Convolutional U-Net | Multimodal transformer |
| Text and image | Mostly separate pathways | Jointly attended in shared layers |
| Text rendering | Usually garbled | Short words often legible |
| Training signal | Single objective | Rectified-flow plus text alignment |
| Scaling | Smaller, cheaper | Larger, more VRAM-hungry |
In termini semplici: il vecchio modello guardava la foto e la didascalia separatamente e cercava di incollarle insieme. SD3 le legge nello stesso passaggio, quindi un "cartello rosso con scritto STOP" ha una reale possibilità di scrivere STOP correttamente. Il costo è dimensione e velocità — MMDiT richiede più memoria e più passaggi a meno che tu non usi la distillazione Turbo.
Come si esegue SD3 localmente?
Ho testato la generazione locale su un singolo GPU da 24 GB utilizzando ComfyUI e la libreria Python Diffusers. SD3.5 Large sta, ma è al limite; SD3.5 Large Turbo è la scelta più adatta per una macchina domestica perché gira in circa quattro passaggi.
- Installa ComfyUI e scarica il workflow ufficiale SD3.5 dal manager.
- Scarica i pesi dall'org HuggingFace di stabilityai e accetta prima la licenza.
- Scegli Large Turbo per la velocità (circa 4 passaggi) o Large per la qualità (28-30 passaggi).
- Mantieni almeno 16 GB di VRAM per Large; 8 GB sono possibili per Turbo con fp8.
- Abbina la precisione al checkpoint: fp16 per Large, fp8 per Turbo a bassa VRAM.

Un workflow realistico in Diffusers: carica StableDiffusion3Pipeline.from_pretrained("stabilityai/stable-diffusion-3.5-large"), spostalo su CUDA, imposta la guidance intorno a 4.0 per Large o 1.0 per Turbo, ed esegui. Ho generato una griglia di test da 50 immagini in questo modo e Large ha avuto in media circa 12 secondi per immagine a 1024x1024; Turbo ha ridotto quel tempo a meno di 3 secondi a costo di dettagli fini.
Come si chiama SD3 tramite l'API di Stability?
Se non vuoi gestire i pesi e la VRAM, la Stability REST API espone SD3 e 3.5 come endpoint. POSTi un prompt, un rapporto d'aspetto e un seed, e ricevi PNG in cambio. Il prezzo è per generazione, fatturato sui crediti del tuo account.
Una richiesta tipica richiede un prompt, negative_prompt, aspect_ratio, seed e output_format. Mantieni il seed fisso quando stai facendo A/B-test delle modifiche ai prompt, in modo che l'unica variabile sia la tua formulazione. Per un percorso ospitato che gestisce i collegamenti del modello, la nostra guida text-to-image AI mostra la stessa idea tra diversi provider.

Quando passi da immagini singole a un prodotto, l'API batte l'inferenza locale in affidabilità e scalabilità, anche se il costo per immagine è più alto rispetto all'auto-hosting su un box che possiedi già.
Come si scrive un prompt per SD3: cosa funziona e cosa no?
SD3 premia i prompt in linguaggio naturale più dei listati di tag separati da virgole che SD 1.5 ci ha insegnato a scrivere. Descrivi la scena con frasi, quindi aggiungi vincoli.
- Inizia con il soggetto in una singola frase semplice.
- Indica il mezzo: foto editoriale, render 3D, disegno a inchiostro.
- Specifica illuminazione e telecamera solo quando cambiano il risultato.
- Cita il testo che vuoi visualizzato, ad esempio un cartello con scritto "OPEN".
- Mantieni i negative prompt brevi; SD3 si affida di più al suo addestramento che ai negs.
- Mantieni lo stesso seed mentre iteri in modo che varino solo le tue modifiche.
Un prompt concreto che ha funzionato per me: an editorial product photo of a matte black kettle on a concrete ledge, soft window light, shallow depth of field, a small label that reads "BREW" — guidance 4.0. Il bollitore era giusto, e "BREW" scritto correttamente sul primo tentativo, cosa che SDXL quasi mai riusciva a fare per me. Per una logica di prompting più ampia che si trasferisce tra i modelli, vedi la nostra panoramica AI Art Generator.
Come si confronta SD3 con SDXL e SD 1.5?
Ogni modello ha ancora un suo ruolo. Scegliere in base all'uso, non alla novità, è ciò che mantiene alta la qualità dell'output.
| Dimension | SD 1.5 | SDXL | SD3 / 3.5 |
|---|---|---|---|
| Text in image | Poor | Rarely works | Often legible, short |
| Prompt adherence | Loose | Moderate | Strongest |
| VRAM floor | About 6 GB | About 8 GB | About 16 GB (Large) |
| Fine-tune ecosystem | Largest | Large and mature | Still growing |
| Speed | Fast | Moderate | Slowest without Turbo |
| Best for | LoRAs, ControlNet | General work | Text and multi-subject |
Ho eseguito un confronto diretto su un prompt per poster ad alta densità testuale e SD3.5 Large è stato l'unico che ha scritto correttamente il titolo più della metà delle volte. SDXL vince ancora per i LoRA stilizzati e le iterazioni veloci, e SD 1.5 rimane il re dei pipeline ControlNet leggeri. Per alternative chiuse, la nostra guida Midjourney v7 e lo schema Adobe Firefly coprono il lato ospitato.

Licenze e cosa puoi distribuire legalmente?
SD3.5 viene fornito sotto la licenza Community di Stability per usi a basso ricavo e richiede un accordo commerciale al superamento di una soglia di ricavi definita. Leggi i termini effettivi sulla model card — la soglia e la definizione di "organizzazione" contano per freelance e piccoli studi.
- Sotto il limite di ricavi, puoi usare gli output commercialmente sotto la licenza community.
- Sopra il limite, negozia una licenza Enterprise o commerciale con Stability.
- Non ridistribuire i raw weights; condividi derivati, non i file del modello.
- Registra quale checkpoint ha generato ogni asset distribuito, per i tuoi archivi.
- Rivedi i termini prima della consegna al cliente, perché la licenza è cambiata tra SD3 e 3.5.
Questo è il vero compromesso rispetto ai modelli veramente permissivi. Se la semplicità della licenza conta più dei guadagni MMDiT, valuta questo prima di impegnare un pipeline. Per partire da una foto esistente, la nostra guida AI Art Generator From Photo mantiene la questione della licenza in primo piano.
Riepilogo
SD3 e 3.5 sono i modelli open Stable Diffusion più potenti per il rendering di testo e l'aderenza ai prompt multi-soggetto, e SD3.5 Large Turbo è la scelta locale pratica per la velocità. Esegulali in ComfyUI o Diffusers per un controllo dei costi self-hosted, oppure chiama l'API di Stability quando l'affidabilità conta più del prezzo per immagine. L'onesto avvertimento: VRAM e licenze sono i colli di bottiglia — Large richiede circa 16 GB, la licenza community ha un limite di ricavi, e l'ecosistema fine-tune e ControlNet è ancora in ritardo rispetto a SDXL, quindi non rimuovere un pipeline SDXL funzionante finché non hai testato i tuoi specifici prompt dall'inizio alla fine.
Domande frequenti
Come è diverso Stable Diffusion 3 da SDXL?
SD3 utilizza un'architettura Multimodal Diffusion Transformer (MMDiT) che gestisce insieme token testo e immagine, quindi rende parole leggibili nelle immagini e segue i prompt multi-soggetto più accuratamente di SDXL. Il costo è una VRAM maggiore (Large richiede ~16 GB contro gli ~8 GB di SDXL) e un ecosistema fine-tune più piccolo. SDXL vince ancora per la varietà di LoRA e ControlNet.
SD3 riesce davvero a scrivere parole nelle immagini?
Sì — questo è stato il suo miglioramento principale. Testo breve ad alto contrasto (cartelli, etichette, poster) viene reso leggibile dove i modelli precedenti producevano un pasticcio. Frasi lunghe e testo piccolo o stilizzato falliscono ancora, quindi trattalo come affidabile per poche parole, non per paragrafi.
Stable Diffusion 3 è gratuito per uso commerciale?
Solo sotto la licenza community, che limita l'uso commerciale in base al ricavo annuale (comunemente $1M). Sopra il limite, o se non puoi accettare i termini, hai bisogno di una licenza Enterprise o commerciale a pagamento da Stability. I termini sono cambiati tra SD3 e 3.5, quindi ri-controlla prima della consegna al cliente.
Crediti immagine
- Pittura astratta espressionista colorata con pennellate testurizzate — foto di Steve A Johnson su Pexels
- Scrivania creativa con codice sullo schermo, un laptop e un quaderno — foto di Vlad Bagacian su Pexels
- Stazione di lavoro moderna per designer con doppio monitor che visualizza software creativo — foto di Tranmautritam su Pexels
- Forma 3D geometrica vibrante con colori arcobaleno su sfondo scuro — foto di Mahmoud Ramadan su Pexels
Usa gli strumenti gratuiti mentre segui la guida.
Continua a leggere

Tue Mar 24 2026 20:00:00 GMT-0400 (北美东部夏令时间)
Come aggiungere una filigrana alle foto (Protezione del copyright)
Aggiungi una filigrana alle foto per proteggere il copyright: confronta posizionamento in angolo, a piastrelle o centrale sfumato, impara a fare watermarking in blocco e bilancia protezione e qualità dell'immagine.

Thu Mar 19 2026 20:00:00 GMT-0400 (北美东部夏令时间)
Come creare un effetto duotone sulle foto (Guida di design)
Crea un effetto duotone sulle foto: come funziona la tonalità bicolore, i migliori abbinamenti di colori, come applicarlo in Canva, Photoshop o ImageMagick e dove viene utilizzato.

Thu Mar 12 2026 20:00:00 GMT-0400 (北美东部夏令时间)
Guida SEO Immagini 2026: Crawl, Rank e Ottenere Citazioni
Un flusso di lavoro pratico per l'SEO delle immagini nel 2026 che copre file indicizzabili (crawlable), alt text, nomi dei file, schema, consegna tramite CDN, Core Web Vitals e visibilità GEO.