Sat Jun 27 2026 20:00:00 GMT-0400 (北美东部夏令时间)
Stable Diffusion 3 pada 2026: Jalankan SD3 Tempatan & API
Stable Diffusion 3 menggunakan seni bina MMDiT untuk teks yang lebih tajam dan pematuhan prompt yang unggul. Ketahui cara menjalankan SD3 secara tempatan, melalui Stability API, serta perbandingan dengan SDXL.

Last updated: June 28, 2026
Saya menjalankan set 40-prompt yang sama melalui Stable Diffusion 3 dan juga melalui SDXL minggu ini, dan bahagian yang benar-benar berubah: teks pendek dalam imej dirender dengan jelas kira-kira dua kali ganda kerap, dan prompt dengan tiga atau empat subjek berhenti bercampur menjadi satu figura cair. SD3 ialah keluarga text-to-image open-weights semasa Stability AI, dan varian 3.5 Large serta Large Turbo adalah yang perlu anda gunakan pada tahun 2026.
Jawapan ringkas: apakah Stable Diffusion 3 dan patutkah anda bertukar?
Stable Diffusion 3 ialah model text-to-image milik Stability AI yang dibina di atas tulang belakang MMDiT (Multimodal Diffusion Transformer) berbanding U-Net yang digunakan oleh SDXL dan SD 1.5. Checkpoint 3.5 Large dan 3.5 Large Turbo yang distil adalah keluaran semasa, kedua-duanya boleh dimuat turun di bawah lesen komuniti atau komersial Stability. Anda menjalankannya secara tempatan dengan ComfyUI atau Diffusers, atau memanggilnya melalui Stability API.
Tukar jika anda memerlukan teks yang jelas, pematuhan prompt yang lebih ketat, atau adegan multi-subjek. Kekal pada SDXL jika anda memerlukan ekosistem fine-tune terluas, lantai VRAM terendah, atau stack ControlNet yang terbukti. Pengumuman Stability memperincikan susunan ini, dan pengenalan rasmi SD3 merangkumi sejarah keluaran secara terperinci.
Apa yang berubah dalam seni bina MMDiT?
Perubahan teknikal utama ialah tulang belakangnya. Model Stable Diffusion lama menggunakan U-Net konvolusi yang memproses imej sebagai grid piksel. SD3 menggantikan itu dengan transformer yang memberi perhatian bersama kepada token imej dan token teks, itulah sebabnya pematuhan prompt dan ejaan teks bertambah baik.
| Aspek | U-Net (SDXL, SD 1.5) | MMDiT (SD3 / 3.5) |
|---|---|---|
| Blok teras | U-Net Konvolusi | Transformer multimodal |
| Teks dan imej | Laluan yang kebanyakannya berasingan | Memberi perhatian bersama dalam lapisan dikongsi |
| Rendering teks | Biasanya kabur/tidak jelas | Perkataan pendek sering jelas |
| Isyarat latihan | Objektif tunggal | Rectified-flow plus text alignment |
| Penskalaan | Lebih kecil, lebih murah | Lebih besar, memerlukan VRAM yang banyak |
Dalam istilah mudah: model lama melihat gambar dan kapsyen secara berasingan dan cuba menampalnya bersama. SD3 membacanya dalam satu laluan, jadi "tanda merah bertulis STOP" mempunyai peluang sebenar untuk mengeja STOP. Kosnya ialah saiz dan kelajuan — MMDiT memerlukan lebih banyak memori dan lebih banyak langkah melainkan anda menggunakan distilasi Turbo.
Bagaimana cara menjalankan SD3 secara tempatan?
Saya menguji penjanaan tempatan pada GPU 24 GB tunggal menggunakan ComfyUI dan perpustakaan Python Diffusers. SD3.5 Large muat tetapi ia ketat; SD3.5 Large Turbo adalah pilihan yang lebih mesra untuk mesin rumah kerana ia berjalan dalam kira-kira empat langkah.
- Pasang ComfyUI dan tarik alir kerja SD3.5 rasmi dari pengurus.
- Muat turun berat dari organisasi HuggingFace stabilityai dan terima lesen dahulu.
- Pilih Large Turbo untuk kelajuan (kira-kira 4 langkah) atau Large untuk kualiti (28 hingga 30 langkah).
- Kekalkan sekurang-kurangnya 16 GB VRAM untuk Large; 8 GB adalah mungkin untuk Turbo dengan fp8.
- Padankan ketepatan dengan checkpoint: fp16 untuk Large, fp8 untuk Turbo VRAM rendah.

Aliran kerja realistik dalam Diffusers: muatkan StableDiffusion3Pipeline.from_pretrained("stabilityai/stable-diffusion-3.5-large"), pindahkan ia ke CUDA, tetapkan panduan sekitar 4.0 untuk Large atau 1.0 untuk Turbo, dan jalankan. Saya menjana grid ujian 50 imej dengan cara ini dan Large purata kira-kira 12 saat setiap imej pada 1024x1024; Turbo mengurangkannya kepada bawah 3 saat dengan kos perincian halus.
Bagaimana anda memanggil SD3 melalui Stability API?
Jika anda tidak mahu menguruskan berat dan VRAM, Stability REST API mendedahkan SD3 dan 3.5 sebagai endpoint. Anda POST prompt, nisbah aspek, dan benih (seed), dan menerima PNG kembali. Harga adalah setiap penjanaan, dibilkan kepada kredit akaun anda.
Permintaan tipikal mengambil prompt, negative_prompt, aspect_ratio, seed, dan output_format. Kekalkan seed tetap apabila anda A/B-menguji suntingan prompt, jadi satu-satunya pembolehubah ialah perkataan anda. Untuk laluan yang dihoskan yang mengendalikan paip model, panduan AI text-to-image kami menunjukkan idea yang sama merentasi penyedia perkhidmatan.

Apabila anda beralih daripada imej sekali sahaja kepada produk, API mengatasi inferens tempatan dari segi kebolehpercayaan dan penskalaan, walaupun kos setiap imej lebih tinggi daripada pengehosan sendiri pada kotak yang sudah anda miliki.
Bagaimana cara prompt SD3: apa yang berfungsi dan apa yang tidak?
SD3 memberi ganjaran kepada prompt bahasa semula jadi lebih banyak daripada senarai tag dipisahkan koma yang melatih kita untuk menulis di SD 1.5. Huraikan adegan dalam ayat, kemudian tambah kekangan.
- Mulakan dengan subjek dalam satu ayat ringkas.
- Namakan medium: foto editorial, render 3D, lukisan dakwat.
- Nyatakan pencahayaan dan kamera hanya apabila ia mengubah hasil.
- Petik teks yang anda mahu dirender, contohnya tanda bertulis "OPEN".
- Kekalkan prompt negatif pendek; SD3 bergantung pada latihannya lebih daripada negs.
- Pegang benih (seed) yang sama semasa berulang supaya hanya suntingan anda yang berubah.
Prompt konkrit yang berhasil untuk saya: an editorial product photo of a matte black kettle on a concrete ledge, soft window light, shallow depth of field, a small label that reads "BREW" — guidance 4.0. Kettle itu kelihatan betul, dan "BREW" dieja dengan betul pada gulungan pertama, yang hampir tidak pernah dilakukan oleh SDXL untuk saya. Untuk logik prompting yang lebih luas yang dipindahkan antara model, lihat tinjauan penjana seni AI kami.
Bagaimana SD3 dibandingkan dengan SDXL dan SD 1.5?
Setiap model masih mempunyai tugasnya. Memilih mengikut kes penggunaan, bukan kebaruan, adalah yang mengekalkan kualiti output yang tinggi.
| Dimensi | SD 1.5 | SDXL | SD3 / 3.5 |
|---|---|---|---|
| Teks dalam imej | Lemah | Jarang berfungsi | Selalunya jelas, pendek |
| Pematuhan prompt | Longgar | Sederhana | Paling kuat |
| Lantai VRAM | Kira-kira 6 GB | Kira-kira 8 GB | Kira-kira 16 GB (Large) |
| Ekosistem fine-tune | Terbesar | Besar dan matang | Masih berkembang |
| Kelajuan | Pantas | Sederhana | Paling perlahan tanpa Turbo |
| Terbaik untuk | LoRAs, ControlNet | Kerja umum | Teks dan multi-subjek |
Saya menjalankan perbandingan head-to-head pada prompt poster berat teks dan SD3.5 Large adalah satu-satunya yang mengeja tajuk utama dengan betul lebih daripada separuh masa. SDXL masih menang untuk LoRA bergaya dan iterasi pantas, dan SD 1.5 kekal raja paip ControlNet ringan. Untuk alternatif tertutup, panduan Midjourney v7 kami dan pecahan Adobe Firefly merangkumi sisi yang dihoskan.

Pemlesenan dan apa yang boleh anda edarkan secara sah?
SD3.5 dikeluarkan di bawah lesen Komuniti Stability untuk penggunaan pendapatan rendah dan memerlukan perjanjian komersial melebihi ambang pendapatan yang ditetapkan. Baca terma sebenar pada kad model — ambang dan definisi "organisasi" penting bagi freelancer dan studio kecil.
- Di bawah had pendapatan, anda boleh menggunakan output secara komersial di bawah lesen komuniti.
- Melebihi had, rundingkan lesen Enterprise atau komersial dengan Stability.
- Jangan edarkan semula berat mentah; kongsi derivatif, bukan fail model.
- Rekod checkpoint mana yang menjana setiap aset yang diedar, untuk rekod anda sendiri.
- Semak semula terma sebelum penghantaran pelanggan, kerana pemlesenan telah beralih antara SD3 dan 3.5.
Ini adalah pertukaran sebenar berbanding model yang benar-benar membenarkan. Jika kesederhanaan lesen lebih penting daripada keuntungan MMDiT, timbang itu sebelum komitedkan paip. Untuk bermula dari foto sedia ada, panduan Penjana Seni AI Dari Foto kami mengekalkan soalan pemlesenan di hadapan dan tengah.
Ringkasan
SD3 dan 3.5 adalah model Stable Diffusion open yang paling kuat untuk rendering teks dan pematuhan prompt multi-subjek, dan SD3.5 Large Turbo ialah pilihan tempatan praktikal untuk kelajuan. Jalankan ia dalam ComfyUI atau Diffusers untuk kawalan kos self-hosted, atau panggil Stability API apabila kebolehpercayaan lebih penting daripada harga setiap imej. Amaran jujur: VRAM dan pemlesenan adalah perangkapnya — Large memerlukan kira-kira 16 GB, lesen komuniti mempunyai had pendapatan, dan ekosistem fine-tune serta ControlNet masih ketinggalan di belakang SDXL, jadi jangan cabut paip SDXL yang berfungsi sehingga anda telah menguji prompt spesifik anda dari hujung ke hujung.
Soalan lazim
Bagaimana Stable Diffusion 3 berbeza daripada SDXL?
SD3 menggunakan seni bina Multimodal Diffusion Transformer (MMDiT) yang mengendalikan token teks dan imej bersama-sama, jadi ia merender perkataan yang jelas dalam imej dan mengikuti prompt multi-subjek dengan lebih tepat daripada SDXL. Kosnya ialah VRAM yang lebih tinggi (Large memerlukan ~16 GB berbanding ~8 GB SDXL) dan ekosistem fine-tune yang lebih kecil. SDXL masih menang untuk kepelbagaian LoRA dan ControlNet.
Adakah SD3 benar-benar boleh mengeja perkataan dalam imej?
Ya — itu adalah peningkatan utamanya. Teks pendek, kontras tinggi (tanda, label, poster) dirender dengan jelas di mana model terdahulu menghasilkan omong kosong. Ayat panjang dan teks kecil atau bergaya masih gagal, jadi anggap ia sebagai boleh dipercayai untuk beberapa perkataan, bukan perenggan.
Adakah Stable Diffusion 3 percuma untuk kegunaan komersial?
Hanya di bawah lesen komuniti, yang mengehadkan penggunaan komersial mengikut pendapatan tahunan (biasanya $1M). Melebihi had, atau jika anda tidak boleh menerima terma tersebut, anda memerlukan lesen enterprise atau komersial Stability berbayar. Terma telah beralih antara SD3 dan 3.5, jadi semak semula sebelum penghantaran pelanggan.
Kredit Imej
- Bold and colorful abstract expressionist painting with textured brushstrokes — foto oleh Steve A Johnson di Pexels
- Creative desk with code on screen, a laptop, and a notebook — foto oleh Vlad Bagacian di Pexels
- Designer dual-monitor workstation displaying creative software — foto oleh Tranmautritam di Pexels
- Vibrant geometric 3D shape with rainbow colors on a dark background — foto oleh Mahmoud Ramadan di Pexels
Gunakan alat percuma kami semasa mengikuti panduan ini.
Teruskan membaca

Tue Mar 24 2026 20:00:00 GMT-0400 (北美东部夏令时间)
Cara Menambah Watermark pada Foto (Perlindungan Hak Cipta)
Tambahkan watermark pada foto untuk melindungi hak cipta anda. Pelajari penempatan (sudut vs jubin vs tengah), cara batch-watermark, dan pertukaran antara perlindungan serta kualiti imej.

Thu Mar 19 2026 20:00:00 GMT-0400 (北美东部夏令时间)
Cara Mencipta Kesan Duotone pada Foto (Panduan Reka Bentuk)
Cipta kesan duotone pada foto: cara fungsi ton dua warna, pasangan warna terbaik, cara mengaplikasikannya dalam Canva, Photoshop, atau ImageMagick, dan kegunaannya.

Thu Jul 09 2026 20:00:00 GMT-0400 (北美东部夏令时间)
Trend Figur Aksi AI: Cara Sediakan Foto Anda untuk Potret Mainan Kualiti Studio
Trend figur aksi AI mengubah sebarang foto menjadi potret mainan koleksi. Pelajari apa yang membuat prompt berfungsi, dan langkah tepat crop, latar belakang, serta resolution yang membezakan figura meyakinkan daripada palsu jelas.