Sat Jun 27 2026 20:00:00 GMT-0400 (北美东部夏令时间)

Stable Diffusion 3 di 2026: Cara Menjalankan SD3 Lokal dan API

Stable Diffusion 3 menggunakan arsitektur MMDiT untuk teks tajam & kepatuhan prompt yang lebih baik. Pelajari cara menjalankan SD3 secara lokal, melalui Stability API, dan perbandingannya dengan SDXL.

Stable Diffusion 3 di 2026: Cara Menjalankan SD3 Lokal dan API

Terakhir diperbarui: June 28, 2026

Saya menjalankan set 40 prompt yang sama melalui Stable Diffusion 3 dan juga melalui SDXL minggu ini, dan bagian yang benar-benar berubah adalah teks pendek dalam gambar dirender dengan jelas sekitar dua kali lebih sering, dan prompt dengan tiga atau empat subjek berhenti menyatu menjadi satu sosok meleleh. SD3 adalah keluarga text-to-image open-weights terbaru dari Stability AI, dan varian 3.5 Large serta Large Turbo adalah yang harus Anda gunakan di tahun 2026.

Jawaban cepat: apa itu Stable Diffusion 3 dan haruskah Anda beralih?

Stable Diffusion 3 adalah model text-to-image milik Stability AI yang dibangun di atas backbone MMDiT (Multimodal Diffusion Transformer) alih-alih U-Net yang digunakan oleh SDXL dan SD 1.5. Checkpoint 3.5 Large dan 3.5 Large Turbo yang didistilasi adalah rilis saat ini, keduanya dapat diunduh di bawah lisensi komunitas atau komersial Stability. Anda menjalankannya secara lokal dengan ComfyUI atau Diffusers, atau memanggilnya melalui Stability API.

Beralih jika Anda membutuhkan teks yang jelas, kepatuhan prompt yang lebih ketat, atau adegan multi-subjek. Tetap menggunakan SDXL jika Anda membutuhkan ekosistem fine-tune terluas, VRAM paling rendah, atau tumpukan ControlNet yang sudah terbukti. Pengumuman Stability merinci jajaran modelnya, dan pengenalan resmi SD3 mencakup riwayat rilis secara detail.

Apa yang berubah dalam arsitektur MMDiT?

Pergeseran teknis utama adalah backbone-nya. Model Stable Diffusion lama menggunakan U-Net konvolusional yang memproses gambar sebagai kisi piksel. SD3 mengganti itu dengan transformer yang bersama-sama memperhatikan (jointly attends) token gambar dan token teks, itulah sebabnya kepatuhan prompt dan ejaan teks meningkat.

Aspek U-Net (SDXL, SD 1.5) MMDiT (SD3 / 3.5)
Blok inti U-Net Konvolusional Transformer multimodal
Teks dan gambar Sebagian besar jalur terpisah Diperhatikan bersama dalam lapisan yang sama
Rendering teks Biasanya berantakan (garbled) Kata pendek seringkali jelas
Sinyal pelatihan Tujuan tunggal Rectified-flow ditambah penyelarasan teks
Penskalaan Lebih kecil, lebih murah Lebih besar, membutuhkan VRAM lebih banyak

Sederhananya: model lama melihat gambar dan keterangan secara terpisah dan mencoba merekatkannya. SD3 membacanya dalam satu kali proses, jadi "rambu merah bertuliskan STOP" memiliki peluang nyata untuk mengeja STOP. Biayanya adalah ukuran dan kecepatan — MMDiT membutuhkan lebih banyak memori dan langkah kecuali Anda menggunakan distilasi Turbo.

Bagaimana cara menjalankan SD3 secara lokal?

Saya menguji generasi lokal pada GPU 24 GB tunggal menggunakan ComfyUI dan pustaka Python Diffusers. SD3.5 Large muat tetapi pas-pasan; SD3.5 Large Turbo adalah pilihan yang lebih ramah untuk mesin rumah karena berjalan dalam sekitar empat langkah.

  • Instal ComfyUI dan tarik alur kerja resmi SD3.5 dari manajer.
  • Unduh bobot (weights) dari organisasi HuggingFace stabilityai dan terima lisensinya terlebih dahulu.
  • Pilih Large Turbo untuk kecepatan (sekitar 4 langkah) atau Large untuk kualitas (28 hingga 30 langkah).
  • Pertahankan setidaknya 16 GB VRAM untuk Large; 8 GB mungkin untuk Turbo dengan fp8.
  • Cocokkan presisi dengan checkpoint: fp16 untuk Large, fp8 untuk Turbo VRAM rendah.

Close-up of colorful programming code on a screen with a laptop and notebook on a creative desk

Alur kerja realistis di Diffusers: muat StableDiffusion3Pipeline.from_pretrained("stabilityai/stable-diffusion-3.5-large"), pindahkan ke CUDA, atur panduan (guidance) sekitar 4.0 untuk Large atau 1.0 untuk Turbo, dan jalankan. Saya menghasilkan kisi uji 50 gambar dengan cara ini dan Large rata-rata sekitar 12 detik per gambar pada 1024x1024; Turbo menurunkannya menjadi di bawah 3 detik dengan mengorbankan detail halus.

Bagaimana cara memanggil SD3 melalui Stability API?

Jika Anda tidak ingin mengelola bobot dan VRAM, Stability REST API mengekspos SD3 dan 3.5 sebagai endpoint. Anda mengirimkan (POST) prompt, rasio aspek, dan seed, dan menerima PNG kembali. Harga per generasi, ditagihkan ke kredit akun Anda.

Permintaan tipikal memerlukan prompt, negative_prompt, aspect_ratio, seed, dan output_format. Pertahankan seed tetap saat Anda melakukan A/B-testing pengeditan prompt, sehingga satu-satunya variabel adalah kata-kata Anda. Untuk jalur yang di-host yang menangani perpipaan model, panduan AI text-to-image kami menunjukkan ide yang sama di berbagai penyedia.

Modern designer dual-monitor workstation displaying creative software on both screens

Ketika Anda beralih dari gambar satu kali menjadi produk, API mengungguli inferensi lokal dalam hal keandalan dan skalabilitas, meskipun biaya per gambar lebih tinggi daripada self-hosting di kotak yang sudah Anda miliki.

Cara memberi prompt pada SD3: apa yang berhasil dan apa yang tidak?

SD3 menghargai prompt bahasa alami lebih dari daftar tag yang dipisahkan koma yang melatih kita untuk menulisnya saat menggunakan SD 1.5. Deskripsikan adegan dalam kalimat, lalu tambahkan batasan.

  • Mulailah dengan subjek dalam satu kalimat sederhana.
  • Sebutkan medianya: foto editorial, render 3D, gambar tinta.
  • Tentukan pencahayaan dan kamera hanya jika mereka mengubah hasilnya.
  • Kutip teks yang ingin Anda tampilkan, misalnya rambu bertuliskan "OPEN".
  • Jaga prompt negatif tetap pendek; SD3 lebih mengandalkan pelatihannya daripada negs.
  • Pertahankan seed yang sama saat melakukan iterasi agar hanya pengeditan Anda yang bervariasi.

Prompt konkret yang berhasil bagi saya: an editorial product photo of a matte black kettle on a concrete ledge, soft window light, shallow depth of field, a small label that reads "BREW" — guidance 4.0. Teko itu terlihat benar, dan "BREW" dieja dengan benar pada gulungan pertama, yang hampir tidak pernah dilakukan SDXL untuk saya. Untuk logika prompting yang lebih luas yang berpindah antar model, lihat gambaran umum AI Art Generator kami.

Bagaimana perbandingan SD3 dengan SDXL dan SD 1.5?

Setiap model masih memiliki tugasnya. Memilih berdasarkan kasus penggunaan, bukan berdasarkan kebaruan, adalah yang menjaga kualitas output tetap tinggi.

Dimensi SD 1.5 SDXL SD3 / 3.5
Teks dalam gambar Buruk Jarang berhasil Seringkali jelas, pendek
Kepatuhan prompt Longgar Sedang Paling kuat
VRAM minimum Sekitar 6 GB Sekitar 8 GB Sekitar 16 GB (Large)
Ekosistem fine-tune Terbesar Besar dan matang Masih berkembang
Kecepatan Cepat Sedang Paling lambat tanpa Turbo
Terbaik untuk LoRAs, ControlNet Pekerjaan umum Teks dan multi-subjek

Saya menjalankan perbandingan langsung pada prompt poster yang berat teks dan SD3.5 Large adalah satu-satunya yang mengeja judul dengan benar lebih dari separuh waktu. SDXL masih unggul untuk LoRA bergaya dan iterasi cepat, dan SD 1.5 tetap menjadi raja pipeline ControlNet ringan. Untuk alternatif tertutup, panduan Midjourney v7 kami dan rincian Adobe Firefly mencakup sisi yang di-host.

Vibrant geometric 3D shape with rainbow colors on a dark background showing abstract generative art

Lisensi dan apa yang dapat Anda kirimkan secara legal?

SD3.5 didistribusikan di bawah lisensi Komunitas Stability untuk penggunaan pendapatan rendah dan memerlukan perjanjian komersial di atas ambang batas pendapatan tertentu. Baca persyaratan sebenarnya pada kartu model — ambang batas dan definisi "organisasi" penting bagi freelancer dan studio kecil.

  • Di bawah batas pendapatan, Anda dapat menggunakan output secara komersial di bawah lisensi komunitas.
  • Di atas batas, negosiasikan lisensi Enterprise atau komersial dengan Stability.
  • Jangan mendistribusikan ulang bobot mentah; bagikan turunan, bukan file modelnya.
  • Catat checkpoint mana yang menghasilkan setiap aset yang dikirimkan, untuk catatan Anda sendiri.
  • Periksa kembali persyaratan sebelum pengiriman klien, karena lisensi bergeser antara SD3 dan 3.5.

Ini adalah pertukaran nyata versus model yang benar-benar permisif. Jika kesederhanaan lisensi lebih penting daripada keuntungan MMDiT, timbang itu sebelum menerapkan pipeline. Untuk memulai dari foto yang sudah ada, panduan AI Art Generator From Photo kami menjaga pertanyaan lisensi di garis depan.

Ringkasan

SD3 dan 3.5 adalah model Stable Diffusion open terkuat untuk rendering teks dan kepatuhan prompt multi-subjek, dan SD3.5 Large Turbo adalah pilihan lokal praktis untuk kecepatan. Jalankan mereka di ComfyUI atau Diffusers untuk kontrol biaya self-hosted, atau panggil Stability API ketika keandalan lebih penting daripada harga per gambar. Peringatan jujurnya: VRAM dan lisensi adalah jebakannya — Large membutuhkan sekitar 16 GB, lisensi komunitas memiliki batas pendapatan, dan ekosistem fine-tune serta ControlNet masih tertinggal dari SDXL, jadi jangan cabut pipeline SDXL yang berfungsi sampai Anda menguji prompt spesifik Anda secara ujung ke ujung.

Pertanyaan yang sering diajukan

Bagaimana Stable Diffusion 3 berbeda dari SDXL?

SD3 menggunakan arsitektur Multimodal Diffusion Transformer (MMDiT) yang menangani token teks dan gambar bersama-sama, sehingga ia merender kata-kata yang jelas di gambar dan mengikuti prompt multi-subjek lebih akurat daripada SDXL. Biayanya adalah VRAM yang lebih tinggi (Large membutuhkan ~16 GB versus ~8 GB SDXL) dan ekosistem fine-tune yang lebih kecil. SDXL masih unggul untuk variasi LoRA dan ControlNet.

Bisakah SD3 benar-benar mengeja kata dalam gambar?

Ya — itu adalah peningkatan utamanya. Teks pendek, kontras tinggi (rambu, label, poster) dirender dengan jelas di tempat model sebelumnya menghasilkan omong kosong. Kalimat panjang dan teks kecil atau bergaya masih gagal, jadi perlakukan ini sebagai andal untuk beberapa kata, bukan paragraf.

Apakah Stable Diffusion 3 gratis untuk penggunaan komersial?

Hanya di bawah lisensi komunitas, yang membatasi penggunaan komersial berdasarkan pendapatan tahunan (umumnya $1M). Di atas batas, atau jika Anda tidak dapat menerima persyaratan tersebut, Anda memerlukan lisensi enterprise atau komersial Stability berbayar. Persyaratan telah bergeser antara SD3 dan 3.5, jadi periksa kembali sebelum pengiriman klien.

Kredit Gambar

Gunakan alat gratis sambil mengikuti panduan.

Gambar sampul untuk Cara Menambahkan Tanda Air pada Foto (Perlindungan Hak Cipta)

Tue Mar 24 2026 20:00:00 GMT-0400 (北美东部夏令时间)

Cara Menambahkan Tanda Air pada Foto (Perlindungan Hak Cipta)

Tambahkan tanda air pada foto untuk melindungi hak cipta: penempatan sudut vs pola ubin vs pusat samar, cara batch-watermark, dan pertimbangan antara perlindungan serta kualitas gambar.

Gambar sampul untuk Cara Membuat Efek Duotone pada Foto (Panduan Desain)

Thu Mar 19 2026 20:00:00 GMT-0400 (北美东部夏令时间)

Cara Membuat Efek Duotone pada Foto (Panduan Desain)

Pelajari cara membuat efek duotone pada foto: bagaimana pewarnaan dua warna bekerja, pasangan warna terbaik, cara menerapkannya di Canva, Photoshop, atau ImageMagick, dan penggunaannya.