Sat Jun 27 2026 20:00:00 GMT-0400 (北美东部夏令时间)

Stable Diffusion 3 năm 2026: Chạy SD3 cục bộ và qua API

Stable Diffusion 3 sử dụng kiến trúc MMDiT để tạo văn bản sắc nét hơn và tuân thủ prompt tốt hơn. Tìm hiểu cách tôi chạy SD3 cục bộ, qua Stability API, và so sánh với SDXL.

Stable Diffusion 3 năm 2026: Chạy SD3 cục bộ và qua API

Cập nhật lần cuối: June 28, 2026

Tuần này tôi đã chạy cùng một bộ 40 prompt qua Stable Diffusion 3 và qua SDXL, và điều thực sự thay đổi là: văn bản ngắn trong hình ảnh được hiển thị rõ ràng nhiều gấp đôi, và các prompt có ba hoặc bốn chủ thể không còn bị hòa quyện thành một hình thù tan chảy. SD3 là dòng mô hình text-to-image open-weights hiện tại của Stability AI, và các biến thể 3.5 Large và Large Turbo là những phiên bản bạn nên sử dụng vào năm 2026.

Trả lời nhanh: Stable Diffusion 3 là gì và bạn có nên chuyển đổi không?

Stable Diffusion 3 là mô hình text-to-image của Stability AI được xây dựng trên backbone MMDiT (Multimodal Diffusion Transformer) thay vì U-Net được sử dụng bởi SDXL và SD 1.5. Các checkpoint 3.5 Large và 3.5 Large Turbo tinh chế là các bản phát hành hiện tại, cả hai đều có thể tải xuống theo giấy phép cộng đồng hoặc thương mại của Stability. Bạn chạy chúng cục bộ bằng ComfyUI hoặc Diffusers, hoặc gọi chúng thông qua Stability API.

Hãy chuyển đổi nếu bạn cần văn bản rõ ràng, tuân thủ prompt nghiêm ngặt hơn, hoặc các cảnh nhiều chủ thể. Hãy tiếp tục sử dụng SDXL nếu bạn cần hệ sinh thái fine-tune rộng nhất, mức VRAM thấp nhất, hoặc một bộ ControlNet đã được chứng minh. Thông báo của Stability phác thảo dòng sản phẩm, và giới thiệu chính thức về SD3 trình bày chi tiết lịch sử phát hành.

Kiến trúc MMDiT thay đổi những gì?

Thay đổi kỹ thuật nổi bật là backbone. Các mô hình Stable Diffusion cũ hơn sử dụng U-Net tích chập (convolutional U-Net) xử lý hình ảnh dưới dạng lưới các pixel. SD3 thay thế điều đó bằng một transformer đồng thời chú ý đến cả token hình ảnh và token văn bản, đó là lý do tại sao việc tuân thủ prompt và chính tả văn bản được cải thiện.

Khía cạnh U-Net (SDXL, SD 1.5) MMDiT (SD3 / 3.5)
Khối cốt lõi Convolutional U-Net Multimodal transformer
Văn bản và hình ảnh Chủ yếu là các đường dẫn riêng biệt Đồng thời chú ý trong các lớp chung
Hiển thị văn bản Thường bị rối/mờ nhòe Các từ ngắn thường rõ ràng
Tín hiệu huấn luyện Mục tiêu đơn lẻ Rectified-flow cộng với căn chỉnh văn bản
Khả năng mở rộng Nhỏ hơn, rẻ hơn Lớn hơn, tốn nhiều VRAM hơn

Nói một cách đơn giản: mô hình cũ xem bức ảnh và chú thích riêng biệt rồi cố gắng dán chúng lại. SD3 đọc chúng trong cùng một lần xử lý, vì vậy "một biển báo đỏ ghi STOP" có cơ hội thực sự để viết đúng chữ STOP. Cái giá phải trả là kích thước và tốc độ — MMDiT cần nhiều bộ nhớ và nhiều bước hơn trừ khi bạn sử dụng kỹ thuật tinh chế Turbo.

Cách chạy SD3 cục bộ?

Tôi đã thử tạo ảnh cục bộ trên một GPU 24 GB duy nhất bằng ComfyUI và thư viện Python Diffusers. SD3.5 Large phù hợp nhưng khá sát; SD3.5 Large Turbo là lựa chọn thân thiện hơn cho máy gia đình vì nó chỉ chạy trong khoảng bốn bước.

  • Cài đặt ComfyUI và tải workflow chính thức của SD3.5 từ trình quản lý.
  • Tải weights từ stabilityai HuggingFace org và chấp nhận giấy phép trước.
  • Chọn Large Turbo để tốc độ (khoảng 4 bước) hoặc Large để chất lượng (28 đến 30 bước).
  • Giữ ít nhất 16 GB VRAM cho Large; 8 GB là khả thi cho Turbo với fp8.
  • Khớp độ chính xác với checkpoint: fp16 cho Large, fp8 cho Turbo VRAM thấp.

Ảnh cận cảnh mã lập trình đầy màu sắc trên màn hình với máy tính xách tay và sổ ghi chép trên bàn làm việc sáng tạo

Một workflow thực tế trong Diffusers: load StableDiffusion3Pipeline.from_pretrained("stabilityai/stable-diffusion-3.5-large"), di chuyển nó đến CUDA, đặt guidance khoảng 4.0 cho Large hoặc 1.0 cho Turbo, và chạy. Tôi đã tạo một lưới thử nghiệm 50 hình ảnh theo cách này và Large trung bình khoảng 12 giây mỗi hình ở độ phân giải 1024x1024; Turbo giảm con số đó xuống dưới 3 giây với cái giá là chi tiết tinh xảo.

Cách gọi SD3 thông qua Stability API?

Nếu bạn không muốn quản lý weights và VRAM, Stability REST API cung cấp các endpoint cho SD3 và 3.5. Bạn POST một prompt, tỷ lệ khung hình (aspect ratio), và một seed, và nhận lại các tệp PNG. Giá cả được tính theo mỗi lần tạo, ghi vào tín dụng tài khoản của bạn.

Một yêu cầu điển hình bao gồm prompt, negative_prompt, aspect_ratio, seed, và output_format. Hãy giữ seed cố định khi bạn đang A/B-testing các chỉnh sửa prompt, để biến số duy nhất là cách diễn đạt bằng lời của bạn. Đối với một đường dẫn được lưu trữ xử lý phần kết nối mô hình (model plumbing), bài hướng dẫn text-to-image AI của chúng tôi cho thấy ý tưởng tương tự trên nhiều nhà cung cấp.

Máy trạm màn hình kép hiện đại dành cho nhà thiết kế hiển thị phần mềm sáng tạo trên cả hai màn hình

Khi bạn chuyển từ các hình ảnh đơn lẻ sang một sản phẩm, API vượt trội hơn suy luận cục bộ về độ tin cậy và khả năng mở rộng, mặc dù chi phí mỗi hình ảnh cao hơn việc tự lưu trữ trên một máy mà bạn đã sở hữu.

Cách prompt SD3: những gì hiệu quả và những gì không?

SD3 ưu tiên các prompt ngôn ngữ tự nhiên hơn là danh sách tag phân cách bằng dấu phẩy mà SD 1.5 đã huấn luyện chúng ta viết. Hãy mô tả cảnh trong các câu, sau đó thêm các ràng buộc.

  • Bắt đầu bằng chủ thể trong một câu đơn giản.
  • Nêu tên phương tiện: ảnh biên tập (editorial photo), render 3D, vẽ mực.
  • Chỉ xác định ánh sáng và máy ảnh khi chúng thay đổi kết quả.
  • Trích dẫn văn bản bạn muốn hiển thị, ví dụ biển báo ghi "OPEN".
  • Giữ các negative prompts ngắn; SD3 dựa vào quá trình huấn luyện của nó nhiều hơn là negs.
  • Giữ cùng một seed trong khi lặp lại để chỉ có chỉnh sửa của bạn thay đổi.

Một prompt cụ thể đã hoạt động với tôi: an editorial product photo of a matte black kettle on a concrete ledge, soft window light, shallow depth of field, a small label that reads "BREW" — guidance 4.0. Chiếc ấm trông đúng, và "BREW" được viết chính xác trên lần đổ đầu tiên, điều mà SDXL hầu như không bao giờ làm được cho tôi. Đối với logic prompt rộng hơn chuyển giao giữa các mô hình, hãy xem tổng quan AI Art Generator của chúng tôi.

SD3 so sánh với SDXL và SD 1.5 như thế nào?

Mỗi mô hình vẫn có một vai trò riêng. Việc chọn lựa theo trường hợp sử dụng, chứ không phải theo sự mới lạ, là điều giữ cho chất lượng đầu ra cao.

Chiều kích SD 1.5 SDXL SD3 / 3.5
Văn bản trong hình ảnh Kém Hiếm khi hoạt động Thường rõ ràng, ngắn
Tuân thủ prompt Lỏng lẻo Vừa phải Mạnh nhất
Mức VRAM tối thiểu Khoảng 6 GB Khoảng 8 GB Khoảng 16 GB (Large)
Hệ sinh thái fine-tune Lớn nhất Lớn và trưởng thành Vẫn đang phát triển
Tốc độ Nhanh Vừa phải Chậm nhất nếu không có Turbo
Tốt nhất cho LoRAs, ControlNet Công việc chung Văn bản và nhiều chủ thể

Tôi đã chạy một bài kiểm tra đối đầu với prompt áp phích nặng văn bản và SD3.5 Large là mô hình duy nhất viết đúng tiêu đề hơn một nửa thời gian. SDXL vẫn thắng về các LoRA được cách điệu hóa và lặp lại nhanh, còn SD 1.5 vẫn là vua của các pipeline ControlNet nhẹ. Đối với các lựa chọn thay thế đóng, hướng dẫn Midjourney v7 và phân tích Adobe Firefly của chúng tôi bao gồm cả phía lưu trữ.

Hình khối 3D hình học rực rỡ với màu cầu vồng trên nền tối thể hiện nghệ thuật tạo sinh trừu tượng

Giấy phép và những gì bạn có thể xuất bản hợp pháp?

SD3.5 được phát hành theo giấy phép Community của Stability cho mục đích sử dụng doanh thu thấp và yêu cầu thỏa thuận thương mại khi vượt qua ngưỡng doanh thu xác định. Hãy đọc các điều khoản thực tế trên model card — ngưỡng và định nghĩa về "tổ chức" rất quan trọng đối với freelancer và studio nhỏ.

  • Dưới giới hạn doanh thu, bạn có thể sử dụng đầu ra cho mục đích thương mại theo giấy phép cộng đồng.
  • Trên giới hạn, hãy đàm phán giấy phép Enterprise hoặc thương mại với Stability.
  • Không phân phối lại raw weights; chia sẻ các dẫn xuất (derivatives), không phải các tệp mô hình.
  • Ghi nhật ký checkpoint nào đã tạo ra từng tài sản được xuất bản, để lưu trữ của riêng bạn.
  • Kiểm tra lại các điều khoản trước khi giao cho khách hàng, bởi vì giấy phép đã thay đổi giữa SD3 và 3.5.

Đây là sự đánh đổi thực tế so với các mô hình thực sự tự do. Nếu sự đơn giản về giấy phép quan trọng hơn những lợi ích của MMDiT, hãy cân nhắc điều đó trước khi cam kết một pipeline. Đối với việc bắt đầu từ một bức ảnh hiện có, hướng dẫn AI Art Generator From Photo của chúng tôi giữ câu hỏi về giấy phép ở vị trí trung tâm.

Tóm tắt

SD3 và 3.5 là các mô hình Stable Diffusion open mạnh nhất cho việc hiển thị văn bản và tuân thủ prompt nhiều chủ thể, và SD3.5 Large Turbo là lựa chọn cục bộ thực tế về tốc độ. Hãy chạy chúng trong ComfyUI hoặc Diffusers để kiểm soát chi phí tự lưu trữ, hoặc gọi Stability API khi độ tin cậy quan trọng hơn giá mỗi hình ảnh. Lưu ý trung thực: VRAM và giấy phép là những điểm cần chú ý — Large cần khoảng 16 GB, giấy phép cộng đồng có giới hạn doanh thu, và hệ sinh thái fine-tune cùng ControlNet vẫn tụt lại phía sau SDXL, vì vậy đừng loại bỏ một pipeline SDXL đang hoạt động cho đến khi bạn đã kiểm tra các prompt cụ thể của mình từ đầu đến cuối.

Các câu hỏi thường gặp

Stable Diffusion 3 khác gì so với SDXL?

SD3 sử dụng kiến trúc Multimodal Diffusion Transformer (MMDiT) xử lý token văn bản và hình ảnh cùng nhau, vì vậy nó hiển thị các từ rõ ràng trong hình ảnh và tuân thủ prompt nhiều chủ thể chính xác hơn SDXL. Cái giá phải trả là VRAM cao hơn (Large cần ~16 GB so với ~8 GB của SDXL) và hệ sinh thái fine-tune nhỏ hơn. SDXL vẫn thắng về sự đa dạng LoRA và ControlNet.

SD3 có thực sự viết được chữ trong hình ảnh không?

Có — đó là cải tiến nổi bật nhất của nó. Văn bản ngắn, độ tương phản cao (biển báo, nhãn mác, áp phích) hiển thị rõ ràng ở nơi các mô hình trước đây tạo ra những thứ vô nghĩa. Các câu dài và văn bản nhỏ hoặc được cách điệu vẫn thất bại, vì vậy hãy coi nó là đáng tin cậy cho một vài từ, chứ không phải đoạn văn.

Stable Diffusion 3 có miễn phí sử dụng thương mại không?

Chỉ theo giấy phép cộng đồng, vốn giới hạn việc sử dụng thương mại bằng doanh thu hàng năm (thường là $1M). Trên giới hạn này, hoặc nếu bạn không chấp nhận các điều khoản, bạn cần một giấy phép Enterprise hoặc thương mại trả phí của Stability. Các điều khoản đã thay đổi giữa SD3 và 3.5, vì vậy hãy kiểm tra lại trước khi giao cho khách hàng.

Tín dụng hình ảnh

Sử dụng các công cụ miễn phí trong khi bạn theo dõi hướng dẫn.

Ảnh bìa cho Cách thêm hình mờ vào ảnh (Bảo vệ bản quyền)

Tue Mar 24 2026 20:00:00 GMT-0400 (北美东部夏令时间)

Cách thêm hình mờ vào ảnh (Bảo vệ bản quyền)

Thêm watermark vào ảnh để bảo vệ bản quyền: so sánh vị trí góc, dạng lát gạch hay ở trung tâm mờ; hướng dẫn cách thêm watermark hàng loạt (batch-watermark); và cân bằng giữa mức độ bảo vệ cùng chất lượng hình ảnh.