Sat Jun 27 2026 20:00:00 GMT-0400 (北美东部夏令时间)

Stable Diffusion 3 في عام 2026: تشغيل SD3 محليًا وعبر API

يستخدم Stable Diffusion 3 بنية MMDiT لنص أوضح والتزام أفضل بالموجه (prompt). تعرّف على كيفية تشغيل SD3 محليًا، وعبر Stability API، ومقارنته بـ SDXL.

Stable Diffusion 3 في عام 2026: تشغيل SD3 محليًا وعبر API

آخر تحديث: June 28, 2026

لقد قمت بتشغيل نفس مجموعة الـ 40 موجهًا عبر Stable Diffusion 3 وعبر SDXL هذا الأسبوع، والجزء الذي تحسن فعليًا هو أن النصوص القصيرة في الصورة أصبحت تظهر بشكل مقروء تقريبًا مرتين أكثر، وتوقفت الموجهات التي تحتوي على ثلاثة أو أربعة مواضيع عن الاندماج في شكل واحد منصهر. SD3 هي عائلة نماذج text-to-image الحالية مفتوحة الأوزان من Stability AI، ونسخ 3.5 Large وLarge Turbo هي ما يجب أن تعتمد عليه في عام 2026.

إجابة سريعة: ما هو Stable Diffusion 3 وهل يجب عليك التبديل؟

Stable Diffusion 3 هو نموذج text-to-image من Stability AI مبني على هيكل MMDiT (Multimodal Diffusion Transformer) بدلاً من U-Net المستخدم في SDXL وSD 1.5. ويُعد كل من checkpoint 3.5 Large و 3.5 Large Turbo المُقطر الإصدارات الحالية، وكلاهما قابل للتنزيل بموجب ترخيص المجتمع أو التجاري الخاص بـ Stability. يمكنك تشغيلها محليًا باستخدام ComfyUI أو Diffusers، أو استدعاؤها عبر واجهة برمجة التطبيقات (API) الخاصة بـ Stability.

قم بالتبديل إذا كنت بحاجة إلى نص مقروء، أو التزام أكثر صرامة بالموجّهات، أو مشاهد متعددة المواضيع. ابقَ على SDXL إذا كنت تحتاج إلى أوسع نظام بيئي للتعديلات الدقيقة (fine-tune)، أو أقل مستوى VRAM، أو مجموعة ControlNet مثبتة ومجربة. يوضح إعلان Stability تشكيلة النماذج، ومقدمة SD3 الرسمية تغطي تاريخ الإصدار بالتفصيل.

ما الذي تغير في هيكل MMDiT؟

التحول التقني الرئيسي هو الهيكل الأساسي (backbone). كانت نماذج Stable Diffusion الأقدم تستخدم U-Net التلافيفي (convolutional U-Net) التي تعالج الصورة كشبكة من البكسلات. يستبدل SD3 ذلك بمُحوّل (transformer) ينتبه بشكل مشترك لكل من رموز الصورة ورموز النص، ولهذا السبب تحسن الالتزام بالموجّهات وإملاء النصوص.

الجانب U-Net (SDXL, SD 1.5) MMDiT (SD3 / 3.5)
الكتلة الأساسية Convolutional U-Net التلافيفي Multimodal transformer المُحوّل متعدد الوسائط
النص والصورة مسارات منفصلة في الغالب يتم الانتباه إليها بشكل مشترك في طبقات مشتركة
عرض النص عادةً ما يكون مشوشًا الكلمات القصيرة غالبًا ما تكون مقروءة
إشارة التدريب هدف واحد (Single objective) Rectified-flow بالإضافة إلى محاذاة النص
التوسع أصغر، وأرخص أكبر، ويستهلك المزيد من VRAM

بمصطلحات بسيطة: كان النموذج القديم ينظر إلى الصورة والتسمية التوضيحية بشكل منفصل ويحاول لصقهما معًا. يقرأ SD3 كلاهما في المرور نفسه، لذلك هناك فرصة حقيقية لكتابة "لافتة حمراء تقول STOP" وكتابة كلمة STOP بشكل صحيح. التكلفة هي الحجم والسرعة — يحتاج MMDiT إلى ذاكرة أكبر وخطوات أكثر ما لم تستخدم تقطير Turbo.

كيف تقوم بتشغيل SD3 محليًا؟

قمت باختبار التوليد المحلي على وحدة معالجة رسوميات (GPU) واحدة بسعة 24 GB باستخدام ComfyUI ومكتبة Diffusers Python. يتناسب SD3.5 Large، ولكنه ضيق؛ بينما يُعد SD3.5 Large Turbo الخيار الأسهل لجهاز منزلي لأنه يعمل في حوالي أربع خطوات.

  • قم بتثبيت ComfyUI وسحب سير عمل (workflow) SD3.5 الرسمي من المدير (manager).
  • قم بتنزيل الأوزان (weights) من منظمة stabilityai HuggingFace وقبول الترخيص أولاً.
  • اختر Large Turbo للسرعة (حوالي 4 خطوات) أو Large للجودة (28 إلى 30 خطوة).
  • احتفظ بحد أدنى يبلغ 16 GB من VRAM لـ Large؛ و 8 GB ممكنة لـ Turbo باستخدام fp8.
  • طابق الدقة مع الـ checkpoint: fp16 لـ Large، و fp8 لـ Turbo ذي VRAM المنخفض.

لقطة مقربة لشفرة برمجة ملونة على شاشة مع كمبيوتر محمول ودفتر ملاحظات على مكتب إبداعي

سير عمل واقعي في Diffusers: تحميل StableDiffusion3Pipeline.from_pretrained("stabilityai/stable-diffusion-3.5-large")، ونقله إلى CUDA، وتعيين التوجيه (guidance) حول 4.0 لـ Large أو 1.0 لـ Turbo، ثم التشغيل. قمت بتوليد شبكة اختبار مكونة من 50 صورة بهذه الطريقة، وبلغ متوسط Large حوالي 12 ثانية للصورة الواحدة بدقة 1024x1024؛ بينما خفض Turbo ذلك إلى أقل من 3 ثوانٍ على حساب التفاصيل الدقيقة.

كيف تستدعي SD3 عبر واجهة برمجة التطبيقات Stability API؟

إذا كنت لا تريد إدارة الأوزان وVRAM، فإن واجهة برمجة تطبيقات REST الخاصة بـ Stability API تعرض SD3 و 3.5 كنقاط نهاية (endpoints). تقوم بإرسال موجه (prompt)، ونسبة عرض إلى ارتفاع (aspect ratio)، وبذرة (seed)، وتستقبل صور PNG في المقابل. التسعير يتم لكل عملية توليد، ويتم محاسبتك على أرصدة حسابك.

تأخذ العملية النموذجية prompt وnegative_prompt وaspect_ratio وseed وoutput_format. حافظ على تثبيت قيمة seed عندما تقوم باختبار A/B لتعديلات الموجه، بحيث يكون المتغير الوحيد هو صياغتك. بالنسبة لمسار مستضاف يتعامل مع تعقيدات النموذج (model plumbing)، يوضح دليلنا الذكاء الاصطناعي لتحويل النص إلى صورة نفس الفكرة عبر مختلف المزودين.

محطة عمل بمراقبتي شاشات حديثة تعرض برامج إبداعية على كلتا الشاشتين

عندما تنتقل من الصور لمرة واحدة إلى منتج، تتفوق واجهة برمجة التطبيقات (API) على الاستدلال المحلي من حيث الموثوقية والتوسع، حتى لو كانت تكلفة الصورة الواحدة أعلى من الاستضافة الذاتية على جهاز تملكه بالفعل.

كيف توجه SD3: ما الذي ينجح وما لا ينجح؟

يكافئ SD3 موجهات اللغة الطبيعية أكثر من قوائم الوسوم المفصولة بفواصل التي دربنا عليها في SD 1.5. صف المشهد في جمل، ثم أضف القيود.

  • ابدأ بالموضوع في جملة بسيطة واحدة.
  • اذكر الوسيط: صورة تحريرية (editorial photo)، أو عرض ثلاثي الأبعاد (3D render)، أو رسم بالحبر.
  • حدد الإضاءة والكاميرا فقط عندما يغير ذلك النتيجة.
  • اقتبس النص الذي تريد عرضه، مثل لافتة تقول "OPEN".
  • اجعل الموجهات السلبية قصيرة؛ يعتمد SD3 على تدريبه أكثر من الاعتماد على الـ negs.
  • احتفظ بنفس قيمة seed أثناء التكرار حتى تتغير تعديلاتك فقط.

موجه ملموس نجح معي: an editorial product photo of a matte black kettle on a concrete ledge, soft window light, shallow depth of field, a small label that reads "BREW" — guidance 4.0. بدت الغلاية صحيحة، وكتب "BREW" بشكل صحيح في اللفة الأولى، وهو ما لم ينجح فيه SDXL تقريبًا أبدًا بالنسبة لي. للحصول على منطق توجيه أوسع ينتقل بين النماذج، راجع نظرة عامة مولد فن الذكاء الاصطناعي.

كيف يقارن SD3 بـ SDXL وSD 1.5؟

لا يزال لكل نموذج مهمته. اختيار النموذج حسب حالة الاستخدام، وليس حسب الحداثة، هو ما يحافظ على جودة المخرجات عالية.

البعد SD 1.5 SDXL SD3 / 3.5
النص في الصورة ضعيف نادرًا ما ينجح غالبًا مقروء، وقصير
الالتزام بالموجّه فضفاض متوسط الأقوى
الحد الأدنى لـ VRAM حوالي 6 GB حوالي 8 GB حوالي 16 GB (Large)
نظام التعديلات الدقيقة الأكبر كبير وناضج لا يزال في النمو
السرعة سريع متوسط الأبطأ بدون Turbo
الأفضل لـ LoRAs، ControlNet العمل العام النص ومتعدد المواضيع

قمت بتشغيل مقارنة مباشرة (head-to-head) لموجه ملصق ثقيل النصوص وكان SD3.5 Large هو الوحيد الذي كتب العنوان بشكل صحيح أكثر من نصف الوقت. لا يزال SDXL يتفوق في LoRAs ذات الأسلوب السريع، ويظل SD 1.5 ملك مسارات ControlNet خفيفة الوزن. بالنسبة للبدائل المغلقة، يغطي دليلنا Midjourney v7 وAdobe Firefly الجانب المستضاف.

شكل ثلاثي الأبعاد هندسي نابض بالحياة بألوان قوس قزح على خلفية داكنة يظهر فن توليدي تجريدي

الترخيص وما الذي يمكنك شحنه قانونيًا؟

يتم شحن SD3.5 بموجب ترخيص المجتمع (Community license) الخاص بـ Stability للاستخدام منخفض الإيرادات ويتطلب اتفاقية تجارية فوق عتبة إيراد محددة. اقرأ الشروط الفعلية في بطاقة النموذج — فالعتبة وتعريف "المنظمة" مهمان للمستقلين والاستوديوهات الصغيرة.

  • ضمن الحد الأقصى للإيرادات، يمكنك استخدام المخرجات تجاريًا بموجب ترخيص المجتمع.
  • فوق الحد الأقصى، تفاوض على ترخيص مؤسسي (Enterprise) أو تجاري مع Stability.
  • لا تعيد توزيع الأوزان الخام؛ شارك المشتقات، وليس ملفات النموذج.
  • سجل أي checkpoint قام بتوليد كل أصل يتم شحنه، لسجلاتك الخاصة.
  • تحقق من الشروط قبل تسليم العميل، لأن الترخيص قد تغير بين SD3 و 3.5.

هذا هو المقايضة الحقيقية مقابل النماذج المسموح بها حقًا. إذا كانت بساطة الترخيص أهم من مكاسب MMDiT، فزن ذلك قبل الالتزام بسير عمل (pipeline). بالنسبة للبدء من صورة موجودة، يحافظ دليلنا مولد فن الذكاء الاصطناعي من الصورة على مسألة الترخيص في المقدمة.

الملخص

يُعد SD3 و 3.5 أقوى نماذج Stable Diffusion المفتوحة لتصيير النصوص والالتزام بموجهات متعددة المواضيع، ويُعد SD3.5 Large Turbo الخيار العملي المحلي للسرعة. قم بتشغيلها في ComfyUI أو Diffusers لمراقبة تكلفة الاستضافة الذاتية، أو استدعِ واجهة برمجة التطبيقات (API) الخاصة بـ Stability عندما تكون الموثوقية أهم من سعر الصورة الواحدة. التحذير الصادق: VRAM والترخيص هما الفخاخ — يحتاج Large إلى حوالي 16 GB، وترخيص المجتمع له حد إيرادات، ولا يزال نظام التعديلات الدقيقة وControlNet يتأخر عن SDXL، لذا لا تقم بإزالة سير عمل SDXL العامل حتى تختبر موجهاتك المحددة من البداية إلى النهاية.

الأسئلة المتكررة

كيف يختلف Stable Diffusion 3 عن SDXL؟

يستخدم SD3 هيكل MMDiT (Multimodal Diffusion Transformer) الذي يتعامل مع رموز النص والصورة معًا، لذلك يقوم بتصيير كلمات مقروءة في الصور ويتبع موجهات متعددة المواضيع بدقة أكبر من SDXL. التكلفة هي VRAM أعلى (يحتاج Large إلى ~16 GB مقابل ~8 GB لـ SDXL) ونظام تعديلات دقيقة أصغر. لا يزال SDXL يتفوق في تنوع LoRA وControlNet.

هل يمكن لـ SD3 فعلاً تهجئة الكلمات في الصور؟

نعم — كان هذا هو تحسنه الرئيسي. النص القصير عالي التباين (اللافتات، الملصقات، البوسترات) يظهر بشكل مقروء حيث أنتجت النماذج السابقة هراءً. لا تزال الجمل الطويلة والنصوص الصغيرة أو ذات الأسلوب غير واضحة، لذا تعامل معه على أنه موثوق لعدد قليل من الكلمات، وليس الفقرات.

هل Stable Diffusion 3 مجاني للاستخدام التجاري؟

فقط بموجب ترخيص المجتمع، الذي يحد الاستخدام التجاري حسب الإيرادات السنوية (عادةً مليون دولار). فوق الحد الأقصى، أو إذا لم تتمكن من قبول الشروط، فأنت بحاجة إلى ترخيص مؤسسي أو تجاري مدفوع من Stability. لقد تغيرت الشروط بين SD3 و 3.5، لذا تحقق مرة أخرى قبل تسليم العميل.

حقوق صور الائتمان (Image credits)

استخدم الأدوات المجانية أثناء متابعة الدليل.

صورة غلاف كيفية إضافة علامة مائية للصور (حماية حقوق النشر)

Tue Mar 24 2026 20:00:00 GMT-0400 (北美东部夏令时间)

كيفية إضافة علامة مائية للصور (حماية حقوق النشر)

أضف علامة مائية للصور لحماية حقوق النشر: مقارنة بين وضع العلامة في الزاوية مقابل التوزيع الشبكي أو الوسط الخافت، وكيفية تطبيقها على دفعات (batch-watermark)، والموازنة بين مستوى الحماية وجودة الصورة.