Sat Jun 27 2026 20:00:00 GMT-0400 (Eastern Daylight Time)
كيف أصنع مقاطع فيديو قصيرة بالذكاء الاصطناعي: الخطافات، التسميات، وB-Roll
الخطافات، والتسميات التوضيحية، وb-roll وإعادة الاستخدام: سير عمل الذكاء الاصطناعي الذي أستخدمه لإنتاج Reels وTikToks وShorts كل أسبوع، مع الأدوات والقيود وما يجب تجنبه.

آخر تحديث: June 28, 2026
يُعد الفيديو العمودي القصير هو التنسيق الوحيد الذي لا يزال يحقق وصولاً لا يمكنني شراؤه في أي مكان آخر، وأصبحت الذكاء الاصطناعي الآن تقوم بالأجزاء التي كنت أخشاها: الخطاف (hook)، ولقطات الدعم البصرية (b-roll)، والتسميات التوضيحية (captions)، وتقطيع التسجيل الطويل إلى مقاطع قصيرة ومحكمة. لقد نشرت حوالي 120 فيديو قصيرًا في الربع الماضي باستخدام سير العمل هذا، وهذا هو الترتيب الدقيق الذي أتبعه — كتابة خطاف مدته ثلاث ثوانٍ، وتوليد أو سحب b-roll، وحرق التسميات التوضيحية، وتقطيعه ليناسب الطول المطلوب، ثم النشر.
بالنسبة للنموذج الذي يقف وراء المقاطع، أعتمد على Sora video generator وRunway Gen-3 video؛ أما اللمسات النهائية والـ effects فتوجد في ملاحظاتنا حول AI video editing. إليك كيف يعمل تجميع الفيديو القصير بالفعل.
إجابة سريعة: كيف تصنع فيديو قصير بالذكاء الاصطناعي؟
اختر فكرة واحدة، واكتب خطافًا يثمر في الثواني الثلاث الأولى، وقم بتوليد أو جمع ما بين خمس إلى ثماني ثوانٍ من b-roll، وقم بنسخ التسميات التوضيحية وحرقها، وقص الفيديو ليصبح أقل من 60 ثانية بنسبة 9:16، ثم انشره. هذه هي الدورة الكاملة. يتولى الذكاء الاصطناعي أربع خطوات من هذه الخطوات — توليد b-roll، والنسخ الصوتي (transcription)، والتسميات التوضيحية، وتقطيع الطويل إلى قصير — لكنك ما زلت تكتب الخطاف وتختار المقطع.
لقد اختبرت هذا التسلسل بالضبط على قناة مالية بدون وجه وشخص يظهر يتحدث عن منتج، وقد صمد الترتيب لكلا النوعين. القرارات الإبداعية ضيقة ولكنها مهمة: فالخطاف هو الذي يقرر ما إذا كان أي شخص سيرى الثانية الثانية، ونمط التسميات التوضيحية يقرر ما إذا كان المشاهدون الذين يشاهدون بدون صوت سيبقون مهتمين.
ما الذي يعتبر فيديو قصيرًا، وماذا تريد المنصات؟
الفيديو القصير هو عمودي، بنسبة 9:16، وأقل من ثلاث دقائق، ومُعد للتشغيل التلقائي (autoplay) مع إيقاف الصوت. تحدد المنصات الثلاثة سقف المدة بشكل مختلف، والطول الآمن أقصر من الحد الأقصى.
| Platform | Aspect ratio | Max length | Length I actually post |
|---|---|---|---|
| Instagram Reels | 9:16 (4:5 accepted) | 90 seconds | 15 to 30 seconds |
| TikTok | 9:16 | 10 minutes | 21 to 34 seconds |
| YouTube Shorts | 9:16 | 60 seconds | under 58 seconds |
قاعدتان من المنصات تشكلان كل شيء آخر. وفقًا لـ YouTube's Shorts guidance، يجب أن يكون الـ Short عموديًا وبحد أقصى 60 ثانية وإلا فهو ليس Short على الإطلاق — بل يتم تصنيفه كفيديو عادي ويفقد مكانته في موجز Shorts. وتدفع Reels best practices الخاصة بـ Instagram نفس القيد العمودي فقط، وتكافئ النصوص والتسميات التوضيحية لأن الكثير من الناس يشاهدون بدون صوت.
الخلاصة العملية: قم بالتصوير أو التصيير دائمًا بنسبة 9:16، واكتب للمشاهد الذي لا يسمع الصوت، وحافظ على الخطاف في الثواني الثلاث الأولى. أعتبر 30 ثانية هو الافتراضي لي ولا أتجاوز هذا الطول إلا إذا كانت الفكرة تتطلب ذلك حقًا.
الخطاف (The hook): كتابة افتتاحية مدتها ثلاث ثوانٍ تجذب المشاهد
الخطاف هو الشيء الوحيد ذو التأثير الأعلى الذي تكتبه، والذكاء الاصطناعي متوسط في هذا المجال، لذلك أكتب الخطافات بنفسي وأستخدم الذكاء الاصطناعي فقط لاختبارها تحت الضغط. يقوم الخطاف بأحد الوظائف الأربعة: إعطاء وعد، أو بيان توتر، أو عرض نتيجة، أو طرح سؤال يحتاج المشاهد إلى إجابته.

الخطافات التي قمت بقياس فعاليتها:
- "استغرق هذا مني ست ساعات. إليك النسخة التي مدتها 30 ثانية."
- "لا أحد يخبرك بهذا عن [topic] حتى يكلفك مالًا."
- "اختبرت [tool] لمدة 30 يومًا. لم تكن النتيجة ما توقعته."
- "في ثلاث ثوانٍ، شاهد ماذا يحدث للسعر."
أكتب خمس خطافات، وألصقها في موجه (prompt) مُولِّد الفيديو كنص على الشاشة، وأختار الأسرع قراءةً. يجب أن يحمل الإطار الأول الخطاف بصريًا، لأن التسمية التوضيحية لم تُقرأ بعد عند الثانية صفر.
B-roll والمشاهد البصرية: توليد اللقطات عندما لا تملك شيئًا
إذا كنت أمام الكاميرا، فإن b-roll هو وجهك بالإضافة إلى لقطات المقاطع الجانبية (cutaways). إذا لم يظهر وجهك، فإن b-roll هو الفيديو بأكمله، وهنا يحقق محتوى الذكاء الاصطناعي قيمته. أقوم بتوليد لقطات تأسيسية، ولقطات مقربة للمنتجات، ومقاطع حركية مجردة، ثم أضع النص تحتها.
سير عمل بدون وجه أتبعه كل أسبوع:
- كتابة السيناريو الذي مدته 60 ثانية وتقسيمه إلى ستة إلى ثماني لقطات.
- توليد كل لقطة كمقطع مدته خمس ثوانٍ من موجه نصي.
- الحفاظ على نمط متسق عن طريق إعادة استخدام واصفات النمط نفسها في كل موجه.
- ترتيب المقاطع بحيث يتوافق كل منها مع السطر الذي يتم نطقه.
- إضافة تعليق صوتي (voiceover) من صوت AI مُستنسخ أو جاهز.
- حرق التسميات التوضيحية والتصدير بنسبة 9:16.
الحد الحقيقي: المقاطع المُولَّدة بالذكاء الاصطناعي تنجرف. قد يتغير شكل كوب القهوة بين اللقطات، وقد يظهر النص في الإطار مشوهًا، والهوية ليست مقفلة عبر المقاطع. أقوم بتوليد ثلاث محاولات لكل لقطة وأختار الأنظف، وأتجنب مطالبة النموذج بنص أو شعارات على الشاشة. عندما أحتاج إلى مواد يمكنني الوثوق بها، أُزاوج بين المقاطع المُولَّدة والمخزنة (stock) حتى لا تبدو جميع القطعات اصطناعية.
التسميات التوضيحية: النص على الشاشة الذي يحافظ على تفاعل المشاهد الصامت أثناء التشغيل التلقائي
التسميات التوضيحية غير قابلة للتفاوض لأن معظم مشاهدات الفيديو القصير تبدأ بدون صوت. أقوم بالنسخ الصوتي التلقائي للصوت، ثم أُصمم الكلمات بحيث تكون مقروءة في النظرة الأولى. تصدير التسميات التوضيحية الافتراضي للذكاء الاصطناعي قابل للاستخدام ولكنه قبيح، لذلك أقضي دقيقتين على نوع الخط (type).

قواعد التسميات التوضيحية التي أتبعها:
- كلمة إلى ثلاث كلمات لكل بطاقة تسمية، متزامنة مع إيقاع الكلام.
- وضع الكلمات في الثلث العلوي الأوسط، بعيدًا عن واجهة المستخدم للمنصة وشريط التعليقات.
- استخدام خط Sans-serif ثقيل مع ضربة أو لوحة خلفية للتباين.
- تمييز الكلمة المفتاحية بلون متباين لتثبيت العين.
- الحفاظ على التسميات التوضيحية داخل المنطقة الآمنة حتى تنجو عند إعادة النشر عبر التطبيقات.
أتعامل مع النسخ الصوتي نفسه كمسودة. يخطئ الذكاء الاصطناعي في الأسماء العلمية، والأرقام، والمصطلحات التقنية، وكلمة خاطئة واحدة في التسميات التوضيحية تُقرأ على أنها خطأ للمشاهد. أقرأ كل تسمية توضيحية بصوت عالٍ مقابل الصوت قبل أن أقوم بالتصدير.
إعادة استخدام فيديو طويل إلى مقاطع قصيرة
إعادة الاستخدام هو المكان الذي يدفع فيه الذكاء الاصطناعي بأسرع ما يمكن، لأن الفيديو الطويل موجود بالفعل والسؤال الوحيد هو أي ثلاثين ثانية تستحق القطع. آخذ تسجيلًا مدته 20 دقيقة وأستخرج منه أربعة إلى ستة مقاطع قصيرة في جلسة واحدة.
الطريقة التي أستخدمها:
- وضع الفيديو الطويل وتشغيل النسخ الصوتي بالذكاء الاصطناعي مع تحديد متحدثي الأدوار (speaker turns).
- مطالبة الأداة بوضع علامة على اللحظات التي تتجاوز عتبة معدل المشاهدة أو التفاعل.
- سحب كل لحظة معلمة وتقصير عشر ثوانٍ من الجانبين.
- إعادة تأطير اللقطات الأفقية إلى 9:16 باستخدام التتبع التلقائي على المتحدث.
- إعادة قص الخطاف ليظهر في المقدمة بحيث يفتح كل مقطع بأقوى سطر فيه.
- حرق تسميات توضيحية جديدة ونشر كل مقطع قصير كمنشور خاص به.
إعادة التأطير هي الخطوة التي تفشل فيها معظم المرات. يفقد التتبع التلقائي المتحدث عندما يتحرك أو عندما يكون شخصان على الشاشة، لذلك أتحقق من إطار القص 9:16 إطارًا بإطار في أول مقطع من كل دفعة. يغطي دليلنا AI video editing أدوات إعادة التأطير والألوان بمزيد من التفصيل.
ما هي أدوات الذكاء الاصطناعي التي أستخدمها فعليًا؟
أحافظ على مجموعة الأدوات صغيرة عن قصد. كل أداة تقوم بوظيفة أفضل من غيرها، وتبديل الأدوات في منتصف الدفعة يكلف وقتًا أكثر مما يوفر.
| Job | What I use | Why |
|---|---|---|
| Text or image to clip | Sora video generator | Longest coherent shots, strong motion |
| Camera-controlled clips | Runway Gen-3 video | Direct pan, tilt, and zoom dials |
| Long-to-short chopping | Built-in AI highlight finder | Finds watch-rate peaks automatically |
| Captions and transcription | Auto-caption with manual pass | Fast draft, I fix the nouns |
تظهر مقارنة النماذج والمقايضة بين Sora و Runway في تحليل Sora AI video generator. بالنسبة للمقاطع القصيرة على وجه التحديد، أتوجه إلى Sora عندما أحتاج أن يتماسك المشهد بالكامل وإلى Runway عندما أحتاج حركة كاميرا دقيقة.
ما الذي سيجعل مقطعك القصير مُعلمًا أو مدفونًا؟
تعاقب المنصات على أشياء محددة، وبعضها سهل الوقوع فيه عن طريق الخطأ عند الاعتماد على الذكاء الاصطناعي. معرفة القواعد قبل النشر يوفر منشورًا كان سيموت خلاف ذلك في المراجعة.
المخاطر التي أراقبها:
- العلامات المائية من منصة منافسة متبقية على التصدير.
- لقطات ذات دقة منخفضة أو مُحاطة بأشرطة سوداء تشير إلى إعادة نشر كسولة.
- تسميات توضيحية مولدة تلقائيًا تحتوي على ألفاظ بذيئة أو إهانات تم نسخها بشكل خاطئ.
- محتوى فيديو بالذكاء الاصطناعي لأشخاص حقيقيين بدون الكشف عن ذلك حيث تتطلبه المنصة.
- صوت غير مرخص أو مأخوذ من فيديو صانع محتوى آخر.
تحدد business advertising and content policies الخاصة بـ TikTok المعيار لما يتم تخفيض ترتيبه، وتتبع المنصات الأخرى منطقًا مماثلاً: الأصلي، والعمودي، والواضح، والموضوعي هو ما يبقى. أحافظ على قائمة مراجعة لهذه الأشياء وأمر بها على كل مقطع قصير قبل الضغط على نشر، لأن علامة مائية واحدة أدت إلى إحباط منشور قوي لولا ذلك.
ملخص: سير عملي الأسبوعي للفيديو القصير
هذه هي الدورة التي أتبعها كل أسبوع، ومُكثفة إلى الخطوات المهمة. يقوم الذكاء الاصطناعي بالجهد الثقيل في b-roll والتسميات التوضيحية وتقطيع الطويل إلى قصير؛ وأنا من يكتب الخطاف ويقوم بالقطع.

قائمة مراجعتي الأسبوعية:
- اختيار فكرة واحدة وكتابة خمسة متغيرات للخطاف.
- توليد أو سحب ما بين ستة إلى ثماني ثوانٍ من b-roll لكل لقطة.
- تسجيل أو تصنيع التعليق الصوتي.
- النسخ الصوتي التلقائي وحرق التسميات التوضيحية المُصممة.
- تقصير الفيديو ليصبح 9:16 وأقل من 60 ثانية، ووضع الخطاف في الثواني الثلاث الأولى.
- تشغيل قائمة مراجعة المخاطر، ثم النشر.
التنبيه الذي سأختتم به: الذكاء الاصطناعي يسرع الإنتاج، لكنه لا يصنع الطلب. المقاطع القصيرة التي حققت أفضل أداء لي كانت تلك التي تحتوي على فكرة مفيدة أو مدهشة حقًا تحت اللمسة النهائية. الفيديو السريع والرخيص والمُسمّى التوضيحي جيداً حول لا شيء ما زال يفشل. استخدم سير العمل لإرسال المزيد من أفكارك الجيدة، وليس لتغطية غيابها.
Image credits
- A modern smartphone on a tripod recording a content styling video setup — photo by Tracy Le Blanc on Pexels
- A content creator recording a video at a desk with camera and lighting gear — photo by RODNAE Productions on Pexels
- A close-up of a video editing timeline interface on a computer screen — photo by Alex Fu on Pexels
- A smartphone screen displaying popular social media applications — photo by cottonbro studio on Pexels
استخدم الأدوات المجانية أثناء متابعة الدليل.
تابع القراءة

Wed Mar 25 2026 20:00:00 GMT-0400 (Eastern Daylight Time)
مُصغِّر الصور بالجملة: تغيير حجم مئات الصور دفعة واحدة (مجاني)
قم بتغيير حجم مئات الصور دفعة واحدة ومجاناً باستخدام أداة متصفح، أو ImageMagick، أو XnConvert، أو سكريبت Python. يوفر هذا سير عمل دفعات آمن وتوفيراً حقيقياً للبايتات.

Wed Mar 18 2026 20:00:00 GMT-0400 (Eastern Daylight Time)
محول WebP: كيفية تحويل الصور إلى WebP (بأحجام حقيقية)
حوّل صور JPEG و PNG إلى WebP لملفات ويب أصغر. يتضمن الدليل أحجامًا مقاسة فعليًا، وأمر cwebp، وطرق Python والمتصفح، واستراتيجية احتياطية (fallback) باستخدام JPEG/PNG.

Wed Mar 11 2026 20:00:00 GMT-0400 (Eastern Daylight Time)
Real-ESRGAN AI Upscaling: كيفية عملها ومتى يجب استخدامها
شرح ما هو Real-ESRGAN، وكيف تعمل تقنية Super-resolution القائمة على GAN، وما هي نقاط قوته (مثل الـ 4x upscaling للصور والفن) وأين يفشل، مع الأوامر والحدود الواقعية.