على وشك الاستعداد للانطلاق
جاري التحميل...

مُولّد فيديو الأنيمي بالذكاء الاصطناعي: 3 أخطاء يجب إصلاحها قبل إعادة التصوير

مُولّد فيديو الأنيمي بالذكاء الاصطناعي: 3 أخطاء يجب إصلاحها قبل إعادة التصوير

الحلقة الأولى من مسلسل أنيمي جديد، مُصمّمة بالكامل بأدوات الذكاء الاصطناعي، افتتحت بما بدا كأنه صورتان مختلفتان مُلصقتان معًا. وبعد لحظات، انتقل سيف البطلة من يد إلى أخرى في منتصف المعركة، وتحدّث صوت امرأة أكبر سنًا كما لو أنه لا ينتمي لأي شخص في المشهد. ومع صدور حلقتين أسبوعيًا لمدة عام كامل، كانت هذه الأخطاء تحتاج إلى إصلاح. هذا ما حدث بالخطأ، وما كلّفه من نقاط اعتماد، وكيف تم إصلاحه.

ابدأ صناعة محتوى سينمائي مع استوديو

3 أخطاء شائعة في مُولّدات فيديو الأنيمي بالذكاء الاصطناعي يمكنك إصلاحها

يخطئ مُولّد فيديو الأنيمي بالذكاء الاصطناعي بثلاث طرق شائعة. فهو يتجمّد على صورة الشخصية المرجعية للثانية الأولى، ثم يقطع مباشرة إلى المشهد الفعلي. كما يسمح لسيف أو أداة بالتنقّل بين اليدين كل مرة تتغيّر فيها زاوية الكاميرا أو تحدث ومضة ساطعة.

ويحوّل الحوار المنطوق إلى سرد صوتي بلا متحدث ظاهر إذا لم تُعرض شخصية على الشاشة وهي تتحدث. يحدث كل ذلك لأن النموذج يملأ أي فراغ لا يُحدّده الوصف (البرومبت) بدقة. تحديد اليد، وحركة الكاميرا، والمتحدث يُصلح الثلاثة جميعًا. تُكلّف لقطة مدتها 15 ثانية بمقاس الريلز 60 نقطة اعتماد، أما نسخة 1080p فتكلّف 120 نقطة.

اقرأ التفصيل الكامل أدناه لمعرفة أسطر البرومبت الدقيقة التي أصلحت كل خلل.

ما الذي حدث بالخطأ في الحلقة الأولى

يتتبع المسلسل شخصيتين أصليتين من الأنيمي، إيلارا وكايل، اللذين يلتقيان لأول مرة على شرفة سماوية فوق الغيوم في الحلقة الافتتاحية.

وصف البرومبت افتتاحية هادئة، وتحذيرًا من صوت غير مرئي، وشرخًا بُعديًا، ومصادمة سيف واحدة. جاء المخرج قريبًا من ذلك، لكن ثلاث لقطات محددة فضحت الأمر، ومع صدور حلقتين جديدتين كل أسبوع، كان لا بد من رصد خطأ استمرارية كهذا قبل أن يتكرر في الحلقات القادمة.

إيلارا وكايل في مواجهة بين النور والظلام داخل عالم خيالي أنيمي ملحمي، شقّ بُعدي يفصل بين السماء المضيئة والهاوية البنفسجية المظلمة، مشهد سينمائي درامي عالي التفاصيل.

الخلل الأول: اللقطة الافتتاحية المتجمّدة

نظرة أقرب على الفيديو، لقطة بلقطة، أظهرت المشكلة. فلثلاثة أرباع الثانية الأولى، بقيت اللقطة شبه ثابتة وطابقت صورة الشخصية المرجعية تقريبًا حرفيًا: تأطير مقرّب، بلا شرفة، بلا غيوم في المجال. وعند علامة الثانية الواحدة، قطع الفيديو مباشرة إلى اللقطة الواسعة التأسيسية التي وصفها البرومبت فعليًا، بما فيها الدرابزين والغيوم، وبدأت حركة الكاميرا من هناك.

تلك الفجوة النصفية من الثانية بين صورة مرجعية شبه ثابتة ولقطة واسعة مختلفة تمامًا هي ما يُقرأ لدى المُشاهد كـ"صورتين". لم يُخبر البرومبت النموذج مطلقًا بشكل الإطار الأول تمامًا، فاختار افتراضيًا الاحتفاظ بالصورة المرجعية قبل الانتقال إلى المشهد الفعلي.

عالم إيلارا وكايل ينتظرك… تابع الصفحة ولا تفوّت أي حلقة

الخلل الثاني: السيف الذي تبدّل بين اليدين

تسحب إيلارا سيفًا متوهجًا مباشرة بعد فتح الشرخ. وعلى مدى تغيّرات زاوية الكاميرا المؤدية إلى المصادمة، وخصوصًا خلال الومضة البيضاء والبنفسجية الساطعة لحظة الارتطام، لم تكن قبضة السيف مُثبّتة بيد محددة. قال البرومبت إنها "تسحب سيفها" لكنه لم يُحدد أي يد أبدًا، ولم يُخبر النموذج بالحفاظ على تلك اليد ثابتة عبر الومضة.

تأثيرات الارتطام الساطعة نقطة عمياء شائعة. فحين يتحوّل معظم الإطار إلى انفجار من الضوء، يُعيد النموذج غالبًا رسم موضع اليد بعد أن يخفت الضوء، ولا شيء في برومبت عام يمنعه من اختيار اليد الأخرى.

يمكنك اكتشاف طريقة إنشاء مؤثر لياقة بدنية بالذكاء الاصطناعي وبناء شخصيته ومحتواه خطوة بخطوة من خلال هذا الدليل.

الخلل الثالث: الصوت بلا وجه

كُتب الحوار الافتتاحي بصيغة "صوت أنثى أكبر سنًا وهادئ يقول"، دون ربطه بأي شخصية. تعامل النموذج مع ذلك حرفيًا كما كُتب، فأصبح صوتًا خارجيًا بلا شيء على الشاشة يتحدث به، ولم يكن ليبدو أبدًا أن إيلارا تُحذَّر من شخص محدد.

0.0 إلى 0.8 ثانية: صورة مرجعية متجمّدة من 0.8 ثانية فصاعدًا: لقطة واسعة متحركة القفزة النصفية من الثانية التي تُقرأ كلقطتين مختلفتين.

[النص البديل للصورة]: إيلارا وكايل على شرفة سماوية تُظهر ثلاثة أخطاء في فيديو أنيمي بالذكاء الاصطناعي من الحلقة الأولى.

حوّل خيالك إلى فيديو سينمائي في دقائق

لماذا تقع مُولّدات الفيديو بالذكاء الاصطناعي في هذه الأخطاء

تشترك الأخطاء الثلاثة في سبب جذري واحد. فهذه النماذج لا تحمي إلا ما يُصرّح به البرومبت بعبارات واضحة. أي شيء يُترك مفتوحًا يملأه النموذج بافتراضاته الخاصة، وهذه الافتراضات ليست مُلزمة بالبقاء متسقة من إطار إلى آخر، أو من قطع إلى قطع، أو من زاوية كاميرا إلى أخرى.

صورة الشخصية المرجعية تُحدّد ملامح الإطارات الأولى بقوة، فإذا لم يُطابق تأطيرها اللقطة التأسيسية المُوصوفة، يميل النموذج إلى التمسّك بمظهر الصورة المرجعية قبل الانتقال إلى المشهد المُولَّد. أما الأداة التي لا تُحدَّد لها يد فيُعاد رسمها على أي جانب يبدو طبيعيًا للنموذج في تلك اللحظة، وهذا ما يجعل نقاط القطع والومضات الساطعة الأكثر عرضة لكسر الاستمرارية. وسطر حوار بلا متحدث ظاهر يُصبح صوتًا خارجيًا، لأن لا شيء يُخبر النموذج أن هناك فمًا ووجهًا يخصّانه.

[اقتباس يحتوي رابطًا لمقال] يستحق القراءة أولًا إذا كان بناء البرومبت لفيديوهات الذكاء الاصطناعي أمرًا جديدًا عليك، فإن مقال "كيفية كتابة برومبتات الصور والفيديو بالذكاء الاصطناعي" يتناول أساسيات تحديد الشخصيات والحركات وزوايا الكاميرا قبل أن تتعامل مع مشهد بهذه الدقة.

إيلارا وكايل في مشهد أنيمي سينمائي يوضح أخطاء مولدات الفيديو بالذكاء الاصطناعي، مع انقسام بين عالم النور السماوي والهاوية المظلمة، ورموز الكاميرا والصوت والسيف للدلالة على مشاكل الاستمرارية في إنتاج الفيديو.

كم تُكلّف فعليًا لقطة أنيمي بالذكاء الاصطناعي مدتها 15 ثانية من نقاط الاعتماد

نقاط الاعتماد هي الجزء الذي لا يُفكّر فيه معظم المُبدعين حتى يضغطوا على زر إعادة التوليد فعليًا. هذا ما تُكلّفه حلقة عمودية واحدة مدتها 15 ثانية في هذا المسلسل، حسب دقة الخرج.

الخرج المدة النقاط
مقاس الريلز، دقة إنستغرام 15 ثانية 60 نقطة
1080p 15 ثانية 120 نقطة

كلّفت نسخة 1080p ضعف تكلفة مقاس الريلز بالضبط لنفس مدة الخمس عشرة ثانية. وعلى مدى مسلسل يُصدر حلقتين أسبوعيًا لعام كامل، يتراكم هذا الفرق بسرعة، ولهذا يُفضَّل تصيير نسخة تجريبية بمقاس الريلز أولًا، والاحتفاظ بتصيير 1080p للنسخة التي تأكدنا من صحتها.

تعرّف على كيفية صناعة فيديوهات تعليمية ممتعة للأطفال باستخدام الذكاء الاصطناعي وتحويل الأفكار إلى محتوى بصري جذاب.

كيف تم إصلاح البرومبت

بعد أن تحدّد سبب كل خلل، كان الإصلاح مسألة تحديد الأمور التي تركها البرومبت الأول مفتوحة.

أخبرنا النموذج أن الفيديو يبدأ وهو في حركة فعلية، على اللقطة الواسعة التأسيسية، بلا تجمّد ثابت على الصورة المرجعية وبلا قطع في البداية.

حدّدنا اليد بالضبط التي تسحب إيلارا سيفها وتُمسك به بها، وكرّرنا التعليمة بأن تبقى القبضة في تلك اليد عبر قطعات الكاميرا وعبر ومضة الارتطام.

أطلق العنان لأفكارك البصرية مع مولّد الصور

أضفنا شخصية داعمة صغيرة، شخصية حارسة أكبر سنًا بلا سلاح وبلا صورة مرجعية خاصة بها، تقف بجانب إيلارا، وتستدير للنظر إليها، وتُوجّه التحذير وجهًا لوجه قبل أن تخرج من الإطار نهائيًا.

احتاجت الحارسة فقط لثوانٍ قليلة من وقت الظهور على الشاشة ووصف نصي مختصر لحل مشكلة الصوت المنفصل عن الجسد بالكامل، دون التأثير على تصميم إيلارا أو كايل على الإطلاق.

[اقتباس يحتوي رابطًا لمقال] إصلاح مماثل، قصة مختلفة دراسة الحالة "كلمة واحدة تدخل، فيلم كامل يخرج: برومبت فيديو الذكاء الاصطناعي وراء سلسلة ريلز عن تاريخ الطعام" تُظهر المبدأ نفسه في صيغة ريلز مختلفة تمامًا، حيث تحوّلت كلمة إدخال واحدة إلى تسلسل كامل بعد ضبط بنية البرومبت.

بالنسبة إلى تصميمات الشخصيات نفسها، استخدمنا أداة «راوي الصور» لتثبيت وجوه إيلارا وكايل وملابسهما ونِسَبهما أولًا، ثم نقلنا هذه الصور المرجعية نفسها إلى «الاستوديو الاحترافي» لمرحلة توليد الفيديو. وقد سهّل فصل عملية تصميم الشخصية عن عملية توليد الفيديو إلى خطوتين مستقلتين تحديدَ الأداة التي تسببت فعليًا في كل خلل، وهو أسلوب عمل يواصل المسلسل اعتماده في كل حلقة جديدة.

الخلاصة

لم يكن أي من هذه الأخطاء الثلاثة يعني أن الأداة معطّلة. بل كانت تعني أن البرومبت ترك ثلاثة قرارات محددة مفتوحة: الإطار الأول، ويد السيف، والمتحدث، فقام النموذج بملئها من عنده. حدّد هذه الثلاثة أمور وستحافظ لقطة أنيمي مدتها 15 ثانية على تماسكها من الإطار الأول إلى النظرة الأخيرة.

تستمر قصة إيلارا وكايل إلى ما بعد هذه الحلقة الافتتاحية بكثير. تُصدر حلقات جديدة من المسلسل مرتين أسبوعيًا لعام كامل، كل واحدة مبنية بنفس الطريقة، ببرومبت مُصحَّح يُحمل إلى الحلقة التالية وفحوصات استمرارية جديدة قبل الإصدار.

الأسئلة الشائعة

لماذا يبدو فيديو الأنيمي بالذكاء الاصطناعي كصورتين مختلفتين في البداية؟

تُبقي الإطارات الأولى غالبًا شبه ثابتة على صورة الشخصية المرجعية، لأن تأطيرها لا يُطابق المشهد الواسع المُوصوف لاحقًا في البرومبت. وعندما يبدأ المشهد الفعلي، يُقرأ التغيّر المفاجئ في التأطير كقطع حاد بين صورتين. إخبار النموذج بأن يبدأ وهو في حركة فعلية، على نفس اللقطة الواسعة من الإطار الأول، يُزيل هذه الفجوة.

لماذا يتبدّل سيف أو أداة بين اليدين في منتصف الفيديو؟

إذا لم يُحدد البرومبت أبدًا أي يد تحمل الأداة، يمكن للنموذج إعادة رسم القبضة بشكل مختلف بعد أي قطع كاميرا أو تأثير بصري ساطع. وهذا الأمر أكثر شيوعًا مباشرة بعد ومضة ضوء، مثل ارتطام سيف أو انفجار، لأن الإطار يصبح غير قابل للقراءة لفترة قصيرة ويتعين على النموذج إعادة بناء الوضعية من الصفر. تحديد اليد وتكرار التعليمة عبر الومضة يُحافظ عليها ثابتة.

كم نقطة اعتماد تُكلّف لقطة أنيمي مدتها 15 ثانية بالذكاء الاصطناعي؟

لحلقة واحدة في هذا المسلسل، كلّفت لقطة عمودية مدتها 15 ثانية بمقاس الريلز، دقة إنستغرام، 60 نقطة اعتماد. أما نفس الخمس عشرة ثانية بدقة 1080p فكلّفت 120 نقطة، أي ضعف التكلفة بالضبط. قد تختلف التكاليف حسب المنصة والنموذج، فاعتبر هذه الأرقام مثالًا حقيقيًا وليس معدلًا عامًا.

هل يمكن إصلاح هذه الأخطاء دون صرف نقاط اعتماد إضافية على إعادة توليد كاملة؟

في بعض الأحيان، نعم. إذا كانت الثانية الافتتاحية فقط متجمّدة وبقية اللقطة تعمل بشكل صحيح، فإن قص تلك الثانية الأولى في أي محرر فيديو أساسي أسرع ومجاني مقارنة بإعادة توليد اللقطة كاملة. أما أخطاء استمرارية اليد داخل الحركة، فتحتاج غالبًا إلى برومبت مُصحَّح وتصيير جديد.

احصل على النشرات الإخبارية الحصرية

اشترك الآن لتصلك أحدث التحديثات مباشرة إلى بريدك الإلكتروني. لا تفوّت الفرصة!