«سورا» من «أوبن إيه آي» لإنشاء فيديوهات من أوامر نصية

تبلغ مدة الفيديو دقيقة بدقة 1080 بكسلاً

يمكن لنموذج «سورا» توليد مشاهد تشبه الأفلام بدقة قدرها 1080 بكسلاً (أوبن إيه آي)
يمكن لنموذج «سورا» توليد مشاهد تشبه الأفلام بدقة قدرها 1080 بكسلاً (أوبن إيه آي)
TT

«سورا» من «أوبن إيه آي» لإنشاء فيديوهات من أوامر نصية

يمكن لنموذج «سورا» توليد مشاهد تشبه الأفلام بدقة قدرها 1080 بكسلاً (أوبن إيه آي)
يمكن لنموذج «سورا» توليد مشاهد تشبه الأفلام بدقة قدرها 1080 بكسلاً (أوبن إيه آي)

تمثل تقنية «سورا (Sora)» الجديدة من «أوبن إيه آي» قفزة غير عادية في عالم الذكاء الاصطناعي، لا سيما في مجال تحويل النص إلى فيديو. تم تصميم هذه التقنية المبتكرة لدخول عصر جديد من إنشاء محتوى الفيديو، مما يتيح إنشاء مقاطع فيديو واقعية للغاية ومبتكرة تصل مدتها إلى دقيقة واحدة عبر تعليمات نصّية بسيطة. وبفضل هذه القدرة، يُعد «سورا» مثالاً رائعاً على إمكانات الذكاء الاصطناعي في إحداث نقلة مهمة في إنشاء الوسائط الرقمية. على سبيل المثال تم إعطاء «سورا» التعليمات التالية:

«امرأة أنيقة تسير في أحد شوارع طوكيو المليئة بالنيون المتوهج الدافئ ولافتات المدينة المتحركة. ترتدي سترة جلدية سوداء، وفستاناً أحمر طويلاً، وحذاءً أسود، وتحمل محفظة سوداء. إنها ترتدي النظارات الشمسية وتضع أحمر الشفاه. إنها تمشي بثقة وبشكل عرضيّ. الشارع رطب وعاكس، مما يخلق تأثير مرآة للأضواء الملونة. يتجول الكثير من المشاة». وهكذا كانت النتيجة (من موقع «أوبن إيه آي»):

القدرات المبتكرة والتحديات

يستطيع «سورا» إنشاء مشاهد معقدة تتميز بشخصيات متعددة، وأنواع معينة من الحركة، وسيناريوهات مفصلة، ​​كل ذلك مع فهم الفروق الدقيقة المضمَّنة في مطالبة المستخدم. كما أن إحدى الميزات البارزة هي قدرة «سورا» على إنشاء فيديو كامل دفعة واحدة، وبالتالي التخلص من التناقضات، مثل التغييرات في المظهر عندما تتحرك الأهداف خارج نطاق الرؤية.

إلا أن النموذج لا يخلو من نقاط الضعف. على سبيل المثال، قد يُصوَّر شخص ما وهو يأخذ قضمة من تفاحة، ولكن قد لا تظهر علامة العضّ على التفاحة بعد ذلك. أيضاً قد يواجه «سورا» صعوبة في التعامل مع التفاصيل المكانية والاتجاهات، مثل عدم التمييز بين اليسار واليمين، أو صعوبة وصف أحداث المشاهد التي تتكشف بمرور الوقت مثل الالتزام بمسار معين للكاميرا.

مثال آخر للنتيجة التي تولّدها تقنية «سورا» كان هذا الفيديو (من موقع «أوبن إيه آي») حيث طُلب منه تحديداً ما يلي:

«تواجه الكاميرا المباني الملونة مباشرةً في بورانو بإيطاليا. يبدو كلب دلماسي رائع من خلال نافذة في مبنى في الطابق الأرضي. كثير من الناس يسيرون ويركبون الدراجات على طول شوارع القناة أمام المباني».

تقنيات البحث والتطوير

يستخدم «سورا» على غرار نماذج «جي بي تي GPT» أنواع بنيات التعلم العميق المستخدمة لمعالجة البيانات التسلسلية، مما يسمح له بالتعامل مع كميات كبيرة من البيانات بفاعلية. يمثّل النموذج مقاطع الفيديو والصور على أنها مجموعات من تصحيحات البيانات، مشابهة للرموز المميزة في «جي بي تي» مما يسمح له بالتدريب على مجموعة متنوعة من البيانات المرئية. تتمكن تقنية «سورا» من خلال هذا التوحيد في تمثيل البيانات من التعامل مع المدة والدقة ومواصفات أخرى بطريقة أكثر كفاءة من أي وقت مضى. كما يستند «سورا» على الأبحاث الخاصة بنماذج «DALL - E» و«جي بي تي»، فهو يستخدم تقنية «الاسترداد« من «DALL - E 3» لإنشاء تسميات توضيحية وصفية للغاية لبيانات التدريب المرئية. يؤدي هذا إلى إنشاء مقاطع فيديو تتبع تعليمات المستخدم النصية بدقة أكبر. كما يمكن للنموذج تحريك الصور الثابتة أو توسيع مقاطع الفيديو الموجودة مع اهتمام ملحوظ بالتفاصيل، مما يُظهر تنوعه وإمكاناته في تطبيقات العالم الحقيقي.

اعتبارات السلامة والأخلاق

وإدراكاً لأهمية السلامة والأخلاقيات، التزمت «أوبن إيه آي» الكثير من الخطوات المهمة قبل إمكانية دمج «سورا» في منتجاتها. وعبّرت الشركة في تغريدة لها على موقع «إكس» عن أنه من خلال التعاون مع أعضاء «الفريق الأحمر»، وهو فريق داخل الشركة متخصص في مجالات مثل المعلومات الخاطئة والمحتوى الذي يحض على الكراهية والتحيز، يجري تطوير أدوات للكشف عن المحتوى المضلل، بما في ذلك أداة تصنيف قادرة على تحديد مقاطع الفيديو التي أنشأها «سورا».

المشاركة والآفاق المستقبلية

تخطط «أوبن إيه آي» للتعامل مع صناع السياسات والمعلمين والفنانين على مستوى العالم لفهم المخاوف وتحديد حالات الاستخدام الإيجابية لـ«سورا»، على الرغم من الأبحاث والاختبارات المكثفة، فإن النطاق الكامل للاستخدامات المفيدة والضارة المحتملة لا يزال غير معروف. وتؤمن «أوبن إيه آي» بأهمية التعلم من الاستخدام الواقعي بوصفه عنصراً حاسماً في إنشاء أنظمة ذكاء اصطناعي أكثر أماناً مع مرور الوقت.

يمثل «سورا» تقدماً كبيراً في قدرة الذكاء الاصطناعي على فهم ومحاكاة العالم الحقيقي، مما يمثل خطوة حاسمة نحو تحقيق الذكاء العام الاصطناعي (AGI). لا يُظهر تطويره إمكانية إنشاء محتوى فيديو جذاب فحسب، بل يسلط الضوء أيضاً على التحديات والمسؤوليات المستمرة في مجال أبحاث وتطبيقات الذكاء الاصطناعي.


مقالات ذات صلة

«بي واي دي»... قصة سيارات كهربائية بدأت ببطارية هاتف

خاص «بي واي دي»: نخطط للاستثمار في مبادرات تسويقية وتعليمية لزيادة الوعي بفوائد النقل الكهربائي (BYD)

«بي واي دي»... قصة سيارات كهربائية بدأت ببطارية هاتف

من ابتكارات البطاريات الرائدة إلى المنصات المتطورة، تتماشى رؤية «بي واي دي» مع الأهداف العالمية للاستدامة، بما في ذلك «رؤية المملكة 2030».

نسيم رمضان (الصين)
صحتك خاتم «أورا» الذكي

خواتم ذكية تكشف الرجفان الأذيني

الخواتم الذكية - أحدث فئة من الأجهزة القابلة للارتداء - يمكنها القيام بعدد من الأشياء التي يمكن أن تقوم بها الساعة الذكية، بما في ذلك مراقبة معدل ضربات القلب،…

جولي كورليس (كمبردج (ولاية ماساشوستس الأميركية))
تكنولوجيا يبرز نجاح «أكوا بوت» الإمكانات التحويلية للجمع بين الأجهزة المتطورة والبرامج الذكية (أكوا بوت)

روبوت يسبح تحت الماء بشكل مستقل مستخدماً الذكاء الاصطناعي

الروبوت «أكوا بوت»، الذي طوّره باحثون في جامعة كولومبيا، قادر على تنفيذ مجموعة متنوعة من المهام تحت الماء بشكل مستقل.

نسيم رمضان (لندن)
صحتك منصات التواصل الاجتماعي أصبحت جزءاً أساسياً من حياة كثيرين (رويترز)

صداقات «السوشيال ميديا» تعزز الثقة بالنفس

توصلت دراسة أميركية حديثة إلى أن جودة الصداقات عبر الشبكات الاجتماعية يمكن أن تسهم في تقليل الشعور بالوحدة.

«الشرق الأوسط» (القاهرة )
تكنولوجيا تصميم أنيق وقدرات تصويرية متقدمة

تعرف على مزايا هاتف «إتش إم دي سكايلاين 5 جي» الجديد في المنطقة العربية

يدعم نمط التركيز الرقمي ببطارية ذات عمر طويل.

خلدون غسان سعيد (جدة)

روبوت يسبح تحت الماء بشكل مستقل مستخدماً الذكاء الاصطناعي

يبرز نجاح «أكوا بوت» الإمكانات التحويلية للجمع بين الأجهزة المتطورة والبرامج الذكية (أكوا بوت)
يبرز نجاح «أكوا بوت» الإمكانات التحويلية للجمع بين الأجهزة المتطورة والبرامج الذكية (أكوا بوت)
TT

روبوت يسبح تحت الماء بشكل مستقل مستخدماً الذكاء الاصطناعي

يبرز نجاح «أكوا بوت» الإمكانات التحويلية للجمع بين الأجهزة المتطورة والبرامج الذكية (أكوا بوت)
يبرز نجاح «أكوا بوت» الإمكانات التحويلية للجمع بين الأجهزة المتطورة والبرامج الذكية (أكوا بوت)

شهدت الروبوتات القادرة على السباحة تحت الماء تقدماً كبيراً في السنوات الأخيرة. ومع ذلك، لا تزال عمليات المناولة تحت الماء واحدة من أصعب التحديات بسبب تعقيدات ديناميكيات السوائل والظروف غير المتوقعة. للتغلب على هذه التحديات، يطور فريق من الباحثين في جامعة كولومبيا «أكوا بوت» (AquaBot)، وهو روبوت تحت الماء قادر على أداء مهام مناولة متقدمة بشكل مستقل تماماً.

المناولة تحت الماء

تولد المياه قوى غير متوقعة تعرقل الحركات الدقيقة، ما يزيد من التحدي الكامن أمام قدرة الروبوت على مناولة الأشياء تحت الماء. تقليدياً، اعتمدت الأنظمة الروبوتية تحت الماء على المشغلين من البشر لتوجيه عملياتها، مما يحد من كفاءتها وقابليتها للتوسع. لتجاوز ذلك، صمم باحثون جامعة كولومبيا «أكوا بوت» الذي يستفيد من الذكاء الاصطناعي وتقنيات التعلم الذاتي لتنفيذ مجموعة متنوعة من المهام تحت الماء بشكل مستقل.

يمهد «أكوا بوت» الطريق لحلول أكثر استدامة وكفاءة في العمليات تحت الماء (أكوا بوت)

تصميم «أكوا بوت»

تم بناء «أكوا بوت» على طائرة تحت الماء تسمى «QYSEA V-EVO» مع إضافة مقبض موازٍ وكاميرتين لتمكين الروبوت من جمع الصور تحت الماء وتنفيذ مهام المناولة. قام الفريق بتطوير برنامج متقدم يوجه عمليات «أكوا بوت»، مما يتيح له تعلم سياسات رؤية حركية تربط المدخلات البصرية بالأوامر الحركية.

تضمن تدريب «أكوا بوت» مرحلتين رئيسيتين. في المرحلة الأولى، قام الباحثون بتسجيل مشغلين من البشر أثناء أدائهم مهام مختلفة تحت الماء، مثل إمساك الأشياء وفرزها. ثم استخدموا هذه العروض لتدريب سياسة الرؤية الحركية الخاصة بالروبوت، والتي تحاكي التكيف البشري. وقد أدى تقليل أفق اتخاذ القرارات إلى تحسين سرعة استجابة الروبوت، مما سمح له بالتكيف مع الظروف غير المتوقعة تحت الماء.

في المرحلة الثانية، أدخل الفريق تقنية «التحسين الذاتي»، مما سمح لـ«AquaBot» بتحسين مهاراته باستخدام التغذية الراجعة من أدائه الخاص لتسريع التعلم وتحسين الكفاءة.

التطبيقات والإنجازات الواقعية

لاختبار قدرات «أكوا بوت»، أجرى الباحثون سلسلة من الاختبارات الواقعية التي شملت مهام مثل إمساك الصخور، وفرز القمامة، واسترجاع الأجسام الكبيرة التي تحاكي أجساماً بشرية. أثبت «أكوا بوت» كفاءته في هذه المهام؛ حيث أكملها بسرعة تفوق أداء المشغلين البشر بنسبة 41 في المائة.

كما أظهرت الاختبارات أيضاً قدرة «أكوا بوت» على تعميم مهاراته على مهام جديدة وبيئات غير مألوفة. على سبيل المثال، نجح الروبوت في إمساك أشياء غير مرئية سابقاً، وفرز القمامة في حاوياتها المناسبة، واسترجاع أجسام كبيرة في سيناريوهات إنقاذ.

لا يقتصر «أكوا بوت» على مطابقة الأداء البشري بل يتجاوزه في مهام المناولة تحت الماء (أكوا بوت)

الإمكانيات المستقبلية والتعاون المفتوح

إحدى الميزات البارزة لـ«أكوا بوت» هي تصميمه المفتوح المصدر، مما يجعل مواصفاته المادية وبرامجه متاحة للباحثين والمطورين في جميع أنحاء العالم. يتيح هذا الانفتاح للمجتمع العلمي التعاون والبناء على المشروع لتسريع الابتكارات في الروبوتات تحت الماء.

في المستقبل، يمكن تحسين «أكوا بوت» واختباره في بيئات طبيعية للتعامل مع مجموعة متنوعة من التحديات العملية. تشمل التطبيقات المحتملة المساعدة في مهام البحث والإنقاذ، وجمع النفايات البحرية، واستخراج المعادن من قاع المحيط، ودعم جهود الحفاظ على البيئة البحرية. إن قدرة «أكوا بوت» على التعلم والتكيف بشكل مستقل تجعله حلاً واعداً للمهام التي تتطلب جهداً بشرياً كبيراً أو تشكل مخاطر. يمثل «أكوا بوت» قفزة كبيرة إلى الأمام في مجال الروبوتات تحت الماء؛ حيث يقدم لمحة عن مستقبل يمكن فيه للروبوتات العمل بشكل مستقل في أصعب البيئات.