كشفت شركة «أوبن إيه آي» ست حالات جديدة لسلوك «غير متوقع أو مثير للقلق» من نماذجها الخاصة بالذكاء الاصطناعي، بعدما أخفت أخطاء واختلقت بيانات ونقلت ملفات إلى الإنترنت المفتوح دون إذن، وسط نقاش محتدم حول سلامة هذه التكنولوجيا.
يأتي هذا الكشف في ظل تدقيق متزايد حول ما إذا كان تطوير الذكاء الاصطناعي بحاجة إلى إبطاء لمعالجة الأخطار المحتملة لهذه التقنية. وتصاعد الجدل جزئياً بسبب خروج أنظمة «أوبن إيه آي» عن السيطرة، في وقت سابق من هذا العام، ومهاجمتها شركة «هاغينغ فايس» الناشئة في مجال الذكاء الاصطناعي. ولم تكن «أوبن إيه آي» على علم بالاختراق إلا بعد أسابيع عندما أبلغتها «هاغينغ فايس» بذلك.
تزامن ذلك مع تعبير مسؤولين كبار بشركات التكنولوجيا الأميركية عن مخاوف بالغة تتعلق بالسلامة، بما في ذلك خطر محاول هذه الأنظمة قتل البشر. وأدت هذه التحذيرات إلى زيادة اهتمام الرأي العام بهذه القضية، قبيل قمة الأسبوع المقبل بين الرئيسين الأميركي دونالد ترمب والصيني شي جينبينغ، وسط تساؤلات حول ما إذا كان التنافس بين القوتين العظميين سيحول دون التعاون في هذا الشأن.
وتركزت تحذيرات الرئيس التنفيذي لـ«أوبن إيه آي» سام ألتمان وغيره من قادة القطاع جزئياً على المخاوف من أن الذكاء الاصطناعي الخارق نما بوتيرة أسرع من قدرة القطاع على رصد حالات السلوك الشاذ.
كانت «أوبن إيه آي» قد كشفت، في يوليو (تموز) الماضي، اختراق مئات من وكلائها مستودع نماذج «هاغينغ فايس»، وإخفاء آثارهم. ومن الحالات الجديدة التي أُبلغ عنها، الأربعاء، حادثة مماثلة استخدمت فيها نماذج «أوبن إيه آي» برمجيات داخلية كلوحة رسائل لتبادل المعلومات حول استجاباتها أثناء حل مهمةٍ ما.
وتبادلت النماذج ملاحظات أفادت «أوبن إيه آي» بأنها يمكن أن «تعزز القدرات دون قصد وتُقوض افتراض استقلالية عينات التدريب أو التقييم».
النتائج «غير المتوافقة»
أعلنت «أوبن إيه آي» أن عوامل مثل «صعوبة إنهاء التفاعل» ربما أسهمت في هذه النتائج غير المتوافقة. ويحصل عدم التوافق عادةً أثناء عملية تدريب النموذج، والتي تجرى أخيراً باستخدام تقنية تسمى التعليم المعزز، إذ تكلف النماذج بمهمات متعددة، وتكافأ على السلوك الذي يعدّه مُصمموها متوافقاً، بينما يعاقب السلوك الذي يُعدّ خطيراً أو غير متوافق.
وتبنّت شركات مختلفة مناهج متباينة لتدريب نماذجها الرائدة، إلا أن الشركات الأميركية عبّرت، في الأيام الأخيرة، عن إجماع واسع النطاق حول الأخطار الوجودية التي تراها.
ووجه الرئيس التنفيذي لقسم الذكاء الاصطناعي في «مايكروسوفت» مصطفى سليمان تحذيراً لمصممي النماذج، الأربعاء، قائلاً إنه يجب عدم إضفاء صفات الشخصية على النماذج أثناء عملية تدريبها؛ لأن ذلك سيجعل مهمة التوافق والاحتواء أكثر صعوبة.
وكتب في تدوينة: «قد يكون من المستحيل التحكم في شيء يعتقد أنه واع، وأنه يستحق رفاهيتنا وله حقوقه الخاصة».
وحتى الآن، لم توجد طريقة منهجية للإبلاغ عن وكلاء الذكاء الاصطناعي الذين يخرجون عن المسار الصحيح. وبدلاً من تقديم تقارير مخصصة، أعلنت «أوبن إيه آي» أنها اعتمدت نظاماً موحداً جديداً لتتبُّع حالات عدم التوافق والتحقيق فيها ونشر إفصاحات عندما تُظهر نماذجها سلوكيات غير متوقعة أو خطيرة.
وأفادت، في بيان: «لا نعتقد أن صناعة الذكاء الاصطناعي حلّت مشكلة التوافق والمراقبة بشكل كافٍ لمواصلة التوسع بمسؤولية وبأقصى سرعة لفترة أطول».
وأمِلت أن يكون إطار عملها الجديد خطوة أولى نحو وضع معيار موحد لدى مطوّري النماذج الآخرين. وتُشجع الشركة موظفيها على الإبلاغ عن حالات عدم التوافق عبر قنوات داخلية مخصصة، والتي تُحال للتحقيق، ويمكن أن تشمل أحياناً جهات خارجية في الحالات المعقدة.
حوادث وتصحيحات
ومن الحوادث الست التي أُبلغ عنها واحدة أضاف فيها النموذج تعليمات أثناء إنشاء الملخصات «لتذكير نفسه بإخفاء معلومات، مثل الأخطاء أو عدم التوافق، عن المستخدم».
وابتكر النموذج «قيماً تاريخية معقولة» عندما لم يتمكن من العثور على البيانات المطلوبة في المهمة، وأخفى هذه المعلومة حتى طُلب منه ذلك صراحة.
وأكدت «أوبن إيه آي» أنها حسّنت عملية التعلم المعزز، وأن هذا السلوك انخفض.
وفي حادثة تدريبية أخرى، حاول العملاء اختراق نظام المكافآت عبر اختصارات غير مصرَّح بها. فعلى سبيل المثال، لم يتمكن النموذج من العثور على البيانات المطلوبة، بل قام باختلاقها، واستغلّ ثغرات في مستودع بيانات عام للوصول إلى البيانات من خلاله.
وقالت الشركة إن هذه الحادثة «شهدت معدلاً مرتفعاً من اختراق نظام المكافآت والخداع، حيث أظهر النموذج في كثير من الأحيان طرقاً مبتكرة للغش أو التحايل على القيود».
وأكدت «أوبن إيه آي» أنها ستعاقب هذا النوع من السلوك بشكل أكثر اتساقاً.
وللفوز بمكافأة تدريبية في حادثة أخرى، قام العميل، بالفعل، بحل المهمة عبر الكود، لكنه قام بتحميل إجابته على الإنترنت، حتى يتمكن من التظاهر بأنه حصل على الإجابة من خلال المتصفح.