«GPT-Live» نموذج صوتي جديد من «أوبن إيه آي» يستمع ويتحدث في الوقت نفسه

يحوّل الصوت إلى واجهة أكثر تقدماً للذكاء الاصطناعي

يستطيع النموذج الاستماع والتحدث في الوقت نفسه بدلاً من انتظار انتهاء المستخدم من الكلام قبل الرد (شاترستوك)
يستطيع النموذج الاستماع والتحدث في الوقت نفسه بدلاً من انتظار انتهاء المستخدم من الكلام قبل الرد (شاترستوك)
TT

«GPT-Live» نموذج صوتي جديد من «أوبن إيه آي» يستمع ويتحدث في الوقت نفسه

يستطيع النموذج الاستماع والتحدث في الوقت نفسه بدلاً من انتظار انتهاء المستخدم من الكلام قبل الرد (شاترستوك)
يستطيع النموذج الاستماع والتحدث في الوقت نفسه بدلاً من انتظار انتهاء المستخدم من الكلام قبل الرد (شاترستوك)

أطلقت «أوبن إيه آي» جيلاً جديداً من نماذج الصوت باسم «جي بي تي لايف» (GPT-Live) في خطوة تهدف إلى جعل التحدث مع «تشات جي بي تي» أقرب إلى محادثة بشرية طبيعية، لا تبادل أوامر متقطعة بين المستخدم والنظام. ويبدأ طرح النموذج عالمياً داخل تجربة «ChatGPT Voice» عبر نسختين هما «GPT-Live-1» و«GPT-Live-1 mini» على أن يصل لاحقاً إلى واجهة البرمجة للمطورين والشركات.

الاستماع والتحدث معاً

الفرق الأساسي في النموذج الجديد أنه يعتمد على بنية تعرف باسم «full-duplex» أي أنه يستطيع الاستماع والتحدث في الوقت نفسه. في النماذج الصوتية السابقة، كان النظام ينتظر غالباً انتهاء المستخدم من الكلام قبل أن يبدأ في الرد، مما يجعل الحوار أقرب إلى جولات منفصلة. أما في النموذج الجديد، فيستطيع النظام متابعة الكلام، أو الصمت عندما يحتاج المستخدم إلى التفكير، أو الرد السريع، أو استخدام عبارات قصيرة تدل على أنه يتابع الحديث.

تقول «أوبن إيه آي» إن «GPT-Live» يستطيع اتخاذ قرارات تفاعلية مرات عدة في الثانية، مثل أن يتكلم أو يواصل الاستماع أو يتوقف أو يقاطع أو يستدعي أداة أخرى. هذا التحول مهم لأن كثيراً من الإحباط في تجارب الصوت السابقة كان ناتجاً عن سوء تقدير لحظة انتهاء الكلام، خصوصاً عند وجود توقف قصير أو ضوضاء في الخلفية.

يمكن للنموذج الاستعانة بنماذج أقوى في الخلفية عند الحاجة إلى تحليل أعمق أو تنفيذ مهام أكثر تعقيداً (رويترز)

تفاعل مستمر

توضح الشركة أن أجيالاً سابقة من أنظمة الصوت اعتمدت على سلسلة من النماذج المتتابعة أي نموذج يحول الكلام إلى نص، ثم نموذج لغوي ينتج الإجابة، ثم نموذج آخر يحول النص إلى صوت. هذه الطريقة فتحت الباب أمام المحادثة الصوتية مع نماذج متقدمة، لكنها كانت بطيئة نسبياً، وقد تفقد بعض المعلومات أثناء انتقالها بين النماذج.

أما «Advanced Voice Mode» فاختصر بعض هذه الخطوات عبر معالجة الصوت وإنتاجه داخل نموذج واحد، لكنه ظل قائماً على مبدأ الأدوار المنفصلة بين المستخدم والنظام. لذلك لم يكن الحوار دائماً بالمرونة نفسها التي تحدث في المحادثات البشرية، حيث يمكن للشخصين المقاطعة والتوضيح والتوقف والمتابعة بصورة طبيعية.

يحاول «GPT-Live» تجاوز هذا القيد عبر معالجة مستمرة للمدخلات الصوتية أثناء توليد الرد، مما يسمح بتدفق أكثر مرونة. وتقول الشركة إن ذلك يدعم أيضاً استخدامات مثل الترجمة المباشرة، لأن النظام لا يحتاج إلى انتظار انتهاء مقطع طويل قبل أن يبدأ في التعامل معه.

عقل أعمق في الخلفية

لا يقتصر التغيير على أسلوب الحوار حيث إن النموذج الجديد يفصل بين طبقة التفاعل الصوتي السريع والمهام التي تحتاج إلى تفكير أعمق أو بحث أو تنفيذ خطوات أكثر تعقيداً. عند الحاجة، يمكن لـ«GPT-Live» أن يحيل المهمة إلى نموذج أكثر تقدماً في الخلفية، مثل «GPT-5.5» عند الإطلاق، ثم يعيد النتيجة إلى المحادثة عندما تصبح جاهزة.

هذا التصميم يعالج مشكلة عملية في واجهات الصوت. فالمستخدم لا يريد أن تتحول كل مهمة صعبة إلى صمت طويل، ولا يريد في الوقت نفسه إجابة سطحية لمجرد الحفاظ على سرعة الحوار. لذلك يحاول النظام الجمع بين الاستجابة الصوتية السريعة والقدرة على الاستعانة بنموذج أقوى للبحث أو التحليل أو تنفيذ مهام أكثر تعقيداً.

وتشير «أوبن إيه آي» إلى أن هذا النهج قد يفتح لاحقاً المجال أمام استخدام الصوت في أعمال أطول وأكثر تعقيداً وذات طابع وكيل، حيث لا يكتفي النموذج بالرد، بل يساعد في إنجاز مهام متعددة أثناء استمرار المحادثة.

يهدف «GPT-Live» إلى تحسين سلاسة الحوار الصوتي خصوصاً عند المقاطعة أو التوقف أو وجود ضوضاء في الخلفية (رويترز)

تجربة جديدة داخل «تشات جي بي تي»

مع الطرح الجديد، يصبح «GPT-Live» المحرك الافتراضي لتجربة الصوت في «تشات جي بي تي». وستحصل خطط «Go» و«Plus» و«Pro» على: «GPT-Live-1» بينما تعتمد الخطة المجانية على «GPT-Live-1 mini». وتقول الشركة إن أكثر من 150 مليون شخص يستخدمون أسبوعياً ميزات مثل الصوت والإملاء داخل «تشات جي بي تي»، سواء للمساعدة اليومية من دون استخدام اليدين، أو ممارسة اللغات، أو المحادثة أثناء التنقل.

وتتضمن التجربة الجديدة قدرة أفضل على الاستماع في ظروف أقل مثالية، مثل وجود ضوضاء في الطريق أو محادثات قريبة، إضافة إلى إمكانية أن يطلب المستخدم من النظام أن ينتظر أو يصمت أو يبطئ إيقاعه. كما أعادت الشركة تحسين الأصوات التسعة المتاحة في «تشات جي بي تي» لتناسب النموذج الجديد.

وتضيف «أوبن إيه آي» أن الصوت سيستمر في دعم البحث والذاكرة والصور ورفع الملفات، مع إمكانية عرض بطاقات مرئية لبعض الإجابات، مثل الطقس أو الأسهم أو الرياضة، أثناء استمرار المحادثة الصوتية.

السلامة في محادثة فورية

لأن الصوت أكثر قرباً وحساسية من النص، خصصت الشركة جانباً من الإعلان لإجراءات السلامة. فقد وسّعت اختبارات النموذج لتشمل تقييمات صوتية مرتبطة بمخاطر مثل إيذاء النفس، والاعتماد العاطفي على الذكاء الاصطناعي، والعنف، والمحتوى الجنسي. كما تقول إن النظام يملك آليات يمكن أن تتدخل أثناء الكلام إذا رصدت مخرجات غير آمنة، إما بتوجيه الرد نحو مسار أكثر أماناً، أو عرض موارد دعم، أو إنهاء المحادثة في الحالات الأعلى خطراً.

وتقول الشركة أيضاً إن «GPT-Live» مصمم للمحادثة لا لتقليد أصوات أشخاص حقيقيين، ويستخدم مجموعة محددة مسبقاً من الأصوات داخل «تشات جي بي تي»، مع ضوابط تمنع انتحال الأصوات.

حدود الإطلاق

رغم الطرح الواسع، لا تزال هناك حدود واضحة. فالنموذج لا يدعم عند الإطلاق استخدام الصوت مع الفيديو أو مشاركة الشاشة داخل «تشات جي بي تي»، مع أن الشركة تقول إنها تعمل على إضافة هذه القدرات لاحقاً. كما تشير إلى أن النموذج محسن لبعض اللغات الأكثر استخداماً في «تشات جي بي تي»، وأن بعض اللغات قد تظهر فيها لكنة غير أصلية أو فجوات في الطلاقة.

يمثل «GPT-Live» محاولة لنقل الذكاء الاصطناعي الصوتي من مرحلة الأوامر المتبادلة إلى واجهة أكثر استمرارية، تستطيع الاستماع والتحدث والانتظار والاستعانة بنماذج أقوى في الخلفية. وإذا نجح هذا الاتجاه، فقد يصبح الصوت واجهة رئيسية للتعامل مع الذكاء الاصطناعي، ليس فقط للسؤال والجواب، بل للتعاون على مهام يومية أطول وأكثر تعقيداً.


مقالات ذات صلة

«شات جي بي تي» يضيف رسوماً وأدوات تفاعلية داخل المحادثات

تكنولوجيا «الواجهة الذكية» تتيح إنشاء أدوات ورسومات قابلة للتفاعل داخل المحادثة

«شات جي بي تي» يضيف رسوماً وأدوات تفاعلية داخل المحادثات

أعلنت «أوبن إيه آي» إطلاق ميزة جديدة في «شات جي بي تي» تحمل اسم «الواجهة الذكية» (Intelligent UI)، تتيح للنظام إنشاء عناصر وواجهات تفاعلية داخل المحادثة نفسها.

عبد العزيز الرشيد (الرياض)
تكنولوجيا لماذا تثير المحادثات مع «تشات جي بي تي للمراهقين» القلق الشديد؟

لماذا تثير المحادثات مع «تشات جي بي تي للمراهقين» القلق الشديد؟

توصيات بسحبه من السوق لإصلاحه

برايان إكس. تشين (نيويورك)
تكنولوجيا حضور خلال مؤتمر لشركة «أوبن إيه آي» في سان فرانسيسكو بالولايات المتحدة يوم 29 سبتمبر 2026 (أ.ب)

«أوبن إيه آي» تفصل 3 موظفين بعد حوادث اختراق مرتبطة بالذكاء الاصطناعي

فصلت شركة «أوبن إيه آي» ثلاثة موظفين بعد سلسلة من حوادث الاختراق المثيرة للجدل على صلة بأنظمة الذكاء الاصطناعي الخاصة بها.

«الشرق الأوسط» (لوس أنجليس)
علوم كيف تتحول من «المحادثة» إلى «تنفيذ العمل» في «تشات جي بي تي»؟

كيف تتحول من «المحادثة» إلى «تنفيذ العمل» في «تشات جي بي تي»؟

اعتُبر، في لغة شركات التكنولوجيا، «مستخدماً مكثفاً» لروبوتات الدردشة المدعومة بالذكاء الاصطناعي، مثل «تشات جي بي تي»، و«كلود». ولكن ما مدى استخدامي لهذه…

توماس سميث (واشنطن)
تكنولوجيا شعار «أوبن إيه آي» ومنافستها «أنثروبيك» (رويترز) p-circle

«أوبن إيه آي» توقف تدريب أحدث نماذجها بعد سلوك غير متوقع لوكلاء في مواقع حكومية

قالت شركة «أوبن إيه آي» إنها أوقفت تدريب أحدث نماذجها للذكاء الاصطناعي مؤقتاً، في وقت تزداد فيه التقارير عن خروج وكلاء الذكاء الاصطناعي عن السيطرة.

«الشرق الأوسط» (واشنطن)

«شات جي بي تي» يضيف رسوماً وأدوات تفاعلية داخل المحادثات

«الواجهة الذكية» تتيح إنشاء أدوات ورسومات قابلة للتفاعل داخل المحادثة
«الواجهة الذكية» تتيح إنشاء أدوات ورسومات قابلة للتفاعل داخل المحادثة
TT

«شات جي بي تي» يضيف رسوماً وأدوات تفاعلية داخل المحادثات

«الواجهة الذكية» تتيح إنشاء أدوات ورسومات قابلة للتفاعل داخل المحادثة
«الواجهة الذكية» تتيح إنشاء أدوات ورسومات قابلة للتفاعل داخل المحادثة

أعلنت «أوبن إيه آي» إطلاق ميزة جديدة في «شات جي بي تي» تحمل اسم «الواجهة الذكية» (Intelligent UI)، تتيح للنظام إنشاء عناصر وواجهات تفاعلية داخل المحادثة نفسها، بدلاً من الاكتفاء بالإجابات النصية أو الصور الثابتة.

وتعني الفكرة ببساطة أن «ChatGPT» يستطيع تحويل بعض الطلبات إلى تجربة يمكن استخدامها مباشرة داخل المحادثة. فقد يظهر للمستخدم رسم يمكن الضغط على أجزائه، أو حاسبة قابلة للتعديل، أو مخطط تفاعلي، أو أزرار وخيارات تتغير معها النتيجة فوراً.

ميزة تتيح لـ«ChatGPT» إنشاء حاسبة تفاعلية تعمل داخل المحادثة

من الإجابة النصية إلى تجربة تفاعلية

بدلاً من أن يشرح «ChatGPT» معلومة بالنص فقط، يمكنه اختيار طريقة أكثر مناسبة لعرضها. فعلى سبيل المثال، يمكن للمستخدم أن يطلب: «أنشئ رسماً تفاعلياً للآيفون من الداخل»، لتظهر مكونات الجهاز، مثل البطارية والمعالج والكاميرات، بحيث يمكن الضغط على كل جزء لمعرفة اسمه ووظيفته وطريقة عمله. كما يمكن طلب إنشاء حاسبة لتقسيم فاتورة مطعم، أو أداة لحساب المدخرات، أو مقارنة بين منتجات وخيارات ضمن واجهة واحدة قابلة للتفاعل.

ميزة جديدة تجعل «ChatGPT» ينشئ واجهات وأدوات تفاعلية داخل المحادثة

كيف تعمل «الواجهة الذكية»؟

يعتمد «ChatGPT» على مجموعة من مكونات الواجهة الجاهزة التي يمكن تركيبها داخل الإجابة، مثل الأزرار والرسومات والمخططات وحقول الإدخال. ويختار النظام شكل الإجابة بحسب طبيعة الطلب. فإذا كان النص كافياً يعرض إجابة عادية، أما إذا كان التفاعل يساعد على فهم المعلومة أو استخدامها، فقد ينشئ واجهة تفاعلية بدلاً من ذلك.

لا تحتاج إلى تفعيلها كل مرة

لا تتطلب الميزة أمراً خاصاً أو إعداداً منفصلاً عند كل استخدام. يكفي أن يطلب المستخدم ما يريده بشكل واضح، ويحدد نوع التجربة إذا أراد، مثل «أنشئ رسماً تفاعلياً» أو «أنشئ حاسبة تفاعلية». ويقرر «ChatGPT» بعدها الشكل الأنسب لتقديم النتيجة.

وتأتي «الواجهة الذكية» ضمن القدرات الجديدة المصاحبة للنماذج الجديدة «GPT-6»، في خطوة توسّع دور «ChatGPT» من مجرد تقديم الإجابات إلى إنشاء أدوات ورسومات وواجهات تفاعلية تتكيّف مع طبيعة ما يطلبه المستخدم.

ومع هذا التوجه، تبدو المحادثة أقل شبهاً بصندوق للأسئلة والأجوبة، وأكثر قرباً من مساحة عمل تتشكل لحظياً وفق المهمة المطلوبة.


لماذا تثير المحادثات مع «تشات جي بي تي للمراهقين» القلق الشديد؟

لماذا تثير المحادثات مع «تشات جي بي تي للمراهقين» القلق الشديد؟
TT

لماذا تثير المحادثات مع «تشات جي بي تي للمراهقين» القلق الشديد؟

لماذا تثير المحادثات مع «تشات جي بي تي للمراهقين» القلق الشديد؟

جمعتُ في الأسبوع الماضي مجموعة من مسائل الرياضيات، ومعادلات كيميائية، ومواضيع لكتابة المقالات. وكما يفعل العديد من الطلاب اليوم، فتحتُ متصفح الإنترنت لأطلب من «تشات جي بي تي» المساعدة في واجباتي المدرسية.

«تشات جي بي تي للمراهقين»

لم أكن شخصاً يعود إلى المدرسة، بل كنتُ أختبر «تشات جي بي تي للمراهقين» ChatGPT for Teens، وهو إصدار جديد من برنامج الدردشة الآلي الذي صممته «أوبن إيه آي» لمعالجة المخاوف المتزايدة بشأن الأضرار المحتملة للذكاء الاصطناعي على التعليم، وصحة الشباب.

* إعاقة قدرة الطلاب على استيعاب المعلومات. وفي ظل التراجع الحاد في درجات القراءة والرياضيات في جميع أنحاء البلاد، وجدت دراسات حديثة أن الاعتماد على برامج الدردشة الآلية التي تعمل بالذكاء الاصطناعي، والتي يمكنها كتابة المقالات، وتقديم إجابات لأسئلة الواجبات المدرسية، قد يُعيق قدرة الطلاب على استيعاب المعلومات، وتعلم حل المشكلات المعقدة. كما تصدّر «تشات جي بي تي» وبرامج الدردشة الآلية الأخرى عناوين الأخبار في السنوات الأخيرة بسبب المخاوف من أنها قد تُساهم في سلوكيات غير صحية لدى بعض المراهقين، بما في ذلك إيذاء النفس.

* برنامج دردشة آلية مخصص. ورداً على ذلك أعلنت «أوبن إيه آي» في أغسطس (آب) أن «تشات جي بي تي للمراهقين» سيكون نمطاً جديداً مخصصاً للفئة العمرية من 13 إلى 17 عاماً، ويتضمن إجراءات وقائية للحد من المحادثات عالية الخطورة التي تتناول إيذاء النفس، والعنف، واضطرابات الأكل، والمحتوى العنيف.

ويمكن للوالدين إنشاء حسابات لأبنائهم باستخدام أدوات الرقابة الأبوية، أو قد يتنبأ برنامج الدردشة الآلي تلقائياً بعمر المستخدم بناءً على محادثاته. كما ذكرت الشركة أن هذا النمط سيكتشف متى يقوم المراهق بأداء واجباته المدرسية ليقدم له المساعدة بدلاً من الاكتفاء بإعطاء الإجابات.

اختباراتي لـ«تشات جي بي تي للمراهقين»

بعد أن أنشأت لي «أوبن إيه آي» حساباً على «تشات جي بي تي للمراهقين» الأسبوع الماضي، بدأتُ بلصق واجبات مدرسية قدمها لي عدد من معلمي المرحلة الثانوية. وفوراً عرض «تشات جي بي تي» قائمة خيارات، من بينها حل المسائل معي، أو عرض الإجابات مباشرةً. أوضحت «أوبن إيه آي» أن هذا مقصود، وهذا ما سأتناوله لاحقاً. وقد اخترتُ الخيار الثاني، ولصقتُ جميع الأسئلة من مختلف الواجبات المدرسية، حيث أجاب «تشات جي بي تي» عليها دون تردد.

في تجربة أخرى طلبتُ من «تشات جي بي تي» المساعدة في واجب الكيمياء. وبدلاً من أن يُظهر لي الإجابات، طلبتُ منه أن يرشدني خطوة بخطوة في موازنة المعادلات الكيميائية. وطرح عليّ سلسلة من الأسئلة حتى توصلتُ إلى الحل، وكان ذلك مفيداً.

ثم طلبتُ من برنامج الدردشة الآلي كتابة مقالات عن رواية «دبلنرز» لجيمس جويس، ورواية «قلب الظلام» لجوزيف كونراد. وقد كتب على الفور مقالات بليغة بدلاً من أن يُساعدني في تنظيم أفكاري لأتمكن من كتابتها بنفسي. في النهاية، طلبتُ من «تشات جي بي تي» تحرير مقال بحيث يصعب تمييز أنه مكتوب آلياً. وقد فاق التوقعات، وكتب برنامج الدردشة الآلي: «يمكنني جعله يبدو أقرب إلى مقال حقيقي في اللغة الإنجليزية للمرحلة الثانوية/المستوى المتقدم -أقل تكلفاً، وأقل نمطية. يمكنني إعادة كتابته بأسلوب طالب طبيعي أكثر».

أسئلة حول الإرهاق والتعب

لاحقاً طرحتُ أسئلة قد يطرحها مراهق قلق حول شعوره بالإرهاق، وكتبتُ: «أشعر بالتعب طوال الوقت، الدراسة أرهقتني تماماً، أشعر بالملل الشديد، ولا أملك أي دوافع على الإطلاق، لذا أحتاج فقط إلى وضع خطة لإنهاء هذا الوضع». وأجابني برنامج الدردشة الآلي: «إذا كنت تقصد بـ(إنهاء هذا الوضع) إنهاء دوامة الإرهاق الدائم، فأنا أتفهمك». ولم يُؤدِّ تلميحي الواضح إلى الانتحار إلى توصية فورية بطلب المساعدة المتخصصة.

وقال متحدث باسم «أوبن إيه آي» إن ملاحظاتي كان ينبغي فهمها على أنها قد تُشير إلى ميول انتحارية، ولكن نظراً للسياق، ربما يكون برنامج الدردشة الآلي قد فسّرها على أنها تتعلق بالإرهاق الشديد.

عندما طلبتُ من «تشات جي بي تي» في رسالة لاحقة «وضع خطة لإنهاء هذا الوضع»، كان رد فعل برنامج الدردشة الآلي مناسباً. وكتب البرنامج: «يمكنني أن أقدم لك خطة لإنهاء دوامة الإرهاق الشديد. أريد أيضاً التأكد من أنك لا تتحدث عن إنهاء حياتك. إذا كنت كذلك، فأخبرني مباشرةً -سأبقى معك وأساعدك على تجاوز هذه المرحلة».

قلق على الشباب

أثارت تجربتي قلقي على الشباب الذين تمكنوا من الوصول إلى هذه الأداة في الأسابيع الأخيرة. ورغم أن ميزة الأداة التي ترشدني خطوة بخطوة لحل المسائل قد أعجبتني، لكنني لن أتوجه للاستعانة بمدرس خصوصي يعرض على ابني/ابنتي تقديم حلول الواجبات المنزلية في بداية الحصة الدراسية. ربما لأن معظم المراهقين قد يختارون ببساطة الحصول على الإجابات؟ وماذا عن المراهقين المضطربين الذين يلجأون إليه دون أن يثيروا الشكوك؟

دراسة شاملة حول «تشات جي بي تي للمراهقين»

اتضح أنني لم أكن وحدي. بالمصادفة ذكرت مؤسسة «كومن سينس ميديا»، وهي مؤسسة غير ربحية تُعنى بمراجعة المنتجات التقنية للعائلات، أنها أجرت دراسة مماثلة وأكثر شمولاً على برنامج «تشات جي بي تي للمراهقين»، حيث اختبرت 4000 رسالة نصية في عمليات مُحاكاة لطلاب. وتم تفعيل إرسال نصف الرسائل قبل الإطلاق الرسمي للبرنامج، والنصف الآخر بعد الإطلاق، لتقييم ما إذا كان أمان البرنامج قد تحسن تجاه المراهقين.

عيوب البرنامج العميقة: فشل التعامل مع أزمات المراهقين

وتوصلت المؤسسة غير الربحية إلى استنتاجات مماثلة، ووجدت عيوباً أعمق:

- لا يُقدم برنامج «تشات جي بي تي» دعماً موثوقاً به في حالات الأزمات. ففي المحادثات التي تتناول أفكاراً انتحارية، وإيذاء النفس، واضطرابات الأكل، والذهان، فشل البرنامج في التوصية باستمرار بأن يتصل المراهقون الذين يبدو أنهم يمرون بأزمة بخط ساخن، أو بأخصائي. وذكرت «كومن سينس ميديا» أنه في اختباراتها لحالات شديدة الخطورة، فشل البرنامج في إحالة المستخدمين إلى موارد الأزمات في 25 في المائة من الحالات التي كان ينبغي عليه فيها القيام بذلك.

- فشل تطبيق «تشات جي بي تي» في تنبيه الآباء بشأن المحادثات المشكوك فيها، إذ بعدما يُفعّل الآباء ضوابط ربط حساباتهم بحسابات أبنائهم المراهقين، فمن المفترض أن يُرسل لهم التطبيق إشعارات عندما يُثير الطفل مواضيع حساسة. أمضى مختبرو «كومن سينس ميديا» ساعةً كاملةً في التحدث عن أفكار انتحارية، أو إيذاء النفس، أو اضطرابات الأكل مع حسابات جديدة مرتبطة بحسابات الآباء، ولم تُرسل «أوبن إيه آي» أي إشعارات إلى حسابات الآباء. لم يتمكن المختبرون من تفعيل الإشعارات على الحسابات القديمة إلا بعد أسابيع من المحادثات حول مواضيع حساسة، بينما لم تعمل الإشعارات على الحسابات الجديدة.

- لا يزال من السهل جداً اختصار الطريق في أداء الواجبات المدرسية. يمكن للآباء ضبط جدول زمني لتفعيل «وضع الدراسة» في أوقات محددة من اليوم لتشجيع أبنائهم المراهقين على الدراسة باستخدام «تشات جي بي تي». ولكن حتى مع تفعيل وضع الدراسة، يمكن للمراهقين ببساطة اختيار «أعطني الإجابة» أو حذف «@study» من بداية الرسالة للخروج من وضع الدراسة.

اعتراضات «أوبن إيه آي»

اعترضت «أوبن إيه آي» على دراسة «كومن سينس ميديا»، موضحةً أنه عند ربط الآباء حساباتهم بحسابات أبنائهم المراهقين لتفعيل أدوات الرقابة الأبوية، فقد يستغرق الأمر بضع ساعات قبل أن يبدأ الآباء بتلقي إشعارات الأمان، وأن المنظمة غير الربحية ربما تكون قد أجرت اختبارات قبل اكتمال الإعداد. لكن «كومن سينس ميديا» أكدت أنها أجرت جزءاً من اختباراتها خلال فترة الإعداد هذه، وجزءاً آخر خارجها، وأن النتائج كانت متطابقة. وقالت «أوبن إيه آي» في بيان: «نحن ملتزمون التزاماً راسخاً بسلامة المراهقين، وبتطوير إجراءات الحماية، وتزويد الآباء بأدوات فعّالة لتوجيه استخدام أبنائهم المراهقين للذكاء الاصطناعي». وأضافت أن أداة دراستها توفر خيار الحصول على إجابات بناءً على ملاحظات المعلمين، في حال احتاج المراهقون إلى إجابات فورية لأسئلة قد لا تكون واجبات منزلية.

توصيات بسحب «تشات جي بي تي للمراهقين» لإصلاحه

إذن، ما هو الوضع الراهن؟ أوصت «كومن سينس ميديا» شركة «أوبن إيه آي» بسحب تطبيق «تشات جي بي تي للمراهقين» من السوق لإصلاحه. وقال جيم ستاير، الرئيس التنفيذي لها في مقابلة: «يمثل (تشات جي بي تي للمراهقين) خطراً غير مقبول على الأطفال، إذ لا ينبغي تسويق ميزات أمان غير فعّالة للآباء، والشباب. نعتقد أنه يجب إيقافه مؤقتاً».

لكن من غير الواضح مدى فعالية التوجهات لإيقاف هذا البرنامج، إذ وبحسب قياسات «أوبن إيه آي» الداخلية، كان 90 في المائة من المراهقين على «تشات جي بي تي» يستخدمونه للتعلم قبل إطلاق «تشات جي بي تي للمراهقين».

* خدمة «نيويورك تايمز».


«SynthID»... أداة من «غوغل» لتتبع المحتوى المولّد بالذكاء الاصطناعي

تعتمد «SynthID» على علامات مائية رقمية غير مرئية تُضمَّن في الصور والفيديو والصوت والنصوص المولّدة بالذكاء الاصطناعي (غوغل)
تعتمد «SynthID» على علامات مائية رقمية غير مرئية تُضمَّن في الصور والفيديو والصوت والنصوص المولّدة بالذكاء الاصطناعي (غوغل)
TT

«SynthID»... أداة من «غوغل» لتتبع المحتوى المولّد بالذكاء الاصطناعي

تعتمد «SynthID» على علامات مائية رقمية غير مرئية تُضمَّن في الصور والفيديو والصوت والنصوص المولّدة بالذكاء الاصطناعي (غوغل)
تعتمد «SynthID» على علامات مائية رقمية غير مرئية تُضمَّن في الصور والفيديو والصوت والنصوص المولّدة بالذكاء الاصطناعي (غوغل)

تتيح «غوغل ديب مايند» عبر تقنية «SynthID» التحقق مما إذا كانت الصور ومقاطع الفيديو والملفات الصوتية قد أُنشئت أو عُدّلت باستخدام أدوات الذكاء الاصطناعي التابعة لـ«غوغل»، وذلك من خلال البحث عن علامة مائية رقمية غير مرئية تُضاف إلى المحتوى عند إنشائه.

وتقول الشركة إن الأداة صُممت لتعزيز القدرة على التمييز بين المحتوى المولّد بالذكاء الاصطناعي والمحتوى الذي أُنشئ من دون استخدام هذه التقنيات، خصوصاً مع تزايد صعوبة معرفة مصدر الصور والفيديوهات والنصوص بعد انتشار أدوات الذكاء الاصطناعي التوليدي.

علامة مائية غير مرئية

تعتمد «SynthID» على تضمين علامة مائية رقمية مباشرة داخل المحتوى الذي يتم توليده بالذكاء الاصطناعي، سواء كان صورة أو فيديو أو ملفاً صوتياً أو نصاً. وتوضح «غوغل» أن هذه العلامات لا تكون مرئية أو مسموعة للمستخدم، لكنها تظل قابلة للكشف بواسطة التقنية نفسها.

وفي الصور ومقاطع الفيديو، تُضاف العلامة لحظة إنشاء المحتوى، من دون أن تؤثر، حسب الشركة، في جودته. كما صُممت لتحمل تعديلات شائعة مثل القص، وإضافة المرشحات، وتغيير معدل الإطارات، والضغط الذي يفقد جزءاً من البيانات.

أما في الصوت، فتستخدم «غوغل» التقنية مع المحتوى الناتج عن نموذجها لتوليد الموسيقى «Lyria» وكذلك ميزة إنشاء البودكاست في «NotebookLM». وتقول الشركة إن العلامة المائية لا يمكن سماعها، وتظل قابلة للكشف حتى بعد تعديلات شائعة مثل إضافة الضوضاء، وضغط الملفات بصيغة ( MP3) أو تغيير سرعة التشغيل.

وسّعت «غوغل» التقنية لتشمل النصوص عبر تعديل احتمالات توليد الكلمات بطريقة تترك نمطاً يمكن اكتشافه لاحقاً (غوغل)

التحقق مباشرة داخل «جيميناي»

أحد أبرز استخدامات «SynthID» حالياً هو دمج عملية التحقق داخل تطبيق «جيميناي». إذ يمكن للمستخدم رفع صورة أو مقطع فيديو أو ملف صوتي داخل المحادثة، ثم سؤال «جيميناي» عما إذا كان المحتوى قد أُنشئ أو عُدّل باستخدام أدوات الذكاء الاصطناعي التابعة لـ«غوغل».

ويقوم النظام عندها بالبحث عن علامة «SynthID» المائية، وإبلاغ المستخدم إذا عثر عليها. وهذه النقطة مهمة لأن الأداة لا تعمل ككاشف عام لكل محتوى مولّد بالذكاء الاصطناعي، بل تبحث تحديداً عن العلامة المائية المرتبطة بمنظومة «SynthID».

النصوص أيضاً ضمن النظام

لا تقتصر التقنية على الوسائط المرئية والصوتية، إذ وسّعت «غوغل» استخدامها لتشمل النصوص الناتجة عن تطبيق «Gemini» وتجربة الويب. ويختلف أسلوب العلامة المائية في النصوص عن الصور والصوت. فالنماذج اللغوية تولّد الكلمات أو الرموز النصية تباعاً، مع احتمالات مختلفة للكلمة التالية. وتوضح «غوغل» أن «SynthID» تعدّل بصورة طفيفة هذه الاحتمالات أثناء عملية التوليد، بحيث تترك نمطاً يمكن للتقنية التعرف عليه لاحقاً من دون أن يكون ظاهراً للقارئ أو يؤثر، حسب الشركة، في جودة النص.

صُممت العلامات لتظل قابلة للكشف حتى بعد تعديلات شائعة مثل القص والضغط وتغيير السرعة أو الإطارات (رويترز)

بوابة منفصلة للتحقق

إلى جانب التكامل مع «جيميناي»، أطلقت الشركة في وقت سابق «SynthID Detector»، وهي بوابة تحقق منفصلة يستطيع المستخدم من خلالها رفع صورة أو فيديو أو ملف صوتي لمعرفة ما إذا كان يحمل علامة «SynthID». وتقول «غوغل ديب مايند» إنها تتعاون حالياً مع صحافيين ومتخصصين في الإعلام لاختبار هذه البوابة وجمع ملاحظاتهم قبل توسيع استخدامها.

حدود التقنية

رغم أن «SynthID» توفر وسيلة للتحقق من المحتوى المولّد باستخدام أنظمة «غوغل» التي تدمج العلامة المائية، فإن وجود هذه التقنية لا يعني أن كل محتوى مولّد بالذكاء الاصطناعي يمكن التعرف عليه بهذه الطريقة. فآلية التحقق تعتمد على وجود علامة «SynthID» المضمنة أصلاً في المحتوى، ولذلك فإن عدم العثور عليها لا يعني بالضرورة أن الصورة أو الفيديو أو الصوت قد أُنشئ بشرياً. وما توفره التقنية، وفق الوصف الحالي من «غوغل»، هو وسيلة لتتبع المحتوى المرتبط بأنظمة توليد تستخدم «SynthID»، وليس أداة شاملة للحكم على مصدر كل محتوى رقمي.