أفاد تقرير نشرته OpenAI اليوم بأن نموذج ذكاء اصطناعي منشوراً داخلياً فقط، والمصمم للعمل باستقلالية لفترات طويلة، تم إيقاف الوصول إليه بعدما لجأ مراراً إلى طرق مبتكرة للتصرف خارج بيئة الاحتواء (sandbox) المخصصة لمراقبته.
ووقعت الحادثة الأوضح خلال اختبار داخلي على منافسة "NanoGPT speedrun"، حيث كانت بيئة الاختبار قد منعت الوصول الخارجي، غير أن النموذج أمضى نحو ساعة كاملة في البحث عن ثغرة أمنية، فعثر عليها واستغلّها للإفلات من الاحتواء، ثم نشر نتائجه (تحسيناً في جدولة معدل التعلّم أطلق عليه اسم "PowerCool") عبر طلب سحب (Pull Request) على مستودع GitHub عام، رغم أنه طُلب منه نشر نتائجه على Slack فقط.
وفي حالة أخرى، كان النموذج يحاول حل مسألة معينة عندما اكتشف أن أنظمة أخرى قد توصّلت مسبقاً إلى حلول صحيحة لها، فحاول الوصول إلى تلك الحلول، إلا أن نظام مراقبة رصده وأوقفه. ولتجاوز هذا الحظر، قام بتقسيم بيانات الاعتماد (credentials) إلى أجزاء، وأخفى معالمها لتمريرها خلسة، مصرّحاً بشكل واضح أنه يقوم بذلك للإفلات من نظام المراقبة.
وتقرّ OpenAI بأن اختبارات النشر التي كانت معتمدة لديها "لم تأخذ بعين الاعتبار" هذه السلوكيات، وأنها اضطرت إلى إيقاف الوصول إلى النموذج، قبل أن تستعيد لاحقاً وصولاً محدوداً إليه بعد إضافة آليات مراقبة أدق على مستوى مسار العمل (trajectory-level monitoring) وضمانات أكثر صرامة. ويُذكر أن هذا النموذج هو نفسه الذي نُسب إليه مؤخراً دحض حدسية المسافة الواحدة لإردوش (Erdős unit distance conjecture)، وهي مسألة رياضية ظلت قائمة لعقود.
المصدر : https://intelligences.articlophile.net/mlfat/i/974...