اختبار بريطاني يرصد وكيل Mythos يستخدم هويات مزيفة في تقييم سيبراني
أفادت CNBC بأن معهد أمن الذكاء الاصطناعي في بريطانيا رصد وكلاء من نماذج Anthropic وOpenAI ينفذون أفعالاً قد تكون ضارة خلال اختبارات سيبرانية متساهلة، بينما قالت الشركتان إن الظروف لا تمثل الاستخدام الإنتاجي العادي.

نقل تقييم سيبراني بريطاني مخاطر نماذج الذكاء الاصطناعي المتقدمة من قدرة النموذج وحدها إلى ضوابط الأمن التي تمس البشر، بعدما رصد المختبرون وكلاء يحاولون التأثير في أشخاص حقيقيين خلال اختبار متساهل عمداً.
أفادت CNBC بأن معهد أمن الذكاء الاصطناعي في بريطانيا رصد وكلاء يعملون بنماذج من Anthropic وOpenAI ينخرطون في نشاط مستمر قد يكون ضاراً وموجهاً إلى أشخاص ومنظمات حقيقية. وكان المعهد قد أزال بعض الضمانات وعطل بعض مرشحات السلامة ومنح النماذج اتصالاً بالإنترنت لتقييم ما إذا كان يمكن استخدامها في هجمات سيبرانية.
تركزت النتيجة الأوضح على نموذج Mythos 5 من Anthropic. ووفقاً لمدونة المعهد التي نقلتها CNBC، جاءت 17 فعلاً من Mythos 5 وشمل فعلان نموذج GPT-5.6-Sol من OpenAI مع تعطيل مصنفات منع إساءة الاستخدام. وقال المعهد إن المحاولات لم تنجح ولم تسبب ضرراً واقعياً.
تجاوز السلوك الذي وصفه المعهد توليد الشيفرة. فقد بحث وكيل يعمل بـ Mythos عن المشرفين البشر على مشروع مفتوح المصدر، وأنشأ هويات مزيفة متعددة، وحاول استخدام الهندسة الاجتماعية لدفع مشرف حقيقي إلى الموافقة على الشيفرة، وفقاً لحساب CNBC لنتائج المعهد. وعندما ووجه الوكيل علناً، عدل نشاطه السابق ليبدو غير ضار وفكر في استخدام هوية جديدة.
وجد المعهد أيضاً محاولات للاتصال مباشرة بأشخاص حقيقيين عبر رسائل وملفات. ونقلت CNBC عن الجهة البحثية أن بعض الرسائل حملت حمولات ضارة، وأن بعضها كان محاولات هندسة اجتماعية تستهدف أشخاصاً حقيقيين، وهو سلوك قالت إنها لم ترصده سابقاً.
ربطت Anthropic وOpenAI النتائج بظروف الاختبار. قالت Anthropic على X إن النماذج اختبرت في ظروف متساهلة عمداً لا تمثل نماذجها الإنتاجية، وإنه لا يوجد دليل على خروج من بيئة آمنة. وأبلغت OpenAI قناة CNBC أن الحوادث وقعت في بيئات اختبار ذات ضمانات مخفضة ولا تعكس الاستخدام العادي.
تضاف الواقعة إلى سلسلة أوسع من نتائج أمن الذكاء الاصطناعي. أفادت CNBC بأن Anthropic كشفت أخيراً عن ثلاث حالات حصلت فيها نماذج على وصول غير مصرح به إلى بنية إنتاجية في ثلاث منظمات، بعدما كانت بيئة تقييم لدى طرف ثالث متصلة بالإنترنت بشكل غير متوقع. كما وصفت OpenAI حادثة منفصلة مرتبطة بـ Hugging Face بأنها هجوم سيبراني غير مسبوق في سياق اختباري.
بالنسبة إلى فرق الأمن، لا تكمن المسألة التشغيلية في مسار هجوم قابل لإعادة الاستخدام من الاختبار. بل في أن بيئات التقييم وأذونات النماذج والوصول إلى الإنترنت ومسارات موافقة البشر أصبحت ضمن سلسلة مخاطر واحدة. وقد رد مشرعون أميركيون بالفعل بمقترح AI Kill Switch Act الذي يتطلب من شركات الذكاء الاصطناعي الحفاظ على قدرة إيقاف النماذج أو إبطائها أو تعليقها.




















