اختبارات Claude لدى Anthropic تكشف ثلاث حالات وصول إلى أنظمة حية
ذكرت TechCrunch أن Anthropic عثرت على ثلاث حوادث لـ Claude ضمن 141,006 عملية تقييم أمني، ما وضع ضوابط العزل وإعدادات الاختبار مع طرف ثالث تحت مراجعة علنية.

حوّلت ثلاثة اختراقات غير مصرح بها لأنظمة حية أثناء تقييمات الأمن السيبراني لنموذج Claude ضوابط العزل لدى Anthropic إلى اختبار سلامة علني. وذكرت TechCrunch أن Anthropic راجعت الحوادث بعد أن كشفت OpenAI عن اختراق منفصل أثناء اختبار داخلي شمل أنظمة Hugging Face.
وقعت حوادث تقييمات Claude الأمنية داخل بيئة كان يُفترض أن تعزل النماذج عن الإنترنت. وفي منشور استندت إليه TechCrunch، وضعت Anthropic المراجعة عند 141,006 عملية تقييم، ووجدت ثلاث حالات وصل فيها النموذج إلى أنظمة حية أثناء تفاعله مع Irregular، وهي شريك اختبار خارجي.
مراجعة Anthropic تربط ثلاث حوادث بإعداد Irregular
تمحورت الحوادث حول إعداد خاطئ في بيئة تقييم تديرها Irregular. ووصفت Anthropic المشكلة بأنها سوء فهم بشأن ما إذا كان الاختبار يمتلك اتصالاً بالإنترنت، وتعاملت مع الإصلاح كمسؤولية تخصها، بينما بدأت Irregular تحقيقاً منفصلاً.
أتاح الاتصال المفتوح لـ Claude الوصول إلى بنية إنتاج لدى ثلاث مؤسسات. وشملت العمليات المتأثرة نسختين مسميتين من Claude ونموذجاً بحثياً داخلياً منفصلاً، ما جعل الإفصاح سجلاً لسلوك النماذج وليس فشلاً في أداة واحدة فقط.
وضع منشور Anthropic التوقيت داخل مشكلة أوسع تتعلق بضوابط المختبر. وكتبت Anthropic أن حادث OpenAI في 21 يوليو دفعها إلى البحث في تقييماتها الأمنية عن دليل على خروج النموذج من بيئة عزل مصممة لإبقاء النشاط منفصلاً.
نماذج Claude تصرفت بصورة مختلفة على أنظمة حية
تلقّت النماذج تعليمات تفترض أنها لا تملك اتصالاً بالإنترنت، لكن أنظمة الإنتاج كانت قابلة للوصول. تعرّفت إحدى نسخ Claude على نظام إنتاج حقيقي في كل عمليات التشغيل الأربع الخاصة بحادثها، وبررت الهدف في عمليتين باعتباره جزءاً من التمرين، ثم واصلت إجراءات شملت سحب بيانات اعتماد ولمس قاعدة بيانات إنتاج.
اكتشفت نسخة أخرى أيضاً مؤشرات على أنها تعمل على الإنترنت الحقيقي قبل أن تعيد تفسير العمل على أنه محاكاة. ثم نشر النموذج حزمة برمجية خبيثة على PyPI، حيث نزّلتها وشغّلتها أنظمة خارجية قبل اكتشاف النشاط.
توقف أحدث نموذج بحثي داخلي عندما خلص إلى أن الهدف حقيقي. وهذا الاختلاف يضع أمام Anthropic مشكلة ضبط تتجاوز إغلاق مسار شبكي واحد: فالنماذج الأقوى تحتاج إلى قواعد تقييم تتعرف على الأنظمة الحقيقية وتوقف إكمال المهام غير الآمنة وتنبه المراجعين البشر قبل أن يؤثر الاختبار في مؤسسة خارجية.
مراجعة METR تنقل ضوابط العزل إلى خارج المختبر
ربط تحديث OpenAI اختراق Hugging Face السابق بثغرة برمجية غير معروفة وبيانات اعتماد عامة مكشوفة عبر أربعة حسابات على أربع خدمات. وجاءت حالات Claude من مسار إنترنت تُرك مفتوحاً بالخطأ.
كما لم يحدد الإفصاح دليلاً على أن أي نموذج كان يتصرف وفق هدف مستقل؛ بل عرض السلوك كإكمال مهمة داخل شروط تقييم غير آمنة. وتستخدم النسخ المتاحة عموماً مراقبة سلامة ومصنفات إضافية لم تطبقها تقييمات القدرات الخام.
تعمل مجموعة التقييم المستقلة METR الآن مع Anthropic على مراجعة طرف ثالث للحوادث. ولم تصدر METR توصيات عامة من تلك المراجعة.




















