OpenAI تبقي نموذج GPT-Red الهجومي خاصا بعد اختبارات prompt injection
أفاد The Next Web بأن OpenAI بنت GPT-Red، وهو نموذج داخلي للاختبار الهجومي الآلي لهجمات prompt injection، لكنها تبقي أداة الهجوم خاصة. وذكر التقرير نسب نجاح تجاوزت 90% ضد نسخة أقدم من GPT-5 وأقل من 23% ضد GPT-5.6، مع بقاء حالات يلتقطها المختبرون البشر.

أشار The Next Web إلى أن GPT-Red هو نموذج OpenAI الداخلي للاختبار الهجومي الآلي والمصمم لمهاجمة أنظمة AI أخرى، وأنه لن يُطرح للعامة. وتركز الأداة على هجمات prompt injection، حيث يمكن لتعليمات مخفية في ملفات أو صفحات ويب أو رسائل أن تدفع وكيل AI إلى تنفيذ أفعال لا يريدها المشغل.
وتصنّف OpenAI نموذج GPT-Red كنظام سلامة لا كمنتج عام. وكتبت The Next Web أن تدريبه يهدف إلى اكتشاف طرق لاختطاف أنظمة AI أو تخريبها حتى يتمكن المطورون من سد الثغرات قبل الإطلاق.
GPT-Red يستهدف هجمات prompt injection
يتعلم GPT-Red الهجوم عبر self-play في مواجهة نماذج دفاعية، بحسب المنصة. ويحصل نموذج الهجوم على مكافآت عندما ينجح الاستغلال، بينما تحصل النماذج الدفاعية على مكافآت عند منع المحاولة.
ولأعمال السلامة هذه، استخدمت OpenAI بعض أكبر عمليات الحوسبة لديها، كما لفتت المنصة. ولم يحدد ذلك العرض تكلفة بالدولار أو عدد قطع العتاد المستخدمة في جولة التدريب.
كما حدّد الباحثون أسلوبا في prompt injection وصفته OpenAI بأنه fake chain of thought. وقال Chris Choquette-Choo لـMIT Technology Review إن الهجوم يزرع ملاحظة كاذبة في ذاكرة العمل الخاصة بالنموذج، ما يجعل الهدف يتعامل مع عبارة غير صحيحة كما لو أنها جرى التحقق منها مسبقا.
اختبار آلة البيع أعطى GPT-Red هدفا ماديا
انتقل أحد الاختبارات إلى ما هو أبعد من أمثلة النص فقط. وفي تلك التجربة، هاجم GPT-Red نظام Vendy، وهو وكيل AI بنته Andon Labs لتشغيل آلة بيع حقيقية في مكتب OpenAI، بحسب ما كتبته The Next Web.
وقد غيّر ذلك الهجوم الأسعار، وخفّض أحد السلع مرتفعة الثمن إلى الحد الأدنى البالغ 50 سنتا، وألغى طلب أحد العملاء. وكشفت OpenAI عن هذه الثغرات بعد الاختبار.
وأظهرت مجموعة النتائج فروقا كبيرة بين GPT-5 الأقدم وGPT-5.6 والمختبرين البشر. وكتبت The Next Web أن أكثر من 90% من أقوى هجمات GPT-Red نجحت ضد نسخة أقدم من GPT-5، بينما نجح أقل من 23% ضد GPT-5.6. وأضاف المصدر نفسه أن إعادة تشغيل لاختبار من عام 2025 أظهرت تمكن GPT-Red من اختراق 84% من السيناريوهات مقابل 13% للمختبرين الهجوميين من البشر.
المختبرون البشر لا يزالون يلتقطون حالات فائتة
ودرّبت OpenAI نموذج GPT-5.6 في مواجهة GPT-Red، ووصفت النموذج الأحدث بأنه أكثر أنظمتها صلابة ضد prompt injection، وفقا للمنصة. وهي تستخدم نموذج الهجوم لتقوية النماذج اللاحقة بدلا من توزيعه كأداة للباحثين الخارجيين.
ولا تزال الهجمات الممتدة ذهابا وإيابا والمحاولات التي تخفي التعليمات داخل الصور من نقاط الضعف لدى GPT-Red، كما أشارت The Next Web. وقالت Jessica Ji، وهي محللة أمن AI في Georgetown's CSET، للمنصة إن الخبرة البشرية ستظل مهمة جدا.
ولم تطلق OpenAI نموذج GPT-Red. ولم يحدد التقرير موعدا لإصدار GPT-Red، أو شروط وصول الباحثين الخارجيين إليه، أو النتائج الكاملة لاختبارات إخفاء التعليمات في الصور، أو النص الكامل للورقة.




















