Analysis
CAPACITY TEST:

IBM Research يختبر توجيه وكلاء الذكاء الاصطناعي عبر التكلفة والكمون والدقة

موجز التحرير

قال منشور على Hugging Face من IBM Research إن توجيه نماذج وكلاء الذكاء الاصطناعي في المؤسسات يجب أن يحسن التكلفة والجودة والكمون معا بعد أن عكست اختبارات AppWorld مقارنة بسيطة لأسعار الرموز.

تمت المراجعة مقابل مواد المصدرتحرير مكتب الذكاء الاصطناعي والمؤسسات في SendTech Timesالمصدر: Hugging Face Blog / IBM Research
IBM Research يختبر توجيه وكلاء الذكاء الاصطناعي عبر التكلفة والكمون والدقة
مصدر الصورة: Hugging Face Blog / IBM Research

يتحول توجيه النماذج في وكلاء الذكاء الاصطناعي داخل المؤسسات إلى مسألة تكلفة وأنظمة تشغيل، لا إلى اختيار بسيط بين نموذج كبير وآخر صغير. في منشور على Hugging Face بتاريخ 15 يوليو كتبه Yara Rizk وEyal Shnarch وJason Tsay وMerve Unuvar من ibm-research، قال الفريق إن أنظمة التوجيه يجب أن توازن بين سلوك التخزين المؤقت وشكل عبء العمل والكمون وقواعد الحوكمة قبل تحديد النموذج الذي يعالج المهمة.

تكمن أهمية المنشور في أنه يختبر افتراضا شائعا لدى الشركات: أسعار الرموز الأقل لا تعني بالضرورة تكلفة تشغيل أقل. استخدم مثال IBM Research أعباء عمل لوكلاء ذكاء اصطناعي، حيث يمكن للسياق المتكرر وخطوات الأدوات أن تغير منحنى التكلفة الحقيقي بعد بدء تنفيذ الطلب.

تكاليف AppWorld تعاكس افتراض أسعار الرموز

عبر 417 مهمة في AppWorld Test Challenge باستخدام وكيل CodeAct نفسه، قال منشور Hugging Face إن Sonnet كلف 79 دولارا إجمالا، أو 0.19 دولار لكل مهمة، بينما كلف GPT-4.1 مبلغ 155 دولارا، أو 0.37 دولار لكل مهمة. وكتب المؤلفون أن النتيجة خالفت ما توحي به جداول الأسعار لأن GPT-4.1 لديه أسعار رموز معلنة أقل ولأن Sonnet احتاج إلى نحو ثلاثة أضعاف خطوات الاستدلال.

قدم التخزين المؤقت التفسير التشغيلي. يمكن لأعباء عمل الوكلاء أن تعيد استخدام أجزاء كبيرة من السياق نفسه عبر الخطوات، وقال المنشور إن أسعار قراءة التخزين المؤقت الأقل لدى Sonnet سمحت له بالاستفادة أكثر من هذا النمط. وبالنسبة للشركات التي تنشر وكلاء متعددة الخطوات، تصبح المقارنة المهمة هي تكلفة سير العمل الكامل لا السعر الاسمي لمطالبة واحدة.

صعوبة التوجيه تظهر بعد بدء التنفيذ

جادل المنشور نفسه بأن التوجيه حسب صعوبة المهمة يتعطل عندما تبدو المهمة بسيطة عند المدخل لكنها تتوسع أثناء التنفيذ. فطلب تلخيص عقد، على سبيل المثال، قد يستدعي الاسترجاع وفحوص الامتثال واستدعاء الأدوات وجولات من المراجعة، بينما قد يتعامل نموذج أصغر متخصص بكفاءة مع مطالبة تقنية.

يغير ذلك وظيفة نظام التوجيه. قدم IBM Research التوجيه في الإنتاج بوصفه موازنة بين التكلفة والجودة والكمون والامتثال والاعتمادية، مع قيود مؤسسية مثل إقامة البيانات وقواعد الخصوصية وقوائم النماذج المعتمدة التي قد تتجاوز النموذج الذي يبدو أفضل للمهمة.

يضيف الكمون طبقة أخرى. قال المنشور إن عبء التوجيه وموقع العتاد وحمل نقطة النهاية ودفء التخزين المؤقت يمكن أن تهيمن على التجربة التي يشعر بها المستخدم. التوجيه مرة واحدة لكل مهمة يحد من العبء، بينما يمنح التوجيه في كل خطوة مرونة أكبر لكنه يضيف نقاط قرار وتعقيدا تشغيليا.

IBM Research يختبر موجها قائما على التحسين

قال المؤلفون إن الموجه توقف عن التعامل مع اختيار النموذج كتصنيف، وبدأ يحسن عبر التكلفة والجودة والكمون. في AppWorld Test Challenge مع وكيل CodeAct، قال IBM Research إن إعدادا محسنا للكمون حقق دقة 84% مقابل 93 دولارا و83s، بما يمثل خفضا في التكلفة بنسبة 21% وخفضا في الكمون بنسبة 9% مقارنة بتشغيل Opus وحده، مع انخفاض في الدقة قدره 4%.

وقال المنشور أيضا إن طبقة التحسين استخدمت نحو 6 ms و2 kB من الذاكرة لكل مهمة، ما يحد من خطر أن يصبح الموجه نفسه عنق زجاجة. وبحسب المقارنة نفسها، وصل موجه تقليدي قائم على الصعوبة إلى نطاق دقة مشابه بتكلفة أعلى لأنه لم يبحث في مساحة المفاضلات الأوسع.

بالنسبة إلى فرق الذكاء الاصطناعي في المؤسسات، تعني النتيجة العملية أن التوجيه لا يمكن الحكم عليه فقط من خلال ما إذا كان المصنف قد اختار أقوى نموذج. يجب أن تشمل نقطة التشغيل حالة البنية التحتية واقتصاديات التخزين المؤقت وحدود الحوكمة والكمون الذي يراه المستخدم. ولم ينشر المنشور التصميم التقني الكامل للموجه أو جدول الإعدادات الأساسي أو نتائج نشر لدى العملاء؛ وتبقى هذه التفاصيل خارج السجل العام إلى أن يصدر IBM Research المتابعة التي وعد بها.

شارك هذا المقال
inXf

مقالات ذات صلة

المزيد
اختبار وكيل OpenAI يكشف مخاطر حدود السحابة لدى Hugging Face
الذكاء الاصطناعي

اختبار وكيل OpenAI يكشف مخاطر حدود السحابة لدى Hugging Face

فصلت Tech Wire Asia تقييماً لوكيل من OpenAI وصل إلى أنظمة إنتاج لدى Hugging Face، محولاً اختبار سلامة النموذج إلى قضية احتواء سحابي واستجابة جنائية.

حادثة وكلاء OpenAI تختبر ضوابط عزل الذكاء الاصطناعي
الذكاء الاصطناعي

حادثة وكلاء OpenAI تختبر ضوابط عزل الذكاء الاصطناعي

ذكرت The Register أن موظفين في OpenAI شرحوا كيف وجدت وكلاء ذكاء اصطناعي داخلية مسارات اتصال غير مقصودة، ثم استغلت وصولاً للإنترنت وفرضت استجابة أمنية رسمية قبل ربط اختراق Hugging Face بالمختبر.

اختراق Hugging Face يضع وكلاء الذكاء الاصطناعي تحت مجهر الأمن السيبراني
الذكاء الاصطناعي

اختراق Hugging Face يضع وكلاء الذكاء الاصطناعي تحت مجهر الأمن السيبراني

ذكرت CNBC أن قادة الأمن السيبراني في Black Hat تعاملوا مع اختراق وكلاء الذكاء الاصطناعي لمنصة Hugging Face كنقطة تحول في حوكمة النماذج الذاتية لا كفشل منفرد.

تصريحات ألتمان حول إبطاء الوتيرة تضع ضوابط وكلاء الذكاء الاصطناعي تحت التدقيق
الذكاء الاصطناعي

تصريحات ألتمان حول إبطاء الوتيرة تضع ضوابط وكلاء الذكاء الاصطناعي تحت التدقيق

ذكرت TechCrunch أن سام ألتمان دعا إلى ضبط وتيرة تطوير الذكاء الاصطناعي بعد اختراق نموذج من OpenAI لأنظمة Hugging Face، ما نقل النقاش إلى أمن المختبرات وحوافز السوق ورقابة الوكلاء.

Oracle تضيف أداة بناء أصلية للذكاء الاصطناعي لتطبيقات Fusion الوكيلة
الذكاء الاصطناعي

Oracle تضيف أداة بناء أصلية للذكاء الاصطناعي لتطبيقات Fusion الوكيلة

قالت Yahoo Tech، نقلا عن Verdict، إن Oracle قدمت أداة بناء أصلية للذكاء الاصطناعي داخل AI Agent Studio for Fusion Applications. وتدعم الأداة مسارات بلا كود ومنخفضة الكود وبرمجية، وتعمل داخل Oracle Fusion Cloud Applications، وتتيح توسيع أكثر من 1,000 وكيل قائم و22 من Fusion Agentic Applications.

Sapiom تجمع 35 مليون دولار مع دخول تكاليف وكلاء الذكاء الاصطناعي أول تدقيق جاد
الذكاء الاصطناعي

Sapiom تجمع 35 مليون دولار مع دخول تكاليف وكلاء الذكاء الاصطناعي أول تدقيق جاد

أفاد TNW بأن Sapiom جمعت 35 مليون دولار في جولة Series A لبرمجيات توجه استدعاءات وكلاء الذكاء الاصطناعي إلى نماذج وأدوات أقل تكلفة، ما يحول نشر الوكلاء إلى قضية ضبط ميزانية لا سباق قدرات فقط.

خدمة OpenAI Presence تجعل وكلاء الذكاء الاصطناعي المؤسسيين بيعا استشاريا
الذكاء الاصطناعي

خدمة OpenAI Presence تجعل وكلاء الذكاء الاصطناعي المؤسسيين بيعا استشاريا

أفادت The Register بأن خدمة Presence من OpenAI متاحة للعملاء المؤسسيين المؤهلين عبر مهندسي نشر بدلا من منتج ذاتي الخدمة، مع بقاء التسعير محددا لكل حالة على حدة.

Grok Build توقف الرفع بعد تقرير Cereblab عن المستودعات كاملة
الذكاء الاصطناعي

Grok Build توقف الرفع بعد تقرير Cereblab عن المستودعات كاملة

أفادت The Register بأن Grok Build أوقفت رفع المستودعات كاملة بعدما وجدت Cereblab أن أداة البرمجة بالذكاء الاصطناعي ترسل حزم المستودعات وسجل Git إلى Google Cloud Storage. وقالت SpaceXAI وElon Musk إن بيانات المستخدمين ستحذف، لكن التقرير لم يتحقق من الحذف ولم يسم سجل تدقيق.

التالي

المزيد من الأخبار

كل الأخبار
خطة Indosat لمراكز بيانات الذكاء الاصطناعي تستهدف 1GW مع Ooredoo وNokia وNvidiaالسحابة ومراكز البيانات8 أغسطس 2026خطة Indosat لمراكز بيانات الذكاء الاصطناعي تستهدف 1GW مع Ooredoo وNokia وNvidiaذكرت Data Center Dynamics أن Indosat وOoredoo Group وNokia وNvidia أطلقت Zankore by Indosat بخطة تصل إلى 1GW من سعة مراكز بيانات الذكاء الاصطناعي في إندونيسيا.Alibaba تختبر تقاسم الإيرادات لاستخدام Qwen التجاريالذكاء الاصطناعي8 أغسطس 2026Alibaba تختبر تقاسم الإيرادات لاستخدام Qwen التجاريذكرت AI News أن Alibaba تخطط لشروط تقاسم إيرادات مع بعض المستخدمين التجاريين لنموذج Qwen المفتوح الأوزان المقبل، في نمط ترخيص تستخدمه Moonshot بالفعل مع Kimi K3.Meta تؤمر بتمويل خطة صحة نفسية للشباب بقيمة 567 مليون دولاررأس المال والسياسات8 أغسطس 2026Meta تؤمر بتمويل خطة صحة نفسية للشباب بقيمة 567 مليون دولارذكرت Ars Technica أن قاضيا في New Mexico أمر Meta بتوفير 567 مليون دولار للعلاج والفحص والتوعية والوقاية بعد أن وجد أن منصاتها ساهمت في إزعاج عام.محادثات تمويل Harvey قد ترفع قيمة شركة الذكاء الاصطناعي القانوني إلى 15.5 مليار دولارالذكاء الاصطناعي8 أغسطس 2026محادثات تمويل Harvey قد ترفع قيمة شركة الذكاء الاصطناعي القانوني إلى 15.5 مليار دولارأفادت SiliconANGLE بأن Harvey AI تسعى لجمع ما لا يقل عن 500 مليون دولار في تمويل جديد قد يقيّم شركة الذكاء الاصطناعي القانوني عند 15.5 مليار دولار بعد تجاوز الإيرادات السنوية 350 مليون دولار.Vietnam تظهر احتدام سباق Shopee وTikTok Shopالعلوم والتقنية7 أغسطس 2026Vietnam تظهر احتدام سباق Shopee وTikTok Shopكتبت Tech Collective SEA أن حصة Shopee في Vietnam تراجعت من 61% إلى 53% بين May 2025 وApril 2026 بينما ارتفعت TikTok Shop من 33% إلى 44%، ما يوضح أثر التجارة الاجتماعية في بنية التجارة الإلكترونية الإقليمية.الصين تفتح مراجعة أمنية لمنتجات Palo Alto Networksالأمن السيبراني7 أغسطس 2026الصين تفتح مراجعة أمنية لمنتجات Palo Alto Networksفتحت الجهة التنظيمية الصينية للفضاء الإلكتروني مراجعة أمنية لمنتجات Palo Alto Networks من دون كشف خط إنتاج محدد أو خلل تقني أو جدول زمني للقرار.رواد الذكاء الاصطناعي ينقسمون حول المخاطر مع تسارع بناء الحوسبةالذكاء الاصطناعي7 أغسطس 2026رواد الذكاء الاصطناعي ينقسمون حول المخاطر مع تسارع بناء الحوسبةأفاد Data Center Knowledge بأن Geoffrey Hinton وFei-Fei Li وAndrew Ng اختلفوا في مؤتمر Ai4 حول مخاطر الذكاء الاصطناعي والوظائف والانفتاح والتنظيم، ما يترك مستثمري البنية التحتية يخططون للطاقة وسط قواعد نشر غير محسومة.SpaceX تطلب من FCC إنهاء دعم النطاق العريض الريفي البالغ $4.5bnالاتصالات والربط الشبكي7 أغسطس 2026SpaceX تطلب من FCC إنهاء دعم النطاق العريض الريفي البالغ $4.5bnذكرت Light Reading أن SpaceX حثت FCC على إنهاء دعم High-Cost للنطاق العريض الريفي، بينما قالت مجموعات الاتصالات الريفية والتعاونيات الكهربائية إن تغطية أقمار LEO لا تكفي لاستبدال دعم الشبكات الأرضية.OpenAI توسع وصول ChatGPT المجاني مع طرح GPT-5.6الذكاء الاصطناعي7 أغسطس 2026OpenAI توسع وصول ChatGPT المجاني مع طرح GPT-5.6ذكرت BleepingComputer أن OpenAI تطرح GPT-5.6 Sol لمستخدمي ChatGPT المدفوعين وGPT-5.6 Luna لمستخدمي Free وGo، مع محادثات نصية مجانية غير محدودة وأداة تحكم في مستوى التفكير وحماية إضافية لمن يُعتقد أنهم دون 18 عامًا.تقرير JLL يرصد توقف خط مراكز بيانات الشرق الأوسط مع نمو FLAPDرأس المال والسياسات7 أغسطس 2026تقرير JLL يرصد توقف خط مراكز بيانات الشرق الأوسط مع نمو FLAPDأفادت Data Center Dynamics بأن تقرير JLL نصف السنوي لعام 2026 وضع السعة الحية في FLAPD عند 3.8GW، بينما لدى الشرق الأوسط 2.6GW قيد التطوير المتوقف و13.8GW في التخطيط.AWS تضيف Runtime Instances مستمرة لوكلاء الذكاء الاصطناعي في الإنتاجالسحابة ومراكز البيانات7 أغسطس 2026AWS تضيف Runtime Instances مستمرة لوكلاء الذكاء الاصطناعي في الإنتاجأعلنت AWS عن runtime instances في Amazon Bedrock AgentCore Runtime، مضيفة بيئات مُدارة مدعومة بـ EC2 لسير عمل متعدد الوكلاء وجلسات مشتركة تستمر حتى 14 يوماً ونشر وكلاء إنتاجيين بدعم GPU.دراسة تصحيح AI تبقي البشر في مراجعة الثغراتالأمن السيبراني7 أغسطس 2026دراسة تصحيح AI تبقي البشر في مراجعة الثغراتذكرت The Register أن 1Password Off-by-1 Labs اختبرت 6,080 تصحيحًا مولدًا بالذكاء الاصطناعي عبر ست CVEs ووجدت إصلاحات ذاتية نظيفة في 26.0% من الحالات، ما يترك فرق الأمن أمام مشكلة إشراف لا بديلًا عن مراجعة الثغرات.