HomeZ - Banner Homeنماذج الذكاء الاصطناعي تنجح في 39.6% فقط من الخطوات في اختبار إعادة...

نماذج الذكاء الاصطناعي تنجح في 39.6% فقط من الخطوات في اختبار إعادة بناء سلسلة الهجوم

باحثو الأمن يأملون منذ فترة طويلة أن تتمكن وكلاء نماذج اللغة الكبيرة من تسريع واحدة من أكثر مهام الاستجابة للحوادث رتابة: تجميع كيفية تحرك المهاجم داخل النظام خطوة بخطوة باستخدام السجلات والقياسات المبعثرة. معيار تشخيصي جديد يسمى DiagChain يضع هذا الأمل تحت الاختبار، وتشير النتائج إلى أن هذه التقنية لا تزال أمامها طريق طويل قبل أن تتمكن من التعامل بشكل موثوق مع إعادة بناء سلسلة الهجوم بشكل مستقل.

تم تطوير DiagChain من قبل فريق من الباحثين يضم شيويانغ ليو، ييبين هان، تشينوي تشانغ، كاي تشانغ، تشيوي شو، تيان كيو، ويشيان دنغ، جيا باو جاو، شياولين بينغ، هاي وان، وشي بين تشاو، وليس مجرد لوحة تسجيل دقة أخرى. بل تم بناؤه خصيصًا لإظهار أين ولماذا تفشل وكلاء نماذج اللغة الكبيرة عندما تحاول إعادة بناء تسلسل الأفعال المرتبة التي قام بها المهاجم، استنادًا إلى الأدلة المستخرجة من قياسات النظام.

أهم النقاط

  • DiagChain هو معيار تشخيصي يقيم وكلاء نماذج اللغة الكبيرة في إعادة بناء سلسلة الهجوم المستندة إلى الأدلة، متجاوزًا مجرد دقة النجاح/الفشل البسيطة.
  • تتضمن حزمة MAIN-69 في المعيار 69 سيناريو تغطي أنظمة تشغيل متعددة، ومستويات مختلفة من ضوضاء الأدلة، وأطوالًا مختلفة للسلاسل.
  • طريقة جديدة تسمى ECRAG تقرن استرجاع الأدلة بتمثيل منظم متطور للسلسلة التي يتم إعادة بنائها.
  • عبر 6 نماذج لغوية كبيرة مختلفة تم اختبارها، نجح أفضل إعداد في 39.6% فقط من أصل 849 خطوة مرجعية.
  • النماذج الأصغر تكافح لاستخدام الأدلة المسترجعة على الإطلاق، بينما تكافح النماذج الأكبر بشكل أساسي في وضع تلك الأدلة بالترتيب الصحيح.

تقديم DiagChain: معيار جديد لإعادة بناء سلسلة الهجوم

يوجد DiagChain لأن معظم المعايير الحالية تنظر فقط إلى المخرجات النهائية أو درجات الدقة الإجمالية، ولا تقدم سوى القليل من الفهم حول كيفية تشكل الأخطاء فعليًا أثناء عملية استدلال الوكيل. هذا فجوة مهمة لفرق الأمن السيبراني التي تحاول تحديد ما إذا كان وكيل الذكاء الاصطناعي جديرًا بالثقة بما يكفي للمساعدة في فرز اختراق حقيقي.

هدف ونطاق DiagChain

في جوهره، DiagChain هو معيار تشخيصي تم بناؤه لمهام الأمن السيبراني المستندة إلى الأدلة. بدلاً من مجرد تقييم ما إذا كان الوكيل قد حصل على السرد النهائي للهجوم بشكل صحيح أم لا، فإنه يقيم كل مرحلة من عملية إعادة البناء بشكل منفصل. يتيح هذا النهج المرحلي للباحثين تحديد المكان الدقيق الذي ينهار فيه استدلال وكيل نموذج اللغة الكبير، سواء كان ذلك أثناء جمع الأدلة، أو تفسير الأدلة، أو ترتيب الأحداث في سلسلة مترابطة متماسكة.

تكوين حزمة سيناريوهات MAIN-69

الجزء المركزي من المعيار هو MAIN-69، وهي حزمة من 69 سيناريو مصممة لاختبار الوكلاء تحت مجموعة من الظروف الواقعية. تمتد هذه السيناريوهات عبر أنظمة تشغيل متعددة، وتختلف في مقدار الضوضاء المختلطة في الأدلة، وتختلف في طول السلسلة، ما يعني أن بعض تسلسلات الهجوم قصيرة بينما يتطلب البعض الآخر تتبع سلسلة أطول من أفعال المهاجم. هذا التنوع يهدف إلى كشف ما إذا كان أداء الوكيل يصمد عندما تصبح الظروف أكثر فوضوية، وليس فقط عندما يكون كل شيء نظيفًا ومباشرًا.

الابتكارات المنهجية ومقاييس التقييم

إلى جانب حزمة السيناريوهات، يقدم DiagChain طريقة استرجاع خاصة به ونظام تقييم مكون من خمسة أجزاء، وكلاهما يهدف إلى جعل تشخيص الفشل منهجيًا بدلاً من التخمين.

التوليد المعزز بالاسترجاع المرتكز على الأدلة (ECRAG)

إحدى المساهمات الرئيسية في الورقة هي ECRAG، وهو اختصار لـ Evidence-Centric Retrieval-Augmented Generation (التوليد المعزز بالاسترجاع المرتكز على الأدلة). على عكس إعدادات التوليد المعزز بالاسترجاع القياسية، يقرن ECRAG استرجاع الأدلة مع تمثيل منظم متطور للسلسلة التي يحاول الوكيل إعادة بنائها. من الناحية العملية، يعني هذا أن النظام لا يكتفي بسحب الأدلة ذات الصلة مرة واحدة ثم المضي قدمًا؛ بل يقوم بتحديث صورته الداخلية لسلسلة الهجوم باستمرار مع وصول أدلة جديدة، مما ينبغي نظريًا أن يساعد الوكلاء على تتبع عمليات التسلل المعقدة متعددة الخطوات بشكل أكثر تماسكًا.

خمسة مقاييس مكملة للتقييم التشخيصي

لفهم مكان حدوث الأخطاء، يعتمد DiagChain على خمسة مقاييس مكملة، يستهدف كل منها مرحلة مميزة من عملية إعادة البناء. معًا، تسمح هذه المقاييس للباحثين بعزل نقاط الفشل المحددة بدلاً من تجميع كل خطأ في رقم دقة عام واحد. هذا جوهري لقيمة المعيار: تقييم تشخيصي يميز بين “الوكيل لم يجد الأدلة الصحيحة” و”الوكيل وجد الأدلة لكنه وضع الأحداث بترتيب خاطئ” هو أكثر فائدة بكثير لتحسين هذه الأنظمة من درجة نجاح/فشل واحدة.

تقييم أداء نماذج اللغة الكبيرة

كيف كان أداء النماذج الحالية فعليًا؟ ليس جيدًا بشكل خاص، وفقًا لنتائج المعيار.

الإعداد التجريبي باستخدام ستة نماذج لغوية كبيرة

أجرى فريق البحث تقييمات باستخدام ستة نماذج لغوية كبيرة مختلفة على سيناريوهات MAIN-69. أتاح هذا الإعداد لهم مقارنة كيفية تعامل النماذج ذات القدرات المختلفة مع نفس مهام إعادة البناء المستندة إلى الأدلة، تحت نفس ظروف الضوضاء وتحديات طول السلسلة، مما يوفر أساسًا ثابتًا لمقارنة الأداء عبر اللوحة.

نتائج الأداء الرئيسية ومعدلات النجاح

الرقم الرئيسي صارخ: حتى أفضل إعداد أداء في الدراسة نجح في 39.6% فقط من أصل 849 خطوة مرجعية مدرجة في MAIN-69. بعبارة أخرى، لا يزال أقوى إعداد تم اختباره يخطئ في تسلسل أفعال المهاجم أكثر من 60% من الوقت عند قياسه مقابل خطوات الحقيقة الأساسية في المعيار. هذا يمثل تنبيهًا واقعيًا لأي شخص يأمل في تسليم مهمة إعادة بناء سلسلة الهجوم بالكامل إلى وكيل ذكاء اصطناعي في الوقت الحالي.

رؤى حول حجم النموذج وتحديات إعادة البناء

لماذا يهم هذا إلى جانب الأرقام الخام؟ لأن أنماط الفشل تختلف حسب حجم النموذج، وهذا الاختلاف يشير إلى مشكلتين هندسيتين مختلفتين تمامًا تحتاجان إلى حل.

قيود النماذج الأصغر

وفقًا لتحليل الباحثين، تكافح النماذج الأصغر مع شيء أكثر أساسية من ترتيب الأحداث بشكل صحيح: فهي تواجه صعوبة في دمج الأدلة المسترجعة في مخرجاتها من الأساس. يشير ذلك إلى أن عنق الزجاجة بالنسبة للنماذج الأصغر يقع في وقت أبكر في خط الأنابيب، عند النقطة التي يجب أن تؤثر فيها الأدلة فعليًا على استدلال الوكيل بدلاً من تجاهلها أو إساءة استخدامها.

تحديات النماذج الأكبر في ترتيب الأدلة

تتجاوز النماذج الأكبر هذا العائق الأول بنجاح أكبر وتتمكن من التقدم أكثر في عملية إعادة البناء. لكنها تصطدم بجدار مختلف: يصبح الترتيب الصحيح للأدلة التي جمعتها هو عنق الزجاجة الرئيسي. هذا نمط فشل أكثر دقة، لأن النموذج يمتلك القطع الصحيحة لكنه يكافح لترتيبها في التسلسل الدقيق لأفعال المهاجم، وهو بالضبط المخرج الأكثر أهمية لتحقيق أمني حقيقي.

هذا الانقسام مهم لأي شخص يبني أو ينشر أدوات معايير تقييم نماذج اللغة الكبيرة في عمليات الأمن. فهو يشير إلى أن زيادة حجم النموذج وحدها لن تحل تلقائيًا مشكلة إعادة بناء سلسلة الهجوم. يتطلب نمطا الفشل حلين مختلفين: تكاملًا أفضل للأدلة في النماذج الأصغر، واستراتيجيات أفضل للتسلسل أو الاستدلال في النماذج الأكبر، بدلاً من مسار تحسين واحد يناسب الجميع.

يؤطر الباحثون هذه النتائج كدليل على جدوى التقييم التشخيصي مقارنة بدرجات الدقة الشاملة من طرف إلى طرف. قد يخبر رقم إجمالي واحد فريق الأمن أن النموذج “يصيب الهدف بنسبة 40% من الوقت”، لكنه لن يخبرهم ما إذا كان هذا الفشل ناتجًا عن أدلة مفقودة، أو أدلة أسيء فهمها، أو تسلسل مشوش. تم تصميم المقاييس المرحلية في DiagChain لسد هذه الفجوة، وتقديم ما يصفه المؤلفون بأنه رؤى قابلة للتنفيذ لتحسين وكلاء الأمن السيبراني المستندين إلى الأدلة في المستقبل.

الأسئلة الشائعة

ما الذي صُمم DiagChain لتقييمه؟

تم تصميم DiagChain لتقييم وكلاء نماذج اللغة الكبيرة في إعادة بناء سلسلة الهجوم المستندة إلى الأدلة من خلال تقييم تشخيصي مرحلي.

ما المحتوى الذي تغطيه حزمة سيناريوهات MAIN-69؟

تتضمن MAIN-69 عدد 69 سيناريو تغطي أنظمة تشغيل متعددة، ومستويات مختلفة من ضوضاء الأدلة، وأطوالًا مختلفة لسلاسل الهجوم.

كيف تحسن منهجية ECRAG من إعادة بناء سلسلة الهجوم؟

تقرن ECRAG استرجاع الأدلة بتمثيل منظم متطور للسلسلة المعاد بناؤها للمساعدة في تحليل التسلسل.

ما هي تحديات الأداء الرئيسية التي تم تحديدها للنماذج اللغوية الكبيرة في هذا المعيار؟

تكافح النماذج الأصغر لدمج الأدلة المسترجعة، بينما تواجه النماذج الأكبر تحديات في ترتيب الأدلة بشكل صحيح أثناء إعادة البناء.

{“@context”:”https://schema.org”,”@type”:”FAQPage”,”mainEntity”:[{“@type”:”Question”,”name”:”ما الذي صُمم DiagChain لتقييمه؟”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”تم تصميم DiagChain لتقييم وكلاء نماذج اللغة الكبيرة في إعادة بناء سلسلة الهجوم المستندة إلى الأدلة من خلال تقييم تشخيصي مرحلي.”}},{“@type”:”Question”,”name”:”ما المحتوى الذي تغطيه حزمة سيناريوهات MAIN-69؟”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”تتضمن MAIN-69 عدد 69 سيناريو تغطي أنظمة تشغيل متعددة، ومستويات مختلفة من ضوضاء الأدلة، وأطوالًا مختلفة لسلاسل الهجوم.”}},{“@type”:”Question”,”name”:”كيف تحسن منهجية ECRAG من إعادة بناء سلسلة الهجوم؟”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”تقرن ECRAG استرجاع الأدلة بتمثيل منظم متطور للسلسلة المعاد بناؤها للمساعدة في تحليل التسلسل.”}},{“@type”:”Question”,”name”:”ما هي تحديات الأداء الرئيسية التي تم تحديدها للنماذج اللغوية الكبيرة في هذا المعيار؟”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”تكافح النماذج الأصغر لدمج الأدلة المسترجعة، بينما تواجه النماذج الأكبر تحديات في ترتيب الأدلة بشكل صحيح أثناء إعادة البناء.”}}]}

تم إعداد المقال بمساعدة الذكاء الاصطناعي ومراجعته من قبل الفريق التحريري.

Satoshi Voice
تم إنتاج هذه المقالة بدعم من الذكاء الاصطناعي وتمت مراجعتها من قبل فريقنا من الصحفيين لضمان الدقة والجودة.
RELATED ARTICLES

Stay updated on all the news about cryptocurrencies and the entire world of blockchain.

Featured video

LATEST