HomeZ - Banner Homeإطار عمل جديد لنموذج لغوي كبير يرسم سلاسل هجمات التهديدات السيبرانية في...

إطار عمل جديد لنموذج لغوي كبير يرسم سلاسل هجمات التهديدات السيبرانية في 19 من أصل 20 تقريرًا

لطالما واجهت فرق الأمن مشكلة عنيدة: فالاستخبارات التي تصف بشكل أفضل كيفية عمل المهاجمين — تقارير استخبارات التهديدات السيبرانية المفصلة والغنية بالسرد — موجودة في شكل لا تستطيع الحواسيب الاستدلال عليه بسهولة. إطار عمل آلي جديد، مُفصَّل في ورقة بحثية منشورة على arXiv، يستهدف هذه الفجوة مباشرة من خلال تحويل سرديات التهديد غير المهيكلة إلى سلاسل هجمات سيبرانية قابلة للقراءة آلياً يمكن لمحرك استدلال منطقي اجتيازها فعلياً.

أهم النقاط

  • تقارير CTI تصف الهجمات الواقعية في شكل سردي لكنها لا يمكن استخدامها مباشرة في الاستدلال الآلي لمسارات الهجوم.
  • يقوم الإطار بنمذجة كل خطوة هجوم على أنها وحدة هجوم — ثلاثية مُهيكلة من الشروط المسبقة، وسلوك الهجوم، والنتائج اللاحقة.
  • يستخرج خط أنابيب متعدد المراحل مدعوم بنماذج لغوية كبيرة هذه الوحدات من نصوص CTI الخام، ويطبعها، ويُصلحها.
  • في 20 تقرير CTI تحتوي على 334 خطوة تم التحقق منها بشرياً، نجح استدلال Datalog في الوصول إلى هدف الهجوم المحدد في 19 من أصل 20 تقريراً، وكشف البحث العكسي عن 34 مسار هجوم.
  • يتفوق الإطار على كلٍّ من أنظمة استخراج CTI الممثلة وخطوط الأساس من النماذج اللغوية الشاملة من طرف إلى طرف من حيث التغطية، والكمال، والاتساق.

التحديات في استخراج المعرفة المهيكلة من تقارير CTI

تقارير استخبارات التهديدات هي من أكثر الوثائق كثافة بالمعلومات في مجال الأمن السيبراني. فهي تلتقط أدوات المهاجمين، وتقنيات الحركة الجانبية، وتسلسلات تصعيد الامتيازات، والأهداف النهائية — وغالباً ما يكتبها محللون شهدوا حدوث الاختراق في الوقت الفعلي. لكن هذه الغزارة تأتي بتكلفة: فالمعرفة مدفونة داخل نثر حر، لا بيانات مهيكلة.

هذه الطبيعة غير المهيكلة تجعل استخراج CTI الآلي صعباً فعلاً. يقرأ المحلل البشري تقريراً ثم يبني ذهنياً خطاً زمنياً لما حدث. لا يملك النظام الآلي اختصاراً مكافئاً. فهو لا يستطيع استنتاج أن الخطوة الثالثة لم تصبح ممكنة إلا لأن الخطوة الثانية أنشأت حالة نظام معينة.

ما الذي تفوته أدوات الاستخراج الحالية

تركز معظم المقاربات الحالية لاستخراج CTI على سحب مؤشرات الاختراق — عناوين IP، تجزئات الملفات، أسماء النطاقات — أو على وسم التكتيكات والتقنيات والإجراءات مقابل أطر مثل MITRE ATT&CK. هذه المخرجات مفيدة، لكنها مسطحة في جوهرها. فهي تخبرك بما حدث دون ترميز لماذا مكَّن إجراءٌ ما الإجراءَ التالي.

القصور الجوهري هو غياب شروط التنفيذ. من دون معرفة حالة النظام قبل أن ينفذ المهاجم أمراً، وما الحالة afterward، لا يمكنك ربط الخطوات معاً في مسار هجوم متماسك. مطابقة الحالات وتحليل إمكانية الوصول — العمليات التي تتيح للمدافع أن يسأل “هل يمكن للمهاجم فعلاً الوصول إلى هذا الهدف من نقطة البداية هذه؟” — ببساطة غير مدعومة بواسطة الاستخراج على مستوى الوسوم.

إطار العمل الآلي المقترح لاستخراج سلاسل الهجوم

يقدم البحث إطار عمل يعيد صياغة مشكلة الاستخراج حول وحدة تحليل أغنى. فبدلاً من استخراج مؤشرات فردية أو وسوم TTP، يقوم بنمذجة كل خطوة من الهجوم على أنها وحدة هجوم: كائن مهيكل يتكون من شروط مسبقة، وسلوك هجوم، ونتائج لاحقة. تلتقط الشروط المسبقة ما يجب أن يكون صحيحاً بشأن البيئة قبل تنفيذ الخطوة. وتلتقط النتائج اللاحقة ما يصبح صحيحاً بعدها. معاً، تجعلان من الممكن الاستدلال على ما إذا كانت خطوة ما يمكن أن تغذي الخطوة التالية.

خط أنابيب استخراج متعدد المراحل بمساعدة النماذج اللغوية الكبيرة

إن إنشاء هذه وحدات الهجوم من النص الخام هو المكان الذي تدخل فيه النماذج اللغوية الكبيرة إلى الصورة — ليس كمولد واحد من طرف إلى طرف، بل كمكوّنات في خط أنابيب تحليل هجوم متعدد المراحل. يعمل خط الأنابيب بالتسلسل: فيستخرج أولاً هياكل سلوك الهجوم من سرد CTI، ثم يستعيد الشروط المسبقة والنتائج اللاحقة لكل سلوك، ثم يطبع جميع المكونات إلى مجموعة محددة مسبقاً من المسندات، وأخيراً يُصلح أي تبعيات مكسورة قد تفصل السلسلة.

تُعد خطوة الإصلاح الأخيرة ذات أهمية تحليلية. فالتقارير الحقيقية لـ CTI لا تُكتب كمواصفات هندسية. المؤلفون يحذفون افتراضات يعتبرونها بديهية، ويتخطون خطوات وسيطة، أو يصفون الآثار دون تسمية الأسباب. النظام الذي لا يسد هذه الفجوات بنشاط سينتج سلاسل هجوم مليئة بالثغرات المنطقية — تسلسلات تبدو مكتملة على السطح لكنها لا يمكن اجتيازها فعلياً. تعالج مرحلة الإصلاح هذا الأمر مباشرة.

نتيجة خط الأنابيب الكامل هي مجموعة من وحدات الهجوم المطبوعة والمتسقة داخلياً — جاهزة لتُسلَّم إلى محرك استدلال بدلاً من مجرد فهرستها.

الاستدلال المنطقي ونتائج التقييم

بمجرد استخراجها، تُحوَّل وحدات الهجوم إلى قواعد بأسلوب Datalog. Datalog هي لغة برمجة منطقية مناسبة جيداً لاستعلامات إمكانية الوصول: بالنظر إلى مجموعة من الحقائق والقواعد، هل يمكن للنظام أن يستنتج أن حالة هدف محددة قابلة للتحقق؟ إن تأطير سلاسل الهجوم بهذه الطريقة يحوّل مشكلة استخراج معرفة إلى مشكلة استدلال رسمي — ذات معيار نجاح واضح.

التحويل إلى قواعد بأسلوب Datalog لتحليل إمكانية الوصول

تصبح كل وحدة هجوم قاعدة: إذا تحققت الشروط المسبقة، فإن النتائج اللاحقة تتبع. يتيح ربط هذه القواعد معاً لمحرك الاستدلال أن يسأل ما إذا كان هدف هجوم محدد — لنقل، اختراقاً كاملاً للنطاق — قابلاً للتحقق من موطئ قدم أولي، بالنظر إلى السلوكيات الموصوفة في تقرير CTI. هذه قدرة مختلفة مادياً عن مجرد معرفة أن TTP معيناً قد لوحظ. إنها الفرق بين قائمة مكونات ووصفة ذات نتيجة مُتحقَّق منها.

الأداء على تقارير CTI المشروحة

تكوَّنَت مجموعة بيانات التقييم من 20 تقرير CTI تحتوي على 334 خطوة مشروحة تم التحقق منها بشرياً. عبر تلك المجموعة، حقق الإطار تغطية أعلى للخطوات المشروحة مقارنة بأنظمة استخراج CTI الممثلة — ما يعني أنه استعاد المزيد من سلوكيات الهجوم التي حددها المحللون البشريون على أنها مهمة.

وصل محرك استدلال Datalog إلى هدف الهجوم المحدد في 19 من أصل 20 تقريراً. وأسفر البحث العكسي عبر مجموعات القواعد المولدة عن 34 مسار هجوم مميزاً. هذه القيمة الأخيرة مهمة: فالعثور على مسارات متعددة إلى الهدف نفسه يكشف عن قدر من التكرار في استراتيجية المهاجم ويمنح المدافعين صورة أكثر اكتمالاً عن الأماكن التي يحتاجون فيها إلى سد الثغرات.

المزايا المقارنة على خطوط الأساس من النماذج اللغوية الشاملة من طرف إلى طرف

بالمقارنة مع خطوط الأساس من النماذج اللغوية الكبيرة من طرف إلى طرف — حيث يُطلَب من نموذج واحد إنتاج وحدة الهجوم الكاملة دفعة واحدة — أنتج خط الأنابيب المهيكل وحدات هجوم كانت أكثر كمالاً واتساقاً بشكل ملموس. يميل التوليد من طرف إلى طرف إلى إنتاج مخرجات تبدو معقولة لكنها مع ذلك تُسقِط الشروط المسبقة أو تولِّد نتائج لاحقة تناقض خطوات سابقة. على النقيض من ذلك، يُجبِر النهج المرحلي كل مكوّن على أن يُستخرَج ويُطبَّع بشكل منفصل قبل تجميعه، مما يقلل الانحراف والسهو.

هذه هي البصيرة المنهجية الأعمق المضمَّنة في البحث. النماذج اللغوية الكبيرة مستخرجات قوية للدلالات من النص غير المهيكل، لكنها ليست معماريين موثوقين للبنية المنطقية عندما تُترَك لتعمل بمفردها. يبدو أن تغليفها داخل خط أنابيب منضبط — حيث لكل مرحلة مهمة محددة ومحدودة — يستعيد الاتساق الذي يفقده التوليد غير المقيَّد.

لماذا يهم هذا لاستخبارات التهديدات والدفاع

الدلالة العملية هي أن المدافعين يمكنهم، من حيث المبدأ، إدخال تقرير CTI منشور حديثاً في نظام كهذا والحصول ليس فقط على ملخص لسلوك المهاجم، بل أيضاً على إجابة مُتحقَّق منها آلياً عن السؤال: بالنظر إلى تسلسل التقنيات المبلغ عنه هذا، هل يمكن للخصم الوصول إلى أصولنا الأكثر قيمة من نقطة دخول معينة؟ هذا النوع من تحليل إمكانية الوصول إلى هدف الهجوم تطلَّب تاريخياً محللين مهرة لتنفيذه يدوياً — وهي عملية بطيئة ومكلفة لا تتناسب مع حجم استخبارات التهديدات التي تتلقاها المؤسسات.

هناك أيضاً إشارة أوسع هنا حول دور الاستدلال المهيكل في الأمن المدعوم بالذكاء الاصطناعي. مع دمج المؤسسات للنماذج اللغوية الكبيرة في عملياتها الأمنية، يكون الإغراء هو التعامل معها كحلالات شاملة. تشير نتائج هذا البحث إلى صورة أكثر دقة: قد تكون النماذج اللغوية الكبيرة المقترنة بمحركات استدلال رسمية أقوى من أي منهما بمفرده، تحديداً لأنها تعوِّض نقاط ضعف بعضها البعض. يتوفر الشيفرة المصدرية والمواد التجريبية في مستودع مجهول الهوية، مما يترك الباب مفتوحاً للتحقق المستقل والتوسعة.

الأسئلة الشائعة

لماذا يُعَد استخراج سلاسل الهجوم من تقارير CTI أمراً صعباً؟

تقارير CTI هي سرديات غير مهيكلة تصف هجمات واقعية، مما يجعل من الصعب أتمتة الاستدلال على مسارات الهجوم. فالنص يحذف افتراضات، ويتخطى خطوات وسيطة، ولا يرمِّز حالات النظام التي تحدد ما إذا كانت خطوة هجوم يمكن أن تتبع أخرى.

كيف يحسِّن إطار العمل المقترح على طرق استخراج CTI الحالية؟

إنه ينمذج كل خطوة هجوم باستخدام الشروط المسبقة، والسلوك، والنتائج اللاحقة، ويستخدم خط أنابيب متعدد المراحل من النماذج اللغوية لاستخراج هذه المكونات وتطبيعها — بما في ذلك مرحلة إصلاح تُرقِّع التبعيات المكسورة. هذا يمكِّن من مطابقة الحالات واستدلال إمكانية الوصول الذي لا تستطيع طرق الاستخراج على مستوى الوسوم دعمه.

ما الدور الذي يلعبه استدلال Datalog في هذا الإطار؟

تُحوَّل وحدات الهجوم المستخرجة إلى قواعد بأسلوب Datalog، مما يسمح للنظام بتنفيذ استدلال على إمكانية الوصول وتحديد مسارات الهجوم المؤدية إلى أهداف محددة. هذا يحوِّل المعرفة المستخرجة إلى ادعاء قابل للتحقق رسمياً حول ما يمكن للمهاجم تحقيقه.

كيف تم تقييم أداء الإطار؟

في 20 تقرير CTI تحتوي على 334 خطوة مشروحة تم التحقق منها بشرياً، حقق الإطار تغطية أعلى من أنظمة استخراج CTI الممثلة وأنتج وحدات هجوم أكثر كمالاً من خطوط الأساس من النماذج اللغوية الشاملة من طرف إلى طرف. نجح تحليل إمكانية الوصول المعتمد على Datalog في 19 من أصل 20 تقريراً، وحدد البحث العكسي 34 مسار هجوم مميزاً.

{“@context”:”https://schema.org”,”@type”:”FAQPage”,”mainEntity”:[{“@type”:”Question”,”name”:”لماذا يُعَد استخراج سلاسل الهجوم من تقارير CTI أمراً صعباً؟”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”تقارير CTI هي سرديات غير مهيكلة تصف هجمات واقعية، مما يجعل من الصعب أتمتة الاستدلال على مسارات الهجوم. فالنص يحذف افتراضات، ويتخطى خطوات وسيطة، ولا يرمِّز حالات النظام التي تحدد ما إذا كانت خطوة هجوم يمكن أن تتبع أخرى.”}},{“@type”:”Question”,”name”:”كيف يحسِّن إطار العمل المقترح على طرق استخراج CTI الحالية؟”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”إنه ينمذج كل خطوة هجوم باستخدام الشروط المسبقة، والسلوك، والنتائج اللاحقة، ويستخدم خط أنابيب متعدد المراحل من النماذج اللغوية لاستخراج هذه المكونات وتطبيعها — بما في ذلك مرحلة إصلاح تُرقِّع التبعيات المكسورة. هذا يمكِّن من مطابقة الحالات واستدلال إمكانية الوصول الذي لا تستطيع طرق الاستخراج على مستوى الوسوم دعمه.”}},{“@type”:”Question”,”name”:”ما الدور الذي يلعبه استدلال Datalog في هذا الإطار؟”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”تُحوَّل وحدات الهجوم المستخرجة إلى قواعد بأسلوب Datalog، مما يسمح للنظام بتنفيذ استدلال على إمكانية الوصول وتحديد مسارات الهجوم المؤدية إلى أهداف محددة. هذا يحوِّل المعرفة المستخرجة إلى ادعاء قابل للتحقق رسمياً حول ما يمكن للمهاجم تحقيقه.”}},{“@type”:”Question”,”name”:”كيف تم تقييم أداء الإطار؟”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”في 20 تقرير CTI تحتوي على 334 خطوة مشروحة تم التحقق منها بشرياً، حقق الإطار تغطية أعلى من أنظمة استخراج CTI الممثلة وأنتج وحدات هجوم أكثر كمالاً من خطوط الأساس من النماذج اللغوية الشاملة من طرف إلى طرف. نجح تحليل إمكانية الوصول المعتمد على Datalog في 19 من أصل 20 تقريراً، وحدد البحث العكسي 34 مسار هجوم مميزاً.”}}]}

تم إعداد المقال بمساعدة الذكاء الاصطناعي ومراجعته من قبل الفريق التحريري.

Satoshi Voice
تم إنتاج هذه المقالة بدعم من الذكاء الاصطناعي وتمت مراجعتها من قبل فريقنا من الصحفيين لضمان الدقة والجودة.
RELATED ARTICLES

Stay updated on all the news about cryptocurrencies and the entire world of blockchain.

Featured video

LATEST