إرسال السجلات والتنبيهات وبيانات القياس عن بُعد عبر صمام ثنائي البيانات

اكتشف كيف
نستخدمُ الذكاء الاصطناعي في ترجمات الموقع، ومع أننا نسعى جاهدين لبلوغ الدقة قد لا تكون هذه الترجمات دقيقةً بنسبة 100% دائمًا. تفهّمك لهذا الأمر هو موضع تقدير لدينا.

المخاطر الأمنية لنموذج LLM الناجمة عن ملفات «بيكل» والحمولات المتراكبة

تعد نماذج الذكاء الاصطناعي المُدرَّبة مسبقًا التي يتم تنزيلها من المنصات العامة رموزًا قابلة للتنفيذ، والتي يقوم مسار المعالجة المكون من خمس طبقات في MetaDefender Aether™ بفحصها قبل أن تعبر حدود الثقة الخاصة بك.
بقلم ترييت تران مينه، محلل كشف التهديدات
شارك هذا المنشور

أمن نماذج اللغات الكبيرة (LLM) هو ممارسة تتمثل في فحص ملفات نماذج الذكاء الاصطناعي المُدرَّبة مسبقًا بحثًا عن أي أكواد ضارة مضمنة فيها قبل تحميلها في أي بيئة. ويمكن لملفات النماذج ذات التنسيقات مثل pickle وPyTorch وTensorFlow وKeras أن تُنفِّذ الأكواد فور تحميلها، مما يجعلها تشكل خطرًا على سلسلة التوريد يعادل تشغيل برامج لم تخضع للتدقيق.

ملخص / النقاط الرئيسية

  • تُعد النماذج المُدرَّبة مسبقًا التي يتم تنزيلها من Hugging Face أو Kaggle أو PyPI رموزًا قابلة للتنفيذ، وليست بيانات خاملة
  • وفقًا لتقرير «حالة الاتحاد 2026» الصادر عن شركة JFrog (Software )Supply Chain ، فإن 53% من المؤسسات تستمد النماذج مباشرةً من السجلات العامة، حيث حدد الباحثون ما يقارب 495 نموذجًا ضارًا قادرًا على سرقة بيانات الاعتماد واختراق النظام بالكامل
  • تقوم التنسيقات المستندة إلى Pickle (.pt، .pth، .bin، .pkl) بتنفيذ وظائف عشوائية عبر تعليمة REDUCE أثناء التحميل، وهو نفس الخلل الهيكلي الموجود في مخططات TensorFlow وطبقات Lambda في Keras
  • تقوم «Safetensors» بإزالة محرك التنفيذ بالكامل، لكن لا تزال هناك مئات الآلاف من النماذج ذات التنسيقات القديمة متداولة، كما أن وجود ملف آمن في مستودع لا يضمن أن بقية محتويات ذلك المستودع آمنة
  • MetaDefender يقوم Aether™ بفحص ملفات النماذج عبر خمس طبقات تحليلية، ليكشف عن التهديدات مثل حمولات «بيكل» المتراكبة التي لا تكتشفها أدوات الفحص التقليدية

نماذج الذكاء الاصطناعي المُدرَّبة مسبقًا هي أكواد قابلة للتنفيذ تتجاوز حدود الثقة

يتطلب بناء نموذج لغوي ضخم من الصفر بيانات وقدرات حاسوبية ووقتًا لا تمتلكها معظم المؤسسات. وبدلاً من ذلك، تقوم الفرق بتنزيل نماذج مدربة مسبقًا من منصات عامة مثل Hugging Face وKaggle وPyPI. وقد أدى هذا الاعتماد إلى ظهور ثغرة أمنية في سلسلة التوريد لا تزال العديد من برامج الأمان تتجاهلها.

تقوم المؤسسات بالفعل بفحص المكتبات مفتوحة المصدر وصور الحاويات التي تستوردها إلى بيئاتها. لكن قلة منها فقط هي التي تطبق نفس مستوى التدقيق على نماذج الذكاء الاصطناعي التي تقوم فرقها بتنزيلها، على الرغم من أن ملف النموذج ليس مجرد جدول بيانات يحتوي على أرقام. فحسب تنسيقه، يمكن أن يكون ملف النموذج برنامجًا يعمل فور تحميله.

يستضيف موقع «Hugging Face» وحده ما يزيد بكثير عن مليون نموذج، لم يخضع معظمها أبدًا لمراجعة تتعلق بالسلامة. ووفقًا لت قرير «Software » الصادر عن شركة «JFrog» بعنوان «Supply Chain : State of the Union 2026»، فإن 53% من المؤسسات تستمد النماذج حاليًا مباشرةً من السجلات العامة، وقد حدد الباحثون ما يقارب 495 نموذجًا ضارًا في تلك السجلات قادرة على سرقة بيانات الاعتماد، وتنفيذ الأكواد البرمجية، والسيطرة الكاملة على النظام. ويُعد نموذج «LLM» برنامجًا قابلاً للتنفيذ يتجاوز حدود الثقة.

كيف تطورت التهديدات المستندة إلى النماذج من النظرية إلى أساليب التحايل

تطور هذا التهديد على مراحل: بدءًا من التحذيرات الأكاديمية، مرورًا بإثباتات المفهوم، وصولاً إلى استغلال سلسلة التوريد في الواقع الفعلي، وانتهاءً بتقنيات التحايل المصممة للتغلب على أجهزة الفحص.

تطور التهديدات التي تنشأ عن النماذج، 2018–2026

المرحلة

الإطار الزمني

ما الذي تغير

أمثلة توضيحية

النظرية

2018

يحذر الأكاديميون من إمكانية التلاعب بالنماذج المعاد استخدامها والمُدرَّبة مسبقًا والتي تأتي من مصادر غير موثوقة

هجمات إعادة استخدام النماذج على أنظمة التعلم العميق

إثبات صحة الفكرة

2023–2024

ظهور نماذج خبيثة حقيقية؛ وتبين أن التنسيقات القائمة على ملفات «بيكل» تحمل حمولات نشطة

ظهر «star23/baller13»، وهو نموذج يحمل هيكلًا معكوسًا، على موقع Hugging Face

في البرية

2024–2025

يزداد الحجم، مع توفير خدمة التوصيل عبر سلسلة التوريد من خلال سجلات الطرود

تشير حزم PyPI التي تحمل علامة «أليبابا» التجارية إلى ظهور هجمات تستهدف سلسلة التوريد الخاصة بنماذج اللغة الكبيرة (LLM)

التملص المتقدم

2024–2025

حمولات متعددة الطبقات ومكدسة مصممة للتحايل على عمليات الفحص السريع

حصلت نسخة تجريبية من برنامج «Stacked Pickle» على 0/70 في VirusTotal

صيغة أكثر أمانًا

2023–2026

تم طرح تنسيق مخصص للبيانات فقط ولا يمكنه نقل التعليمات البرمجية، لكن النماذج القديمة لا تزال مستخدمة على نطاق واسع

تصبح «Safetensors» الخيار الافتراضي في الإصدارات الجديدة من الطرازات

تقوم ملفات Pickle وPyTorch بتنفيذ التعليمات البرمجية فور تحميلها

يُعد «بيكل» (Pickle) تنسيق التسلسل الأصلي في لغة بايثون، وكان الطريقة القياسية لحفظ النماذج على القرص لسنوات عديدة. وقد استندت PyTorch في إنشاء ملفاتها ذات الامتدادات .pt و.pth و.bin إلى هذا التنسيق، ونُشرت العديد من النماذج بهذه التنسيقات. وتوجد اليوم خيارات أكثر أمانًا، تم استبعادها باعتبارها لغة تجارية مجردة. ولا تزال حصة كبيرة من النماذج المتداولة حاليًّا على المنصات العامة تعتمد على تنسيق «بيكل»، وتقوم الفرق بتحميلها يوميًا.

يُستخدم تنسيق «بيكل» على نطاق واسع لتخزين نماذج النماذج اللغوية الكبيرة (LLM)

لا يخزن «بيكل» البيانات فحسب، بل هو تيار تعليمات تنفذه الآلة الافتراضية أثناء تحميل الملف وإعادة بناء كائنات بايثون. ويمكن لهذا التيار استدعاء دالات عشوائية، لذا فإن تحميل نموذج قائم على «بيكل» قد يؤدي أيضًا إلى تشغيل التعليمات البرمجية.

يستغل المهاجمون تعليمة «REDUCE» الخاصة بـ«pickle»، والتي توجه المُحمِّل إلى استدعاء دالة محددة بوسائط يختارها المهاجم أثناء عملية «unpickling». ويمكن أن يؤدي ذلك إلى تشغيل شل عكسي، أو زرع حمولة من المرحلة الثانية، أو الكتابة فوق مفتاح SSH، في حين يظل النموذج يُحمَّل ويتصرف كملف شرعي.

تنطوي كل من TensorFlow وKeras على مخاطر متشابهة. فمخططات TensorFlow الخبيثة يمكنها تهريب مشغلات كتابة الملفات أو مشغلات الشبكة إلى مخطط الحساب، في حين أن طبقات Lambda في Keras يمكنها حمل بايت كود لغة Python مُرتب يتم فك تسلسله عند التحميل. ويسمح كل من هذين التنسيقين للملف بحمل سلوك قابل للتنفيذ. وهذه المخاطر هي مخاطر هيكلية، لذا فإن إصلاح خطأ برمجي واحد لا يكفي لإزالتها. وقد أجبر هذا القيد القطاع على البحث عن تنسيق أكثر أمانًا.

قذيفة عكسية مضمنة في ملف نموذج قائم على صيغة «بيكل»

أدت الحوادث التي وقعت في الواقع إلى تحويل هذه النظرية إلى تهديد من نوع « Supply Chain »

ظهرت التحذيرات بشأن هجمات إعادة استخدام النماذج لأول مرة في عام 2018. وأثبت الباحثون لاحقًا أن هذا الخطر يمكن أن يتحقق فعليًّا. وفي يناير 2024، ظهر نموذج يُدعى star23/baller13 على منصة Hugging Face، وكان يحتوي على «ريفرس شيل» داخل ملف PyTorch. وكان هذا النموذج قادرًا على توفير وصول عن بُعد، مع استمرار ظهوره كنموذج صالح.

تحذير من Star23/baller13 على موقع Hugging Face. المصدر: https://huggingface.co/star23/baller13
حزمة PyPi ضارة
حزمة PyPi ضارة

بحلول مايو 2025، انتقل التهديد إلى المجال التقليدي لسلسلة التوريد. فقد نشر المهاجمون حزمًا على PyPI تحمل أسماء «aliyun-ai-labs-snippets-sdk» و«ai-labs-snippets-sdk» و«aliyun-ai-labs-sdk»، والتي انتحلت صفة مجموعة أدوات الذكاء الاصطناعي الخاصة بشركة «أليبابا»، وقامت بتحميل نموذج ضار خلسةً أثناء الاستخدام. ظلت الحزم متاحة لأقل من 24 ساعة، ومع ذلك تم تنزيلها حوالي 1,600 مرة؛ وهو ما يذكرنا بأن فترة التعرض القصيرة تكفي تمامًا عندما يتولى التنزيل نظام حل التبعيات الآلي.

ماجستير في القانون (LLM) في مجال هجمات سلسلة التوريد

الحمولات المتراكبة من نوع «بيكل» تتغلب على أجهزة الفحص التقليدية

بحلول عام 2024، أصبح المهاجمون يستهدفون أدوات الفحص المصممة للكشف عن النماذج الخبيثة. وأبرز مثال على ذلك هو تقنية «Stacked Pickle»، التي تقوم بتداخل عدة كائنات «pickle» ونشر التعليمات الخبيثة عبر الطبقات، ثم تغليفها بعمليات الضغط والترميز.

تبدو كل طبقة غير ضارة عند فحصها بمفردها، لذا فإن برامج الفحص والمراجعات اليدوية التي تقتصر على السطح لا تكتشف شيئًا. وعندما يتم تحميل النموذج، يتم فك الطبقات بالتسلسل وإعادة تجميع الحمولة. وقد سجلت عينة «إثبات المفهوم» التي تم إنشاؤها باستخدام هذه التقنية صفر اكتشافات عبر جميع محركات الفحص على موقع VirusTotal.

قد يفوت الماسح الضوئي الذي يفحص الطبقة المرئية فقط أي حمولة مخفية في أعماق الملف. وهكذا تمكنت العينة من اجتياز جميع المحركات.

تتجاوز تقنية «Stacked Pickle» الماسحات الضوئية التقليدية

تقوم «Safetensors» بإزالة محرك التنفيذ بالكامل

يقوم «Safetensors» بتخزين أوزان النماذج دون محرك تنفيذ. يحتوي الملف على رأس بيانات وصفية مضغوط يصف شكل كل توتر ونوع بياناته وإزاحة البايتات، تليه بايتات التوتر الخام. ولا يحتوي على تيار تعليمات أو آلة افتراضية أو ما يعادل دالة «REDUCE» في «pickle»، لذا لا يمكن توجيه المحمل لاستدعاء دالة ما.

ملف «Safetensors» هو عبارة عن بيانات خاملة يقرأها برنامج التحميل. وحتى الملف الذي تم إنشاؤه بهدف خبيث لا يمكنه تنفيذ أي تعليمات برمجية عند التحميل، لأن التنسيق لا يوفر أي مسار لتشغيل تلك التعليمات.

مقارنة بين «Safetensors» و«Pickle» من حيث بنية الملفات

لماذا تم إنشاء «Safetensors»، ولماذا انتشرت

لم تكن المشكلة في التنسيقات القديمة تكمن أبدًا في الأوزان نفسها، بل في أن الملف كان يمكن أن يحتوي أيضًا على تعليمات قابلة للتنفيذ. وقد قامت شركة Hugging Face، بالتعاون مع EleutherAI وStability AI، بتطوير «Safetensors» كبديل مصمم خصيصًا لهذا الغرض، حيث يزيل هذه الإمكانية مع الحفاظ على ما تحتاجه الفرق من ملف الأوزان.

كما أن Safetensors عملي أيضًا. فهو يتم تحميله بسرعة من خلال الوصول المُخطَّط في الذاكرة دون نسخ، ويعمل عبر PyTorch وTensorFlow وJAX وغيرها من الأطر البرمجية، وقد أصبح الخيار الافتراضي لمعظم الإصدارات الجديدة من النماذج. وقد ساعدت هذه المزايا على انتشاره دون الحاجة إلى فرض استخدامه.

Safetensors هو معيار أكثر أمانًا لملفات نماذج التعلم الآلي

تقرير تدقيق مستقل يؤيد الادعاء المتعلق بالسلامة

ليس القائمون على صيانة المكتبة هم المصدر الوحيد وراء هذا الادعاء المتعلق بالأمان. فقد كُتبت المكتبة بلغة «Rust»، التي يمنع مُترجمها حدوث فئات كاملة من أخطاء التحليل. وفي عام 2023، كلفت كل من «Hugging Face» و«EleutherAI» و«Stability AI» بشكل مشترك شركة «Trail of Bits» بإجراء تدقيق مستقل لهذا التنسيق.

لم تكشف عملية التدقيق عن أي ثغرة خطيرة قد تؤدي إلى تنفيذ تعليمات برمجية تعسفية. وقد حددت العملية عددًا قليلاً من أوجه عدم الدقة في المواصفات، بالإضافة إلى وجود فجوة في عملية التحقق من الصحة كانت تسمح بوجود ملفات متعددة اللغات. وقام القائمون على الصيانة بإصلاح جميع هذه المشكلات ونشرها، ثم جعلوا «Safetensors» الخيار الافتراضي.

وتؤيد السجلات المسجلة منذ ذلك الحين النتائج التي توصلت إليها عملية التدقيق. فقد تسببت التنسيقات القديمة في وقوع حوادث حقيقية منذ عام 2024، في حين لم يتم إثبات وقوع أي هجوم لتنفيذ التعليمات البرمجية يستهدف تنسيق «Safetensors» نفسه خلال الفترة نفسها. ولا يوفر تنسيق «Safetensors» للمهاجمين أي آلية تنفيذ لنوع الهجمات التي تجعل الملفات القائمة على تنسيق «pickle» خطرة. أما المخاطر المتبقية فتنبع من التنسيقات القديمة التي لا تزال مستخدمة على نطاق واسع.

لا يزال الطراز « Supply Chain » بحاجة إلى فتحة فحص

ينبع الخطر من قدرة تنسيق ملف النموذج على حمل التعليمات البرمجية إلى جانب أوزانه. وتتمتع تنسيقات Pickle وPyTorch وTensorFlow وKeras بهذه القدرة؛ أما تنسيق Safetensors فلا يتمتع بها بحكم تصميمه. لذا، يتعين على المسؤولين عن الأمن التعامل مع تنسيقات النماذج القابلة للتنفيذ على أنها تشكل خطرًا، وفحص كل نموذج يدخل البيئة، وتوجيه الفرق نحو استخدام التنسيقات الآمنة كلما أمكن ذلك.

لا تزال هناك ملايين النماذج ذات التنسيقات القديمة موجودة على المنصات العامة، ولا تزال الفرق تقوم بتنزيلها. كما يمكن للمستودع أن يضم ملفًا بتنسيق «بيكل» جنبًا إلى جنب مع ملف آمن، لذا فإن وجود أوزان «Safetensors» لا يجعل المستودع بأكمله آمنًا. وستحتاج سلسلة توريد النماذج إلى بوابة فحص حتى يتم التخلي عن التنسيقات القديمة.

في الواقع، تتحول هذه القائمة إلى قائمة مراجعة موجزة تقلل من حالات الإيجابية الكاذبة:

  • يفضل استخدام «Safetensors»، واعتبار التنسيقات القديمة على أنها تتطلب الفحص قبل الاستخدام. يجب فحص أي نموذج بتنسيقات .pt أو .pth أو .bin أو .pkl أو .pb أو .h5 صادر عن ناشر لم يتم التحقق من مصداقيته قبل تحميله بأي حال من الأحوال
  • اعتبر تحميل نموذج بتنسيق قديم حدثًا تنفيذيًّا. فعمليّة تحميل النموذج التي تؤدي إلى إنشاء غلاف برمجي، أو فتح اتصال صادر من مترجم لغة بايثون، أو الكتابة إلى مسار حساس، تُعد إشارة سلوكية ينبغي إدراجها في بيانات القياس عن بُعد الخاصة بالمضيف، تمامًا كما هو الحال مع أي عملية تنفيذ للكود
  • قم بمسح الأثر بأكمله، وليس ملف الأوزان فقط. وحدة التحليل هي حزمة النموذج كما تم تسليمها، لأن تنسيق المستودع يمثل ادعاءً وليس ضمانًا، إلى أن يتم التحقق منه

كيف يقوم خط الإنتاج المكون من خمس طبقات في « MetaDefender Aether» بفحص ملفات نماذج النماذج اللغوية الكبيرة (LLM)

MetaDefender يوفر Aether™، الحل الموحد للكشف عن الثغرات الأمنية من نوع «صفر يوم» (zero-day) من شركة « OPSWAT »، فعالية في الكشف عن هذه الثغرات بنسبة 99.9% من خلال مسار فحص مكون من خمس طبقات. تبدأ كل عملية إرسال بتحليل نوع الملف، الذي يعمل على تحديد هوية الملف بدلاً من الاعتماد على امتداده. ويمكن لكل طبقة تحليلية تحديد النتيجة بشكل مستقل. وبمجرد وصول إحدى الطبقات إلى إجابة قاطعة، يتوقف التحليل، وبالتالي تتجنب معظم الملفات المراحل الأعمق والأكثر تكلفة.

  1. سمعة التهديد. يتم فحص التجزئة (هاش) للملف والمؤشرات ذات الصلة بمقارنتها مع قاعدة المعلومات الاستخباراتية العالمية الخاصة بالتهديدات المتوفرة على OPSWAT ، والتي تستند إلى أكثر من 50 مليار مؤشر. يتم حظر التجزئة المرتبطة بالفعل بتحميل ضار معروف في أقل من ثانية، كما يتم إجازة الملفات المعروفة بأنها آمنة بنفس السرعة، وبالتالي لا يتم السماح بمرور سوى الملفات غير المعروفة.
  2. التحليل الثابت. قبل تشغيل أي شيء، يتم تقييم الملف بواسطة Predictive Alin AI إلى جانب التحليل الثابت والمسح بواسطة محرك مكافحة الفيروسات. يقدم «Predictive Alin AI» نتائج التعلم الآلي في غضون أجزاء من الألف من الثانية دون الحاجة إلى تشغيلها في بيئة الحماية (sandbox)، حيث تم تدريبه على مجموعات بيانات مؤسسية مختارة بعناية وتراعي الخصوصية، ويتم تحسينه باستمرار من خلال حلقة إعادة تدريب فورية (zero-day) تُغذى بالكشفات المؤكدة من « MetaDefender » و«Aether». بالنسبة لملفات النماذج، يتم هنا اكتشاف ملف «pickle» مشبوه يحتوي على رموز تشغيل حمولة (opcodes) يمكن التعرف عليها قبل أن يتم إنفاق أي وقت في محاكاته.
  3. التحليل الديناميكي. تعالج المحاكاة على مستوى التعليمات مشكلة «Stacked Pickle» من خلال الكشف عن سلوك الملف دون الحاجة إلى تشغيل آلة افتراضية كاملة لكل عينة. وهي تتغلب على عمليات الفحص المضادة للآلات الافتراضية والتأخيرات الزمنية التي تتجاوز صناديق الحماية القديمة، وتُنجز التحليل في ثوانٍ بدلاً من دقائق، بسرعة تصل إلى 20 ضعفًا وحجم يصل إلى 100 ضعف مقارنةً بصناديق الحماية التقليدية أدوات.
  4. تقييم درجة التهديد. تجمع هذه الطبقة بين الوظائف التي تم استدعاؤها، ومحاولات الاتصال، وإشارات السمعة، والنتائج الأخرى المستخلصة من الطبقات الثلاث الأولى. وهي تعتمد على أكثر من 900 مؤشر سلوكي لإنتاج درجة تقييم واحدة قابلة للتنفيذ وبصمة تشابه للمرحلة النهائية.
  5. البحث عن التهديدات. يعمل البحث عن أوجه التشابه باستخدام التعلم الآلي على ربط البصمة بقاعدة بيانات معلومات التهديدات الخاصة بـ OPSWAT والسلوكيات المُصنَّفة وفقًا لمعايير MITRE، وذلك لتحديد المتغيرات والحملات. قد يكون للنموذج الخبيث الذي أعيد تجميعه أو تغيير اسمه هاش جديد، لكن هذه الطبقة لا تزال قادرة على اكتشاف تشابهه مع نموذج خبيث معروف سابق.

تعمل السلسلة بأكملها تلقائيًّا. وتُصدر نتيجة موحدة واحدة وتقريرًا للأدلة يربط كل مؤشر بالسلوك الذي أدى إلى ظهوره.

MetaDefender يقوم Aether بفحص ملفات النماذج عند كل نقطة دخول

تصل النماذج عبر التنزيلات من الإنترنت، والبريد الإلكتروني، ومنصات نقل الملفات، وقنوات النقل الآلية. ويجب أن تغطي بوابة الفحص كل مسار دون إجبار المؤسسات على إعادة تصميم البنية التحتية التي تنقل حركة المرور.

بالنسبة لقنوات الشبكة، MetaDefender يتكامل Aether من خلال ICAP ، وهو البروتوكول القياسي الذي تستخدمه بالفعل الخوادم الوكيلة وبوابات البريد الإلكتروني ومنصات نقل الملفات لتسليم الملفات إلى خدمة الفحص. وفي الحالات التي لا يمر فيها حركة المرور عبر أي جهاز شبكي، يمكن إجراء التحليل نفسه عبر واجهة REST API بدلاً من ذلك.

  • التنزيلات عبر الويب. عندما يقوم مطور ما بسحب نموذج من Hugging Face أو Kaggle، يقوم الوكيل أو بوابة الويب الآمنة بتوجيه عملية التنزيل إلى MetaDefender Aether عبر ICAP ، ويتم إيقاف ملف pickle ضار قبل أن يصل إلى نقطة النهاية.
  • البريد الإلكتروني. يتم استخراج ملفات النماذج وأدوات الذكاء الاصطناعي التي يتم مشاركتها كمرفقات وتحليلها عبر نفس مسار المعالجة الذي يتم اتباعه مع أي مرفق آخر، مما يقطع الطريق أمام الهجمات الهندسية الاجتماعية التي تتجاوز الضوابط على مستوى السجل.
  • نقل الملفات. يتم فحص الملفات التي يتم تبادلها مع الشركاء والموردين، أو التي يتم نقلها بين المناطق الداخلية عبر نظام نقل الملفات المُدار، أثناء نقلها؛ وبالتالي، تظل حدود الثقة سارية حتى بالنسبة للملفات التي لا تمر أبدًا عبر مركز توزيع عام.
  • خطوط الأنابيب والسجلات الآلية. قم بإنشاء مهام ومنصات التعلم الآلي التي تسترد النماذج برمجياً وترسلها عبر API قبل أن يتم نقل أي شيء إلى سجل داخلي، مما يسد الثغرة التي استغلتها حزم Alibaba PyPI بالضبط، حيث يتولى حل التبعيات عملية التنزيل ولا يرى أحد أبداً ملفاً يثير الشكوك.

يستخدم كل مسار نفس مسار الفحص ومنطق اتخاذ القرار، مما لا يترك أي قناة غير خاضعة للمراقبة يمكن للمهاجم استغلالها.

الأمان دون إعاقة عمل المطورين

غالبًا ما تترك فرق الأمن مخاطر النماذج دون معالجة، لأن حظر التنزيلات من المحطات العامة أمر غير عملي. MetaDefender يتيح Aether للمطورين الحفاظ على سير عملهم الحالي، بينما يقوم مسار العمل بفحص النماذج في الترتيب حسب دورها بسرعة المحاكاة. وتشمل التنزيلات المحظورة تقريرًا تبريريًا يشرح سبب القرار.

تعرف على كيفية قيام خدمة «Aether» من شركة « MetaDefender » بفحص ملفات نماذج النماذج اللغوية الكبيرة (LLM) قبل أن تتجاوز حدود الثقة الخاصة بك.

الأسئلة المتداولة

ما المقصود بأمن نماذج اللغات الكبيرة (LLM)؟
أمن نماذج اللغات الكبيرة (LLM) هو ممارسة تتمثل في فحص ملفات نماذج الذكاء الاصطناعي المُدرَّبة مسبقًا بحثًا عن أي شفرات خبيثة مضمنة قبل تحميلها في بيئة ما. وتتعامل هذه الممارسة مع النماذج التي يتم تنزيلها من المنصات العامة على أنها برامج قابلة للتنفيذ تتجاوز حدود الثقة، وليس كبيانات خاملة.

لماذا تُعد ملفات «بيكل» خطرة على نماذج الذكاء الاصطناعي؟
تقوم الآلة الافتراضية بتنفيذ سلسلة التعليمات الموجودة في ملف «بيكل» أثناء تحميل الملف. وتسمح تعليمة «REDUCE» للمهاجم باستدعاء دالات عشوائية خلال تلك العملية، لذا فإن تحميل نموذج يعتمد على ملف «بيكل» قد يؤدي إلى تشغيل تعليمات برمجية يتحكم فيها المهاجم دون سابق إنذار.

ما هو «Safetensors»، وكيف يختلف عن «pickle»؟
«Safetensors» هو تنسيق ملف مخصص للبيانات فقط لتخزين أوزان النماذج، ويحتوي على رأس بيانات وصفية وبايتات «تنزور» خام، دون محرك تنفيذ ودون أي ما يعادل تعليمة «REDUCE» في «pickle». ففي حين أن ملف «pickle» هو برنامج يقوم المحمل بتشغيله، فإن ملف «Safetensors» هو بيانات خاملة يقوم المحمل بقراءتها.

هل يمكن أن يكون ملف Safetensors ضارًّا؟
لا يمكن لملف Safetensors تنفيذ أي تعليمات برمجية عند التحميل لأن التنسيق لا يوفر مسارًا للتنفيذ. ومع ذلك، قد يتضمن المستودع ملفًا قديمًا قائمًا على تنسيق pickle جنبًا إلى جنب مع أوزان Safetensors الآمنة، لذا لا يزال المستودع بأكمله بحاجة إلى الفحص.

كيف يقوم نظام Aether التابع لشركة MetaDefender بالكشف عن نماذج LLM الخبيثة؟
MetaDefender يقوم نظام Aether بفحص ملفات النماذج عبر خمس طبقات: سمعة التهديد، والتحليل الثابت، والتحليل الديناميكي، وتقييم درجة خطورة التهديد، والبحث عن التهديدات. وهو يوقف معظم الملفات قبل وصولها إلى المراحل الأعمق والأكثر تكلفة، ويمكنه الكشف عن حمولات «بيكل» المكدسة التي تتجاوز الماسحات الضوئية التقليدية ذات الطبقة الواحدة.

افحص كل طراز قبل أن يتجاوز حدود ثقتك

تعتمد الفرق حاليًا على نماذج معاد استخدامها ومدربة مسبقًا، لكن كل عملية تنزيل من مصدر عام تثير السؤال نفسه: هل يحتوي الملف على بيانات فقط، أم أنه قادر على تشغيل تعليمات برمجية؟ MetaDefender يقدم «Aether» الإجابة قبل تحميل النموذج، حيث يطبق خمس طبقات من التحليل على التنزيلات من الويب، والبريد الإلكتروني، وعمليات نقل الملفات، وخطوط الإنتاج الآلية.

ابق على اطلاع دائم OPSWAT!

اشترك اليوم لتلقي آخر تحديثات الشركة, والقصص ومعلومات عن الفعاليات والمزيد.