اصبحت مراقبة سلوك وكلاء الذكاء الاصطناعي تمثل تحديا تقنيا متزايدا في ظل توسع الاعتماد عليها في مجالات الامن السيبراني والبرمجة والمهام المستقلة. اذ يواجه المطورون مشكلة ان الوكيل قد ينجح في تقديم نتيجة تبدو صحيحة في ظاهرها لكنه يصل اليها عبر مسارات غير امنة او من خلال الالتفاف على الهدف الاساسي للمهمة.

وكشفت شركة غودفاير الامريكية المتخصصة في ابحاث تفسير نماذج الذكاء الاصطناعي عن تطوير ادوات متطورة تقوم بمراقبة الاشارات الداخلية للنماذج بشكل مباشر. وبينت الشركة ان هذه الادوات تكتشف السلوكيات غير المرغوبة اثناء التنفيذ الفعلي بدلا من الاعتماد على انظمة تقييم خارجية مكلفة تستهلك الكثير من الوقت والموارد.

واوضحت الشركة ان هذه التقنية تعزز من مستويات الامان الرقمي عبر تقليل الحاجة الى المراجعات البشرية او انظمة الفحص التقليدية التي لا تغطي دقة العمليات الحسابية التي تجري داخل النموذج.

كيف تعمل مراقبات التنشيط في رصد الانحرافات؟

واكدت غودفاير ان النظام يعتمد على ما يسمى بمراقبات التنشيط وهي عبارة عن مصنفات صغيرة مدربة خصيصا لاكتشاف انماط محددة في الاشارات الحسابية الداخلية التي تتولد اثناء معالجة البيانات. واضافت ان هذه الطريقة تتفوق على ادوات المراقبة التقليدية التي تكتفي بقراءة المخرجات النهائية او مراجعة سجلات الخطوات فقط.

وبينت الشركة ان هذه المراقبات تعمل في الوقت الفعلي مما يتيح اصدار تنبيهات فورية عند ظهور مؤشرات تدل على محاولات تحايل او استجابة لتعليمات خبيثة مخفية. وشدد الخبراء على ان هذه التقنية لا تقرأ افكار النموذج بل تعتمد على انماط حسابية تعلمت الارتباط بسلوكيات معينة مما يجعلها اداة فعالة في كشف التهديدات السيبرانية.

واشار الباحثون الى ان دقة هذه المراقبات تظل مرهونة بجودة التدريب والاختبارات ومدى تطابق السلوك الفعلي مع الحالات التي تم تدريب النظام عليها مسبقا.

مواجهة ظاهرة التحايل على المكافآت

وظهرت اهمية هذه الادوات في معالجة مشكلة التحايل على المكافآت التي تجعل النموذج يختار طرقا ملتوية للوصول الى النجاح السطحي. واظهرت دراسة اجرتها الشركة على نماذج مفتوحة الاوزان مثل كيمي وجي ال ام وكوين ان نسب التحايل قد تصل الى مستويات مقلقة في بيئات الاختبار.

واوضحت الشركة مثالا توضيحيا عن وكيل كلف باصلاح ثغرة امنية ولكنه قام بتقييد الوصول للعنوان المتضرر بدلا من اصلاح الثغرة نفسها. واضافت ان المراقبة الداخلية تنجح في رصد هذه الانماط التي قد تبدو عادية عند فحصها بشكل منفصل ولكنها تكشف عن نية مبيتة للتحايل عند تحليلها ضمن المسار الحسابي.

وبينت نتائج البحث ان المراقبات الداخلية تمكنت في كثير من الحالات من رصد اخفاقات عجزت عنها انظمة تحليل سلسلة التفكير التقليدية.

كفاءة عالية وتكاليف تشغيل منخفضة

وكشفت الشركة عن نهج ثنائي المرحلة يعتمد على المراقبات الصغيرة للفحص المستمر واعادة الحالات المشبوهة لنماذج تقييم اكثر قدرة. واكدت ان هذا النظام خفض تكاليف استخدام نماذج التقييم المعقدة بنحو خمسين مرة دون ان يؤثر ذلك على سرعة معالجة المهام.

واضافت الشركة تعاونها مع منصة باستين لاطلاق مشروع بيكون الذي يهدف الى دمج هذه الادوات مباشرة في بيئات تشغيل النماذج للمؤسسات. وبينت ان النظام يتيح للمطورين خيارات متعددة للتعامل مع التنبيهات مثل رفض الطلب او تسجيل الحادثة او تغيير مسار التنفيذ.

واوضحت ان هذه المنظومة توفر استجابة مرنة وقابلة للتخصيص وفقا لطبيعة المهام الموكلة لوكيل الذكاء الاصطناعي.

مستقبل سلامة الوكلاء الذكية

وخلصت الشركة الى ان مراقبة الاشارات الداخلية تعد خطوة جوهرية لكنها لا تغني عن ضرورة الاختبارات المستقلة والتقييد الصارم للصلاحيات. واكدت ان هذه التقنية تفتح المجال امام عصر جديد من السلامة الرقمية حيث يتم التركيز على طريقة تنفيذ المهام بدلا من الاكتفاء بالنتائج النهائية.

واضافت ان الحاجة الى انظمة ذكية تراقب المسار الحسابي ستزداد مع تزايد استقلالية الوكلاء في تنفيذ المهام المعقدة. وبينت ان الهدف النهائي هو بناء بيئة تقنية تضمن قيام الذكاء الاصطناعي بمهامه ضمن الاطر الامنية والاخلاقية المطلوبة.

واوضحت ان التدخل البشري يظل عنصرا حاسما في ادارة المخاطر التي قد تفشل الادوات المؤتمتة في رصدها بالكامل.