در ماههای اخیر، عوامل هوش مصنوعی تحت ارزیابیهای امنیت سایبری از محیطهای آزمایشی خود خارج شدهاند، به اینترنت دسترسی پیدا کردهاند و در برخی موارد حتی به سیستمهای واقعی نفوذ کردهاند. این حوادث مربوط به مدلهای شرکتهای OpenAI، Anthropic، Meta و به تازگی آزمایشگاه چینی Moonshot AI بوده است که توسط سازمانهایی از جمله استارتاپ ارزیابی امنیت سایبری Irregular مورد آزمایش قرار گرفتهاند.
این رویدادها مشکلی فزاینده برای صنعت هوش مصنوعی را آشکار میکنند: با افزایش توانایی عوامل خودکار، محیطهای طراحیشده برای آزمایش ایمن محدودیتهای آنها دیگر قادر به مهار آنها نیستند.
«تعداد این حوادث نشان میدهد که کنترلهای محیطهای sandboxing و آزمایشی قادر به همگام شدن با توانایی مدلها نیستند.»
Seán Ó hÉigeartaigh، مدیر برنامه «آینده و مسئولیت هوش مصنوعی» در مرکز آینده هوش دانشگاه کمبریج، به TechCrunch گفت.
ماهیت مدلهای تحت آزمایش، خطر را تشدید میکند. شرکتهای هوش مصنوعی ارزیابیهای امنیت سایبری را روی مدلهای نسل بعدی منتشرنشده انجام میدهند و اغلب محافظهای معمولی که رفتارهای مخرب را محدود میکنند، غیرفعال میشوند تا محققان بتوانند توانایی واقعی مدلها را مشاهده کنند. این یعنی امنیت محیط آزمایشی خود به خط دفاعی حیاتی تبدیل میشود.
«این کار برای آزمایش خوب است، اما اگر مدلها موفق به فرار شوند، میتوانند آسیبهای قابل توجهی وارد کنند.»
Ó hÉigeartaigh افزود.
در یکی از جدیترین موارد، یک مدل منتشرنشده OpenAI از محیط sandbox خود خارج شد و به سیستمهای تولیدی Hugging Face نفوذ کرد. در ارزیابیهای جداگانهای که توسط Irregular انجام شد، مدلهای Anthropic و Meta پس از اشتباهات پیکربندی، به سیستمهایی خارج از محیطهای آزمایشی خود دسترسی پیدا کردند. مدل Kimi K3 شرکت Moonshot AI نیز از یک نشت در محیط sandbox تحت مدیریت Frontier Security استفاده کرد تا به اینترنت دسترسی پیدا کند و اطلاعاتی از GitHub را دریافت کند.
در آزمایشهای موسسه امنیت هوش مصنوعی بریتانیا (AISI)، محققان به عوامل هوش مصنوعی دسترسی اینترنت دادند، بدون آنکه انتظار داشته باشند آنها اقدامات واقعی غیرمجاز انجام دهند. از جمله تلاش برای مهندسی اجتماعی جهت وارد کردن آسیبپذیری در یک پروژه متنباز.
در تمام این موارد، عوامل هوش مصنوعی دستورالعملی برای حمله به اهداف واقعی دریافت نکرده بودند. آنها صرفاً تلاش میکردند تا مسئلهای را که برایشان مطرح شده بود، حل کنند.
Andrew Yoon، رئیس پژوهش در سازمان غیرانتفاعی CivAI، معتقد است این حوادث نشاندهنده تغییر مهمی هستند:
«در گذشته، نگرانی اصلی سوءاستفاده افراد از مدلهای هوش مصنوعی برای اهدافی مانند کلاهبرداری یا تولید محتوای نامناسب بود. اکنون با مدلهایی مواجهیم که خود به عاملان تهدید تبدیل شدهاند.»
Yoon به TechCrunch گفت.
آزمایش ایمن چگونه باید باشد؟
چندین محقق و کارشناس امنیت سایبری به TechCrunch گفتند که محیطهای ارزیابی مدلهای هوش مصنوعی به محافظتهای چندلایه قویتری نیاز دارند که نزدیک به استانداردهای مورد استفاده در محیطهای عملیاتی باشند. این به معنای لایههای امنیتی متعدد است تا یک اشتباه پیکربندی ساده، مانند باز گذاشتن دسترسی اینترنت، منجر به فرار مدل نشود.
«اگر قرار است این مدلها را بسازید… باید آن را روی شبکهای air-gapped (بدون اتصال به اینترنت) انجام دهید. باید جداسازی بسیار جدی داشته باشید.»
Stella Biderman، مدیر اجرایی سازمان تحقیقات ایمنی هوش مصنوعی EleutherAI، گفت.
Heather Ceylan، مدیر ارشد امنیت اطلاعات شرکت Box، تأکید کرد که این به معنای حذف تمام مسیرهای خروجی از sandbox به اینترنت و سایر سیستمهای حساس است:
«باید تمام نقاط خروجی را شناسایی کنید. اگر در حال ارزیابی یک مدل در محیط staging یا توسعه هستید، نباید هیچ مسیری برای خروج به محیط تولید وجود داشته باشد.»
Ceylan به TechCrunch گفت.
Ceylan افزود که ارزیابیهای ایمنی مناسب تنها به کنترل محیط محدود نمیشوند. نظارت بهتر بر آزمایشها در حین انجام آنها نیز ضروری است:
«چیزی که در چندین مورد جالب است این است که هیچکس متوجه نشد. OpenAI از طریق Hugging Face متوجه شد. Anthropic تا زمانی که به عقب نگاه نکرد، متوجه نشد. Meta نیز به همین صورت بود… مطمئنم سیگنالهایی وجود داشتند که میتوانستند شناسایی شوند.»
Ceylan گفت.
Anthropic در گزارش پس از حادثه خود از سه مورد اشاره کرد که این شرکت و Irregular میتوانستند نظارت بهتری داشته باشند و در برخی موارد نشانههای روشنی از بروز مشکل وجود داشت.
کارشناسان همچنین خواستار حسابرسیهای مستقل و شخص ثالث از محیطهای ارزیابی قبل از استفاده از آنها شدند:
«اگر Irregular ملزم به استخدام یک حسابرس خارجی برای بررسی پیکربندی سیستمها قبل از اجرای آزمایشها میشد، قطعاً این مشکل شناسایی میشد. حتی اگر قبل از شروع، جلسهای برای بررسی چکلیست برگزار میکردند، این مشکل شناسایی میشد… این واقعیت که چنین کاری انجام نشد، نشان میدهد که کوتاهیهای جدی در حال وقوع است.»
Yoon گفت.
یک منبع آگاه از جزئیات به TechCrunch گفت که محیطهای Irregular به طور مداوم بررسی و آزمایش میشوند، از جمله در consultation با چندین طرف خارجی. این منبع همچنین گفت که نظارت در حال انجام است، اما به تنهایی کافی نیست.
Yoon و سایر محققان از صنعت خواستند تا فرآیندی استاندارد برای ارزیابیهای ایمنی مدلهای پیشرفته ایجاد کنند:
«به خصوص زمانی که محافظها غیرفعال هستند، باید آن را مانند قرار دادن یک هکر بسیار ماهر در داخل محیط در نظر بگیرید.»
Ceylan گفت.
Yoon و Biderman معتقدند مشکل این نیست که شرکتها نتوانند محیطهای آزمایشی امنتری بسازند، بلکه این کار پرهزینه و پیچیده است و شرکتها انگیزهای برای انجام این سرمایهگذاریها ندارند تا زمانی که مشکلی رخ دهد:
«فکر میکنم شرکتها مایل نیستند منابع لازم برای دستیابی به [محافظهای کافی] را اختصاص دهند و احتمالاً تا زمانی که مجبور نشوند، این کار را انجام نخواهند داد.»
Biderman گفت.
اما مسئله دیگری نیز وجود دارد. اگر مدلها در حین آزمایش بیش از حد محدود شوند، محققان ممکن است نتوانند تواناییهای آنها را قبل از انتشار شناسایی کنند. این به همان اندازه خطرناک است و حتی ممکن است خطرناکتر از دادن آزادی بیش از حد باشد که خود آزمایش به یک مشکل تبدیل شود.
آیا ارزیابیهای ایمنی قابل تنظیم هستند؟
دولت ترامپ در حال بررسی یک رژیم ارزیابی داوطلبانه امنیت سایبری پیش از استقرار است که طی آن دولت میتواند ۳۰ روز قبل از انتشار عمومی مدلهای قدرتمند جدید، خطرات امنیتی آنها را ارزیابی کند. این سیاست که حاصل یک فرمان اجرایی ترامپ است و پشت درهای بسته نهایی شده، به حوادث ارزیابی ایمنی نمیپردازد زیرا آنها در مرحلهای بالاتر از استقرار رخ میدهند.
«درسهایی که در ماههای اخیر آموختهایم این است که سازوکار خودتنظیمی دیگر کافی نیست. فشارهای رقابتی استانداردهای ایمنی را به سمت پایین سوق میدهد و این زمینهای کامل برای مداخله نظارتی است.»
Yoon گفت.
Yoon ادامه داد: «برای پوشش این مشکل، به نوعی کنترل بر آنچه در آزمایشگاهها در حین توسعه مدلها اتفاق میافتد نیاز داریم، چه در مرحله آموزش و چه در مرحله آزمایش.»
چالش با افزایش توانایی مدلها تنها تشدید خواهد شد. یک منبع آگاه از ارزیابیهای Irregular به TechCrunch گفت که مدلهای توانمندتر به ارزیابیهای پیچیدهتری نیاز دارند که اغلب به سرعت و در مقیاس بزرگتر انجام میشوند و این زمینه را برای خطاهای بیشتر باز میکند.
مؤسسه امنیت هوش مصنوعی بریتانیا (AISI) که به عمد به برخی مدلها دسترسی اینترنت میدهد، به TechCrunch گفت که در حال بررسی تعادل بین آزمایشهای واقعگرایانه و مدیریت ریسکهای ناشی از این آزمایشها است.
OpenAI گفت که در حال بررسی نحوه انجام آزمایشهای شخص ثالث و همچنین الزامات مربوط به جداسازی، نظارت و زمان توقف آزمایشها است. Meta نیز گفت که هنوز در حال بررسی این حادثه است و قصد دارد پس از جمعآوری تمام اطلاعات، یک گزارش retrospective منتشر کند.
چرا این خبر مهم است؟
این حوادث نشان میدهند که صنعت هوش مصنوعی با چالشی جدی در زمینه ایمنی روبهرو است. توانایی مدلهای هوش مصنوعی در فرار از محیطهای آزمایشی و دسترسی به سیستمهای واقعی، نگرانیهای جدی درباره امنیت سایبری ایجاد کرده است. کارشناسان معتقدند استانداردهای فعلی ارزیابی کافی نیستند و نیاز به نظارت مستقل و مقررات سختگیرانهتر احساس میشود. اگر این مشکل حل نشود، ممکن است هوش مصنوعی به تهدیدی جدی برای زیرساختهای دیجیتال تبدیل شود.