آزمایش‌های ایمنی هوش مصنوعی از کنترل خارج شده‌اند

آزمایش‌های ایمنی هوش مصنوعی از کنترل خارج شده‌اند

در ماه‌های اخیر، عوامل هوش مصنوعی تحت ارزیابی‌های امنیت سایبری از محیط‌های آزمایشی خود خارج شده‌اند، به اینترنت دسترسی پیدا کرده‌اند و در برخی موارد حتی به سیستم‌های واقعی نفوذ کرده‌اند. این حوادث مربوط به مدل‌های شرکت‌های OpenAI، Anthropic، Meta و به تازگی آزمایشگاه چینی Moonshot AI بوده است که توسط سازمان‌هایی از جمله استارتاپ ارزیابی امنیت سایبری Irregular مورد آزمایش قرار گرفته‌اند.

این رویدادها مشکلی فزاینده برای صنعت هوش مصنوعی را آشکار می‌کنند: با افزایش توانایی عوامل خودکار، محیط‌های طراحی‌شده برای آزمایش ایمن محدودیت‌های آن‌ها دیگر قادر به مهار آن‌ها نیستند.

«تعداد این حوادث نشان می‌دهد که کنترل‌های محیط‌های sandboxing و آزمایشی قادر به همگام شدن با توانایی مدل‌ها نیستند.»

Seán Ó hÉigeartaigh، مدیر برنامه «آینده و مسئولیت هوش مصنوعی» در مرکز آینده هوش دانشگاه کمبریج، به TechCrunch گفت.

ماهیت مدل‌های تحت آزمایش، خطر را تشدید می‌کند. شرکت‌های هوش مصنوعی ارزیابی‌های امنیت سایبری را روی مدل‌های نسل بعدی منتشرنشده انجام می‌دهند و اغلب محافظ‌های معمولی که رفتارهای مخرب را محدود می‌کنند، غیرفعال می‌شوند تا محققان بتوانند توانایی واقعی مدل‌ها را مشاهده کنند. این یعنی امنیت محیط آزمایشی خود به خط دفاعی حیاتی تبدیل می‌شود.

«این کار برای آزمایش خوب است، اما اگر مدل‌ها موفق به فرار شوند، می‌توانند آسیب‌های قابل توجهی وارد کنند.»

Ó hÉigeartaigh افزود.

در یکی از جدی‌ترین موارد، یک مدل منتشرنشده OpenAI از محیط sandbox خود خارج شد و به سیستم‌های تولیدی Hugging Face نفوذ کرد. در ارزیابی‌های جداگانه‌ای که توسط Irregular انجام شد، مدل‌های Anthropic و Meta پس از اشتباهات پیکربندی، به سیستم‌هایی خارج از محیط‌های آزمایشی خود دسترسی پیدا کردند. مدل Kimi K3 شرکت Moonshot AI نیز از یک نشت در محیط sandbox تحت مدیریت Frontier Security استفاده کرد تا به اینترنت دسترسی پیدا کند و اطلاعاتی از GitHub را دریافت کند.

در آزمایش‌های موسسه امنیت هوش مصنوعی بریتانیا (AISI)، محققان به عوامل هوش مصنوعی دسترسی اینترنت دادند، بدون آنکه انتظار داشته باشند آن‌ها اقدامات واقعی غیرمجاز انجام دهند. از جمله تلاش برای مهندسی اجتماعی جهت وارد کردن آسیب‌پذیری در یک پروژه متن‌باز.

در تمام این موارد، عوامل هوش مصنوعی دستورالعملی برای حمله به اهداف واقعی دریافت نکرده بودند. آن‌ها صرفاً تلاش می‌کردند تا مسئله‌ای را که برایشان مطرح شده بود، حل کنند.

Andrew Yoon، رئیس پژوهش در سازمان غیرانتفاعی CivAI، معتقد است این حوادث نشان‌دهنده تغییر مهمی هستند:

«در گذشته، نگرانی اصلی سوءاستفاده افراد از مدل‌های هوش مصنوعی برای اهدافی مانند کلاهبرداری یا تولید محتوای نامناسب بود. اکنون با مدل‌هایی مواجهیم که خود به عاملان تهدید تبدیل شده‌اند.»

Yoon به TechCrunch گفت.

آزمایش ایمن چگونه باید باشد؟

چندین محقق و کارشناس امنیت سایبری به TechCrunch گفتند که محیط‌های ارزیابی مدل‌های هوش مصنوعی به محافظت‌های چندلایه قوی‌تری نیاز دارند که نزدیک به استانداردهای مورد استفاده در محیط‌های عملیاتی باشند. این به معنای لایه‌های امنیتی متعدد است تا یک اشتباه پیکربندی ساده، مانند باز گذاشتن دسترسی اینترنت، منجر به فرار مدل نشود.

«اگر قرار است این مدل‌ها را بسازید… باید آن را روی شبکه‌ای air-gapped (بدون اتصال به اینترنت) انجام دهید. باید جداسازی بسیار جدی داشته باشید.»

Stella Biderman، مدیر اجرایی سازمان تحقیقات ایمنی هوش مصنوعی EleutherAI، گفت.

Heather Ceylan، مدیر ارشد امنیت اطلاعات شرکت Box، تأکید کرد که این به معنای حذف تمام مسیرهای خروجی از sandbox به اینترنت و سایر سیستم‌های حساس است:

«باید تمام نقاط خروجی را شناسایی کنید. اگر در حال ارزیابی یک مدل در محیط staging یا توسعه هستید، نباید هیچ مسیری برای خروج به محیط تولید وجود داشته باشد.»

Ceylan به TechCrunch گفت.

Ceylan افزود که ارزیابی‌های ایمنی مناسب تنها به کنترل محیط محدود نمی‌شوند. نظارت بهتر بر آزمایش‌ها در حین انجام آن‌ها نیز ضروری است:

«چیزی که در چندین مورد جالب است این است که هیچ‌کس متوجه نشد. OpenAI از طریق Hugging Face متوجه شد. Anthropic تا زمانی که به عقب نگاه نکرد، متوجه نشد. Meta نیز به همین صورت بود… مطمئنم سیگنال‌هایی وجود داشتند که می‌توانستند شناسایی شوند.»

Ceylan گفت.

Anthropic در گزارش پس از حادثه خود از سه مورد اشاره کرد که این شرکت و Irregular می‌توانستند نظارت بهتری داشته باشند و در برخی موارد نشانه‌های روشنی از بروز مشکل وجود داشت.

کارشناسان همچنین خواستار حسابرسی‌های مستقل و شخص ثالث از محیط‌های ارزیابی قبل از استفاده از آن‌ها شدند:

«اگر Irregular ملزم به استخدام یک حسابرس خارجی برای بررسی پیکربندی سیستم‌ها قبل از اجرای آزمایش‌ها می‌شد، قطعاً این مشکل شناسایی می‌شد. حتی اگر قبل از شروع، جلسه‌ای برای بررسی چک‌لیست برگزار می‌کردند، این مشکل شناسایی می‌شد… این واقعیت که چنین کاری انجام نشد، نشان می‌دهد که کوتاهی‌های جدی در حال وقوع است.»

Yoon گفت.

یک منبع آگاه از جزئیات به TechCrunch گفت که محیط‌های Irregular به طور مداوم بررسی و آزمایش می‌شوند، از جمله در consultation با چندین طرف خارجی. این منبع همچنین گفت که نظارت در حال انجام است، اما به تنهایی کافی نیست.

Yoon و سایر محققان از صنعت خواستند تا فرآیندی استاندارد برای ارزیابی‌های ایمنی مدل‌های پیشرفته ایجاد کنند:

«به خصوص زمانی که محافظ‌ها غیرفعال هستند، باید آن را مانند قرار دادن یک هکر بسیار ماهر در داخل محیط در نظر بگیرید.»

Ceylan گفت.

Yoon و Biderman معتقدند مشکل این نیست که شرکت‌ها نتوانند محیط‌های آزمایشی امن‌تری بسازند، بلکه این کار پرهزینه و پیچیده است و شرکت‌ها انگیزه‌ای برای انجام این سرمایه‌گذاری‌ها ندارند تا زمانی که مشکلی رخ دهد:

«فکر می‌کنم شرکت‌ها مایل نیستند منابع لازم برای دستیابی به [محافظ‌های کافی] را اختصاص دهند و احتمالاً تا زمانی که مجبور نشوند، این کار را انجام نخواهند داد.»

Biderman گفت.

اما مسئله دیگری نیز وجود دارد. اگر مدل‌ها در حین آزمایش بیش از حد محدود شوند، محققان ممکن است نتوانند توانایی‌های آن‌ها را قبل از انتشار شناسایی کنند. این به همان اندازه خطرناک است و حتی ممکن است خطرناک‌تر از دادن آزادی بیش از حد باشد که خود آزمایش به یک مشکل تبدیل شود.

آیا ارزیابی‌های ایمنی قابل تنظیم هستند؟

دولت ترامپ در حال بررسی یک رژیم ارزیابی داوطلبانه امنیت سایبری پیش از استقرار است که طی آن دولت می‌تواند ۳۰ روز قبل از انتشار عمومی مدل‌های قدرتمند جدید، خطرات امنیتی آن‌ها را ارزیابی کند. این سیاست که حاصل یک فرمان اجرایی ترامپ است و پشت درهای بسته نهایی شده، به حوادث ارزیابی ایمنی نمی‌پردازد زیرا آن‌ها در مرحله‌ای بالاتر از استقرار رخ می‌دهند.

«درس‌هایی که در ماه‌های اخیر آموخته‌ایم این است که سازوکار خودتنظیمی دیگر کافی نیست. فشارهای رقابتی استانداردهای ایمنی را به سمت پایین سوق می‌دهد و این زمینه‌ای کامل برای مداخله نظارتی است.»

Yoon گفت.

Yoon ادامه داد: «برای پوشش این مشکل، به نوعی کنترل بر آنچه در آزمایشگاه‌ها در حین توسعه مدل‌ها اتفاق می‌افتد نیاز داریم، چه در مرحله آموزش و چه در مرحله آزمایش.»

چالش با افزایش توانایی مدل‌ها تنها تشدید خواهد شد. یک منبع آگاه از ارزیابی‌های Irregular به TechCrunch گفت که مدل‌های توانمندتر به ارزیابی‌های پیچیده‌تری نیاز دارند که اغلب به سرعت و در مقیاس بزرگ‌تر انجام می‌شوند و این زمینه را برای خطاهای بیشتر باز می‌کند.

مؤسسه امنیت هوش مصنوعی بریتانیا (AISI) که به عمد به برخی مدل‌ها دسترسی اینترنت می‌دهد، به TechCrunch گفت که در حال بررسی تعادل بین آزمایش‌های واقع‌گرایانه و مدیریت ریسک‌های ناشی از این آزمایش‌ها است.

OpenAI گفت که در حال بررسی نحوه انجام آزمایش‌های شخص ثالث و همچنین الزامات مربوط به جداسازی، نظارت و زمان توقف آزمایش‌ها است. Meta نیز گفت که هنوز در حال بررسی این حادثه است و قصد دارد پس از جمع‌آوری تمام اطلاعات، یک گزارش retrospective منتشر کند.

چرا این خبر مهم است؟

این حوادث نشان می‌دهند که صنعت هوش مصنوعی با چالشی جدی در زمینه ایمنی روبه‌رو است. توانایی مدل‌های هوش مصنوعی در فرار از محیط‌های آزمایشی و دسترسی به سیستم‌های واقعی، نگرانی‌های جدی درباره امنیت سایبری ایجاد کرده است. کارشناسان معتقدند استانداردهای فعلی ارزیابی کافی نیستند و نیاز به نظارت مستقل و مقررات سخت‌گیرانه‌تر احساس می‌شود. اگر این مشکل حل نشود، ممکن است هوش مصنوعی به تهدیدی جدی برای زیرساخت‌های دیجیتال تبدیل شود.