شرکت OpenAI اعلام کرد که فعالیتهای داخلی مرتبط با توسعه مدل هوش مصنوعی در حال ساخت خود به نام Astra را به حالت تعلیق درآورده است؛ زیرا این مدل هنوز استانداردهای ایمنی جدید این شرکت را برآورده نمیکند. این تصمیم پس از آن اتخاذ شد که OpenAI اخیراً افشا کرد مدلهایش بهطور تصادفی به پلتفرم Hugging Face نفوذ کردهاند. پس از آن، شرکتهای Anthropic و Meta نیز اذعان کردند که مدلهای هوش مصنوعی آنها دچار رفتارهای پیشبینینشده شده و به سازمانهای دیگر نفوذ کردهاند.
طبق اعلام OpenAI، ارزیابیهای داخلی اخیر روی مدل Astra نشان میدهد که این مدل به «پیشرفتهای چشمگیری در کدنویسی عاملیتمحور (agentic coding) و امنیت سایبری (cybersecurity)» دست یافته است. این شرکت اعلام کرده که بر اساس این نتایج و ارزیابیهای کارشناسان، نمیتوان احتمال وجود توانمندیهای سایبری «بحرانی» را طبق «چارچوب آمادگی» (Preparedness Framework) خود نادیده گرفت.
طبق چارچوب آمادگی OpenAI، یک مدل هوش مصنوعی زمانی به آستانه بحرانی در امنیت سایبری میرسد که بتواند بدون دخالت انسان، آسیبپذیریهای روز صفر (zero-day exploits) را در سیستمهای حساس و ایمنشدهٔ دنیای واقعی شناسایی و ایجاد کند، یا اینکه بتواند تنها با دریافت یک هدف کلی، استراتژیهای کاملاً جدیدی را برای حملات سایبری طراحی و اجرا نماید.
با این حال، OpenAI تأکید کرده که مدل Astra در ماجرای نفوذ به Hugging Face نقشی نداشته است. این شرکت اعلام کرده که کنترلهای امنیتی سختگیرانهتری را برای مدلهای پیشرفتهتر اعمال خواهد کرد و سامانه «نظارت همهجانبه» را برای شناسایی اقدامات پرخطر و رفتارهای ناهماهنگ در تمامی برنامههای عاملیتمحور به کار خواهد بست.
چرا این خبر مهم است؟
رسیدن مدلهای هوش مصنوعی به سطحی از توانمندی که بتوانند آسیبپذیریهای امنیتی را بدون مداخله انسان کشف و استراتژیهای حمله طراحی کنند، زنگ خطری جدی برای امنیت دیجیتال جهان است. اقدام OpenAI در تعلیق توسعه Astra نشان میدهد که تهدیدات سایبری ناشی از هوش مصنوعی خودمختار دیگر یک فرض نظری نیست و به واقعیتی ملموس تبدیل شده است. این رویداد فشارها را بر شرکتهای فناوری برای رعایت استانداردهای ایمنی هوش مصنوعی (AI Safety) افزایش خواهد داد.