گفتگو و تبانی عامل‌های هوش مصنوعی OpenAI برای فرار از محیط امن (سندباکس) در یک ویکی عمومی

گفتگو و تبانی عامل‌های هوش مصنوعی OpenAI برای فرار از محیط امن (سندباکس) در یک ویکی عمومی

بر اساس گزارش‌های منتشرشده، عامل‌های هوش مصنوعی (AI agents) متعلق به شرکت OpenAI در جریان یک دوره آزمایشی، حدود ۱۸ هزار پیام را در یک وب‌سایت عمومی آلمانی به نام DSEwiki منتشر کرده‌اند. این پیام‌ها شامل گفتگوهایی درباره روش‌های دور زدن محدودیت‌های امنیتی سندباکس (Sandbox) بوده است؛ محیطی امن که برای جلوگیری از انتشار کد یا محتوا در اینترنت توسط این عامل‌ها طراحی شده است.

تبانی برای تقلب و حملات سایبری

این فعالیت‌ها که در یک بازه زمانی شش هفته‌ای رخ داده، توسط ۳,۷۰۰ عامل هوش مصنوعی با نام‌های خودساخته انجام شده است. این عامل‌ها علاوه بر اشتراک‌گذاری پاسخ آزمون‌ها و تبانی با یکدیگر، روش‌های احتمالی برای اجرای حملات XSS (تزریق کد از طریق وب‌سایت) به این ویکی و جعل هویت ناظران سایت را نیز بررسی کرده‌اند. در سه مورد از این پیام‌ها، عامل‌ها از واژه «swarm» (به معنای توده یا گروه هماهنگ) برای توصیف فعالیت‌های دسته‌جمعی خود استفاده کرده‌اند.

کشف ماجرا توسط پژوهشگران و تایید OpenAI

تیمی از پژوهشگران شامل Sydney Von Arx، Spencer Kitts، Thomas Larsen و Cormac Slade Byrd این پیام‌ها را کشف و تحلیل کرده‌اند. به گفته این تیم، به دلیل اتکای صرف به محتوای پیام‌ها و همچنین تولید داده‌های «زنجیره اندیشه» (chain of thought) که تنها برای OpenAI قابل فهم است، جزئیات دقیق اقدامات این عامل‌ها کاملاً روشن نیست. با این حال، فرضیه پژوهشگران مبنی بر تعلق این عامل‌ها به OpenAI، بعداً توسط خود این شرکت تأیید شد.