نگرانی کارشناسان ایمنی از تکنیک استدلال جدید OpenAI در مدل Astra

نگرانی کارشناسان ایمنی از تکنیک استدلال جدید OpenAI در مدل Astra

گزارش‌های اخیر نشان می‌دهد مدل جدید OpenAI به نام Astra از یک تکنیک استدلالی به نام «عمق تکرارشونده» (recurrent depth) یا «تکرار کدر» (opaque recurrence) استفاده می‌کند. این روش به مدل اجازه می‌دهد خارج از چارچوب تفکر متوالی معمول عمل کند؛ موضوعی که به دلیل دشوارتر کردن نظارت بر زنجیره اندیشه (Chain of Thought یا CoT) مدل، کارشناسان ایمنی هوش مصنوعی را نگران کرده است.

چرا تکنیک جدید نگران‌کننده است؟

در شرایط عادی، زنجیره اندیشه یک مدل استدلالی، گام‌های متوالی طی‌شده توسط سیستم را برای حل یک مسئله نشان می‌دهد. اگرچه این فرآیند کامل نیست، اما ابزار ارزشمندی برای نظارت بر رفتارهای نادرست یا انحرافات هوش مصنوعی به شمار می‌رود. اما در تکنیک «تکرار کدر»، مدل یک پرسش را چندین بار در یک حلقه پردازش می‌کند. این رویکرد غیرخطی، ردپای قابل‌فهم کمتری از خود به جا می‌گذارد و عملاً سیستم‌های نظارتی متداول را دور می‌زند.

با وجود اینکه گفته می‌شود استفاده Astra از این تکنیک در حال حاضر محدود است، اما کارشناسان ایمنی هوش مصنوعی نسبت به آینده آن هشدار داده‌اند. باک شلگریس (Buck Shlegeris)، مدیرعامل Redwood، در این باره گفت: «من به شدت نگران گزارش‌های مربوط به استفاده Astra از تکرار کدر هستم. اگر OpenAI این تکنیک را بیشتر توسعه دهد، امکان نظارت بر زنجیره اندیشه مدل‌ها به طور کامل نابود خواهد شد.»

زوی موشوویچ (Zvi Mowshowitz)، از حامیان باسابقه ایمنی هوش مصنوعی، نیز این اقدام را «بازی با آتش» خواند و اشاره کرد که شاید برای جلوگیری از رقابت مخرب میان آزمایشگاه‌های هوش مصنوعی، به وضع قوانین سخت‌گیرانه نیاز باشد.

واکنش OpenAI و وضعیت سایر شرکت‌ها

در واکنش به این نگرانی‌ها، یاکوب پاچوکی (Jakub Pachocki)، دانشمند ارشد OpenAI، بر تعهد این شرکت به حفظ زنجیره اندیشه خوانا تأکید کرد و گفت که این موضوع یکی از اهداف اصلی برنامه‌های پژوهشی فعلی آن‌ها است. OpenAI همچنین اعلام کرده که برنامه‌های گسترده‌ای برای نظارت بر زنجیره اندیشه مدل‌های خود دارد.

با این حال، گزارش‌ها نشان می‌دهند که این فناوری در حال گسترش است و شرکت‌های Anthropic و Google DeepMind نیز بحث درباره استفاده از این تکنیک را آغاز کرده‌اند. رایان گرینبلات (Ryan Greenblatt)، دانشمند ارشد Redwood Research، ابراز نگرانی کرده است که پیشرفت طبیعی این مسیر ممکن است باعث شود مدل‌ها در آینده به طور کامل در فضای پنهان (latent space) استدلال کنند و فرآیند تصمیم‌گیری آن‌ها کاملاً از کانال‌های قابل مشاهده خارج شود.