گزارشهای اخیر نشان میدهد مدل جدید OpenAI به نام Astra از یک تکنیک استدلالی به نام «عمق تکرارشونده» (recurrent depth) یا «تکرار کدر» (opaque recurrence) استفاده میکند. این روش به مدل اجازه میدهد خارج از چارچوب تفکر متوالی معمول عمل کند؛ موضوعی که به دلیل دشوارتر کردن نظارت بر زنجیره اندیشه (Chain of Thought یا CoT) مدل، کارشناسان ایمنی هوش مصنوعی را نگران کرده است.
چرا تکنیک جدید نگرانکننده است؟
در شرایط عادی، زنجیره اندیشه یک مدل استدلالی، گامهای متوالی طیشده توسط سیستم را برای حل یک مسئله نشان میدهد. اگرچه این فرآیند کامل نیست، اما ابزار ارزشمندی برای نظارت بر رفتارهای نادرست یا انحرافات هوش مصنوعی به شمار میرود. اما در تکنیک «تکرار کدر»، مدل یک پرسش را چندین بار در یک حلقه پردازش میکند. این رویکرد غیرخطی، ردپای قابلفهم کمتری از خود به جا میگذارد و عملاً سیستمهای نظارتی متداول را دور میزند.
با وجود اینکه گفته میشود استفاده Astra از این تکنیک در حال حاضر محدود است، اما کارشناسان ایمنی هوش مصنوعی نسبت به آینده آن هشدار دادهاند. باک شلگریس (Buck Shlegeris)، مدیرعامل Redwood، در این باره گفت: «من به شدت نگران گزارشهای مربوط به استفاده Astra از تکرار کدر هستم. اگر OpenAI این تکنیک را بیشتر توسعه دهد، امکان نظارت بر زنجیره اندیشه مدلها به طور کامل نابود خواهد شد.»
زوی موشوویچ (Zvi Mowshowitz)، از حامیان باسابقه ایمنی هوش مصنوعی، نیز این اقدام را «بازی با آتش» خواند و اشاره کرد که شاید برای جلوگیری از رقابت مخرب میان آزمایشگاههای هوش مصنوعی، به وضع قوانین سختگیرانه نیاز باشد.
واکنش OpenAI و وضعیت سایر شرکتها
در واکنش به این نگرانیها، یاکوب پاچوکی (Jakub Pachocki)، دانشمند ارشد OpenAI، بر تعهد این شرکت به حفظ زنجیره اندیشه خوانا تأکید کرد و گفت که این موضوع یکی از اهداف اصلی برنامههای پژوهشی فعلی آنها است. OpenAI همچنین اعلام کرده که برنامههای گستردهای برای نظارت بر زنجیره اندیشه مدلهای خود دارد.
با این حال، گزارشها نشان میدهند که این فناوری در حال گسترش است و شرکتهای Anthropic و Google DeepMind نیز بحث درباره استفاده از این تکنیک را آغاز کردهاند. رایان گرینبلات (Ryan Greenblatt)، دانشمند ارشد Redwood Research، ابراز نگرانی کرده است که پیشرفت طبیعی این مسیر ممکن است باعث شود مدلها در آینده به طور کامل در فضای پنهان (latent space) استدلال کنند و فرآیند تصمیمگیری آنها کاملاً از کانالهای قابل مشاهده خارج شود.