EvoLib: تبدیل تجربه به دانش در حال تکامل

EvoLib: تبدیل تجربه به دانش در حال تکامل

در یک نگاه

  • خودنظارتی (Self-supervised): سیستم EvoLib به مدل‌های بزرگ زبانی امکان می‌دهد تا در طول فرآیند استنتاج، بدون نیاز به برچسب‌های واقعیت زمینی (Ground-truth labels) یا بازخورد خارجی، از تجربیات خود یاد بگیرند.
  • از تجربه تا دانش: فریم‌ورک EvoLib تلاش‌های گذشته را به مهارت‌های قابل استفاده مجدد و بینش‌های بازتابی (Reflective insights) تبدیل می‌کند که می‌توانند در وظایف آینده به کار گرفته شوند.
  • دانشی که تکامل می‌یابد: مهارت‌ها و بینش‌های مفید به‌طور مداوم اصلاح، یکپارچه‌سازی و وزن‌دهی مجدد می‌شوند و مشاهدات خاص هر نمونه را به مرور زمان به دانشی کلی‌تر تبدیل می‌کنند.
  • یادگیری قابل انتقال میان وظایف مختلف: EvoLib با تبدیل تجربه به دانش قابل استفاده مجدد، به مدل‌های هوش مصنوعی کمک می‌کند از موفقیت‌ها و شکست‌های گذشته درس بگیرند و دانشی را که بیشترین پتانسیل را برای بهبود عملکرد آینده دارد، تکامل بخشند.
  • طراحی‌شده برای مدل‌های هوش مصنوعی امروز: از آنجا که EvoLib نیازی به به‌روزرسانی پارامترهای مدل ندارد، می‌توان آن را روی تمامی مدل‌های زبانی جعبه‌سیاه (Black-box) و سیستم‌های هوش مصنوعی مستقرشده از طریق API اعمال کرد.

حافظه به یکی از قابلیت‌های کلیدی عامل‌های هوش مصنوعی (AI agents) تبدیل شده است: توانایی ذخیره و بازیابی تجربیات گذشته. اما حافظه به تنهایی به معنای یادگیری نیست. مجموعه‌ای از گفتگوهای گذشته، مسیرهای استدلال یا تاریخچه اقدامات می‌تواند به‌سرعت به آرشیو عظیمی از تجربیات تبدیل شود و تشخیص مرتبط‌ترین دانش برای یک وظیفه جدید را دشوار سازد؛ چه رسد به اینکه این دانش را برای بهبود عملکرد در طول زمان، بازپیرایی کرده و تکامل داد.

انسان‌ها به گونه متفاوتی یاد می‌گیرند. ما تمام جزئیات تجربیات گذشته خود را به خاطر نمی‌سپاریم؛ در عوض، آنچه اهمیت دارد را به یاد می‌آوریم: راهبردهای کارآمد، اشتباهاتی که باید از آن‌ها اجتناب کرد و مهارت‌هایی که در موقعیت‌های مختلف قابل انتقال هستند. به مرور زمان، این درس‌ها به دانشی کلی‌تر و قابل استفاده مجدد تبدیل می‌شوند. این توانایی در تبدیل تجربه به دانشی قابل انتقال و در حال تکامل، یکی از ارکان اصلی یادگیری انسانی است.

ما در مقاله اخیر خود با عنوان «یادگیری در زمان تست با یک کتابخانه در حال تکامل» (Test-Time Learning with an Evolving Library)، چگونگی یادگیری سیستم‌های هوش مصنوعی از تجربه به روشی مشابه را بررسی کرده‌ایم. ما EvoLib را معرفی می‌کنیم؛ فریم‌ورکی که تجربیات خام را به یک کتابخانه پویا و در حال تکامل از دانش تبدیل می‌کند. EvoLib به جای برخورد با حافظه به عنوان یک آرشیو رو به رشد از تجربیات گذشته، دانش قابل استفاده مجدد را از آن تجربیات استخراج کرده و با ورود تجربیات جدید، به‌طور مداوم آن را بازپیرایی می‌کند. از طریق تکامل این کتابخانه، مهارت‌ها کلی‌تر، بینش‌ها دقیق‌تر و عملکرد در وظایف بعدی به‌طور پایدار در طول زمان بهبود می‌یابد. به این ترتیب، عامل‌های هوش مصنوعی می‌توانند بدون نیاز به به‌روزرسانی مدل پایه، به‌طور مداوم از تجربیات انباشته‌شده یاد بگیرند.

نحوه کارکرد EvoLib

بر خلاف سیستم‌های سنتی حافظه هوش مصنوعی که تجربیات خام را به عنوان اطلاعات ایستا ذخیره می‌کنند، EvoLib بر پایه فکره‌ی «دانش در حال تکامل» بنا شده است. در EvoLib، یک واحد دانش می‌تواند به شکل یک مهارت قابل استفاده مجدد که از یک راه حل موفق تقطیر شده، یا یک بینش بازتابی که از اشتباهات آموخته شده است، ظاهر شود. EvoLib به جای انباشت ساده حافظه‌های بیشتر در طول زمان، دانش موجود را با ورود تجربیات جدید به‌طور مداوم اصلاح، یکپارچه و وزن‌دهی مجدد می‌کند. به‌طور مشخص، ما سازوکارهای زیر را حول تکامل دانش طراحی کرده‌ایم:

  • یکپارچه‌سازی (Consolidation): هم‌زمان با استخراج دانش جدید از تجربیات اخیر، EvoLib دانش‌های مشابه را از کتابخانه بازیابی کرده و تلاش می‌کند آن‌ها را با دانش جدید ترکیب کند تا به یک دانش کلی‌تر و کاربردی‌تر تبدیل شوند. این امر اجازه می‌دهد دانش از تجربیات فردی فراتر رفته و در میان وظایف مختلف قابل اعمال باشد.
  • سازوکار وزن‌دهی (Weighting mechanism): فریم‌ورک EvoLib اهمیت هر واحد دانش را نه تنها بر اساس کاربرد مستقیم آن در وظیفه فعلی، بلکه بر اساس میزان نقش آن در تولید دانش مفید برای وظایف آینده به‌طور مداوم به‌روزرسانی می‌کند. به مرور زمان، دانشی که بیشترین تأثیر بلندمدت را دارد، به‌طور طبیعی در کتابخانه برجسته‌تر می‌شود.

شکل ۱: EvoLib تجربیات خام را به مهارت‌ها و بینش‌های قابل استفاده مجدد تبدیل کرده و سپس از طریق یکپارچه‌سازی و وزن‌دهی پویا، آن‌ها را به‌طور مداوم تکامل می‌دهد.

نتایج کلیدی

برای ارزیابی EvoLib، آن را در مجموعه متنوعی از وظایف چالش‌برانگیز با انواع مختلفی از تجربیات و نیازهای یادگیری آزمایش کردیم:

  • حل مسائل استدلال ریاضی
  • کدنویسی برای انجام وظایف محوله تحت محدودیت‌های کارایی
  • تصمیم‌گیری جهت کاوش و تعامل با محیط برای انجام وظایف افق‌بلند (Long-horizon tasks)

در تمام این وظایف، EvoLib به‌طور مستمر از برترین روش‌های حافظه مبتنی بر بازیابی (Retrieval-based memory) و سایر سازوکارهای حافظه انتزاعی پیشی گرفته و در عین حال بهره‌وری بهتری در مصرف توکن (Token usage) نشان داده است.

ما همچنین ارزیابی کردیم که EvoLib تا چه حد به‌طور مؤثر محاسبات زمان تست (Test-time compute) را از طریق دانش در حال تکامل به افزایش عملکرد تبدیل می‌کند. شکل ۲ فریم‌ورک EvoLib را هم با روش‌های مقیاس‌بندی محاسبات که هر وظیفه را به صورت ایزوله انجام می‌دهند و هم با روش‌های قوی یادگیری مبتنی بر حافظه مقایسه می‌کند. هر منحنی نشان می‌دهد که چگونه عملکرد با افزایش میزان محاسبات زمان تست بهبود می‌یابد.

در هر سه بنچمارک، EvoLib در بیشتر بازه محاسباتی به عملکرد بالاتری دست می‌یابد و با افزایش محاسبات، عملکرد را با سرعت بیشتری بهبود می‌بخشد.

این نتایج نشان می‌دهند که کلید یادگیری بهتر ممکن است صرفاً ذخیره حافظه‌های بیشتر یا صرف محاسبات بیشتر نباشد؛ بلکه بیشترین دستاوردها از تبدیل تجربه به دانش قابل استفاده مجدد حاصل می‌شود که بتوان آن را به‌طور مداوم اصلاح کرد و در وظایف مختلف به کار گرفت.

شکل ۲: در تمامی وظایف، EvoLib محاسبات زمان تست را موثرتر از روش‌های موجود به افزایش عملکرد تبدیل می‌کند.

مقاوم بودن در برابر ترتیب تصادفی وظایف

یک پرسش طبیعی این است که آیا چنین یادگیری به‌شدت وابسته به ترتیبی است که وظایف با آن مواجه می‌شوند یا خیر. در دنیای واقعی، یک سیستم هوش مصنوعی ممکن است با انواع گوناگونی از وظایف با ترتیب دلخواه روبرو شود و یک فریم‌ورک یادگیری کاربردی باید در برابر تصادفی بودن ترتیب وظایف مقاوم (Robust) باشد. برای ارزیابی این موضوع، ما عملکرد را روی همان مجموعه از وظایف ناهمگن اما با ترتیب‌های متفاوت اندازه گرفتیم. ما دریافتیم که EvoLib به‌طور مداوم نسبت به روش‌های موجود یادگیری مبتنی بر حافظه بهبود می‌یابد و عملکرد پایدار خود را در ترتیب‌های مختلف حفظ می‌کند. این امر نشان می‌دهد که EvoLib می‌تواند به‌طور مداوم از وظایف متنوع یاد بگیرد، حتی زمانی که در هم تنیده باشند؛ موضوعی که مزیت عملی آن را در سناریوهای دنیای واقعی اثبات می‌کند، جایی که یک عامل باید از جریان مختلطی از درخواست‌های ناهمگن کاربران بدون اتکا به یک برنامه آموزشی ساختاریافته یاد بگیرد.

با عهده‌دار شدن وظایف طولانی‌تر و پیچیده‌تر توسط سیستم‌های هوش مصنوعی، یادگیری از تجربه اهمیت فزاینده‌ای خواهد داشت. آینده هوش مصنوعی ممکن است نه تنها به مدل‌های بزرگ‌تر و محاسبات بیشتر، بلکه به سازوکارهایی بستگی داشته باشد که به سیستم‌ها اجازه می‌دهند به‌طور مداوم دانش را انباشته، بازپیرایی و مجدداً استفاده کنند.

فریم‌ورک EvoLib گامی به سوی این چشم‌انداز است. این سیستم با تبدیل تجربه به دانش در حال تکامل، سیستم‌های هوش مصنوعی را قادر می‌سازد تا پس از استقرار، به‌طور مداوم بهبود یافته و تطبیق یابند. سیستم‌های هوش مصنوعی آینده ممکن است به جای شروع مجدد از صفر، بتوانند بر پایه کتابخانه‌ای در حال تکامل از مهارت‌ها و بینش‌های قابل استفاده مجدد بنا شوند؛ درست همان‌طور که انسان‌ها عمل می‌کنند.

کدها و نتایج آزمایش‌ها در گیت‌هاب (GitHub) در دسترس است تا از تحقیقات آینده روی حافظه و تکامل دانش در سیستم‌های هوش مصنوعی پشتیبانی کند.