EvoLib: تبدیل تجربه به دانش در حال تکامل
در یک نگاه
- خودنظارتی (Self-supervised): سیستم EvoLib به مدلهای بزرگ زبانی امکان میدهد تا در طول فرآیند استنتاج، بدون نیاز به برچسبهای واقعیت زمینی (Ground-truth labels) یا بازخورد خارجی، از تجربیات خود یاد بگیرند.
- از تجربه تا دانش: فریمورک EvoLib تلاشهای گذشته را به مهارتهای قابل استفاده مجدد و بینشهای بازتابی (Reflective insights) تبدیل میکند که میتوانند در وظایف آینده به کار گرفته شوند.
- دانشی که تکامل مییابد: مهارتها و بینشهای مفید بهطور مداوم اصلاح، یکپارچهسازی و وزندهی مجدد میشوند و مشاهدات خاص هر نمونه را به مرور زمان به دانشی کلیتر تبدیل میکنند.
- یادگیری قابل انتقال میان وظایف مختلف: EvoLib با تبدیل تجربه به دانش قابل استفاده مجدد، به مدلهای هوش مصنوعی کمک میکند از موفقیتها و شکستهای گذشته درس بگیرند و دانشی را که بیشترین پتانسیل را برای بهبود عملکرد آینده دارد، تکامل بخشند.
- طراحیشده برای مدلهای هوش مصنوعی امروز: از آنجا که EvoLib نیازی به بهروزرسانی پارامترهای مدل ندارد، میتوان آن را روی تمامی مدلهای زبانی جعبهسیاه (Black-box) و سیستمهای هوش مصنوعی مستقرشده از طریق API اعمال کرد.
حافظه به یکی از قابلیتهای کلیدی عاملهای هوش مصنوعی (AI agents) تبدیل شده است: توانایی ذخیره و بازیابی تجربیات گذشته. اما حافظه به تنهایی به معنای یادگیری نیست. مجموعهای از گفتگوهای گذشته، مسیرهای استدلال یا تاریخچه اقدامات میتواند بهسرعت به آرشیو عظیمی از تجربیات تبدیل شود و تشخیص مرتبطترین دانش برای یک وظیفه جدید را دشوار سازد؛ چه رسد به اینکه این دانش را برای بهبود عملکرد در طول زمان، بازپیرایی کرده و تکامل داد.
انسانها به گونه متفاوتی یاد میگیرند. ما تمام جزئیات تجربیات گذشته خود را به خاطر نمیسپاریم؛ در عوض، آنچه اهمیت دارد را به یاد میآوریم: راهبردهای کارآمد، اشتباهاتی که باید از آنها اجتناب کرد و مهارتهایی که در موقعیتهای مختلف قابل انتقال هستند. به مرور زمان، این درسها به دانشی کلیتر و قابل استفاده مجدد تبدیل میشوند. این توانایی در تبدیل تجربه به دانشی قابل انتقال و در حال تکامل، یکی از ارکان اصلی یادگیری انسانی است.
ما در مقاله اخیر خود با عنوان «یادگیری در زمان تست با یک کتابخانه در حال تکامل» (Test-Time Learning with an Evolving Library)، چگونگی یادگیری سیستمهای هوش مصنوعی از تجربه به روشی مشابه را بررسی کردهایم. ما EvoLib را معرفی میکنیم؛ فریمورکی که تجربیات خام را به یک کتابخانه پویا و در حال تکامل از دانش تبدیل میکند. EvoLib به جای برخورد با حافظه به عنوان یک آرشیو رو به رشد از تجربیات گذشته، دانش قابل استفاده مجدد را از آن تجربیات استخراج کرده و با ورود تجربیات جدید، بهطور مداوم آن را بازپیرایی میکند. از طریق تکامل این کتابخانه، مهارتها کلیتر، بینشها دقیقتر و عملکرد در وظایف بعدی بهطور پایدار در طول زمان بهبود مییابد. به این ترتیب، عاملهای هوش مصنوعی میتوانند بدون نیاز به بهروزرسانی مدل پایه، بهطور مداوم از تجربیات انباشتهشده یاد بگیرند.
نحوه کارکرد EvoLib
بر خلاف سیستمهای سنتی حافظه هوش مصنوعی که تجربیات خام را به عنوان اطلاعات ایستا ذخیره میکنند، EvoLib بر پایه فکرهی «دانش در حال تکامل» بنا شده است. در EvoLib، یک واحد دانش میتواند به شکل یک مهارت قابل استفاده مجدد که از یک راه حل موفق تقطیر شده، یا یک بینش بازتابی که از اشتباهات آموخته شده است، ظاهر شود. EvoLib به جای انباشت ساده حافظههای بیشتر در طول زمان، دانش موجود را با ورود تجربیات جدید بهطور مداوم اصلاح، یکپارچه و وزندهی مجدد میکند. بهطور مشخص، ما سازوکارهای زیر را حول تکامل دانش طراحی کردهایم:
- یکپارچهسازی (Consolidation): همزمان با استخراج دانش جدید از تجربیات اخیر، EvoLib دانشهای مشابه را از کتابخانه بازیابی کرده و تلاش میکند آنها را با دانش جدید ترکیب کند تا به یک دانش کلیتر و کاربردیتر تبدیل شوند. این امر اجازه میدهد دانش از تجربیات فردی فراتر رفته و در میان وظایف مختلف قابل اعمال باشد.
- سازوکار وزندهی (Weighting mechanism): فریمورک EvoLib اهمیت هر واحد دانش را نه تنها بر اساس کاربرد مستقیم آن در وظیفه فعلی، بلکه بر اساس میزان نقش آن در تولید دانش مفید برای وظایف آینده بهطور مداوم بهروزرسانی میکند. به مرور زمان، دانشی که بیشترین تأثیر بلندمدت را دارد، بهطور طبیعی در کتابخانه برجستهتر میشود.
شکل ۱: EvoLib تجربیات خام را به مهارتها و بینشهای قابل استفاده مجدد تبدیل کرده و سپس از طریق یکپارچهسازی و وزندهی پویا، آنها را بهطور مداوم تکامل میدهد.
نتایج کلیدی
برای ارزیابی EvoLib، آن را در مجموعه متنوعی از وظایف چالشبرانگیز با انواع مختلفی از تجربیات و نیازهای یادگیری آزمایش کردیم:
- حل مسائل استدلال ریاضی
- کدنویسی برای انجام وظایف محوله تحت محدودیتهای کارایی
- تصمیمگیری جهت کاوش و تعامل با محیط برای انجام وظایف افقبلند (Long-horizon tasks)
در تمام این وظایف، EvoLib بهطور مستمر از برترین روشهای حافظه مبتنی بر بازیابی (Retrieval-based memory) و سایر سازوکارهای حافظه انتزاعی پیشی گرفته و در عین حال بهرهوری بهتری در مصرف توکن (Token usage) نشان داده است.
ما همچنین ارزیابی کردیم که EvoLib تا چه حد بهطور مؤثر محاسبات زمان تست (Test-time compute) را از طریق دانش در حال تکامل به افزایش عملکرد تبدیل میکند. شکل ۲ فریمورک EvoLib را هم با روشهای مقیاسبندی محاسبات که هر وظیفه را به صورت ایزوله انجام میدهند و هم با روشهای قوی یادگیری مبتنی بر حافظه مقایسه میکند. هر منحنی نشان میدهد که چگونه عملکرد با افزایش میزان محاسبات زمان تست بهبود مییابد.
در هر سه بنچمارک، EvoLib در بیشتر بازه محاسباتی به عملکرد بالاتری دست مییابد و با افزایش محاسبات، عملکرد را با سرعت بیشتری بهبود میبخشد.
این نتایج نشان میدهند که کلید یادگیری بهتر ممکن است صرفاً ذخیره حافظههای بیشتر یا صرف محاسبات بیشتر نباشد؛ بلکه بیشترین دستاوردها از تبدیل تجربه به دانش قابل استفاده مجدد حاصل میشود که بتوان آن را بهطور مداوم اصلاح کرد و در وظایف مختلف به کار گرفت.
شکل ۲: در تمامی وظایف، EvoLib محاسبات زمان تست را موثرتر از روشهای موجود به افزایش عملکرد تبدیل میکند.
مقاوم بودن در برابر ترتیب تصادفی وظایف
یک پرسش طبیعی این است که آیا چنین یادگیری بهشدت وابسته به ترتیبی است که وظایف با آن مواجه میشوند یا خیر. در دنیای واقعی، یک سیستم هوش مصنوعی ممکن است با انواع گوناگونی از وظایف با ترتیب دلخواه روبرو شود و یک فریمورک یادگیری کاربردی باید در برابر تصادفی بودن ترتیب وظایف مقاوم (Robust) باشد. برای ارزیابی این موضوع، ما عملکرد را روی همان مجموعه از وظایف ناهمگن اما با ترتیبهای متفاوت اندازه گرفتیم. ما دریافتیم که EvoLib بهطور مداوم نسبت به روشهای موجود یادگیری مبتنی بر حافظه بهبود مییابد و عملکرد پایدار خود را در ترتیبهای مختلف حفظ میکند. این امر نشان میدهد که EvoLib میتواند بهطور مداوم از وظایف متنوع یاد بگیرد، حتی زمانی که در هم تنیده باشند؛ موضوعی که مزیت عملی آن را در سناریوهای دنیای واقعی اثبات میکند، جایی که یک عامل باید از جریان مختلطی از درخواستهای ناهمگن کاربران بدون اتکا به یک برنامه آموزشی ساختاریافته یاد بگیرد.
با عهدهدار شدن وظایف طولانیتر و پیچیدهتر توسط سیستمهای هوش مصنوعی، یادگیری از تجربه اهمیت فزایندهای خواهد داشت. آینده هوش مصنوعی ممکن است نه تنها به مدلهای بزرگتر و محاسبات بیشتر، بلکه به سازوکارهایی بستگی داشته باشد که به سیستمها اجازه میدهند بهطور مداوم دانش را انباشته، بازپیرایی و مجدداً استفاده کنند.
فریمورک EvoLib گامی به سوی این چشمانداز است. این سیستم با تبدیل تجربه به دانش در حال تکامل، سیستمهای هوش مصنوعی را قادر میسازد تا پس از استقرار، بهطور مداوم بهبود یافته و تطبیق یابند. سیستمهای هوش مصنوعی آینده ممکن است به جای شروع مجدد از صفر، بتوانند بر پایه کتابخانهای در حال تکامل از مهارتها و بینشهای قابل استفاده مجدد بنا شوند؛ درست همانطور که انسانها عمل میکنند.
کدها و نتایج آزمایشها در گیتهاب (GitHub) در دسترس است تا از تحقیقات آینده روی حافظه و تکامل دانش در سیستمهای هوش مصنوعی پشتیبانی کند.