اکوورس: محیط‌های عمیق و در حال تکامل برای ایجنت‌های کاربرد رایانه

در یک نگاه

ما دوازده دنیای آموزشی برای ایجنت‌های کاربرد رایانه (computer-use agents) ساختیم: ۱۰ دنیای حوزه عمیق (deep domain worlds) و دو دنیای قابلیت‌محور (capability worlds) که هر کدام روی یک کنترل خاص که در فرم‌های مختلف رندر شده تمرکز دارند (مانند انتخاب‌گرهای تاریخ و فیلترهای توئیده‌شده). این «عمق» است که آن‌ها را شایسته آموزش می‌کند: این جهان‌ها رفتار واقعی یک برنامه کاربردی را بازسازی می‌کنند، با داده‌های واقعی مقداردهی اولیه می‌شوند و وضعیت یکپارچه را در میان صفحات و کاربران مختلف حفظ می‌کنند. یک مدل ۹ میلیارد پارامتری (9B) با آموزش روی هر دوازده محیط، امتیاز پایه خود را تقریباً دو برابر کرد (از ۳۶.۵٪ به ۶۷.۱٪) و به فاصله ۱۴ نقطه‌ای مدل GPT-5.4 رسید.

این آزمایش چند درس مهم به ما آموخت:

  • وفاداری بالای شبیه‌سازی یک ضرورت است: محیط‌های سطحی به ایجنت آسیب می‌زنند. آموزش مدل روی نسخه‌های سطحی و عمیق از وب‌سایت‌های یکسان نشان داد که مدل در نسخه‌های سطحی افت کرد اما در نسخه‌های عمیق بهبود یافت.
  • چالش عناصر رابط کاربری: ایجنت‌ها اغلب با عناصر تعاملی دشوار مانند انتخاب‌گر تاریخ (date pickers) و فیلترهای توئیده‌شده (nested filters) درگیر هستند. تمرین روی این کنترل‌ها در فرم‌های متنوع، به مدل آموخت تا در حوزه‌هایی که هرگز در زمان آموزش ندیده بود نیز با آن‌ها کار کند.
  • تکامل هم‌زمان (Co-evolution): بهبود هم‌زمان مدل، جهان شبیه‌سازی و ارزیاب (verifier) باعث ارتقای همه آن‌ها می‌شود. با دقیق‌تر شدن جهان و سخت‌تر شدن وظایف، مدل نیز همراه با آن رشد می‌کند.
  • یادگیری تقویتی (RL): یادگیری تقویتی در برابر این جهان‌ها، ایجنت را فراتر از تقلید محض می‌برد. با استفاده از ارزیاب مبتنی بر پایگاه داده به عنوان پاداش، یادگیری تقویتی عملکرد مدل را روی داده‌های نادیده افزایش داده و به ایجنت می‌آموزد در گام‌های کمتری به هدف برسد.

ما چهار مورد از این جهان‌ها را به همراه کد، داده‌ها و ارزیاب‌های مبتنی بر پایگاه داده متصل انتشار می‌دهیم تا از پژوهش‌ها در زمینه محیط‌های کاربرد رایانه با وفاداری بالا پشتیبانی کنیم.

چرا محیط‌های سنتزی و عمیق؟

یک ایجنت کاربرد رایانه، نتایج اقدامات خود را تنها در جایی می‌آموزد که آن اقدامات پیامدهای واقعی داشته باشند. یک کلیک، وضعیت ذخیره‌شده را تغییر می‌دهد، یک پیام به یک شخص واقعی می‌رسد، یا صفحه‌ای که حرکت نمی‌کند به ایجنت می‌گوید حرکت قبلی‌اش بی‌نتیجه بوده است. اسکرین‌شات فقط می‌تواند ظاهر یک رابط کاربری را نشان دهد، اما تنها یک دنیای واقعی و فعال نشان می‌دهد که یک عمل چه نتیجه‌ای ایجاد کرده است.

پیامدهایی که ارزش یادگیری دارند ذاتاً دارای وضعیت (stateful) هستند و بیشتر آن‌ها پشت صفحه ورود (login) قرار دارند. کارهایی که مردم می‌خواهند خودکار شوند در سیستم‌های بسته قرار دارند: ایمیل، چت، امور بانکی، پرونده‌های پزشکی، و کنسول‌های داخلی ابر و یادگیری ماشین. شما نمی‌توانید یک ایجنت را روی نسخه‌های زنده این سیستم‌ها آموزش دهید؛ زیرا هر تلاش در یک حساب واقعی ثبت می‌شود، امکان بازنشانی بین آزمون‌ها وجود ندارد و وضعیت واقعی پشت صفحه پنهان می‌ماند. بنابراین شما سیستم را به عنوان یک دنیای سنتزی (synthetic world) بازسازی می‌کنید که پایگاه داده آن در اختیار شماست: وضعیت واقعی است و تغییر می‌کند، اما برای خراب شدن ایمن است، سریع بازنشانی می‌شود و به‌جای اسکرین‌شات، از روی داده ارزیابی می‌شود.

منظور ما از «یک جهان» سه عنصر به‌هم‌پیوسته است: محیط (برنامه، وضعیت آن و اقداماتی که آن را تغییر می‌دهند)، وظایفی که اهداف را تعیین می‌کنند، و ارزیابی‌کننده‌ای که نتیجه را با واقعیت موجود (ground truth) می‌سنجد.

کارخانه اکوورس چگونه کار می‌کند؟

اکوورس یک خط لوله واحد با دو خروجی است: جهان‌های حوزه کامل که عمق گردش کار را حفظ می‌کنند، و جهان‌های قابلیت‌محور که یک تعامل خاص را تغییر می‌دهند. هر دو بر این واقعیت متکی هستند که پایگاه داده زیرین در اختیار ماست، بنابراین موفقیت، ویژگی وضعیت خود برنامه است، نه برداشت یک مدل از اسکرین‌شات.

خط لوله، سناریوهای اولیه را به مشخصات فنی تبدیل کرده و سپس آن را به ادعاهای قابل بررسی توسط ماشین درباره مسیرها، وضعیت و رفتار تبدیل می‌کند. تازه پس از آن برنامه ساخته می‌شود: یک فرانت‌اند React روی بک‌اند FastAPI و SQLite. یک برنامه تازه ساخت، یک فرضیه است نه یک جهان کامل؛ سازنده تمام ادعاها را بررسی کرده و تا زمان قبولی، پایگاه داده، بک‌اند یا فرانت‌اند را ترمیم می‌کند.

ارزیاب مبتنی بر پایگاه داده است

هر وظیفه حاوی کلید پاسخ خود است؛ مقداری یا تغییری در وضعیت که از پایگاه داده واقعی استخراج شده است. خواندن داده بر اساس معادل‌سازی معنایی سنجیده می‌شود (مثلاً ۲۸۸ دلار برای ۲۸۷.۶۲ دلار پذیرفته می‌شود)؛ نوشتن داده بر اساس تفاوت واقعی پایگاه داده قبل و بعد از عمل ارزیابی می‌شود.

حوزه‌های کامل گردش کار را حمل می‌کنند

۱۰ حوزه اکو شامل ارتباطات، کارهای فنی، ثبت‌های تنظیم‌شده، انجمن، رسانه و سفر است. جایی که داده‌های عمومی غنی وجود داشته، از آن استفاده شده است؛ مثلاً EchoStay از داده‌های InsideAirbnb استفاده می‌کند و EchoForum بر پایه مجموعه داده‌ای با ۲.۵۵ میلیون کامنت ساخته شده است.

دسته‌بندی محیط‌های اکو

  • ارتباطات و هماهنگی (EchoMail, EchoCalendar, EchoChat): رشته‌گفتگوهای مشترک، برنامه‌ها، شرکت‌کنندگان، دسترسی‌ها و تاریخچه‌ها
  • خلق و عملیات فنی (EchoML, EchoForge): مصنوعات، پیکربندی، وابستگی‌ها، نقش‌ها و تغییرات چندمرحله‌ای
  • ثبت‌ها و تراکنش‌های قانونی (EchoBank, EchoCare): موجودی‌ها یا پرونده‌ها، احراز هویت، تاریخچه حسابرسی و نوشتن‌های پیامدمحور
  • انجمن، رسانه و سفر (EchoForum, EchoTunes, EchoStay): ترجیحات پایدار، وضعیت اجتماعی، جستجو، رزرو و اقدامات حساب کاربری