کاهش هزینه‌های RAG در Amazon Bedrock با فشرده‌سازی مبتنی بر پرس‌وجو

کاهش هزینه‌های RAG در Amazon Bedrock با فشرده‌سازی مبتنی بر پرس‌وجو

در سیستم‌های تولید متن مبتنی بر بازیابی اطلاعات (RAG)، بخش عمده‌ای از هزینه‌ها به توکن‌های ورودی ارسال‌شده به مدل‌های زبانی بزرگ مربوط می‌شود. برای حل این چالش، پلتفرم Amazon Bedrock الگوی جدیدی به نام «فشرده‌سازی متن مبتنی بر پرس‌وجو» (Query-aware context compression) را معرفی کرده است که هزینه‌های پردازش را به شکل چشمگیری کاهش می‌دهد.

در معماری‌های سنتی RAG، تمام بخش‌های بازیابی‌شده از پایگاه داده (معمولاً بین ۵ تا ۲۰ بخش بزرگ) مستقیماً به مدل اصلی ارسال می‌شوند. اما در روش جدید، یک مدل کوچک‌تر و ارزان‌تر مانند Anthropic Claude Haiku ابتدا متون بازیابی‌شده را بررسی کرده و تنها بخش‌های دقیقاً مرتبط با پرسش کاربر را استخراج می‌کند. سپس این محتوای فشرده‌شده به مدل اصلی و قدرتمندتر مانند Anthropic Claude Sonnet فرستاده می‌شود تا پاسخ نهایی را تولید کند.

این فرآیند دو مرحله‌ای که از طریق AWS Lambda و Converse API در Amazon Bedrock پیاده‌سازی می‌شود، علاوه بر کاهش شدید تعداد توکن‌های ورودی و هزینه‌ها، احتمال بروز خطا و توهم (Hallucination) را نیز در مدل اصلی کاهش می‌دهد؛ زیرا اطلاعات نامرتبط پیش از رسیدن به مدل اصلی حذف می‌شوند.