معرفی «تجربه کاتالوگ عامل‌محور» در Amazon Quick

معرفی «تجربه کاتالوگ عامل‌محور» در Amazon Quick

هم‌زمان با استقبال سازمان‌ها از تحلیل‌های مبتنی بر هوش مصنوعی، ارزش پاسخ‌های برپایه زبان طبیعی (Text2SQL) کاملاً به زمینه و بافت تجاری (Business Context) پشت آن وابسته است. ما در حال ورود به مرحله‌ای هستیم که غنای معنایی (توصیف جدول‌ها، ستون‌ها و روابط میان آن‌ها) باید مستقیماً از کاتالوگ‌های داده و ابزارهای معنایی بالادستی به محصولات هوش مصنوعی کاربر نهایی منتقل شود. ابزارهایی مانند Amazon Quick دیگر نمی‌توانند به‌صورت ایزوله کار کنند؛ بلکه باید تعاریف، روابط و متاداده‌های حاکمیتی را که تیم‌های داده در سیستم‌هایی مانند کاتالوگ داده AWS Glue (AWS Glue Data Catalog) و Unity Catalog داتابریکس ایجاد کرده‌اند، به‌طور بومی درک کرده و تحلیل کنند. این تغییر مسیر از متاداده‌های سیلوشده و مجزا به هوش مصنوعی متصل و آگاه از کاتالوگ، عاملی است که امکان تحلیل هوشمند در مقیاس بزرگ را فراهم می‌سازد.

چالش: طی کردن قدم آخر

سرمایه‌گذاری انجام شده است: تیم‌های داده سازمان‌ها کارهای سخت را انجام داده‌اند. آن‌ها سرمایه‌گذاری سنگینی روی پلتفرم‌های کاتالوگ بالادستی مانند AWS Glue، Unity Catalog داتابریکس، Snowflake Horizon، Collibra و dbt کرده‌اند. در این پلتفرم‌ها، توصیفات جدول، معنای ستون‌ها، روابط کلید اصلی و خارجی، اصطلاحات واژه‌نامه (Glossary terms) و تعاریف شاخص‌ها با دقت ثبت شده‌اند.

با این حال، زمانی که نوبت به آماده‌سازی کاربران نهایی (مانند مدیران فروش، مدیران بازاریابی و سرپرستان مالی) برای استفاده از هوش مصنوعی آماده‌به‌کار و داشبوردهای قابل اعتماد می‌رسد، همچنان یک شکاف بزرگ وجود دارد.

سه چالش پیچیده: وقتی متصدیان داده (مهندسان هوش تجاری، راهبران تحلیل و تحلیل‌گران ارشد) می‌خواهند کاربران کسب‌وکار را در Amazon Quick فعال کنند، با سه چالش هم‌زمان روبرو می‌شوند:

  • کشف‌پذیری محدود: با وجود هزاران جدول در کاتالوگ‌های سازمانی، پیدا کردن دارایی‌های بالادستی مناسب و تأییدشده برای گزارش‌گیری، مانند پیدا کردن سوزن در انبار کاه است. هیچ راهی وجود ندارد که نیاز خود را توصیف کنید و سیستم آن را برای شما پیدا کند.
  • تکه‌تکه شدن معنایی و بازسازی دستی: متاداده‌های غنی موجود در بالادست (توصیفات تجاری جدول‌ها و ستون‌ها، و روابط کلید اصلی/خارجی) منتقل نمی‌شوند. متصدیان مجبورند دارایی‌ها را از نو بسازند، توصیفات را دوباره تعریف کنند و تطبیق تعاریف را به‌صورت دستی انجام دهند. آیا «درآمد» به معنای ناخالص است یا خالص؟ آیا «مشتری فعال» به معنای خرید در ۳۰ روز گذشته است یا ۹۰ روز؟ این تعاریف در بالادست وجود دارند اما نیاز به ورود مجدد و دستی دارند.
  • زمان رسیدن به تحلیل در سطح هفته‌ها به جای ساعت‌ها: ترکیب کشف دستی و بازسازی دستی باعث می‌شود زمان دسترسی از داده به تحلیل‌های کاربردی از چند ساعت به چند هفته افزایش یابد. بدتر از آن، وقتی تعاریف بالادستی تغییر می‌کنند، تعاریف معنایی دستی در مجموعه‌داده‌های Quick قدیمی می‌شوند و باعث «انحراف معنایی» (Semantic drift) می‌گردند که به مرور زمان اعتماد به پاسخ‌های هوش مصنوعی و داشبوردها را از بین می‌برد.

شکاف اصلی: مشکل در بالادست نیست؛ متاداده‌ها وجود دارند، حاکمیت داده تعریف شده و روابط نقشه‌برداری شده‌اند. مشکل اصلی در گام آخر است: ترجمه آن بافت غنی کاتالوگ به یک تجربه مدیریت‌شده و قابل مصرف که پاسخ‌های مستند هوش مصنوعی و داشبوردهای قطعی و قابل اعتماد ارائه دهد.

معرفی تجربه کاتالوگ عامل‌محور در Amazon Quick

امروز ما «تجربه کاتالوگ عامل‌محور» (Agentic Catalog Experience) را در Amazon Quick معرفی می‌کنیم؛ یک جریان کاری مبتنی بر هوش مصنوعی که به متصدیان داده کمک می‌کند مرزهای بافت داده خود را به سرعت مشخص کرده، معناشناسی بالادستی را به ارث ببرند و امکان پاسخ‌دهی مستند به پرسش‌ها (Q&A) و داشبوردهای قابل اعتماد را در مقیاس وسیع برای کاربران نهایی فراهم کنند.

در قلب این تجربه، «عامل کوئیک» (Quick Agent) قرار دارد که برای وظایف کشف، ایجاد و وراثت در بافت کاتالوگ طراحی شده است. این عامل از بافت معنایی اتصال کاتالوگ استفاده می‌کند تا کل کاتالوگ را در یک نگاه خلاصه کند، با کاربر به زبان طبیعی گفتگو نماید، مرتبط‌ترین جدول‌ها و روابط را بر اساس سناریوی مصرفی پیشنهاد دهد و میزان آمادگی متاداده را ارزیابی کند. سپس با یک تأیید گفتگویی ساده، به‌طور خودکار مجموعه‌داده‌ها (Datasets) و موضوعات (Topics) تولیدشده از کاتالوگ را با متاداده‌های هدفمند ارث‌برده‌شده از کاتالوگ بالادستی می‌سازد.

بدون پیکربندی دستی، بدون تغییر محیط کاری و بدون هفته‌ها راه‌اندازی.

نحوه عملکرد

کشف دارایی‌ها با زبان طبیعی: به جای پیمایش در میان هزاران جدول، متصدیان داده از زبان طبیعی استفاده می‌کنند. با تجربه کاتالوگ عامل‌محور، متصدیان فقط آنچه را نیاز دارند توصیف می‌کنند:

متصدی داده: «من تحلیل‌گر ارشد تیم مالی هستم. به جدول‌هایی برای گزارش درآمد سه ماهه و تحلیل هزینه‌ها نیاز دارم.»

عامل کوئیک با استفاده از تمام متاداده‌های موجود شامل توصیفات تجاری، برچسب‌ها، رتبه‌بندی‌های طلایی/نقره‌ای/برنزی، امتیازات کیفیت داده و اصطلاحات واژه‌نامه، کل کاتالوگ شما را جستجو می‌کند تا مرتبط‌ترین جدول‌ها را بلافاصله نمایش دهد.

ایجاد انبوه و عامل‌محور مجموعه‌داده‌ها: پس از انتخاب جدول‌ها توسط متصدی، عامل کوئیک بازنمایی‌های کاتالوگ (Datasets) را در مقیاس بزرگ و در یک جریان کاری هدایت‌شده می‌سازد. کاتالوگ بالادستی شما به عنوان مرجع اصلی باقی می‌ماند زیرا مسیر پیش‌فرض ساخت، «پرس‌وجوی مستقیم» (DirectQuery) است. مجموعه‌داده‌های دارای معناشناسی ارث‌برده‌شده با نشان واضح «Semantics Inherited» مشخص می‌شوند و متاداده آن‌ها فقط‌خواندنی است. مؤلفان می‌توانند در صورت نیاز با کلیک روی دکمه همگام‌سازی (Sync)، متاداده‌ها را به‌روزرسانی کنند تا با کاتالوگ هماهنگ بمانند.

عامل کوئیک: «در حال ساخت ۶ مجموعه‌داده تولیدشده از کاتالوگ: revenue_by_region ساخته شد (DirectQuery، متاداده فقط‌خواندنی)، cost_centers ساخته شد، و gl_transactions ساخته شد.»

وراثت معنایی و روابط: عامل کوئیک متاداده‌های هدفمند را از کاتالوگ به دارایی‌های ساخته‌شده منتقل می‌کند. در حال حاضر، وراثت به‌طور هدفمند روی دو بخش کلیدی تمرکز دارد تا از شلوغی جلوگیری شده و مجموعه‌داده‌ها تمیز بمانند:

  • تعاریف جدول و ستون به مجموعه‌داده‌ها: توصیفات تجاری و تعاریف ستون‌ها مستقیماً منتقل می‌شوند تا کاربران بافت معنایی مورد نیاز را داشته باشند.
  • روابط کلید اصلی و خارجی به موضوعات (Topics): عامل، روابط را تشخیص داده و از آن‌ها برای پیشنهاد و ساخت ساختارهای چند مجموعه‌داده‌ای (Topics) با پیوندهای پیش‌فرض طرح‌واره‌های ستاره‌ای (Star) و برف‌دانه (Snowflake) استفاده می‌کند.

عامل کوئیک: «من ۳ رابطه بین این جدول‌ها پیدا کردم و موضوعی به نام Finance Revenue Model با پیوندهای طرح‌واره ستاره‌ای پیش‌فرض ساختم. تعاریف جدول و ستون از کاتالوگ بالادستی ارث‌بری شدند.»

استفاده فوری: مجموعه‌داده‌ها و موضوعات ساخته‌شده بلافاصله آماده استفاده هستند:

  • پرسش و پاسخ: گفتگو را با مجموعه‌داده‌های جدید شروع کنید. عامل هوش مصنوعی از توصیفات ارث‌برده‌شده برای ارائه پاسخ‌های مستند استفاده می‌کند.
  • ساخت داشبورد: تجسم‌های داده قطعی را با بافت کامل معنایی بسازید.
  • اشتراک‌گذاری: مجموعه‌داده‌ها را به یک فضای کاری (Space) اضافه کرده و با کاربران تجاری به اشتراک بگذارید.

معماری: مصرف‌کننده، نه کاتالوگ

یک اصل طراحی کلیدی در این تجربه وجود دارد: Amazon Quick مصرف‌کننده متاداده‌های کاتالوگ بالادستی است، نه یک کاتالوگ مجزا. این یعنی:

  • عدم تکثیر داده‌ها: از پرس‌وجوی مستقیم (DirectQuery) استفاده می‌شود و هیچ داده‌ای کپی یا جابه‌جا نمی‌شود.
  • مصرف متاداده برای بافت‌دهی: معناشناسی ارث‌برده‌شده فقط‌خواندنی است و کاتالوگ بالادستی مرجع نهایی باقی می‌ماند.
  • همگام‌سازی دستی معنایی: امکان همگام‌سازی دستی با دکمه Sync وجود دارد و همگام‌سازی زمان‌بندی‌شده به‌زودی اضافه خواهد شد.
  • توسعه‌پذیری با شفافیت: اگر مؤلفی اقدام به ویرایش مجموعه‌داده کند، سیستم هشدار می‌دهد که این کار یک مجموعه‌داده سفارشی می‌سازد و همگام‌سازی قطع خواهد شد.

کاتالوگ‌های پشتیبانی‌شده در حال حاضر

  • AWS Glue Data Catalog: احرازهویت از طریق IAM Role ARN آمازون
  • Databricks Unity Catalog: احرازهویت از طریق OAuth 2.0 / توکن دسترسی شخصی (Personal Access Token)

پشتیبانی از پلتفرم‌های کاتالوگ بیشتر به‌زودی ارائه می‌شود.

چه مواردی ارث‌بری می‌شوند؟

به مجموعه‌داده‌ها (تعاریف جدول و ستون):

  • توصیفات تجاری و فنی جدول.
  • توصیفات و نام‌های نمایشی ستون‌ها.
  • انواع داده (Data types) و قابلیت پذیرش مقادیر خالی (Nullability).
  • اصطلاحات واژه‌نامه و مترادف‌ها.

به موضوعات/Topics (روابط):

  • روابط کلید اصلی و خارجی.
  • تعاریف روابط و چندوچوندی (Cardinality).
  • مدل‌های طرح‌واره ستاره‌ای و برف‌دانه.

تجربه کاربر نهایی

مدیر فروش می‌پرسد: «میزان فروش سه ماهه چهارم ما به تفکیک منطقه چقدر بوده است؟»

در پشت صحنه، عامل هوش مصنوعی جدول مناسب را پیدا کرده، پیوندهای پیش‌فرض را اعمال می‌کند، قوانین ماسک‌گذاری داده‌های حساس (PII) را رعایت کرده و در چند ثانیه پاسخی دقیق و قابل اعتماد ارائه می‌دهد.

بافت سازمانی یکپارچه

تجربه کاتالوگ عامل‌محور در کنار سایر قابلیت‌های Amazon Quick (مانند اتصال به اسلاک، اوت‌لوک و پایگاه‌های دانش) یک بافت یکپارچه سازمانی شامل داده‌های ساختاریافته، غیرساختاریافته و قوانین کسب‌وکار ایجاد می‌کند.

اتصال به کاتالوگ داده AWS Glue

برای شروع، یک اتصال منبع داده به AWS Glue Data Catalog در Amazon Quick ایجاد کنید. پس از برقراری اتصال، عامل کوئیک شما را در مراحل کشف و ساخت موضوع هدایت می‌کند.

در Amazon Quick، یک منبع داده جدید ایجاد کرده و Glue Data Catalog را انتخاب کنید. این اتصال برای متاداده‌هاست تا Quick بتواند تعاریف را بخواند.

تصویر ۱: انتخاب نوع اتصال Glue Data Catalog در Amazon Quick

اتصال Glue در کنار اتصال Amazon Athena کار می‌کند. Glue متاداده را تامین می‌کند و Athena مسیر پرس‌وجو به داده‌های موجود در Amazon S3 را ارائه می‌دهد.

تصویر ۲: لیست منابع داده Glue Data Catalog و Athena در کنار هم

صفحه جزییات منبع داده GDC-Demo را باز کرده و روی Explore data کلیک کنید تا عامل کوئیک اجرا شود.

تصویر ۳: اجرای عامل کوئیک از صفحه جزییات منبع داده