معرفی «تجربه کاتالوگ عاملمحور» در Amazon Quick
همزمان با استقبال سازمانها از تحلیلهای مبتنی بر هوش مصنوعی، ارزش پاسخهای برپایه زبان طبیعی (Text2SQL) کاملاً به زمینه و بافت تجاری (Business Context) پشت آن وابسته است. ما در حال ورود به مرحلهای هستیم که غنای معنایی (توصیف جدولها، ستونها و روابط میان آنها) باید مستقیماً از کاتالوگهای داده و ابزارهای معنایی بالادستی به محصولات هوش مصنوعی کاربر نهایی منتقل شود. ابزارهایی مانند Amazon Quick دیگر نمیتوانند بهصورت ایزوله کار کنند؛ بلکه باید تعاریف، روابط و متادادههای حاکمیتی را که تیمهای داده در سیستمهایی مانند کاتالوگ داده AWS Glue (AWS Glue Data Catalog) و Unity Catalog داتابریکس ایجاد کردهاند، بهطور بومی درک کرده و تحلیل کنند. این تغییر مسیر از متادادههای سیلوشده و مجزا به هوش مصنوعی متصل و آگاه از کاتالوگ، عاملی است که امکان تحلیل هوشمند در مقیاس بزرگ را فراهم میسازد.
چالش: طی کردن قدم آخر
سرمایهگذاری انجام شده است: تیمهای داده سازمانها کارهای سخت را انجام دادهاند. آنها سرمایهگذاری سنگینی روی پلتفرمهای کاتالوگ بالادستی مانند AWS Glue، Unity Catalog داتابریکس، Snowflake Horizon، Collibra و dbt کردهاند. در این پلتفرمها، توصیفات جدول، معنای ستونها، روابط کلید اصلی و خارجی، اصطلاحات واژهنامه (Glossary terms) و تعاریف شاخصها با دقت ثبت شدهاند.
با این حال، زمانی که نوبت به آمادهسازی کاربران نهایی (مانند مدیران فروش، مدیران بازاریابی و سرپرستان مالی) برای استفاده از هوش مصنوعی آمادهبهکار و داشبوردهای قابل اعتماد میرسد، همچنان یک شکاف بزرگ وجود دارد.
سه چالش پیچیده: وقتی متصدیان داده (مهندسان هوش تجاری، راهبران تحلیل و تحلیلگران ارشد) میخواهند کاربران کسبوکار را در Amazon Quick فعال کنند، با سه چالش همزمان روبرو میشوند:
- کشفپذیری محدود: با وجود هزاران جدول در کاتالوگهای سازمانی، پیدا کردن داراییهای بالادستی مناسب و تأییدشده برای گزارشگیری، مانند پیدا کردن سوزن در انبار کاه است. هیچ راهی وجود ندارد که نیاز خود را توصیف کنید و سیستم آن را برای شما پیدا کند.
- تکهتکه شدن معنایی و بازسازی دستی: متادادههای غنی موجود در بالادست (توصیفات تجاری جدولها و ستونها، و روابط کلید اصلی/خارجی) منتقل نمیشوند. متصدیان مجبورند داراییها را از نو بسازند، توصیفات را دوباره تعریف کنند و تطبیق تعاریف را بهصورت دستی انجام دهند. آیا «درآمد» به معنای ناخالص است یا خالص؟ آیا «مشتری فعال» به معنای خرید در ۳۰ روز گذشته است یا ۹۰ روز؟ این تعاریف در بالادست وجود دارند اما نیاز به ورود مجدد و دستی دارند.
- زمان رسیدن به تحلیل در سطح هفتهها به جای ساعتها: ترکیب کشف دستی و بازسازی دستی باعث میشود زمان دسترسی از داده به تحلیلهای کاربردی از چند ساعت به چند هفته افزایش یابد. بدتر از آن، وقتی تعاریف بالادستی تغییر میکنند، تعاریف معنایی دستی در مجموعهدادههای Quick قدیمی میشوند و باعث «انحراف معنایی» (Semantic drift) میگردند که به مرور زمان اعتماد به پاسخهای هوش مصنوعی و داشبوردها را از بین میبرد.
شکاف اصلی: مشکل در بالادست نیست؛ متادادهها وجود دارند، حاکمیت داده تعریف شده و روابط نقشهبرداری شدهاند. مشکل اصلی در گام آخر است: ترجمه آن بافت غنی کاتالوگ به یک تجربه مدیریتشده و قابل مصرف که پاسخهای مستند هوش مصنوعی و داشبوردهای قطعی و قابل اعتماد ارائه دهد.
معرفی تجربه کاتالوگ عاملمحور در Amazon Quick
امروز ما «تجربه کاتالوگ عاملمحور» (Agentic Catalog Experience) را در Amazon Quick معرفی میکنیم؛ یک جریان کاری مبتنی بر هوش مصنوعی که به متصدیان داده کمک میکند مرزهای بافت داده خود را به سرعت مشخص کرده، معناشناسی بالادستی را به ارث ببرند و امکان پاسخدهی مستند به پرسشها (Q&A) و داشبوردهای قابل اعتماد را در مقیاس وسیع برای کاربران نهایی فراهم کنند.
در قلب این تجربه، «عامل کوئیک» (Quick Agent) قرار دارد که برای وظایف کشف، ایجاد و وراثت در بافت کاتالوگ طراحی شده است. این عامل از بافت معنایی اتصال کاتالوگ استفاده میکند تا کل کاتالوگ را در یک نگاه خلاصه کند، با کاربر به زبان طبیعی گفتگو نماید، مرتبطترین جدولها و روابط را بر اساس سناریوی مصرفی پیشنهاد دهد و میزان آمادگی متاداده را ارزیابی کند. سپس با یک تأیید گفتگویی ساده، بهطور خودکار مجموعهدادهها (Datasets) و موضوعات (Topics) تولیدشده از کاتالوگ را با متادادههای هدفمند ارثبردهشده از کاتالوگ بالادستی میسازد.
بدون پیکربندی دستی، بدون تغییر محیط کاری و بدون هفتهها راهاندازی.
نحوه عملکرد
کشف داراییها با زبان طبیعی: به جای پیمایش در میان هزاران جدول، متصدیان داده از زبان طبیعی استفاده میکنند. با تجربه کاتالوگ عاملمحور، متصدیان فقط آنچه را نیاز دارند توصیف میکنند:
متصدی داده: «من تحلیلگر ارشد تیم مالی هستم. به جدولهایی برای گزارش درآمد سه ماهه و تحلیل هزینهها نیاز دارم.»
عامل کوئیک با استفاده از تمام متادادههای موجود شامل توصیفات تجاری، برچسبها، رتبهبندیهای طلایی/نقرهای/برنزی، امتیازات کیفیت داده و اصطلاحات واژهنامه، کل کاتالوگ شما را جستجو میکند تا مرتبطترین جدولها را بلافاصله نمایش دهد.
ایجاد انبوه و عاملمحور مجموعهدادهها: پس از انتخاب جدولها توسط متصدی، عامل کوئیک بازنماییهای کاتالوگ (Datasets) را در مقیاس بزرگ و در یک جریان کاری هدایتشده میسازد. کاتالوگ بالادستی شما به عنوان مرجع اصلی باقی میماند زیرا مسیر پیشفرض ساخت، «پرسوجوی مستقیم» (DirectQuery) است. مجموعهدادههای دارای معناشناسی ارثبردهشده با نشان واضح «Semantics Inherited» مشخص میشوند و متاداده آنها فقطخواندنی است. مؤلفان میتوانند در صورت نیاز با کلیک روی دکمه همگامسازی (Sync)، متادادهها را بهروزرسانی کنند تا با کاتالوگ هماهنگ بمانند.
عامل کوئیک: «در حال ساخت ۶ مجموعهداده تولیدشده از کاتالوگ: revenue_by_region ساخته شد (DirectQuery، متاداده فقطخواندنی)، cost_centers ساخته شد، و gl_transactions ساخته شد.»
وراثت معنایی و روابط: عامل کوئیک متادادههای هدفمند را از کاتالوگ به داراییهای ساختهشده منتقل میکند. در حال حاضر، وراثت بهطور هدفمند روی دو بخش کلیدی تمرکز دارد تا از شلوغی جلوگیری شده و مجموعهدادهها تمیز بمانند:
- تعاریف جدول و ستون به مجموعهدادهها: توصیفات تجاری و تعاریف ستونها مستقیماً منتقل میشوند تا کاربران بافت معنایی مورد نیاز را داشته باشند.
- روابط کلید اصلی و خارجی به موضوعات (Topics): عامل، روابط را تشخیص داده و از آنها برای پیشنهاد و ساخت ساختارهای چند مجموعهدادهای (Topics) با پیوندهای پیشفرض طرحوارههای ستارهای (Star) و برفدانه (Snowflake) استفاده میکند.
عامل کوئیک: «من ۳ رابطه بین این جدولها پیدا کردم و موضوعی به نام Finance Revenue Model با پیوندهای طرحواره ستارهای پیشفرض ساختم. تعاریف جدول و ستون از کاتالوگ بالادستی ارثبری شدند.»
استفاده فوری: مجموعهدادهها و موضوعات ساختهشده بلافاصله آماده استفاده هستند:
- پرسش و پاسخ: گفتگو را با مجموعهدادههای جدید شروع کنید. عامل هوش مصنوعی از توصیفات ارثبردهشده برای ارائه پاسخهای مستند استفاده میکند.
- ساخت داشبورد: تجسمهای داده قطعی را با بافت کامل معنایی بسازید.
- اشتراکگذاری: مجموعهدادهها را به یک فضای کاری (Space) اضافه کرده و با کاربران تجاری به اشتراک بگذارید.
معماری: مصرفکننده، نه کاتالوگ
یک اصل طراحی کلیدی در این تجربه وجود دارد: Amazon Quick مصرفکننده متادادههای کاتالوگ بالادستی است، نه یک کاتالوگ مجزا. این یعنی:
- عدم تکثیر دادهها: از پرسوجوی مستقیم (DirectQuery) استفاده میشود و هیچ دادهای کپی یا جابهجا نمیشود.
- مصرف متاداده برای بافتدهی: معناشناسی ارثبردهشده فقطخواندنی است و کاتالوگ بالادستی مرجع نهایی باقی میماند.
- همگامسازی دستی معنایی: امکان همگامسازی دستی با دکمه Sync وجود دارد و همگامسازی زمانبندیشده بهزودی اضافه خواهد شد.
- توسعهپذیری با شفافیت: اگر مؤلفی اقدام به ویرایش مجموعهداده کند، سیستم هشدار میدهد که این کار یک مجموعهداده سفارشی میسازد و همگامسازی قطع خواهد شد.
کاتالوگهای پشتیبانیشده در حال حاضر
- AWS Glue Data Catalog: احرازهویت از طریق IAM Role ARN آمازون
- Databricks Unity Catalog: احرازهویت از طریق OAuth 2.0 / توکن دسترسی شخصی (Personal Access Token)
پشتیبانی از پلتفرمهای کاتالوگ بیشتر بهزودی ارائه میشود.
چه مواردی ارثبری میشوند؟
به مجموعهدادهها (تعاریف جدول و ستون):
- توصیفات تجاری و فنی جدول.
- توصیفات و نامهای نمایشی ستونها.
- انواع داده (Data types) و قابلیت پذیرش مقادیر خالی (Nullability).
- اصطلاحات واژهنامه و مترادفها.
به موضوعات/Topics (روابط):
- روابط کلید اصلی و خارجی.
- تعاریف روابط و چندوچوندی (Cardinality).
- مدلهای طرحواره ستارهای و برفدانه.
تجربه کاربر نهایی
مدیر فروش میپرسد: «میزان فروش سه ماهه چهارم ما به تفکیک منطقه چقدر بوده است؟»
در پشت صحنه، عامل هوش مصنوعی جدول مناسب را پیدا کرده، پیوندهای پیشفرض را اعمال میکند، قوانین ماسکگذاری دادههای حساس (PII) را رعایت کرده و در چند ثانیه پاسخی دقیق و قابل اعتماد ارائه میدهد.
بافت سازمانی یکپارچه
تجربه کاتالوگ عاملمحور در کنار سایر قابلیتهای Amazon Quick (مانند اتصال به اسلاک، اوتلوک و پایگاههای دانش) یک بافت یکپارچه سازمانی شامل دادههای ساختاریافته، غیرساختاریافته و قوانین کسبوکار ایجاد میکند.
اتصال به کاتالوگ داده AWS Glue
برای شروع، یک اتصال منبع داده به AWS Glue Data Catalog در Amazon Quick ایجاد کنید. پس از برقراری اتصال، عامل کوئیک شما را در مراحل کشف و ساخت موضوع هدایت میکند.
در Amazon Quick، یک منبع داده جدید ایجاد کرده و Glue Data Catalog را انتخاب کنید. این اتصال برای متادادههاست تا Quick بتواند تعاریف را بخواند.
تصویر ۱: انتخاب نوع اتصال Glue Data Catalog در Amazon Quick
اتصال Glue در کنار اتصال Amazon Athena کار میکند. Glue متاداده را تامین میکند و Athena مسیر پرسوجو به دادههای موجود در Amazon S3 را ارائه میدهد.
تصویر ۲: لیست منابع داده Glue Data Catalog و Athena در کنار هم
صفحه جزییات منبع داده GDC-Demo را باز کرده و روی Explore data کلیک کنید تا عامل کوئیک اجرا شود.
تصویر ۳: اجرای عامل کوئیک از صفحه جزییات منبع داده