پیوند کاهش ابعاد و علم شبکه: درک و تحلیل داده‌ها از طریق گراف kNN در UMAP

پیوند کاهش ابعاد و علم شبکه: درک و تحلیل داده‌ها از طریق گراف kNN در UMAP

پیوند کاهش ابعاد و علم شبکه: درک و تحلیل داده‌ها از طریق گراف kNN در UMAP

نویسندگان: دوئن هورنگ (پولو) چاو، دونگ‌هاو رن، فرد هوهمان، دومینیک موریتز

در حالی که روش UMAP به‌طور گسترده برای کاوش و بررسی داده‌های چندبعدی استفاده می‌شود، گردش‌های کاری معمول عمدتاً بر نگاشت (Embedding) کم‌بعدی آن تمرکز دارند و گراف غنی k-نزدیک‌ترین همسایه (k-Nearest-Neighbor یا kNN) را که UMAP به‌طور داخلی می‌سازد، نادیده می‌گیرند. این گراف، منیفولد (Manifold) داده‌ها را در فضای چندبعدی اصلی خود، پیش از ایجاد اعوجاج ناشی از تصویرسازی دوبعدی UMAP، کدگذاری می‌کند.

ما پتانسیل دست‌نخورده این بازنمایی داخلی را نشان می‌دهیم و اثبات می‌کنیم که چگونه اعمال الگوریتم‌های استاندارد شبکه بر روی این گراف، درک و تحلیل داده‌ها (Sensemaking) را ارتقا می‌دهد:

  • الگوریتم PageRank: نقاط داده شاخص و نماینده (Representative Data Points) را شناسایی می‌کند.
  • تجزیه k-core: مناطق هسته‌ای متراکم را در برابر نواحی کم‌تراکم پیرامونی مشخص می‌سازد.
  • ضریب خوشه‌بندی (Clustering Coefficient): همسایگی‌های فشرده با داده‌های بسیار مشابه را تشخیص می‌دهد.

از طریق ارزیابی‌های کمی و کیفی روی مجموعه‌داده‌های MNIST و Fashion MNIST، نشان می‌دهیم که این تحلیل‌های مبتنی بر گراف نه تنها کاربردی هستند، بلکه با روش‌های اختصاصی (مانند k-medoids برای انتخاب نمونه یا HDBSCAN برای خوشه‌بندی مبتنی بر تراکم) رقابت کرده یا مکمل آن‌ها عمل می‌کنند.

مطالعات مرتبط و به‌روزرسانی‌ها

یادگیری بازنمایی گراف مولد و تقابلی

۲۹ سپتامبر ۲۰۲۵ – حوزه پژوهشی: روش‌ها و الگوریتم‌ها

یادگیری خودنظارتی (Self-Supervised Learning یا SSL) روی گراف‌ها، بازنمایی‌های گره و گراف (تعبیه‌ها یا Embeddings) را تولید می‌کند که می‌توانند برای وظایف پایین‌دستی مانند دسته‌بندی گره، خوشه‌بندی گره و پیش‌بینی لینک استفاده شوند. SSL روی گراف به‌ویژه در سناریوهایی با داده‌های برچسب‌دار محدود یا بدون برچسب کاربرد دارد. روش‌های موجود SSL عمدتاً از پارادایم‌های تقابلی یا مولد پیروی می‌کنند که هر کدام در وظایف مختلفی برتری دارند…

آموزش منظم‌سازی‌شده مدل‌های زبانی نزدیک‌ترین همسایه

۱۷ اوت ۲۰۲۲ – حوزه پژوهشی: پردازش زبان طبیعی و گفتار (کارگاه NAACL)

افزودن بانک‌های حافظه به معماری پردازش زبان طبیعی (NLP)، ظرفیت مدل را با تجهیز آن به داده‌های اضافی در زمان استنتاج (Inference Time) افزایش می‌دهد. در این مقاله، ما بر پایه kNN-LM کار می‌کنیم که از یک مدل زبانی پیش‌آموخته‌شده همراه با جستجوی جامع kNN در داده‌های آموزشی (بانک حافظه) برای دستیابی به پیشرفته‌ترین نتایج استفاده می‌کند. ما بررسی می‌کنیم که آیا می‌توان با آموزش یک مدل زبانی همراه با دانش موجود، عملکرد kNN-LM را بهبود بخشید یا خیر.

فرصت‌ها را در حوزه یادگیری ماشین کشف کنید. پژوهش‌های ما در یادگیری ماشین هر روز مرزهای جدیدی را می‌شکند.