پیوند کاهش ابعاد و علم شبکه: درک و تحلیل دادهها از طریق گراف kNN در UMAP
پیوند کاهش ابعاد و علم شبکه: درک و تحلیل دادهها از طریق گراف kNN در UMAP
نویسندگان: دوئن هورنگ (پولو) چاو، دونگهاو رن، فرد هوهمان، دومینیک موریتز
در حالی که روش UMAP بهطور گسترده برای کاوش و بررسی دادههای چندبعدی استفاده میشود، گردشهای کاری معمول عمدتاً بر نگاشت (Embedding) کمبعدی آن تمرکز دارند و گراف غنی k-نزدیکترین همسایه (k-Nearest-Neighbor یا kNN) را که UMAP بهطور داخلی میسازد، نادیده میگیرند. این گراف، منیفولد (Manifold) دادهها را در فضای چندبعدی اصلی خود، پیش از ایجاد اعوجاج ناشی از تصویرسازی دوبعدی UMAP، کدگذاری میکند.
ما پتانسیل دستنخورده این بازنمایی داخلی را نشان میدهیم و اثبات میکنیم که چگونه اعمال الگوریتمهای استاندارد شبکه بر روی این گراف، درک و تحلیل دادهها (Sensemaking) را ارتقا میدهد:
- الگوریتم PageRank: نقاط داده شاخص و نماینده (Representative Data Points) را شناسایی میکند.
- تجزیه k-core: مناطق هستهای متراکم را در برابر نواحی کمتراکم پیرامونی مشخص میسازد.
- ضریب خوشهبندی (Clustering Coefficient): همسایگیهای فشرده با دادههای بسیار مشابه را تشخیص میدهد.
از طریق ارزیابیهای کمی و کیفی روی مجموعهدادههای MNIST و Fashion MNIST، نشان میدهیم که این تحلیلهای مبتنی بر گراف نه تنها کاربردی هستند، بلکه با روشهای اختصاصی (مانند k-medoids برای انتخاب نمونه یا HDBSCAN برای خوشهبندی مبتنی بر تراکم) رقابت کرده یا مکمل آنها عمل میکنند.
مطالعات مرتبط و بهروزرسانیها
یادگیری بازنمایی گراف مولد و تقابلی
۲۹ سپتامبر ۲۰۲۵ – حوزه پژوهشی: روشها و الگوریتمها
یادگیری خودنظارتی (Self-Supervised Learning یا SSL) روی گرافها، بازنماییهای گره و گراف (تعبیهها یا Embeddings) را تولید میکند که میتوانند برای وظایف پاییندستی مانند دستهبندی گره، خوشهبندی گره و پیشبینی لینک استفاده شوند. SSL روی گراف بهویژه در سناریوهایی با دادههای برچسبدار محدود یا بدون برچسب کاربرد دارد. روشهای موجود SSL عمدتاً از پارادایمهای تقابلی یا مولد پیروی میکنند که هر کدام در وظایف مختلفی برتری دارند…
آموزش منظمسازیشده مدلهای زبانی نزدیکترین همسایه
۱۷ اوت ۲۰۲۲ – حوزه پژوهشی: پردازش زبان طبیعی و گفتار (کارگاه NAACL)
افزودن بانکهای حافظه به معماری پردازش زبان طبیعی (NLP)، ظرفیت مدل را با تجهیز آن به دادههای اضافی در زمان استنتاج (Inference Time) افزایش میدهد. در این مقاله، ما بر پایه kNN-LM کار میکنیم که از یک مدل زبانی پیشآموختهشده همراه با جستجوی جامع kNN در دادههای آموزشی (بانک حافظه) برای دستیابی به پیشرفتهترین نتایج استفاده میکند. ما بررسی میکنیم که آیا میتوان با آموزش یک مدل زبانی همراه با دانش موجود، عملکرد kNN-LM را بهبود بخشید یا خیر.
فرصتها را در حوزه یادگیری ماشین کشف کنید. پژوهشهای ما در یادگیری ماشین هر روز مرزهای جدیدی را میشکند.