دیپ‌سیک اولین مدل بینایی بومی خود را با نام V4-Flash-Vision-Exp متن‌باز کرد

دیپ‌سیک اولین مدل بینایی بومی خود را با نام V4-Flash-Vision-Exp متن‌باز کرد

شرکت هوش مصنوعی دیپ‌سیک (DeepSeek) اولین مدل چندوجهی بومی خود را با نام DeepSeek-V4-Flash-Vision-Exp به صورت متن‌باز منتشر کرد. این مدل که در تاریخ ۳۱ اوت تحت مجوز MIT روی پلتفرم Hugging Face قرار گرفته است، برای نخستین بار قابلیت‌های پردازش تصویر را در کنار متن به سری مدل‌های V4 این شرکت اضافه می‌کند.

این انتشار شامل فایل‌های مدل، توکنایزر (Tokenizer)، پیاده‌سازی مرجع کدگذاری پرامپت و یک پیاده‌سازی حداقلی برای استنتاج با PyTorch است که بخش‌هایی مانند انکودر بینایی، ترازکننده (Aligner)، مکانیسم توجه DFlash، لایه مسیریابی مخلوطی از متخصصان (MoE)، فناوری Hyper-Connections و ماژول‌های DSpark را پوشش می‌دهد. دیپ‌سیک این نسخه را به عنوان یک ساختار آزمایشی (Exp) معرفی کرده است، هرچند دسترسی به آن از طریق API دیپ‌سیک از ۲۱ اوت فراهم شده بود.

قابلیت‌ها و عملکرد مدل جدید دیپ‌سیک

قابلیت‌های بینایی این مدل به آن اجازه می‌دهد تا تصاویر را توصیف کند، متن‌های موجود در اسکرین‌شات‌ها را بخواند و نمودارها را تحلیل کند. این مدل از فرمت‌های تصویری JPEG، PNG، GIF و WebP پشتیبانی می‌کند. به گفته دیپ‌سیک، عملکرد این مدل در وظایف صرفاً متنی مانند عامل‌های هوشمند، استدلال و دانش عمومی، هم‌سطح با نسخه استاندارد V4-Flash باقی مانده است. با این حال، در بنچمارک‌های مربوط به عامل‌های هوشمند که نیاز به درک بصری دارند، این مدل بهبود چشمگیری نسبت به V4-Flash نشان داده و توانایی‌های چندوجهی آن به مدل قدرتمند Claude Opus 4.8 نزدیک شده است.

دیپ‌سیک با متن‌باز کردن پشته استنتاج (Inference Stack) در کنار وزن‌های مدل، شرایطی را فراهم کرده تا توسعه‌دهندگان بتوانند به راحتی این مدل را در فریم‌ورک‌ها و ابزارهای مختلف ادغام کنند. این اقدام هزینه استقرار مدل‌های بینایی رقابتی را روی زیرساخت‌های محلی یا استاندارد برای شرکت‌ها و توسعه‌دهندگان به شدت کاهش می‌دهد و همسو با روند کلی صنعت به سمت مدل‌های متن‌باز، مقرون‌به‌صرفه و قابل شخصی‌سازی است.