شرکت هوش مصنوعی دیپسیک (DeepSeek) اولین مدل چندوجهی بومی خود را با نام DeepSeek-V4-Flash-Vision-Exp به صورت متنباز منتشر کرد. این مدل که در تاریخ ۳۱ اوت تحت مجوز MIT روی پلتفرم Hugging Face قرار گرفته است، برای نخستین بار قابلیتهای پردازش تصویر را در کنار متن به سری مدلهای V4 این شرکت اضافه میکند.
این انتشار شامل فایلهای مدل، توکنایزر (Tokenizer)، پیادهسازی مرجع کدگذاری پرامپت و یک پیادهسازی حداقلی برای استنتاج با PyTorch است که بخشهایی مانند انکودر بینایی، ترازکننده (Aligner)، مکانیسم توجه DFlash، لایه مسیریابی مخلوطی از متخصصان (MoE)، فناوری Hyper-Connections و ماژولهای DSpark را پوشش میدهد. دیپسیک این نسخه را به عنوان یک ساختار آزمایشی (Exp) معرفی کرده است، هرچند دسترسی به آن از طریق API دیپسیک از ۲۱ اوت فراهم شده بود.
قابلیتها و عملکرد مدل جدید دیپسیک
قابلیتهای بینایی این مدل به آن اجازه میدهد تا تصاویر را توصیف کند، متنهای موجود در اسکرینشاتها را بخواند و نمودارها را تحلیل کند. این مدل از فرمتهای تصویری JPEG، PNG، GIF و WebP پشتیبانی میکند. به گفته دیپسیک، عملکرد این مدل در وظایف صرفاً متنی مانند عاملهای هوشمند، استدلال و دانش عمومی، همسطح با نسخه استاندارد V4-Flash باقی مانده است. با این حال، در بنچمارکهای مربوط به عاملهای هوشمند که نیاز به درک بصری دارند، این مدل بهبود چشمگیری نسبت به V4-Flash نشان داده و تواناییهای چندوجهی آن به مدل قدرتمند Claude Opus 4.8 نزدیک شده است.
دیپسیک با متنباز کردن پشته استنتاج (Inference Stack) در کنار وزنهای مدل، شرایطی را فراهم کرده تا توسعهدهندگان بتوانند به راحتی این مدل را در فریمورکها و ابزارهای مختلف ادغام کنند. این اقدام هزینه استقرار مدلهای بینایی رقابتی را روی زیرساختهای محلی یا استاندارد برای شرکتها و توسعهدهندگان به شدت کاهش میدهد و همسو با روند کلی صنعت به سمت مدلهای متنباز، مقرونبهصرفه و قابل شخصیسازی است.