انتشار مدل‌های صوتی Gemini 3.8 Live گوگل و امکان پیاده‌سازی بدون کتابخانه با WebSockets

انتشار مدل‌های صوتی Gemini 3.8 Live گوگل و امکان پیاده‌سازی بدون کتابخانه با WebSockets

گوگل به تازگی دو مدل جدید گفتار به گفتار (speech-to-speech) به نام‌های Gemini 3.8 Live و Gemini 3.8 Live Extended Thinking را منتشر کرده است. این مدل‌ها از نظر ساختار و کارکرد شباهت زیادی به خانواده GPT-Live شرکت OpenAI دارند و امکان مکالمه صوتی مستقیم و بلادرنگ را فراهم می‌سازند.

جزئیات فنی و نحوه اتصال به مدل‌های جدید

بر اساس گزارش سایمون ویلیسون (Simon Willison)، توسعه‌دهنده نرم‌افزار، این مدل‌ها قابلیت قطع کردن صحبت هوش مصنوعی (interrupt) در حین گفتگو را دارند. ویلیسون با استفاده از مدل هوش مصنوعی GPT-6 Astra Extra High یک رابط کاربری تحت وب برای آزمایش این مدل‌های جدید طراحی کرده است که بدون نیاز به هیچ کتابخانه جانبی کار می‌کند.

این پیاده‌سازی مستقیماً به نقطه پایانی WebSocket گوگل به آدرس wss://generativelanguage.googleapis.com/ws/google.ai.generativelanguage.v1alpha.GenerativeService.BidiGenerateContent متصل می‌شود و برای ضبط و پخش صدا در مرورگر، از Web Audio API و قابلیت AudioContext استفاده می‌کند. این رویکرد نشان می‌دهد توسعه‌دهندگان می‌توانند بدون درگیر شدن با کتابخانه‌های سنگین، ارتباط صوتی دوطرفه با مدل‌های جدید Gemini برقرار کنند.