أطلقت جوجل نموذجي Gemini 3.8 Live وGemini 3.8 Live Extended Thinking، موفرةً نموذجين حواريين تم تصميمهما لتجاوز مشكلات الاستجابة البطيئة وفترات التوقف الصامتة أثناء التفاعل الصوتي مع أنظمة الذكاء الاصطناعي.
وجاء الإعلان عبر توم أويانغ، كبير المهندسين، والباحثة ماليني جاغاناثان، نيابة عن فريق الصوتيات في Gemini، حيث يستهدف الإصداران الجمع بين مرونة المحادثة اليومية والقدرات الحوسبية المتقدمة.
يركز نموذج Gemini 3.8 Live القياسي على الكفاءة التشغيلية والقدرة العالية على التوسع بتكلفة منخفضة، بينما خُصص نموذج Gemini 3.8 Live Extended Thinking للمهام المعقدة متعددة المراحل التي تتطلب تفكيرًا واستدلالًا معمقين.
من الناحية التقنية، تعمل النماذج الجديدة على تشغيل الأدوات البرمجية واستدعاء واجهات البرمجة التطبيقية (API) في الخلفية دون مقاطعة تدفق الحديث. ويستطيع Gemini 3.8 Live معالجة المدخلات المرئية في الوقت الفعلي تقريبًا للإجابة الفورية عن تساؤلات تتعلق بما ترصده الكاميرا مباشرة، فضلاً عن التعرف التلقائي والتحويل السلس بين 97 لغة مدعومة في منتصف الجملة الواحدة.
وفي المهام الحسابية المكثفة، ينفذ طراز Extended Thinking عمليات التفكير المنطقي والحديث الصوتي بالتوازي. فبدلاً من التوقف الصامت أثناء جلب البيانات، يقدم النموذج تنبيهات صوتية طبيعية مثل “دعني أتحقق من ذلك” مصحوبة بسرد شفهي مباشر لخطوات التقدم.
وتضمنت العروض العملية للنموذج تحويل رسومات ورقية مبدئية إلى مكونات برمجية عاملة عبر React، وإدارة حجوزات المطاعم المعقدة عبر استدعاءات برمجية غير متزامنة، إلى جانب توجيه خطوات استكشاف الأعطال وحلها مباشرة داخل محرك بحث جوجل.
وأكد راجان باتيل، نائب رئيس قطاع هندسة البحث، تفعيل Gemini 3.8 Live عالميًا عبر ميزة Search Live، مع بدء توفير مزايا Extended Thinking للمشتركين في الباقات المدفوعة من حزمة Workspace ضمن تطبيقات Docs وGmail وKeep.
وتتيح جوجل النماذج للمطورين عبر واجهة برمجة Gemini Live API من خلال اتصالات WebSocket مستمرة الحالة، حيث تدعم معالجة صوت PCM خام بدقة 16 بت وتردد 16kHz ومدخلات صور JPEG بمعدل يصل إلى إطار واحد في الثانية، لتوليد مخرجات صوتية بدقة 24kHz. ولدواعي السلامة وتتبع المحتوى، زُودت المخرجات الصوتية المولدة آليًا بعلامات SynthID المائية المدمجة غير المحسوسة داخل البث الصوتي مباشرة.