تتوسع غوغل في تطوير تقنيات الذكاء الاصطناعي الصوتية ضمن نماذج Gemini، مع طرح تحديثات جديدة تمنح النظام قدرة أكبر على إنتاج أصوات تبدو أقرب إلى الأداء البشري، سواء من حيث النبرة واللهجة وسرعة الكلام أو التعبير عن المشاعر والتوقفات والضحك والتنهد وحتى الهمس.
وتأتي هذه الإمكانات ضمن عائلة Gemini 3.8، التي بدأت مع نموذج Gemini 3.8 Flash، قبل أن تنضم إليها نماذج Live وLive Extended Thinking، وصولًا إلى Gemini 3.8 Flash TTS وFlash-Lite TTS المخصصين لتحويل النصوص إلى كلام.
ويتيح Gemini 3.8 Flash TTS للمستخدم إنشاء صوت انطلاقًا من وصف مكتوب باللغة الطبيعية، مع دعم أكثر من 100 لغة ولهجة. كما توفر غوغل أكثر من 2000 صوت جاهز للاستخدام في الإنتاج، إلى جانب إمكانية استنساخ صوت بالاعتماد على عينة لا تتجاوز 30 ثانية، شريطة الحصول على الموافقة اللازمة من صاحب الصوت.
ولا تقتصر قدرات النماذج الجديدة على قراءة النصوص، إذ يمكن توجيهها بتعليمات دقيقة تحدد طريقة إلقاء كل سطر، بما في ذلك النبرة والإيقاع واللهجة وسرعة الحديث، فضلًا عن الهمس والضحك والتنهدات وغيرها من المؤثرات الصوتية المرتبطة بالأداء. كما يستطيع النظام إنشاء حوارات بين شخصين انطلاقًا من نص واحد، مع الحفاظ على هوية الأصوات وثباتها حتى في التسجيلات الممتدة لساعات.
وتفتح هذه التقنيات الباب أمام مجموعة واسعة من الاستخدامات، تشمل إنتاج البودكاست والكتب الصوتية والدبلجة والمقاطع المصورة المروية، إضافة إلى تطوير الوكلاء الصوتيين، مع محاولة تقليص السمات الآلية التي غالبًا ما ترتبط بالأصوات المولدة بالذكاء الاصطناعي.
وأظهرت اختبارات أجرتها غوغل نتائج متقدمة للنماذج الجديدة؛ إذ تصدر Gemini 3.8 Flash TTS الترتيب العام في اختبار Voice Design Benchmark التابع لشركة Hume AI، وسجل 60.8 نقطة في فئة اللهجات. كما احتل نموذجا Flash وFlash-Lite المركزين الأول والثاني في مؤشر الجودة العام لدى Hume، فيما أظهرت اختبارات Voice Arena نتائج وضعت النموذجين في الصدارة أو بالقرب منها عبر لغات متعددة.
ورغم ذلك، لم يتفوق نموذجا غوغل في جميع الاختبارات، إذ حققت ElevenLabs نتائج أعلى في اختبارات Hume المرتبطة بجودة الصوت الفردي ومدى التنوع الذي يحاكي الأصوات البشرية.
وبدأت غوغل كذلك إدخال هذه القدرات إلى بعض خدماتها، مع طرح Flash TTS داخل تطبيق Gemini Notebook، بينما يصل Flash-Lite TTS إلى Google Vids، بالتزامن مع توسيع نطاق إتاحة مولد الفيديو Omni داخل الخدمة. أما المطورون، فيمكنهم استخدام النموذجين عبر Gemini API وAI Studio.
ومع اتساع إمكانات استنساخ الأصوات، أضافت غوغل مجموعة من إجراءات الحماية للحد من إساءة الاستخدام، من بينها اشتراط التحقق من امتلاك المستخدم موافقة صاحب الصوت قبل استنساخه، إلى جانب استخدام تقنية SynthID للعلامات المائية وبيانات اعتماد C2PA للمساعدة في التعرف على المحتوى الذي جرى توليده بالذكاء الاصطناعي.
وفي المقابل، لا تتوفر ميزة استنساخ الأصوات داخل AI Studio في عدد من المناطق، من بينها المملكة المتحدة والمنطقة الاقتصادية الأوروبية والهند وولايتي تكساس وإلينوي في الولايات المتحدة، ضمن القيود التي تفرضها الشركة على هذه التقنية.
وبهذه التحديثات، تنتقل أدوات تحويل النص إلى كلام في Gemini إلى مستوى أكثر تطورًا، إذ لا تكتفي بتحويل الكلمات المكتوبة إلى صوت، بل تمنح المستخدم قدرة أكبر على تحديد الطريقة التي تُقال بها الجمل، وصولًا إلى تفاصيل دقيقة ترتبط بالأداء والإيقاع والمشاعر.

