رئيس مجلس الإدارة: أحمد همام
|
رئيس التحرير: عادل البكل
العربية
تكنولوجيا

OpenAI تطلق نموذجين جديدين من الذكاء الاصطناعي الصوتي

OpenAI تطلق نموذجين جديدين من الذكاء الاصطناعي الصوتي

كتبت: فاطمة يونس

أعلنت شركة OpenAI عن إطلاق نموذجين جديدين للمحادثات الصوتية يحملان اسم GPT-Live-1 وGPT-Live-1 mini. يهدف هذان النموذجان لتقديم تجربة تفاعلية صوتية أكثر طبيعية، مع تحسين القدرة على إدارة تبادل الأدوار أثناء التحدث.

التقنية المتطورة في GPT-Live

يعتمد النموذجان الجديدان على تقنية Full-Duplex، التي تتيح للمستخدمين التحدث والاستماع في الوقت نفسه. وبفضل هذه التقنية، يمكن للمستخدمين مقاطعة المساعد بشكل طبيعي أثناء المحادثة، مما يعزز سلاسة التفاعل. يدعم النظام أيضًا ميزات مثل الترجمة الفورية المباشرة، وهو ما يتيح تفاعلات متعددة اللغات بشكل فوري.

التحديثات على ChatGPT

أكدت OpenAI أنها ستعتمد نموذج GPT-Live-1 mini كطريقة الصوت الافتراضية الجديدة في ChatGPT، مما يعني استبدال وضع الصوت المتقدم الحالي. بينما سيتمكن مشتركو الخطط المدفوعة من الاستفادة من النموذج الأكبر GPT-Live-1. هذه الخطوة تعكس رؤية الشركة لتحسين تجربة المستخدم ورفع مستوى الأداء.

تحسين تجربة المستخدم

ابتكرت OpenAI نماذج جديدة تقدم تجربة أكثر سلاسة، حيث تستفيد من أحدث نماذجها، مثل GPT-5.5، لتنفيذ عمليات البحث الاستدلالية وتشغيل المهام الوكيلة دون تعطيل مجرى المحادثة. وقد وفرت هذه النماذج حلولاً للعديد من المشكلات التي كانت تعترض النظام الصوتي السابق، مثل مقاطعة المستخدم أثناء حديثه أو عدم القدرة على الإجابة عن الأسئلة المعقدة.

الاستماع والتحليل السياقي

تم تطوير النظام الجديد ليمكنه من الاستماع بصمت لفترات طويلة، بالإضافة إلى استيعاب سياق الحديث قبل الرد عند الحاجة. تسعى OpenAI إلى جعل المحادثات أكثر طبيعية، مما يعكس مستوى عالياً من التطور في قدرات الذكاء الاصطناعي.

التكامل مع نماذج الذكاء الاصطناعي الحديثة

تستطيع النسخة الجديدة ارتباطها بالتقنيات الحديثة، حيث يمكنها عرض معلومات معينة بصيغ مرئية بفضل تكاملها مع نماذج GPT المتقدمة. تسعى الشركة لمواكبة ما تعمل عليه الشركات الناشئة مثل Monogram، والتي تركز على تطوير مساعدين يعتمدون على الاستجابات البصرية لتكون التفاعل أكثر ثراءً.

توجهات مستقبلية في الذكاء الاصطناعي الصوتي

وضعت OpenAI خططًا لدعم المحادثات الطويلة، حيث استطاع المسؤول عن منتج ChatGPT Voice إجراء محادثات استمرت ما بين 30 و40 دقيقة مع الميزة أثناء التنزه. تعتقد الشركة أن الواجهة الصوتية ستصبح الوسيلة الأساسية للتفاعل مع تقنيات الحوسبة، مما يسهل إنجاز المهام المعقدة.

استثمارات المستقبل والتطويرات المقبلة

تمت الإشارة إلى أنه بالرغم من التقارير التي تحدثت عن احتمالية إطلاق سماعات أذن مدعومة بالذكاء الاصطناعي، إلا أن OpenAI لم تكشف بعد عن تفاصيل تتعلق بأجهزة أو منتجات عتادية جديدة. يعكس ذلك التوجه المستقبلي للشركة نحو استثمار مزيد من الوقت في تطوير الميزات الصوتية لتحسين تجربة المحادثات.

النمو المتزايد للذكاء الاصطناعي الصوتي

أوضحت OpenAI أن أكثر من 150 مليون مستخدم يتفاعلون مع ChatGPT عبر ميزات مثل Voice وDictation، مما يدل على النمو المتزايد للاستخدامات الصوتية في الذكاء الاصطناعي. يتوقع أن يصبح الصوت الواجهة الرئيسية لإنجاز مختلف المهام نظراً للتطور المستمر في قدرات وكلاء الذكاء الاصطناعي.

يمكنك قراءة المزيد في المصدر.

لمزيد من التفاصيل اضغط هنا.