كتبت: إسراء الشامي
كيف يمكن قياس فعالية الذكاء الاصطناعي في التنبؤ بالمستقبل؟ في هذا السياق، قدمت شركة Obside الناشئة تجربة مثيرة كمعيار واقعي لتقييم الذكاء الاصطناعي. بدلاً من الاعتماد على اختبار موحد للذكاء الاصطناعي، قامت الشركة باستخدام نماذج مثل ChatGPT، Gemini، Claude، Grok، Mistral، DeepSeek، وKimi للمراهنة على مباريات كأس العالم باستخدام أسعار Polymarket الحية.
قبل ساعة من بدء المباريات، يدخل كل نموذج في وضع الوكيل، حيث يبحث عن معلومات حول الفرق، الإصابات، وغيرها من المعلومات العامة. بعد ذلك، يحدد كل نموذج مقدار الرهان من رصيده الافتراضي الذي يبلغ 10,000 دولار. وعند مراجعة النتائج بعد نصف النهائي يوم الخميس، تصدر نموذج Mistral، بينما جاء GPT 5.5 من OpenAI في المرتبة الثانية، تلاه نموذج DeepSeek V4. ومن جهة أخرى، احتل نموذج Claude Opus 4.8 المرتبة الأخيرة، ليكون النموذج الوحيد الذي سجل خسائر.
ربما يكون الذكاء الاصطناعي من Anthropic أكثر أخلاقية من أن يكون مقامراً، مما يفسر أدائه المتراجع في هذا السياق. يعتبر هذا التمرين الترفيهي وسيلة فريدة لقياس شيء عجزت عنه الكثير من معايير الذكاء الاصطناعي: الحكم تحت ظروف عدم اليقين. هذا الموضوع قد تم التطرق إليه سابقاً، حيث كتبت عن دخول ChatGPT في مسابقة توقعات سرية نظمتها مجموعة من الاقتصاديين، حيث لم يتمكن من التفوق على متوسط أداء المتسابقين البشر.
تعتبر المراهنة على كرة القدم ليست هي نفس الشيء، لكنها تقدم طريقة ذكية أخرى لاختبار قدرة الذكاء الاصطناعي على تحويل المعلومات المتاحة عبر الإنترنت إلى توقعات مربحة، رغم أن النتائج ما زالت غير معروفة في ذلك الوقت.
تستمر النتائج في التطور، مما يوفر فرصاً جديدة لاختبار وتحليل أداء الذكاء الاصطناعي في مجالات مختلفة. ومع تزايد استخدام نماذج الذكاء الاصطناعي في مجموعة متنوعة من التطبيقات، يمكن أن تلقي هذه التجربة بعض الضوء على كيفية قدرة الذكاء الاصطناعي على التفاعل مع الأحداث العشوائية.
تجربة Obside تعد بمثابة خطوة مبتكرة لفهم كيفية عمل نماذج الذكاء الاصطناعي في بيئات المنافسة الحقيقية. وفي حين أن هناك الكثير من النقاشات حول قدرة الذكاء الاصطناعي على التنبؤ بدقة، تبقى هذه التجربة واحدة من الأقرب لاختبار قدراته في سياقات الحياة الواقعية.
يمكنك قراءة المزيد في المصدر.
لمزيد من التفاصيل اضغط هنا.