تقارير أصلية مع ذكر المصادر دائمًا

الذكاء الاصطناعي يهزم بطل لعبة "ستراتيجو" التاريخي باستخدام بنية شبكة عصبية مزدوجة

تمكن نموذج ذكاء اصطناعي جديد من التغلب على أفضل لاعب بشري في تاريخ لعبة "ستراتيجو" بميزانية منخفضة، وذلك باستخدام شبكة عصبية ثانوية مخصصة للتنبؤ بالقطع المخفية.

The Global Wire Newsroom ·

Link preview · horizonglobalnews.com

الذكاء الاصطناعي يهزم بطل لعبة "ستراتيجو" التاريخي باستخدام بنية شبكة عصبية مزدوجة

تمكن نموذج ذكاء اصطناعي جديد من التغلب على أفضل لاعب بشري في تاريخ لعبة "ستراتيجو" بميزانية منخفضة، وذلك باستخدام شبكة عصبية ثانوية مخصصة للتنبؤ بالقطع المخفية.

Share

تُرجم هذا المقال آليًا بواسطة الذكاء الاصطناعي في غرفة أخبارنا عن الأصل الإنجليزي. اقرأ بالإنجليزية

الذكاء الاصطناعي يهزم بطل لعبة "ستراتيجو" التاريخي باستخدام بنية شبكة عصبية مزدوجة

حقق الذكاء الاصطناعي إنجازاً تاريخياً في مجال اتخاذ القرارات المعقدة بالتغلب على اللاعب البشري الأعلى تصنيفاً في تاريخ لعبة "ستراتيجو" (Stratego)، معتمداً على ميزانية حوسبة منخفضة نسبياً. ووفقاً لتقرير أعده ياتسيك كريفكو (Jacek Krywko)، تحقق هذا الإنجاز بفضل تقديم شبكة عصبية ثانوية مخصصة صُممت خصيصاً لاستنتاج هوية قطع الخصم المخفية. ومن خلال الفصل بين التخطيط الاستراتيجي واستنتاج المعلومات المخفية، حلّ النظام واحدة من أصعب التحديات في نظرية الألعاب—وهي التعامل مع حالة عدم اليقين الشديدة والخداع دون الحاجة إلى موارد حاسوبية ضخمة. ويشكل هذا الإنجاز تحولاً رئيسياً في أبحاث الذكاء الاصطناعي نحو الكفاءة الهيكلية الموجهة في بيئات المعلومات غير الكاملة.

## حقائق رئيسية - تغلب نموذج ذكاء اصطناعي على أرفع لاعب بشري تصنيفاً في تاريخ لعبة ستراتيجو، وفقاً لتقرير أعده ياتسيك كريفكو (Jacek Krywko). - يستخدم النظام شبكة عصبية ثانوية مخصصة بالكامل للتنبؤ بهويات ورتب قطع الخصم غير المرئية. - تتمتع لعبة ستراتيجو بتعقيد في شجرة اللعبة يصل إلى نحو 10^535، وهو ما يتجاوز بكثير فضاء حالات الشطرنج (10^123) ولعبة غو (10^360). - وصل الذكاء الاصطناعي إلى قدرات تضاهي أبطال العالم بميزانية حوسبة محدودة، مما يتناقض مع معايير الذكاء الاصطناعي السابقة التي تطلبت موارد ضخمة. - وعلى عكس ألعاب اللوحة التقليدية ذات المعلومات الكاملة، تتطلب ستراتيجو من الأنظمة اتخاذ القرارات في ظل رؤية جزئية والمناورة والمعلومات غير المكتملة.

## ماذا حدث اعتمد تطوير الذكاء الاصطناعي الخاص بالألعاب تاريخياً على ركيزتين أساسيتين: أشجار البحث الشاملة للألعاب ذات المعلومات الكاملة مثل الشطرنج، والتقريبات التوافقية بنظرية الألعاب للألعاب ذات المعلومات غير الكاملة مثل البوكر. وتجمع لعبة ستراتيجو بين أصعب تحديات كلا المجالين؛ إذ تتميز برقعة شبكية كبيرة بأبعاد 10 في 10، و40 قطعة لكل لاعب، ونشر أولي سري للقطع، وضبابية حرب مستمرة.

ووفقاً لتقرير أعده ياتسيك كريفكو (Jacek Krywko)، يكمن الاختراق التقني الحاسم وراء الذكاء الاصطناعي الجديد للعبة ستراتيجو في تطبيق نظام شبكة عصبية مزدوجة. ففي التعلم المعزز القياسي، غالباً ما تُكلف شبكة عصبية واحدة بتقييم مواضع الرقعة، وتنفيذ المناورات التكتيكية، وتقدير الاحتمالات المتعلقة بوحدات الخصم المخفية في الوقت نفسه. وتجبر هذه المقاربة الموحدة النموذج على معالجة توزيعات احتمالية ضخمة، مما يتطلب موارد حوسبة هائلة للتعلم بفاعلية.

يقسّم النظام الجديد هذه المسؤوليات. فتتولى الشبكة الأساسية التخطيط التكتيكي وخيارات الحركة. وتعمل إلى جانبها شبكة عصبية ثانوية تعمل حصرياً كمحرك استنتاج—أي كمقدّر مخصص لـ "حالة الاعتقاد". ومع تقدم اللعبة، توفر كل حركة يقوم بها الخصم أدلة خفية حول الهوية المخفية للقطعة. على سبيل المثال، تؤدي القطعة التي تتحرك بسرعة عبر مربعات مفتوحة متعددة إلى الكشف عن كونها كشافاً (Scout)، بينما قد تكون القطعة الثابتة في الصف الخلفي قنبلة (Bomb) أو العلم (Flag). ومن خلال تحليل مسارات الحركة ونتائج القتال، تقوم الشبكة الثانوية بتحديث مصفوفة الاحتمالات باستمرار لكل قطعة مخفية على الرقعة.

يُمرَّر "حالة الاعتقاد" المستنتجة هذه مباشرة إلى شبكة اتخاذ القرار الأساسية. ومن خلال إسناد استنتاج القطع المخفية إلى وحدة فرعية متخصصة، يقلل الذكاء الاصطناعي بشكل كبير من التعقيد الرياضي المطلوب أثناء اختيار الحركة، مما يتيح أداءً رفيع المستوى بميزانية محدودة.

## لماذا يكتسب هذا الإنجاز أهمية يمثل الفوز في لعبة ستراتيجو تحولاً جوهرياً في كيفية تعامل الذكاء الاصطناعي مع حالة عدم اليقين في العالم الحقيقي. وفي حين أظهرت محطات تاريخية مثل فوز نظام Deep Blue التابع لشركة IBM على غاري كاسباروف في عام 1997 أو هزيمة نظام AlphaGo التابع لشركة DeepMind لـ لي سيدول في عام 2016 قدرات الآلة في بيئات المعلومات الكاملة، فإن تحديات العالم الحقيقي نادراً ما توفر رؤية كاملة. ففي الأسواق المالية، والاستراتيجية العسكرية، والأمن السيبراني، ومفاوضات العقود، يتعين على متخذي القرار التصرف بناءً على بيانات غير مكتملة مع توقع خداع الخصم.

وتحظى لعبة ستراتيجو باعتراف واسع بين علماء الكمبيوتر باعتبارها واحدة من أهم بيئات الاختبار لاتخاذ القرار في ظل عدم اليقين. فمع وجود 40 قطعة لكل طرف وتعقيد في شجرة اللعبة يُقدّر بـ 10^535—مقارنة بـ 10^123 للشطرنج و10^360 للعبة غو—تقدم اللعبة عدداً فلكياً من تكوينات الحالات. فضلاً عن ذلك، ونظراً لأن رتب القطع تظل مخفية حتى حدوث القتال، فإن اللعبة تتطلب إدارة المخاطر، وجمع المعلومات، والمناورة.

وإن إثبات إمكانية تحقيق أداء بمستوى عالمي من خلال بنية نمطية واقتصادية يحمل آثاراً عملية كبيرة. فغالباً ما تكلف تدريبات الذكاء الاصطناعي فائقة التطور ملايين الدولارات في البنية التحتية للحوسبة. ومن خلال إظهار أن شبكة ثانوية متخصصة يمكنها حل المتغيرات المخفية بفاعلية، يقدم هذا البحث مخططاً لنماذج ذكاء اصطناعي خفيفة الوزن. ويمكن للتطبيقات الصناعية—مثل الملاحة الذاتية للطائرات المسيرة في بيئات محجوبة الحساسات، والتداول الخوارزمي في ظل المعلومات غير المتماثلة، واكتشاف التهديدات الشبكية—الاستفادة من الاستنتاج المزدوج للشبكات لاتخاذ قرارات سريعة دون الحاجة إلى أجهزة سحابية للمؤسسات.

## الخلفية التاريخية لطالما شكل تاريخ الذكاء الاصطناعي في الألعاب معياراً رئيسياً للتقدم الحوسبي. ففي مايو 1997، هزم نظام Deep Blue لشركة IBM بطل العالم في الشطرنج غاري كاسباروف في مباراة من ست جولات، باستخدام أجهزة مخصصة قيمت 200 مليون موقف على الرقعة في الثانية. وفي مارس 2016، هزم نظام AlphaGo لشركة DeepMind بطل العالم 18 مرة لي سيدول بنتيجة 4-1 في لعبة غو، باستخدام شبكات عصبية عميقة مقترنة ببحث شجرة مونت كارلو.

وتعد كل من الشطرنج وغو ألعاباً ذات معلومات كاملة، حيث يراقب اللاعبون الموقف الدقيق لكل قطعة في جميع الأوقات. وفي وقت لاحق، تحول الاهتمام نحو الألعاب ذات المعلومات غير الكاملة. ففي يوليو 2019، قدمت جامعة كارنيغي ميلون وFacebook AI نظام Pluribus، وهو ذكاء اصطناعي هزم لاعبين محترفين بارزين في لعبة بوكر "تكساس هولدم غير المحدودة" لستة لاعبين باستخدام تقليل الندم المقابل لمونت كارلو.

وظلت ستراتيجو تحدياً أصعب بكثير بسبب جمعها بين الاستراتيجية المكانية على الرقعة والمعلومات المخفية. اخترع اللعبة بصيغتها الحديثة جاك جوهان موغندورف (Jacques Johan Mogendorff) في عام 1946 وتم تسويقها لاحقاً بواسطة Milton Bradley وHasbro. وتضع ستراتيجو لاعبين في مواجهة بعضهما على رقعة شبكية 10 في 10 تضم بحيرتين غير قابلتين للعبور بأبعاد 2 في 2. يتحكم كل لاعب في 40 قطعة: علم واحد، وست قنابل، وجاسوس واحد، وتدرج هرمي من الرتب العسكرية يمتد من الجنرال والمارشال وصولاً إلى المنقبين والكشافة.

وفي ديسمبر 2022، نشرت شركة DeepMind ورقة بحثية في مجلة Science قدمت فيها DeepNash، وهو نظام ذكاء اصطناعي حقق أداءً بمستوى الخبراء البشر في ستراتيجو دون أشجار بحث صريحة. استخدم DeepNash خوارزمية نظرية الألعاب تُدعى "ديناميكيات ناش المنتظمة" (R-NaD) لتعلم سياسة توازن ناش المستقرة من خلال اللعب الذاتي. ورغم أن DeepNash أثبت قدرة الذكاء الاصطناعي على الوصول إلى مستويات الخبراء في ستراتيجو، إلا أن التغلب على أفضل اللاعبين البشر تصنيفاً بميزانية حوسبة محدودة ظل تحدياً مفتوحاً حتى هذا التطور الأخير في الشبكات المزدوجة.

## ردود الفعل أثار الاختراق التقني المُعلن عنه اهتماماً واسعاً في أوساط أبحاث الذكاء الاصطناعي وأوساط الألعاب اللوحية التنافسية. وسلط باحثو علوم الكمبيوتر الضوء على كفاءة بنية الشبكة المزدوجة، مشيرين إلى أن الفصل بين الاستنتاج والتنفيذ الاستراتيجي يحاكي الأطر المعرفية البشرية، حيث تعالج مناطق عصبية متميزة الإدراك الحسي بينما تدير مناطق أخرى التخطيط التنفيذي.

وضمن مجتمع لعبة ستراتيجو التنافسي، يقيّم اللاعبون ومظلمو البطولات تداعيات وجود ذكاء اصطناعي قادر على التغلب باستمرار على كبار الأساتذة البشر. ويعتمد الأساتذة البشر بشكل كبير على التحليل النفسي، وتتبع عادات حركة الخصم، وزرع إشارات زائفة لاستدراج قطع العدو نحو القنابل أو الجواسيس. ويشير الكشف عن أن شبكة عصبية ثانوية يمكنها استنتاج هويات القطع بدقة بناءً على أنماط الحركة السلوكية إلى أن نماذج التعلم الآلي باتت قادرة على تحديد أنماط الخداع البشري بشكل أكثر فاعلية مما كان يُعتقد سابقاً.

كما يقيّم مطورو الذكاء الاصطناعي الصناعي ومحللو الدفاع كيفية تكيف إطار الاستنتاج منخفض الميزانية هذا مع اللوجستيات في الوقت الفعلي، والنظم الذاتية، والمحاكاة الحربية الاستراتيجية حيث تكون بيانات الحساسات غير مكتملة أو متأخرة.

## ما لا نعرفه بعد على الرغم من الاختراق المُعلن، لا تزال عدة تفاصيل محددة تتعلق ببنية النظام ومقاييس الأداء غير مؤكدة في التقرير الذي أعده ياتسيك كريفكو (Jacek Krywko).

أولاً، لم يُكشف صراحة عن الهوية المحددة للاعب البشري الأعلى تصنيفاً الذي هُزم في المباريات الاختيارية، كما لم يُكشف عن إجمالي عدد المباريات الملعوبة أو نسبة الفوز إلى الخسارة الدقيقة التي تحققت خلال سلسلة الاختبارات. ويتطلب قياس أداء الذكاء الاصطناعي المعياري عادةً مئات المباريات الخاضعة للرقابة ضد منافسين متعددين من النخبة لإثبات الأهمية الإحصائية.

ثانياً، لم تُدرج ميزانية الحوسبة الدقيقة ومواصفات الأجهزة المستخدمة لتدريب تشغيل النظام بالكامل. ورغم وصفها بأنها منخفضة التكلفة، فقد أُهملت البيانات الدقيقة التي تفصل ساعات وحدة معالجة الرسومات (GPU)، أو نفقات التدريب، أو استهلاك الطاقة مقارنة بالأنظمة السابقة مثل DeepNash التابع لـ DeepMind في التغطية المتاحة.

أخيراً، لا يزال من غير المعروف ما إذا كان نظام الشبكة المزدوجة يعتمد كلياً على التعلم المعزز باللعب الذاتي أم أنه أدرج قواعد بيانات الألعاب البشرية أثناء مرحلة ما قبل التدريب.

## ما يجب مراقبته - النشر المحكم: ترقب الإصدار الرسمي لورقة بحثية محكمة تفصل بنية الشبكة الكاملة، والكود الخوارزمي، ومعلمات التدريب في مجلة علمية أو مؤتمر. - مقارنة أداء الذكاء الاصطناعي وجهاً لوجه: سيتضمن التقييم الحاسم مواجهات مباشرة بين نموذج الشبكة المزدوجة هذا ومحركات ستراتيجو الحديثة الحالية، بما في ذلك DeepNash التابع لـ DeepMind. - توفر الكود: سيراقب مجتمع المصادر المفتوحة ما إذا كان الباحثون سينشرون أوزان النموذج أو مستودعات الكود البرمجي، مما يتيح التحقق المستقل. - البطولات الاستعراضية: ستؤكد المباريات المستقبلية ضد قائمة أوسع من الأساتذة الكبار وفقاً للقواعد الدولية الرسمية ما إذا كان أداء النظام مستقراً عبر أساليب اللعب المتنوعة. - التكيف مع المجالات الأخرى: سيختبر تطبيق بنية الشبكة المزدوجة في مجالات غير مرتبطة بالألعاب، مثل النمذجة المالية أو الروبوتات متعددة الوكلاء، مدى فائدتها في ظل الضوضاء التشغيلية في العالم الحقيقي.

يستند هذا التقرير إلى التغطية الإخبارية الأصلية التي أعدها ياتسيك كريفكو (Jacek Krywko).

المصدر: Jacek Krywko

أخبار ذات صلة