التعلّم المعزّز القائم على النموذج (Model-Based Reinforcement Learning) هو أسلوب في الذكاء الاصطناعي يتعلّم فيه النظام نموذجاً للبيئة يساعده على التنبؤ بما قد يحدث نتيجة أفعاله، ثم يستخدم هذه التنبؤات للتخطيط واختيار الأفعال الأفضل.
مثال: روبوت يتعلم قيادة سيارة. بدلاً من تجربة كل حركة فعلياً، يتعلم نموذجاً يتنبأ بما يلي: إذا أدرت المقود بهذا المقدار وزدت السرعة، فكيف ستتحرك السيارة؟ ثم يستخدم هذه التنبؤات لاختيار الحركة الأنسب.
لذلك يمكن تلخيصه بأنه: التعلّم بالتجربة + بناء نموذج للبيئة + التخطيط باستخدام هذا النموذج.
ومن أهم ميزاته أنه قد يحتاج إلى تجارب فعلية أقل من التعلّم المعزّز القائم على التجربة المباشرة فقط، لأنه يستطيع إجراء بعض التجارب والتنبؤات داخل النموذج. لكن أداءه يعتمد بدرجة كبيرة على مدى دقة النموذج الذي يتعلمه للبيئة.
ملاحظة: المقصود ببناء نموذج للبيئة هو أن يتعلم النظام قواعد تقريبية تصف كيف تتغير البيئة عندما يقوم بفعل معين. بعبارة أبسط، يتعلم الإجابة عن سؤال: إذا كنت في هذه الحالة وفعلت هذا، فماذا سيحدث؟
مثلاً، في روبوت يقود سيارة، يمكن أن يتعلم نموذجاً مثل:
إذا كانت السيارة تسير بسرعة 50 كم/س وأدرت المقود قليلاً → ستتجه السيارة تدريجياً إلى اليمين.
إذا ضغطت على المكابح ستنخفض السرعة.
إذا كان الطريق زلقاً ستكون استجابة السيارة للمقود والمكابح مختلفة.
إذن النموذج ليس صورة للبيئة، بل هو مجموعة من العلاقات أو القواعد التي تمكّن النظام من التنبؤ بانتقال البيئة من حالة إلى حالة نتيجة فعل معين.

You must be logged in to post a comment.