التعلم المعزز (التعلم بالمكافأة) هو نهج من نُهج التعلم الآلي، حيث يتعلم النموذج — الذي يُسمى «الوكيل» — السلوك الأمثل بطريقة التجربة والخطأ بناءً على المكافآت والعقوبات المترتبة على القرارات الفردية في بيئة معينة. ويُستخدم هذا النهج، على سبيل المثال، في ألعاب الفيديو، والتحكم في الروبوتات، وكذلك في ضبط نماذج اللغة بناءً على ردود الفعل البشرية (RLHF)، مما يساعد النماذج على الاستجابة بشكل أفضل لتفضيلات المستخدمين الفعلية.