Reinforcement learning (učenie odmenou) je prístup strojového učenia, pri ktorom sa model, nazývaný agent, učí optimálne správanie metódou pokus-omyl na základe odmien a trestov za jednotlivé rozhodnutia v danom prostredí. Používa sa napríklad pri hraní hier, riadení robotov, ale aj pri doladení jazykových modelov podľa spätnej väzby od ľudí (RLHF), čo pomáha modelom lepšie zodpovedať skutočným preferenciám používateľov.