Aprendizagem por Reforço Inversa
Pontos principais
- A aprendizagem por reforço inversa busca deduzir a função de recompensa a partir de demonstrações.
- Complementa a aprendizagem por reforço tradicional, que assume uma recompensa conhecida.
- Utiliza conceitos de processos de decisão de Markov para modelar o ambiente.
Em inteligência artificial e aprendizagem de máquina, a aprendizagem por reforço inversa (frequentemente associada ao estudo mais amplo da aprendizagem por reforço) investiga como inferir a função de recompensa subjacente a partir do comportamento observado de um agente especialista.

Princípios Fundamentais
Na aprendizagem por reforço tradicional, o agente interage com um ambiente modelado tipicamente como um processo de decisão de Markov para maximizar um sinal de recompensa predefinido. No entanto, em diversos cenários práticos, definir explicitamente essa função de recompensa pode ser uma tarefa complexa ou impraticável.
A abordagem inversa resolve esse problema observando demonstrações de especialistas humanos ou de outros agentes, buscando deduzir quais objetivos ou preferências motivam tais ações.
Perguntas frequentes
O que é aprendizagem por reforço inversa?
É o processo de determinar a função de recompensa de um agente com base na observação de suas ações e comportamento especialista.
Como se relaciona com a aprendizagem por reforço padrão?
Enquanto a aprendizagem por reforço utiliza uma recompensa dada para encontrar uma política ideal, a versão inversa faz o oposto: usa políticas demonstradas para encontrar a recompensa.