Aplicação de máquinas de vetor suporte on-line em algoritmos de iteração de política para aprendizado por reforço
Hugo Tanzarella Teixeira1; Celso Pascoli Bottura1
1 Unicamp
Resumo
Neste trabalho é apresentado um algoritmo de iteração de política com máquina de vetor suporte (osvrPI) para controle de sistemas não lineares em que a dinâmica do sistema é desconhecida. A aplicação do algoritmo osvrPI permite encontrar políticas ótimas, ou quase-ótimas, sem que haja conhecimento a priori do modelo da dinâmica do sistema a ser controlado. O algoritmo usa um algoritmo de diferenças temporais com máquinas de vetor suporteon-line (osvrTD-Q) para realizar a etapa de avaliação de política. O uso das máquinas de vetor suporte traz uma melhoria na capacidade de generalização associada à sua característica de tornar a solução esparsa. O algoritmo proposto é testado em uma cadeia de Markov estocástica, problema típico de aprendizado por reforço.
Palavras-chave: Aprendizado de Máquina; Aprendizado por Reforço; Iteração de Política; Aproximação da Função Valor; Máquina de Vetor Suporte Online