C Conferentia Proceedings
CBA2016-0885 Sistemas Inteligentes

Aplicação de máquinas de vetor suporte on-line em algoritmos de iteração de política para aprendizado por reforço

Hugo Tanzarella Teixeira1; Celso Pascoli Bottura1

1 Unicamp

Baixar PDF

Resumo

Neste trabalho é apresentado um algoritmo de iteração de política com máquina de vetor suporte (osvrPI) para controle de sistemas não lineares em que a dinâmica do sistema é desconhecida. A aplicação do algoritmo osvrPI permite encontrar políticas ótimas, ou quase-ótimas, sem que haja conhecimento a priori do modelo da dinâmica do sistema a ser controlado. O algoritmo usa um algoritmo de diferenças temporais com máquinas de vetor suporteon-line (osvrTD-Q) para realizar a etapa de avaliação de política. O uso das máquinas de vetor suporte traz uma melhoria na capacidade de generalização associada à sua característica de tornar a solução esparsa. O algoritmo proposto é testado em uma cadeia de Markov estocástica, problema típico de aprendizado por reforço.

Palavras-chave: Aprendizado de Máquina; Aprendizado por Reforço; Iteração de Política; Aproximação da Função Valor; Máquina de Vetor Suporte Online

Como citar

Hugo Tanzarella Teixeira; Celso Pascoli Bottura. “Aplicação de máquinas de vetor suporte on-line em algoritmos de iteração de política para aprendizado por reforço”. XXI Congresso Brasileiro de Automática. CBA2016. 2016. Código: CBA2016-0885