Planejamento probabilístico como busca num espaço de transição de estados

Um dos modelos mais usados para descrever problemas de planejamento probabilístico, i.e., planejamento de ações com efeitos probabilísticos, é o processo de decisão markoviano (Markov Decision Process - MDP). Soluções tradicionais são baseadas em programação dinâmica, sendo as mais ecientes aque...

Full description

Bibliographic Details
Main Author:	Daniel Javier Casani Delgado
Other Authors:	Leliane Nunes de Barros
Language:	Portuguese
Published:	Universidade de São Paulo 2013
Subjects:	Busca em grafos AND/OR com transições probabilísticas Planejamento probabilístico Programação Dinâmica em Tempo Real Probabilistic planning Real-Time Dynamic Programming Search in graphs AND/OR with probabilistic transitions
Online Access:	http://www.teses.usp.br/teses/disponiveis/45/45134/tde-04062013-060258/

id	ndltd-IBICT-oai-teses.usp.br-tde-04062013-060258
record_format	oai_dc
spelling	ndltd-IBICT-oai-teses.usp.br-tde-04062013-0602582019-01-21T22:04:18Z Planejamento probabilístico como busca num espaço de transição de estados Probabilistic planning as search within transition state-space. Daniel Javier Casani Delgado Leliane Nunes de Barros Silvio do Lago Pereira Valdinei Freire da Silva Busca em grafos AND/OR com transições probabilísticas Planejamento probabilístico Programação Dinâmica em Tempo Real Probabilistic planning Real-Time Dynamic Programming Search in graphs AND/OR with probabilistic transitions Um dos modelos mais usados para descrever problemas de planejamento probabilístico, i.e., planejamento de ações com efeitos probabilísticos, é o processo de decisão markoviano (Markov Decision Process - MDP). Soluções tradicionais são baseadas em programação dinâmica, sendo as mais ecientes aquelas baseadas em programação dinâmica em tempo real (Real-Time Dynamic Programming - RTDP), por explorarem somente os estados alcançáveis a partir de um dado estado inicial. Por outro lado, existem soluções ecientes baseadas em métodos de busca heurística em um grafo AND/OR, sendo que os nós AND representam os efeitos probabilísticos das ações e os nós OR representam as escolhas de ações alternativas. Tais soluções também exploram somente estados alcançáveis a partir de um estado inicial porém, guardam um subgrafo solução parcial e usam programação dinâmica para a atualização do custo dos nós desse subgrafo. No entanto, problemas com grandes espaços de estados limitam o uso prático desses métodos. MDPs fatorados permitem explorar a estrutura do problema, representando MDPs muito grandes de maneira compacta e assim, favorecer a escalabilidade das soluções. Neste trabalho, apresentamos uma análise comparativa das diferentes soluções para MDPs, com ênfase naquelas que fazem busca heurística e as comparamos com soluções baseadas em programação dinâmica assíncrona, consideradas o estado da arte das soluções de MPDs. Além disso, propomos um novo algoritmo de busca heurística para MDPs fatorados baseado no algoritmo ILAO* e o testamos nos problemas da competição de planejamento probabilístico IPPC-2011. One of the most widely used models to describe probabilistic planning problems, i.e., planning of actions with probabilistic eects, is the Markov Decision Process - MDP. The traditional solutions are based on dynamic programming, whereas the most ecient solutions are based on Real-Time Dynamic Programming - RTDP, which explore only the reachable states from a given initial state. Moreover, there are ecient solutions based on search methods in a AND/OR graph, where AND nodes represent the probabilistic eects of an action and OR nodes represent the choices of alternative actions. These solutions also explore only reachable states but maintain the parcial subgraph solution, using dynamic programming for updating the cost of nodes of these subgraph. However, problems with large state spaces limit the practical use of these methods. Factored representation of MDPs allow to explore the structure of the problem, and can represent very large MDPs compactly and thus improve the scalability of the solutions. In this dissertation, we present a comparative analysis of dierent solutions for MDPs, with emphasis on heuristic search methods. We compare the solutions which are based on asynchronous dynamic programming which are also considered the state of the art. We also propose a new factored algorithm based on the search algorithm ILAO*. It is also tested by using the problems of the International Probabilistic Planning Competition IPPC-2011. 2013-02-04 info:eu-repo/semantics/publishedVersion info:eu-repo/semantics/masterThesis http://www.teses.usp.br/teses/disponiveis/45/45134/tde-04062013-060258/ por info:eu-repo/semantics/openAccess Universidade de São Paulo Ciência da Computação USP BR reponame:Biblioteca Digital de Teses e Dissertações da USP instname:Universidade de São Paulo instacron:USP
collection	NDLTD
language	Portuguese
sources	NDLTD
topic	Busca em grafos AND/OR com transições probabilísticas Planejamento probabilístico Programação Dinâmica em Tempo Real Probabilistic planning Real-Time Dynamic Programming Search in graphs AND/OR with probabilistic transitions
spellingShingle	Busca em grafos AND/OR com transições probabilísticas Planejamento probabilístico Programação Dinâmica em Tempo Real Probabilistic planning Real-Time Dynamic Programming Search in graphs AND/OR with probabilistic transitions Daniel Javier Casani Delgado Planejamento probabilístico como busca num espaço de transição de estados
description	Um dos modelos mais usados para descrever problemas de planejamento probabilístico, i.e., planejamento de ações com efeitos probabilísticos, é o processo de decisão markoviano (Markov Decision Process - MDP). Soluções tradicionais são baseadas em programação dinâmica, sendo as mais ecientes aquelas baseadas em programação dinâmica em tempo real (Real-Time Dynamic Programming - RTDP), por explorarem somente os estados alcançáveis a partir de um dado estado inicial. Por outro lado, existem soluções ecientes baseadas em métodos de busca heurística em um grafo AND/OR, sendo que os nós AND representam os efeitos probabilísticos das ações e os nós OR representam as escolhas de ações alternativas. Tais soluções também exploram somente estados alcançáveis a partir de um estado inicial porém, guardam um subgrafo solução parcial e usam programação dinâmica para a atualização do custo dos nós desse subgrafo. No entanto, problemas com grandes espaços de estados limitam o uso prático desses métodos. MDPs fatorados permitem explorar a estrutura do problema, representando MDPs muito grandes de maneira compacta e assim, favorecer a escalabilidade das soluções. Neste trabalho, apresentamos uma análise comparativa das diferentes soluções para MDPs, com ênfase naquelas que fazem busca heurística e as comparamos com soluções baseadas em programação dinâmica assíncrona, consideradas o estado da arte das soluções de MPDs. Além disso, propomos um novo algoritmo de busca heurística para MDPs fatorados baseado no algoritmo ILAO* e o testamos nos problemas da competição de planejamento probabilístico IPPC-2011. === One of the most widely used models to describe probabilistic planning problems, i.e., planning of actions with probabilistic eects, is the Markov Decision Process - MDP. The traditional solutions are based on dynamic programming, whereas the most ecient solutions are based on Real-Time Dynamic Programming - RTDP, which explore only the reachable states from a given initial state. Moreover, there are ecient solutions based on search methods in a AND/OR graph, where AND nodes represent the probabilistic eects of an action and OR nodes represent the choices of alternative actions. These solutions also explore only reachable states but maintain the parcial subgraph solution, using dynamic programming for updating the cost of nodes of these subgraph. However, problems with large state spaces limit the practical use of these methods. Factored representation of MDPs allow to explore the structure of the problem, and can represent very large MDPs compactly and thus improve the scalability of the solutions. In this dissertation, we present a comparative analysis of dierent solutions for MDPs, with emphasis on heuristic search methods. We compare the solutions which are based on asynchronous dynamic programming which are also considered the state of the art. We also propose a new factored algorithm based on the search algorithm ILAO*. It is also tested by using the problems of the International Probabilistic Planning Competition IPPC-2011.
author2	Leliane Nunes de Barros
author_facet	Leliane Nunes de Barros Daniel Javier Casani Delgado
author	Daniel Javier Casani Delgado
author_sort	Daniel Javier Casani Delgado
title	Planejamento probabilístico como busca num espaço de transição de estados
title_short	Planejamento probabilístico como busca num espaço de transição de estados
title_full	Planejamento probabilístico como busca num espaço de transição de estados
title_fullStr	Planejamento probabilístico como busca num espaço de transição de estados
title_full_unstemmed	Planejamento probabilístico como busca num espaço de transição de estados
title_sort	planejamento probabilístico como busca num espaço de transição de estados
publisher	Universidade de São Paulo
publishDate	2013
url	http://www.teses.usp.br/teses/disponiveis/45/45134/tde-04062013-060258/
work_keys_str_mv	AT danieljaviercasanidelgado planejamentoprobabilisticocomobuscanumespacodetransicaodeestados AT danieljaviercasanidelgado probabilisticplanningassearchwithintransitionstatespace
_version_	1718890275944792064

Planejamento probabilístico como busca num espaço de transição de estados

Similar Items