Controle Baseado em Dados
Universidade Federal do Pará
Um agente aprende a agir sobre um ambiente por tentativa e erro, maximizando recompensa acumulada — sem que ninguém lhe diga a ação certa.
Um MDP é a tupla \((\mathcal{S}, \mathcal{A}, P, r, \gamma)\): estados, ações, \(P(s'|s,a)\) (transição), \(r(s,a)\) (recompensa), \(\gamma\) (desconto).
Uma política \(\pi(a|s)\) mapeia estados em ações. Objetivo: maximizar \(\mathbb{E}\left[\sum_{k} \gamma^k r(s_k,a_k)\right]\).
Nota
Em controle: \(\mathcal{S}\) é o estado da planta, \(\mathcal{A}\) a entrada, \(-r\) o custo por estágio (Kaelbling et al. 1996).
\(Q^\pi(s,a)\): retorno esperado seguindo \(\pi\) a partir de \((s,a)\).
A política ótima satisfaz (Bellman 1957): \[ Q^\ast(s,a) = \mathbb{E}_{s'}\left[r(s,a) + \gamma \max_{a'} Q^\ast(s',a')\right] \] e \(\pi^\ast(s) = \arg\max_a Q^\ast(s,a)\).
Q-learning (Watkins e Dayan 1992) aprende \(Q^\ast\) só observando transições \((s,a,r,s')\):
\[ Q(s,a) \leftarrow Q(s,a) + \alpha \Big[ r + \gamma \max_{a'} Q(s',a') - Q(s,a) \Big] \]
Para estados contínuos, tabelas viram redes neurais:
No fundo, o mesmo problema (Bertsekas 2019):
| Controle ótimo | RL |
|---|---|
| Custo \(\ell(x,u)\) | Recompensa \(-r(s,a)\) |
| Riccati / HJB | Equação de Bellman |
| Programação dinâmica | Iteração de valor/política |
| LQR | Caso exatamente solúvel |
Para controle contínuo, muito do que RL “descobre” já tem solução fechada na teoria clássica (Recht 2019) — o exemplo a seguir mostra isso.