> For the complete documentation index, see [llms.txt](https://hci-project.gitbook.io/reinforcement-learning-of-n-puzzle/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://hci-project.gitbook.io/reinforcement-learning-of-n-puzzle/master.md).

# 강화학습 기본 개념

## Notation

![](/files/-LsixhGQxEQp-d7S0gRK)

### Markov Decision Process

마르코프 결정 과정은 유한 상태의 집합에서 정의된다. 유한하지 않으면 은닉 마르코프 결정이라고 한다.

![Markov Chain reward process](/files/-Lsix6WCxdfTchMJDGZZ)

![](/files/-Lsr4eu4QbjEe2CEHf3w)

### Value functions

#### State value function

![](/files/-LsjcXlSlByJJ4waCHJ8)

#### Action value function

![](/files/-LsjcmGzI1q5aClqMzi3)

### Optimal Value Function

![Optimal Value Function](/files/-Lsjf-hfpFq51C4VMdrq)

그렇다면 어떻게 슬라이딩 퍼즐에 이 문제를 적용할 수 있을까?
