> For the complete documentation index, see [llms.txt](https://hci-project.gitbook.io/reinforcement-learning-of-n-puzzle/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://hci-project.gitbook.io/reinforcement-learning-of-n-puzzle/master.md).

# 강화학습 기본 개념

강화학습에 필요한 용어 및 이론 정리. Made by 이승현, 곽수인, 유윤제

## Notation

![](https://2049597759-files.gitbook.io/~/files/v0/b/gitbook-legacy-files/o/assets%2F-Lsa-Uyh66jwfKddkd55%2F-LsiwBiwNzH8SSvTqfOs%2F-LsixhGQxEQp-d7S0gRK%2F1.JPG?alt=media\&token=ab5b627d-9541-4caa-83de-c05fd4049aed)

### Markov Decision Process

마르코프 결정 과정은 유한 상태의 집합에서 정의된다. 유한하지 않으면 은닉 마르코프 결정이라고 한다.

![Markov Chain reward process](https://2049597759-files.gitbook.io/~/files/v0/b/gitbook-legacy-files/o/assets%2F-Lsa-Uyh66jwfKddkd55%2F-LsiwBiwNzH8SSvTqfOs%2F-Lsix6WCxdfTchMJDGZZ%2F1.JPG?alt=media\&token=f54ed729-35a2-4c2d-b316-6841f3d62344)

![](https://2049597759-files.gitbook.io/~/files/v0/b/gitbook-legacy-files/o/assets%2F-Lsa-Uyh66jwfKddkd55%2F-Lsr4dXk6uPG1mHKZ-qH%2F-Lsr4eu4QbjEe2CEHf3w%2Fimage.png?alt=media\&token=5528c60d-5765-4f8b-a689-4a7747826e82)

### Value functions

#### State value function

![](https://2049597759-files.gitbook.io/~/files/v0/b/gitbook-legacy-files/o/assets%2F-Lsa-Uyh66jwfKddkd55%2F-LsjbguUzAkqERxU74u5%2F-LsjcXlSlByJJ4waCHJ8%2Fimage.png?alt=media\&token=75be003a-244a-4b1c-aa67-95c2805bf1b5)

#### Action value function

![](https://2049597759-files.gitbook.io/~/files/v0/b/gitbook-legacy-files/o/assets%2F-Lsa-Uyh66jwfKddkd55%2F-LsjbguUzAkqERxU74u5%2F-LsjcmGzI1q5aClqMzi3%2Fimage.png?alt=media\&token=d5418437-bba8-4cf4-b532-008ec77d3dd9)

### Optimal Value Function

![Optimal Value Function](https://2049597759-files.gitbook.io/~/files/v0/b/gitbook-legacy-files/o/assets%2F-Lsa-Uyh66jwfKddkd55%2F-LsjbguUzAkqERxU74u5%2F-Lsjf-hfpFq51C4VMdrq%2Fimage.png?alt=media\&token=d6aea4a3-f6b8-4bbf-a579-5137406b9bae)

그렇다면 어떻게 슬라이딩 퍼즐에 이 문제를 적용할 수 있을까?
