딥러닝 - 알파고의 딥러닝 알고리즘

글 수 203

알파고의 딥러닝 알고리즘

조회 수 5494 추천 수 0 2017.03.12 03:53:17

깊은바다 *.68.247.188 http://aidev.co.kr/864

AlphaGo : AlphaGo Pipeline 헤집기

-> https://shuuki4.wordpress.com/2016/03/11/alphago-alphago-pipeline-%ED%97%A4%EC%A7%91%EA%B8%B0/

AlphaGo의 알고리즘과 모델

-> http://sanghyukchun.github.io/97/

DeepMind에서 발표한 논문

-> https://gogameguru.com/i/2016/03/deepmind-mastering-go.pdf

Deep Q-Network로 오목을 학습하는 딥러닝을 구현하려고 공부하고 있습니다. 알파고 알고리즘을 좀 더 자세히 찾아봤는데 알고보니 여기 사용된 강화학습은 DQN가 아니었습니다.

아타리 게임을 학습하던 DQN은 Q-Learning 방법을 사용합니다. 상태 s에서 행동 a를 했을때 Q(s,a)값이 높은 쪽으로 행동을 결정합니다. 좋은 행동이었을 경우 보상값 r을 받고 보상값을 인접 Q테이블에 조금씩 감소시키며 전파합니다. 계속 반복학습을 통해 전체 상태집합에서 어떤 행동이 가장 좋은 것인지 알 수 있습니다.

알파고에서 구현한 강화학습은 이것과 약간 다릅니다. 어떤 알고리즘이 사용되었는지 간단하게 살펴보겠습니다.

보드게임 인공지능을 위한 대표적인 방법은 미니맥스(Minimax) 알고리즘입니다. 나와 상대방이 번갈아 두는 모든 경우의 수를 구하고 어떤 수가 이길 수 있는 최선인지 검색합니다.

위 그림은 틱택토의 미니맥스 트리인데 이기면 +10, 지면 -10의 평가값을 얻습니다. 트리의 말단 노드까지 검사하여 평가값이 가장 높은 수를 선택합니다.

하지만 바둑은 경우의 수가 천문학적으로 많기 때문에 모든 트리를 검사할 수 없습니다. 그래서 몬테카를로 트리 검색(Monte Carlo Tree Search)라는 방법을 사용합니다. 기본적인 아이디어는 트리의 일부분만 샘플링하여 검색하고 이를 여러번 반복하여 근사치를 얻는 것입니다.

알파고는 MCTS를 기반으로 정책망(Policy Network)와 가치망(Value Network)를 사용합니다. 트리를 샘플링하여 가치를 칠때 최대한 연관이 높은 것을 선택해야 합니다. 바둑에서 다음 수는 보통 이전 수 근처에 있지 멀리 떨어진 곳에 두지 않습니다.

이렇게 좋은 쪽으로 트리를 선택하기 위해서 정책망으로 판단을 하는데 이걸 딥러닝 CNN으로 구현했습니다. 프로기사가 둔 3000만개의 기보를 사용하여 지도학습을 했다고 합니다. 학습된 정책망으로 현재 상태에서 최적의 수를 찾아내고 그쪽 방향으로 계속 검색합니다.

하지만 이런 방법으로는 기보에 없는 새로운 수를 찾을 수 없는 한계가 있습니다. 이를 극복하기 위해 지도학습 정책망과 함께 강화학습 정책망을 이용합니다. 강화학습 정책망은 지도학습 정책망의 가중치를 초기값으로 하여 생성합니다.

그리고 지도학습 정책망끼리 대결을 하여 그 결과에 따라 강화학습 정책망의 가중치를 조정합니다. Q러닝과는 다른 방법으로 직접 가중치를 조정하는데 논문에는 자세한 방법이 나와있지 않습니다.

정책망으로 트리를 선택한 다음에는 가치망으로 좋은 수인지를 평가해야 합니다. 가치망에서도 강화학습을 사용하는데 이것 역시 Q러닝은 아닙니다.

정책망끼리 대결을 하여 승패를 기록하고 이 데이터로 CNN 지도학습을 합니다. (바둑판 상태, 평가값)의 데이터인데 많이 이긴 바둑판의 상태일 경우 높은 평가값을 가집니다.

지도학습 정책망 CNN이 최선의 수를 찾는 분류작업이라면 가치망 CNN은 현재 바둑판의 상태에서 평가값을 예측하는 것이라 할 수 있습니다.

정리하면 알파고에서 사용된 딥러닝은 모두 세가지 입니다.

1. 지도학습 정책망

2. 강화학습 정책망

3. 강화학습 가치망

< 인공지능 개발자 모임 >

- 페이스북 그룹에 가입하시면 인공지능에 대한 최신 정보를 쉽게 받으실 수 있습니다.

- https://www.facebook.com/groups/AIDevKr/

이 게시물을

엮인글 :

List of Articles

제목	글쓴이	날짜	조회 수
딥러닝 이론에서 텐서플로 실습까지 [2]	깊은바다	2017-11-08	786
Stable Diffusion을 사용한 사진 변환 앱 Lensa AI, 앱스토어 1위 달성	깊은바다	2022-12-09	786
사진을 텍스트로 설명 - CaptionBot	깊은바다	2016-04-07	794
AutoML-Zero, 진화적 알고리즘을 사용하여 신경망 구조 설계 [2]	깊은바다	2020-03-13	820
당근마켓에서 딥러닝 활용하기 - 불량 게시물 검사	깊은바다	2017-12-23	821
자동회귀(autoregressive)로 이미지를 생성하는 iGPT	깊은바다	2020-06-18	821
알렉스넷과 Seq2Seq의 창시자 일리야 수츠케버(Ilya Sutskever)	깊은바다	2020-11-17	831
전신 사진을 생성하는 GAN	깊은바다	2019-05-05	832
어떻게 해야 기계에게 글을 잘 읽고 말할 수 있게 할까? - 기계독해(MRC)	깊은바다	2020-01-14	836
앤드류 응의 YOLO 강의 영상	깊은바다	2020-09-23	836
3D 이미지를 만드는 GAN - StyleNeRF	깊은바다	2021-12-20	841
소프트웨어 2.0	깊은바다	2018-08-14	846
고해상도 GAN - A Style-Based Generator Architecture for GAN	깊은바다	2018-12-15	849
인공지능 과학자의 꿈, 범용 AI는 가능할까	깊은바다	2021-10-15	865
제프리 힌튼, 얀 르쿤, 요슈아 벤지오가 말하는 딥러닝의 미래	깊은바다	2021-07-08	878

쓰기

첫 페이지 1 2 3 4 5 6 7 8 9 10 끝 페이지