
오늘은 앞에서 설명드렸던 기계 학습( Machine Learning)은 지도 학습(Supervised Learning), 비지도 학습(Unsupervised Learning) 그리고 강화 학습( Reinforcement Learning)으로 나뉠 수가 있는데, 지난 시간에 지도 학습과 비지도 학습은 설명을 드렸고, 이번에는 강화 학습 관련 내용으로 마저 설명드리고 딥 러닝( Deep Learning)으로 넘어가겠습니다.
1. ‘강화 학습'(Reinforcement Learning)
1-1. 강화 학습의 유래
강화 학습은 바람직한 행동 패턴을 학습하는 일종의 알고리즘으로 그 유래는 심리학과 행동 주의(Behaviorism) 이론에 뿌리를 두고 있습니다. 잠깐 그 내용을 살펴보면 20세기 초 심리학자들은 행동 주의 이론을 통해 설명하면서 동물 실험 결과로 학습이 보상과 처벌을 통해 이루어진다는 것을 주장하였고 행동이 강화되거나 약화된다는 것을 보여주며 ‘ 행동’이 보상에 의해 어떻게 강화되는지도 설명하였습니다.
‘강화 학습’의 ‘환경’은 에이전트가 처할 수 있는 ‘상태의 변화’, 각 상태에서 선택할 수 있는 ‘행동’, 행동에 따른 ‘상태의 변화’, 그리고 ‘보상’으로 정의가 됩니다.
1-2. 강화 학습이 지도 학습, 비지도 학습과 다른 차이점
강화 학습은 입력과 출력이 쌍으로 이루어진 훈련데이터 집합이 제시되지 않습니다. 이러한 점은 앞에서 설명드렸던 ‘지도 학습’과는 큰 차이가 있습니다. 그렇다고 훈련데이터가 아주 없는 것은 아니고 상황 종료 시에 종합적으로 주어진다는 점에서 ‘비지도 학습’ 과도 다르다는 것을 이해해 주시면 되겠습니다.

2. 강화 학습의 학습 과정
2-1. 환경 설정: 상호 작용할 환경을 정의( 상태, 행동, 보상)
2-2. 에이전트 정의: 환경, 상호작용하는 주체이면서 어떤 행동을 선택할지 결정함.
2-3. 정책 학습: 어떤 행동을 선택할지를 정의하는 함수.
2-4. 상호작용 및 경험 수집: 에이전트는 상태 관찰, 행동 선, 보상 정보 수집.
2-5. 가치 함수(Value Function) 업데이트: 상태-행동 쌍의 가치를 평가하는 함수. 이를 기반으로 정책 개선.
2-6. 정책 개선: 수집한 경험을 바탕으로 정책 개선. 반복하므로 점차 최적 정책으로 접근.
2-7. 반복 및 수렴: 여러 에피소드(Episode)를 반복하여 최적의 정책을 찾기 위해 수렴.
3. 강화 학습의 상용화
강화 학습은 게임, 로봇 공학, 의료, 금융등 다양한 분야에 적용되고 있으며, 특히 알파고와 같은 사례는 강화 학습의 가능성을 알리는 계기가 되었습니다. 또한 최근에는 강화 학습의 안전성과 윤리적 문제에 대한 연구도 이와 함께 활발하게 진행되고 있습니다.
4. 마무리
오늘은 기계 학습의 한 부류인 강화 학습에 대해 설명드렸습니다. 강화 학습은 점점 더 복잡하고 다양한 문제를 해결할 수 있는 하나의 툴(Tool)로 자리 잡아나가고 있습니다.