여기를 클릭하면, 샘플강의가 재생됩니다.
- tag
Gymnasium으로 나만의 환경을 설계하고, 보상 함수 튜닝부터 DQN까지 [실습형 강화학습 입문]
담당강사 : 김동희
| 강의구성 | 총 8강좌 (강의시간 : 총 ) | 수강기간 | 30일 |
|---|---|---|---|
| 강의형식 | 동영상 | 수강료 |
32,000원
이 강좌의 80% 이상 수강 시 출력이 가능합니다. |
| 강의수준 | 초급 | 강의에서 사용하는 프로그램 & 버전 |
? Google Colab 또는 로컬 Python 환경 (Colab 기본 무료 / Colab Pro는 유료) ? Python 3.10+ (무료, 오픈소스) ? PyTorch 2.1+ (무료, 오픈소스) ? Gymnasium v1.2.3 (무료, 오픈소스, pip install gymnasium) ? Stable-Baselines3 (무료, 오픈소스, pip install stable-baselines3[extra]) ? 8차시 DQN 실습에 사용 ? NumPy, Matplotlib, pygame (무료, 오픈소스) |
| 담당강사 |
김동희 강사
|
참고도서 |
| 강의구성 | 총 8강좌 (강의시간 : 총 ) |
|---|---|
| 수강기간 | 30일 |
| 강의형식 | 동영상 |
| 수강료 |
32,000원
이 강좌의 80% 이상 수강 시 출력이 가능합니다. |
| 강의수준 | 초급 |
| 강의에서 사용하는 프로그램 & 버전 |
? Google Colab 또는 로컬 Python 환경 (Colab 기본 무료 / Colab Pro는 유료) ? Python 3.10+ (무료, 오픈소스) ? PyTorch 2.1+ (무료, 오픈소스) ? Gymnasium v1.2.3 (무료, 오픈소스, pip install gymnasium) ? Stable-Baselines3 (무료, 오픈소스, pip install stable-baselines3[extra]) ? 8차시 DQN 실습에 사용 ? NumPy, Matplotlib, pygame (무료, 오픈소스) |
| 담당강사 |
김동희 강사
|
- 수강신청
-
- 현재 강좌만 수강 신청하기
- 수강료 32,000원
- 수강기간 : 30일 수강신청
-
- 자유이용권으로 수강하기
- 총 4,194강좌 / 54,382개 영상
3개월 62,700원, 6개월 118,800원, 12개월 224,400원의 가격으로 무제한 수강해 보세요. - 자유이용권 구매 >
- 과정소개
-
? 본 과정은 강화학습(Reinforcement Learning)을 처음 접하는 학습자를 대상으로 합니다.
? 쉽게 풀어낸 이론 설명과 더불어 시뮬레이션 환경 설계와 실습 중심으로 강화학습의 핵심 개념과 실제 적용 방법을 학습하는 실전형 입문 과정입니다.
? Gymnasium 기반의 시뮬레이션 환경을 활용하여 강화학습 문제를 정의하고, 보상 함수를 설계하며, DQN 알고리즘을 통해 실제로 정책을 학습시키는 전 과정을 경험합니다.
- 학습목표
-
본 과정을 통해 학습자는 다음을 수행할 수 있습니다.
1. 강화학습이 해결하는 문제 유형을 이해한다.
2. State, Action, Reward 개념을 기반으로 RL 문제를 정의할 수 있다.
3. Gymnasium 환경 구조를 이해하고 커스텀 환경을 설계할 수 있다.
4. 보상 함수(Reward)를 설계하여 학습 성능을 개선할 수 있다.
5. DQN 알고리즘을 활용하여 실제 강화학습 모델을 학습시킬 수 있다.
- 교육대상
-
? 강화학습을 처음 접하는 개발자 및 데이터 분석가
? 머신러닝 기본 개념은 알고 있으나 RL은 처음인 학습자
? 시뮬레이션 기반 AI 모델 설계에 관심 있는 기획자 및 엔지니어
? AI 자동제어, 로봇, 게임 AI 분야, GPT 동작 원리에 관심 있는 실무자
- 선수 과정
- ? PyTorch(파이토치)로 딥러닝 제대로 배우기 (중급)
? 또는 중급수준의 인공지능 강좌 이수자
차시별 학습목표
- 01. 지도학습과 강화학습의 차이를 이해하고, 강화학습의 핵심 구성요소(State, Action, Reward, Policy)와 활용 분야를 설명할 수 있다.
- 02. 1. MDP(마르코프 결정 과정)의 구성 요소와 수학적 구조를 설명할 수 있다. 2. 강화학습의 핵심 3요소(State/Action/Reward)를 정의하고 실제 문제에 매핑할 수 있다. 3. 간단한 예제를 통해 상태·행동·보상을 직접 설계할 수 있다. 4. 에이전트의 정책(Policy)이 MDP 내에서 어떤 역할을 하는지 설명할 수 있다.
- 03. 1. Gymnasium 라이브러리의 역할과 구조를 설명할 수 있다. 2. gym.make(), env.reset(), env.step(), env.render() 등 핵심 API를 사용할 수 있다. 3. CartPole-v1의 State, Action, Reward, Done 구조를 분석할 수 있다. 4. 랜덤 정책(Random Agent)으로 CartPole을 실행하고 결과를 출력할 수 있다.
- 04. 1. gymnasium.Env를 상속하여 커스텀 환경을 만드는 기본 구조와 필수 메서드를 설명할 수 있다. 2. observation_space와 action_space를 Discrete/Box 타입으로 정의할 수 있다. 3. reset()/step()/render() 메서드를 직접 구현할 수 있다. 4. 완성된 커스텀 환경을 gym.register로 등록하고 테스트할 수 있다.
- 05. 1. 보상 함수가 에이전트 행동에 미치는 영향을 설명할 수 있다. 2. Sparse/Dense/Shaped 보상의 차이와 장단점을 비교할 수 있다. 3. NumberLineEnv에 다양한 보상 함수를 직접 구현할 수 있다. 4. 서로 다른 보상 함수의 학습 성능을 실험적으로 비교·분석할 수 있다.
- 06. 1. Bellman 방정식 기반의 Q-Learning 알고리즘 원리를 설명할 수 있다. 2. 상태×행동 Q-Table의 구조와 업데이트 과정을 이해한다. 3. NumberLineEnv에서 Q-Learning을 직접 구현하고 실행할 수 있다. 4. 학습률(α)·할인율(γ)·탐험율(ε)이 학습에 미치는 영향을 실험으로 비교할 수 있다.
- 07. 1. 테이블 기반 Q-Learning이 실제 문제에 적용되기 어려운 이유를 설명할 수 있다. 2. Q(s,a) 테이블을 신경망 함수로 대체하는 함수 근사 개념을 설명할 수 있다. 3. Q-Network, Experience Replay, Target Network의 역할을 설명할 수 있다. 4. DQN이 Deep RL 분야를 연 역사적 맥락과 의의를 이해한다.
- 08. 1. Stable-Baselines3 설치 및 Gymnasium 환경 연동 방법을 익힌다. 2. SB3의 DQN 클래스로 CartPole 에이전트를 학습시킬 수 있다. 3. 학습된 에이전트의 성능을 정량적으로 평가하고 해석할 수 있다. 4. 주요 하이퍼파라미터를 변경하며 학습 결과 차이를 분석할 수 있다.
- 참고사항
- - 수강 기간 중 언제든지 반복 수강이 가능합니다.
- - 수강 여부 : 해당 차시의 80%를 수강하면 (회색) 배경으로 표시됩니다.
- - 수강 신청 완료 후 수강할 수 있습니다.
- - 즐겨찾기 한 강좌는 MY Class에서 확인할 수 있습니다.