여기를 클릭하면, 샘플강의가 재생됩니다.
- tag
[심화과정]Fine tuning (파인 튜닝) - Transformer (트랜스포머) 아키텍처 Part.5 (完)
담당강사 : 김동영
| 강의구성 | 총 15강좌 (강의시간 : 총 ) | 수강기간 | 30일 |
|---|---|---|---|
| 강의형식 | 동영상 | 수강료 |
60,000원
이 강좌의 80% 이상 수강 시 출력이 가능합니다. |
| 강의수준 | 중급 | 강의에서 사용하는 프로그램 & 버전 |
VS Code (무료) |
| 담당강사 | 참고도서 | ![]() |
| 강의구성 | 총 15강좌 (강의시간 : 총 ) |
|---|---|
| 수강기간 | 30일 |
| 강의형식 | 동영상 |
| 수강료 |
60,000원
이 강좌의 80% 이상 수강 시 출력이 가능합니다. |
| 강의수준 | 중급 |
| 강의에서 사용하는 프로그램 & 버전 |
VS Code (무료) |
| 담당강사 |
김동영 강사
|
- 수강신청
-
- 현재 강좌만 수강 신청하기
- 수강료 60,000원
- 수강기간 : 30일 수강신청
-
- 자유이용권으로 수강하기
- 총 4,149강좌 / 53,975개 영상
3개월 62,700원, 6개월 118,800원, 12개월 224,400원의 가격으로 무제한 수강해 보세요. - 자유이용권 구매 >
- 과정소개
- 본 과정은 AI 모델을 특정 목적에 맞게 최적화하는 핵심 기술인 Fine-tuning을 Transformer 아키텍처의 원리부터 실제 구현까지 체계적으로 학습합니다. Attention 메커니즘, Self-attention, Multi-head Attention 등 Transformer의 핵심 구조를 수식과 함께 이해하고, 사전학습(Pre-training)된 모델이 Fine-tuning을 통해 어떻게 새로운 태스크에 적응하는지 그 원리를 탄탄히 익힙니다. 학습률(Learning Rate), 배치 크기(Batch Size), Epoch 등 주요 하이퍼파라미터의 역할을 이론적으로 파악하고, PyTorch와 Hugging Face를 활용한 실습을 통해 텍스트 분류, 감성 분석 등 실제 태스크에 Fine-tuning을 직접 적용해봅니다. 이 과정을 통해 AI/ML을 처음 접하는 분도 Transformer 기반 모델의 동작 원리를 이해하고, 원하는 도메인에 맞는 모델을 스스로 학습시킬 수 있는 기초 역량을 갖추게 됩니다.
- 학습목표
-
● RMSNorm과 RoPE(Rotary Position Embedding)의 수학적 원리와 구현 방식을 이해할 수 있다.
● MLA(Multi-Head Latent Attention)의 차원 압축 구조와 각 변환 과정을 이해할 수 있다.
● nn.Linear()를 활용하여 MLA의 Query/Key/Value 변환 계층을 직접 구현할 수 있다.
● DeepSeek V2의 Mixture of Experts(MoE) 구조에서 Routing과 Expert 연산 과정을 구현할 수 있다.
● RMSNorm, MLA, MoE를 결합한 DeepSeek V2 Transformer Block 전체를 코드로 구현할 수 있다.
- 교육대상
- Transformer 아키텍처의 원리를 이해하고 PyTorch 기반 AI 모델 구현 및 Fine-tuning을 학습하고자 하는 개발자 및 AI 입문자
- 선수 과정
- 파이썬 프로그래밍 언어
차시별 학습목표
- 01. RMSNorm(Root Mean Square Normalization)의 수식과 동작 원리를 이해할 수 있다.
- 02. RoPE(Rotary Position Embedding)의 회전 각도(theta) 계산 원리와 inv_freq 생성 과정을 이해할 수 있다.
- 03. rotate_half 함수를 통해 행렬 회전 연산을 element-wise 벡터 연산으로 변환하는 원리를 이해할 수 있다.
- 04. apply_rotary_pos_emb 함수를 통해 Query와 Key에 RoPE를 실제로 적용하는 코드를 구현할 수 있다.
- 05. MLA(Multi-Head Latent Attention)의 잠재 벡터(latent) 압축 차원과 주요 변수(q_lora_rank, kv_lora_rank, qk_nope_head_dim, qk_rope_head_dim 등)의 의미를 이해할 수 있다.
- 06. MLA의 Query 및 Key/Value 압축·복원 과정을 nn.Linear()로 구현하는 방법을 이해할 수 있다.
- 07. MLA의 kv_b_proj, o_proj 등 나머지 선형 변환 계층의 구조와 역할을 이해할 수 있다.
- 08. DeepseekAttention 클래스의 생성자와 Query 압축·복원 과정을 코드로 구현할 수 있다.
- 09. DeepseekAttention의 forward() 내 Key/Value 압축·복원과 RoPE 적용, KV 캐시 처리 과정을 구현할 수 있다.
- 10. MLA의 Attention Score 계산과 softmax, o_proj를 통한 최종 출력 생성 과정을 구현할 수 있다.
- 11. SwiGLU 활성화 함수의 구조를 이해하고 DeepseekMLP 클래스로 Expert를 구현할 수 있다.
- 12. MoEGate 클래스를 통해 입력과 Expert centroid 간 유사도를 계산하고 Top-K Expert를 선택하는 과정을 이해할 수 있다.
- 13. 선택된 Top-K Routed Expert에 토큰을 정렬하여 전달하고 출력을 계산하는 _moe_infer 과정을 이해할 수 있다.
- 14. Routed Expert의 출력을 원래 토큰 순서로 복원하고 Top-K 가중합 및 Shared Expert 출력을 결합하는 과정을 구현할 수 있다.
- 15. RMSNorm, MLA Attention, MoE/MLP를 결합한 DeepseekDecoderLayer(Transformer Block)의 전체 구조와 잔차 연결 과정을 구현할 수 있다.
- 참고사항
- - 수강 기간 중 언제든지 반복 수강이 가능합니다.
- - 수강 여부 : 해당 차시의 80%를 수강하면 (회색) 배경으로 표시됩니다.
- - 수강 신청 완료 후 수강할 수 있습니다.
- - 즐겨찾기 한 강좌는 MY Class에서 확인할 수 있습니다.

