아이티고

강좌검색

  • 강좌검색
  • 질문검색
    최근 검색어 자동저장 전체삭제

    알림

    여기를 클릭하면, 샘플강의가 재생됩니다.
    tag
    강좌코드 : la_P080327
    열공이

    [심화과정]Fine tuning (파인 튜닝) - Transformer (트랜스포머) 아키텍처 Part.5 (完)
    담당강사 : 김동영

    강의구성 총 15강좌 (강의시간 : 총 ) 수강기간 30일
    강의형식 동영상 수강료 60,000원 이 강좌의 80% 이상 수강 시
    출력이 가능합니다.
    강의수준 중급 강의에서 사용하는
    프로그램 & 버전
    VS Code (무료)
    담당강사 참고도서
    강의구성 총 15강좌 (강의시간 : 총 )
    수강기간 30일
    강의형식 동영상
    수강료 60,000원 이 강좌의 80% 이상 수강 시
    출력이 가능합니다.
    강의수준 중급
    강의에서 사용하는
    프로그램 & 버전
    VS Code (무료)
    담당강사
    김동영 강사
    수강신청
    • 현재 강좌만 수강 신청하기
    • 수강료 60,000원
    • 수강기간 : 30일 수강신청
    • 자유이용권으로 수강하기
    • 총 4,149강좌 / 53,975개 영상
      3개월 62,700원, 6개월 118,800원, 12개월 224,400원의 가격으로 무제한 수강해 보세요.
    • 자유이용권 구매 >
    과정소개
    본 과정은 AI 모델을 특정 목적에 맞게 최적화하는 핵심 기술인 Fine-tuning을 Transformer 아키텍처의 원리부터 실제 구현까지 체계적으로 학습합니다. Attention 메커니즘, Self-attention, Multi-head Attention 등 Transformer의 핵심 구조를 수식과 함께 이해하고, 사전학습(Pre-training)된 모델이 Fine-tuning을 통해 어떻게 새로운 태스크에 적응하는지 그 원리를 탄탄히 익힙니다. 학습률(Learning Rate), 배치 크기(Batch Size), Epoch 등 주요 하이퍼파라미터의 역할을 이론적으로 파악하고, PyTorch와 Hugging Face를 활용한 실습을 통해 텍스트 분류, 감성 분석 등 실제 태스크에 Fine-tuning을 직접 적용해봅니다. 이 과정을 통해 AI/ML을 처음 접하는 분도 Transformer 기반 모델의 동작 원리를 이해하고, 원하는 도메인에 맞는 모델을 스스로 학습시킬 수 있는 기초 역량을 갖추게 됩니다.
    학습목표
    ● RMSNorm과 RoPE(Rotary Position Embedding)의 수학적 원리와 구현 방식을 이해할 수 있다.
    ● MLA(Multi-Head Latent Attention)의 차원 압축 구조와 각 변환 과정을 이해할 수 있다.
    ● nn.Linear()를 활용하여 MLA의 Query/Key/Value 변환 계층을 직접 구현할 수 있다.
    ● DeepSeek V2의 Mixture of Experts(MoE) 구조에서 Routing과 Expert 연산 과정을 구현할 수 있다.
    ● RMSNorm, MLA, MoE를 결합한 DeepSeek V2 Transformer Block 전체를 코드로 구현할 수 있다.
    교육대상
    Transformer 아키텍처의 원리를 이해하고 PyTorch 기반 AI 모델 구현 및 Fine-tuning을 학습하고자 하는 개발자 및 AI 입문자
    선수 과정
    파이썬 프로그래밍 언어
    차시별 학습목표
    01. RMSNorm(Root Mean Square Normalization)의 수식과 동작 원리를 이해할 수 있다.
    02. RoPE(Rotary Position Embedding)의 회전 각도(theta) 계산 원리와 inv_freq 생성 과정을 이해할 수 있다.
    03. rotate_half 함수를 통해 행렬 회전 연산을 element-wise 벡터 연산으로 변환하는 원리를 이해할 수 있다.
    04. apply_rotary_pos_emb 함수를 통해 Query와 Key에 RoPE를 실제로 적용하는 코드를 구현할 수 있다.
    05. MLA(Multi-Head Latent Attention)의 잠재 벡터(latent) 압축 차원과 주요 변수(q_lora_rank, kv_lora_rank, qk_nope_head_dim, qk_rope_head_dim 등)의 의미를 이해할 수 있다.
    06. MLA의 Query 및 Key/Value 압축·복원 과정을 nn.Linear()로 구현하는 방법을 이해할 수 있다.
    07. MLA의 kv_b_proj, o_proj 등 나머지 선형 변환 계층의 구조와 역할을 이해할 수 있다.
    08. DeepseekAttention 클래스의 생성자와 Query 압축·복원 과정을 코드로 구현할 수 있다.
    09. DeepseekAttention의 forward() 내 Key/Value 압축·복원과 RoPE 적용, KV 캐시 처리 과정을 구현할 수 있다.
    10. MLA의 Attention Score 계산과 softmax, o_proj를 통한 최종 출력 생성 과정을 구현할 수 있다.
    11. SwiGLU 활성화 함수의 구조를 이해하고 DeepseekMLP 클래스로 Expert를 구현할 수 있다.
    12. MoEGate 클래스를 통해 입력과 Expert centroid 간 유사도를 계산하고 Top-K Expert를 선택하는 과정을 이해할 수 있다.
    13. 선택된 Top-K Routed Expert에 토큰을 정렬하여 전달하고 출력을 계산하는 _moe_infer 과정을 이해할 수 있다.
    14. Routed Expert의 출력을 원래 토큰 순서로 복원하고 Top-K 가중합 및 Shared Expert 출력을 결합하는 과정을 구현할 수 있다.
    15. RMSNorm, MLA Attention, MoE/MLP를 결합한 DeepseekDecoderLayer(Transformer Block)의 전체 구조와 잔차 연결 과정을 구현할 수 있다.
    참고사항
    - 수강 기간 중 언제든지 반복 수강이 가능합니다.
    - 수강 여부 : 해당 차시의 80%를 수강하면 (회색) 배경으로 표시됩니다.
    - 수강 신청 완료 후 수강할 수 있습니다.
    - 즐겨찾기 한 강좌는 MY Class에서 확인할 수 있습니다.

    시리즈강좌

    수강평

    • 0.0
    • 0.0
    • (0개의 수강평)
    버튼
    • 최신순
    • 높은 평점순
    • 낮은 평점순
    ※ 리뷰는 본 강의를 1차시 이상 수강하셔야 작성하실 수 있습니다.
    이전 1/297 다음
    수강생 리뷰 작성

    평점

    버튼
    • 5점
    • 4점
    • 3점
    • 2점
    • 1점

    수강평

    ※ 수강평은 최대 200자까지 가능합니다.
    ※ 리뷰 작성 안내
    본 리뷰는 AItgo 사이트에 작성자 ID와 함께 게시됩니다.
    타인에게 불쾌감을 줄 수 있는 부적절한 표현(욕설, 비방, 비속어 등등)이 들어 있는 게시물의 경우 고지 없이 삭제 될 수 있습니다.
    작성하신 리뷰는 "My Class > 나의 수강 리뷰" 페이지에서 삭제 하실 수 있습니다.
    강좌 리스트
    01. DeepSeek V2의 transformer block - Root Mean Square Normalization [29:47]
    02. DeepSeek V2의 Rotary Position Embedding 1/3 [33:27]
    03. DeepSeek V2의 Rotary Position Embedding 2/3 [31:2]
    04. DeepSeek V2의 Rotary Position Embedding 3/3 [37:2]
    05. DeepSeek V2의 MLA (Multi-Head Latent Attention)의 차원/변환/변수 설명 [41:13]
    06. DeepSeek V2의 MLA (Multi-Head Latent Attention)의 nn.Linear()로 구현한 변환 부분 설명 1/2 [35:48]
    07. DeepSeek V2의 MLA (Multi-Head Latent Attention)의 nn.Linear()로 구현한 변환 부분 설명 2/2 [35:26]
    08. MLA (Multi-Head Latent Attention) 코드 설명 1/3 [30:58]
    09. MLA (Multi-Head Latent Attention) 코드 설명 2/3 [34:3]
    10. MLA (Multi-Head Latent Attention) 코드 설명 3/3 [20:31]
    11. DeepSeek V2의 Mixture of Experts 코드 설명 (Expert의 SwiGLU 구현) 1/4 [29:6]
    12. DeepSeek V2의 Mixture of Experts 코드 설명 2/4 (expert centroid와 입력의 유사도 계산) [33:29]
    13. DeepSeek V2의 Mixture of Experts 코드 설명 3/4 (routed expert의 출력 계산) [36:13]
    14. DeepSeek V2의 Mixture of Experts 코드 설명 4/4 (routed expert의 출력 계산) [43:40]
    15. DeepSeek V2의 transformer block 코드 설명 [8:29]
    지금 자유이용권 구매하고, 모든 강의를 자유롭게 수강하세요!