트랜스포머 구조 해부 강의: 토크나이저·어텐션·잔차 스트림으로 보는 LLM 작동 원리와 GPT-2 구현
AI 안전 교육 프로그램 ARENA의 강의에서 트랜스포머의 토큰화, 어텐션, 잔차 스트림, 인과 마스크를 GPT-2를 직접 구현하는 관점으로 풀어낸 설명을 정리했다. 2017년 구조가 지금까지 유지되는 이유와 남은 한계도 함께 짚는다.
핵심 내용 읽기 →AI TOPIC
GPT-2 관련 핵심 뉴스와 활용 인사이트 6편을 최신순으로 모았습니다.

AI 안전 교육 프로그램 ARENA의 강의에서 트랜스포머의 토큰화, 어텐션, 잔차 스트림, 인과 마스크를 GPT-2를 직접 구현하는 관점으로 풀어낸 설명을 정리했다. 2017년 구조가 지금까지 유지되는 이유와 남은 한계도 함께 짚는다.
핵심 내용 읽기 →
사전학습된 GPT-2의 출력 헤드를 두 개 클래스로 바꿔 스팸 문자를 걸러내는 분류 미세조정 실습을 따라가고, 마지막 토큰만 쓰는 이유와 챗봇 아레나 선호 예측을 다루는 캐글 대회 제출 과정까지 정리했습니다.
핵심 내용 읽기 →
라벨 없는 텍스트로 GPT-2를 직접 학습시킨 스터디 기록. 크로스 엔트로피와 퍼플렉서티로 모델을 평가하고, 훈련·검증 손실을 함께 그려 과적합 시점을 잡고, 온도와 top-k로 생성 문장을 조절한 뒤 체크포인트까지 저장하는 과정을 정리했다.
핵심 내용 읽기 →
세바스찬 라시카가 GPT 모델을 밑바닥부터 사전학습하는 과정을 공개했다. 교차 엔트로피 손실 계산부터 학습·검증 손실 추적, 온도 조절과 top-k 샘플링, 오픈AI GPT-2 가중치 이식까지 단계별로 다룬다.
핵심 내용 읽기 →
세바스찬 라슈카가 사전학습된 GPT-2를 명령어를 따르는 비서 모델로 파인튜닝하는 과정을, 데이터셋 준비와 패딩 마스킹부터 학습, 그리고 Ollama를 이용한 자동 평가까지 코드로 차근차근 보여 줍니다.
핵심 내용 읽기 →
안드레이 카파시가 GPT-2(124M)를 PyTorch로 바닥부터 재현한다. 모델 구조와 GPT-3 하이퍼파라미터, torch.compile·플래시 어텐션 최적화, 약 1시간·10달러 학습까지 다룬다.
핵심 내용 읽기 →