LLM 사전 학습 실습 정리 — 크로스 엔트로피와 퍼플렉서티, 온도·top-k 샘플링, 체크포인트 저장
라벨 없는 텍스트로 GPT-2를 직접 학습시킨 스터디 기록. 크로스 엔트로피와 퍼플렉서티로 모델을 평가하고, 훈련·검증 손실을 함께 그려 과적합 시점을 잡고, 온도와 top-k로 생성 문장을 조절한 뒤 체크포인트까지 저장하는 과정을 정리했다.
핵심 내용 읽기 →AI TOPIC
PyTorch 관련 핵심 뉴스와 활용 인사이트 14편을 최신순으로 모았습니다.

라벨 없는 텍스트로 GPT-2를 직접 학습시킨 스터디 기록. 크로스 엔트로피와 퍼플렉서티로 모델을 평가하고, 훈련·검증 손실을 함께 그려 과적합 시점을 잡고, 온도와 top-k로 생성 문장을 조절한 뒤 체크포인트까지 저장하는 과정을 정리했다.
핵심 내용 읽기 →
학습이 느린 진짜 원인은 GPU가 아니라 데이터 파이프라인인 경우가 많다. 카네기멜런대 딥러닝 수업 실습에서 짚은 Dataset과 DataLoader의 역할 분담, 병목을 재는 방법, 속도를 끌어올리는 여덟 가지 기법을 정리했다.
핵심 내용 읽기 →
카네기멜런대 딥러닝 수업 실습에서 소개한 모델 디버깅 절차를 정리했다. 에러도 경고도 없이 학습만 진행되고 성능은 나오지 않는 조용한 실패를 데이터·모델·손실·학습 루프 네 곳으로 좁혀가는 순서와 점검 기법을 다룬다.
핵심 내용 읽기 →
제인스트리트 엔지니어들이 GPU 학습을 느리게 만드는 세 가지 병목을 짚었다. 숨은 CPU-GPU 동기화와 메모리 대역폭, 커널 실행 오버헤드를 프로파일러로 찾아내고 커스텀 커널로 20밀리초를 30마이크로초까지 줄인 과정을 정리했다.
핵심 내용 읽기 →
모델이 GPU 한 장에 담기지 않을 때 쓰는 FSDP의 두 단계 분할과 all-gather·reduce-scatter가 만드는 통신 비용, FSDP2 실습 설정, 그리고 학습 로직과 분산 실행을 나누는 Ray Train의 역할을 정리했다.
핵심 내용 읽기 →
전력망도 기지국도 없는 코스타리카 국립공원에서 멸종위기 새를 추적한 사례. 라즈베리 파이와 BirdNet 대신 신호처리와 100KB 모델을 택해 배터리 수명과 오탐 문제를 함께 푼 과정을 정리했다.
핵심 내용 읽기 →
메타 엔지니어가 발표한 torch.compile의 CUDA 스트림 지원 정리. 스트림 컨텍스트에서 그래프가 끊기던 문제를 Dynamo·AOT Autograd·Inductor 세 단계에서 어떻게 풀었는지와, 활성값 오프로딩의 실측 결과를 다뤘다.
핵심 내용 읽기 →
생성형 AI에 가려졌던 타이니ML이 다시 주목받고 있다. 메타 엔지니어들이 파이토치 콘퍼런스에서 공개한 ExecuTorch의 마이크로컨트롤러 지원 현황과, 램이 10MB도 안 되는 기기에서 쓰는 실전 용량 절감 요령을 정리했다.
핵심 내용 읽기 →
NASA와 ESA가 쏟아내는 0.5엑사바이트 위성 데이터는 형식도 출처도 제각각이다. IBM 연구진이 파이토치 콘퍼런스에서 공개한 오픈소스 라이브러리 테라킷이 이 데이터 준비 과정을 어떻게 줄이는지 정리했다.
핵심 내용 읽기 →
구글 서머 오브 코드로 태양광 발전량 예측 모델을 만든 개발자가 시계열 트랜스포머(TFT)를 쓰며 겪은 문제를 정리했다. 정작 시간의 대부분은 모델 튜닝이 아니라 결측 없는 36시간 학습 구간을 만드는 데 들어갔다.
핵심 내용 읽기 →
안드레이 카파시가 벤지오의 2003년 논문을 따라 다층 퍼셉트론 언어 모델을 직접 구현한다. 임베딩 테이블부터 미니배치, 학습률 탐색, 학습·검증·테스트 분할까지 딥러닝의 기본기를 코드로 하나씩 짚어간다.
핵심 내용 읽기 →
70억 파라미터 모델은 32비트로 저장하면 28GB가 필요하다. 이 무게를 줄이는 양자화의 원리와 대칭·비대칭 방식의 차이, 구간 끝값 선택 기준, 학습 후 양자화와 양자화 인식 학습의 차이까지 정리했다.
핵심 내용 읽기 →
CNN이 이미지를 이해하는 원리를 커널·필터·맥스풀링 중심으로 짧고 명확하게 정리한다. RGB 처리 방식과 CNN이 왜 그렇게 효율적인지, PyTorch로 어떻게 구성하는지까지 짚는다.
핵심 내용 읽기 →
큰 배치는 학습을 안정시키지만 GPU 메모리에 한꺼번에 다 올리지 못할 때가 많다. 작은 마이크로배치의 경사를 합산해 큰 배치 효과를 내는 그래디언트 누적의 원리와 PyTorch 구현 순서를 정리했다.
핵심 내용 읽기 →