PyTorch Dataset·DataLoader 최적화 — CMU 딥러닝 수업이 짚은 데이터 병목 진단과 여덟 가지 처방
학습이 느린 진짜 원인은 GPU가 아니라 데이터 파이프라인인 경우가 많다. 카네기멜런대 딥러닝 수업 실습에서 짚은 Dataset과 DataLoader의 역할 분담, 병목을 재는 방법, 속도를 끌어올리는 여덟 가지 기법을 정리했다.
핵심 내용 읽기 →AI TOPIC
CMU 관련 핵심 뉴스와 활용 인사이트 7편을 최신순으로 모았습니다.

학습이 느린 진짜 원인은 GPU가 아니라 데이터 파이프라인인 경우가 많다. 카네기멜런대 딥러닝 수업 실습에서 짚은 Dataset과 DataLoader의 역할 분담, 병목을 재는 방법, 속도를 끌어올리는 여덟 가지 기법을 정리했다.
핵심 내용 읽기 →
카네기멜런대 딥러닝 수업 리사이테이션이 Weights & Biases 설정부터 실시간 지표 로깅, 중단된 학습 이어가기, 하이퍼파라미터 스윕까지 실습으로 짚는다. API 키 관리와 무료 저장 용량 주의점도 함께 정리했다.
핵심 내용 읽기 →
카네기멜런대 고급 자연어처리 수업의 초청 강연이 이미 훈련된 언어모델에 추론 시점의 연산을 더 써서 성능을 끌어올리는 메타 생성 알고리즘 네 가지를 정리하고, 비용까지 함께 따져야 하는 이유를 짚었다.
핵심 내용 읽기 →
카네기멜런대 LLM 추론 수업이 조건부 확률과 온도 샘플링, 잠재변수로서의 사고의 사슬, 재랭킹 메타 생성까지 언어모델 생성 원리를 코드 시연으로 짚었다. 온도를 0으로 두어도 결과가 매번 달라지는 이유도 함께 설명한다.
핵심 내용 읽기 →
카네기멜런대 고급 자연어처리 강의가 AI 편향의 출처를 데이터에서 모델과 추론 알고리즘, 배포 방식까지 넓혀 짚고, 학습 데이터 필터링이 오히려 의학 문서와 소수자 방언까지 지워버리는 역설을 설명한다.
핵심 내용 읽기 →
CMU 그레이엄 뉴빅의 LLM 추론 강의가 그리디 탐색과 빔서치부터 A*, 최선 우선 빔서치까지 정리한다. 모델이 좋아진 지금 왜 다시 제대로 탐색할 때인지, 언어모델에 최적 탐색이 어려운 이유는 무엇인지 짚었다.
핵심 내용 읽기 →
CMU 고급 자연어처리 강의에서 아만다 버치가 언어모델을 확률분포로 보는 관점부터 온도 조절, top-k, top-p, 엡실론, 국소 전형성 샘플링까지 비교하며 상황에 맞는 디코딩 전략을 고르는 기준을 설명한다.
핵심 내용 읽기 →