ARO 옵티마이저 해설: 회전 좌표계로 LLM 학습을 AdamW보다 1.3배 빠르게 만든 원리
10년째 AdamW가 지배해 온 LLM 학습에 마이크로소프트 리서치가 회전이라는 관점을 들고 나왔다. 기존 행렬 옵티마이저를 하나로 설명하면서 더 적은 데이터로 같은 손실에 도달하는 ARO를 정리했다.
핵심 내용 읽기 →AI TOPIC
AdamW 관련 핵심 뉴스와 활용 인사이트 3편을 최신순으로 모았습니다.

10년째 AdamW가 지배해 온 LLM 학습에 마이크로소프트 리서치가 회전이라는 관점을 들고 나왔다. 기존 행렬 옵티마이저를 하나로 설명하면서 더 적은 데이터로 같은 손실에 도달하는 ARO를 정리했다.
핵심 내용 읽기 →
오랫동안 기본값이던 AdamW에 도전하는 Muon 옵티마이저의 작동 원리를 정리했다. 모멘텀 행렬을 직교화해 드문 방향을 살리는 아이디어와, SVD 없이 이를 근사하는 다항식 반복, 대형 모델 학습 안정화 기법까지 다룬다.
핵심 내용 읽기 →
신경망 과적합을 줄이는 가중치 감쇠(L2 정규화)의 작동 원리를 쉽게 정리했다. 손실 함수에 가중치 제곱 페널티를 더하는 방식, 정규화 강도 람다 조절, SGD와 AdamW의 차이, 실전 적용법까지 한눈에 살펴본다.
핵심 내용 읽기 →