Muon

🏷️ 머신러닝 딥러닝 오픈소스

Muon

Muon은 Keller Jordan 등이 2024년 공개한 옵티마이저입니다. 신경망의 행렬형 파라미터(선형 레이어 가중치)에 대해, 모멘텀으로 얻은 업데이트 행렬을 Newton-Schulz 반복으로 근사 직교화한 뒤 적용합니다. 같은 연산량에서 AdamW보다 빠르게 수렴한다는 결과가 보고되면서 대규모 사전학습 쪽에서 채택이 늘었습니다.

실무에서의 취급

μP와의 관계

μP(Maximal Update Parameterization)는 원래 AdamW를 전제로 유도됐습니다. 옵티마이저가 바뀌면 업데이트 스케일 규칙이 달라지므로 μP 공식이 그대로 옮겨가지 않습니다. Muon 위에서 μP 학습률 전이가 성립하는지를 다룬 연구가 2025년 이후 따로 나오고 있습니다.