Muon
Muon
Muon은 Keller Jordan 등이 2024년 공개한 옵티마이저입니다. 신경망의 행렬형 파라미터(선형 레이어 가중치)에 대해, 모멘텀으로 얻은 업데이트 행렬을 Newton-Schulz 반복으로 근사 직교화한 뒤 적용합니다. 같은 연산량에서 AdamW보다 빠르게 수렴한다는 결과가 보고되면서 대규모 사전학습 쪽에서 채택이 늘었습니다.
실무에서의 취급
- 임베딩과 출력층, 그리고 스칼라·벡터형 파라미터는 Muon으로 다루지 않고 AdamW에 맡기는 하이브리드 구성이 일반적입니다.
- 업데이트 스케일이 AdamW와 달라서 학습률을 그대로 가져다 쓸 수 없습니다. Moonshot AI의 Kimi 계열 작업 이후로는 학습률에 \(0.2 \cdot \sqrt{\max(A, B)}\)를 곱해 업데이트 RMS를 AdamW에 맞추는 보정이 관행처럼 쓰입니다. \(A\)와 \(B\)는 행렬 파라미터의 fan-in과 fan-out입니다.
- 학습 불안정을 억제하려고 어텐션 로짓을 함께 제한하는 MuonClip 변형이 Kimi K2와 카카오 Kanana 2 계열에서 쓰였습니다.
μP와의 관계
μP(Maximal Update Parameterization)는 원래 AdamW를 전제로 유도됐습니다. 옵티마이저가 바뀌면 업데이트 스케일 규칙이 달라지므로 μP 공식이 그대로 옮겨가지 않습니다. Muon 위에서 μP 학습률 전이가 성립하는지를 다룬 연구가 2025년 이후 따로 나오고 있습니다.