사나에 로트피
개요
Sanae Lotfi는 Meta Superintelligence Labs(구 FAIR) 소속 리서치 사이언티스트입니다. 딥러닝 모델이 왜 잘 일반화되는지를 수학적으로 설명하는 데 집중하는 연구자로, 모델 압축, 손실곡면(loss landscape) 분석, 베이지안 학습이론을 연결하는 방식으로 접근합니다.
딥러닝의 경험적 현상에 엄밀한 이론적 틀을 부여하는 작업을 일관되게 추구하며, LLM 일반화에 대한 압축 이론적 이해를 개척하고 있습니다.
생애
로트피는 모로코 출신으로, Polytechnique Montreal에서 응용수학 석사를 마쳤습니다. 이후 미국으로 건너가 NYU Center for Data Science에서 Andrew Gordon Wilson의 지도하에 박사 과정에 진학했습니다. 2025년 4월 "Understanding Generalization in Deep Learning Through Occam's Razor"라는 제목의 박사 논문으로 학위를 취득했습니다.
박사 재학 중 Microsoft Research, Amazon, Meta에서 리서치 인턴으로 일했습니다. Microsoft Research PhD Fellowship, Google DeepMind Fellowship, Meta AI Mentorship Program의 지원을 받았습니다. 2025년 7월 Meta Superintelligence Labs에 정규직으로 합류했습니다. MIT와 메릴랜드 대학교에서 Rising Star로 선정된 바 있습니다.
업적
로트피의 대표 성과는 베이지안 모델 선택 관점에서 딥러닝 일반화를 설명한 연구로, ICML 2022 Outstanding Paper Award를 수상했습니다. 베이지안 오컴의 면도날이 과잉 매개변수화된 신경망에서도 적용된다는 점을 보여주는 이 작업은 딥러닝 이론 커뮤니티에서 주목을 받았습니다.
LLM 일반화를 압축 이론으로 이해하는 연구는 ICML 2024 Theoretical Foundations Workshop Best Paper를 받았습니다. 양자화된 LLM이 추론 트레이스 길이를 실제로는 더 길게 만들지 않으면서도 그렇게 느끼는 현상을 KL 발산으로 진단하는 Quantized Reasoning Models Think They Need to Think Longer, but They Do Not의 1저자이기도 합니다. 2026년에는 ICLR에서 GRaM Workshop과 Sci4DL Workshop을 공동 주최하며 이론 기반 딥러닝 연구를 이끌고 있습니다.
Softmax Attention의 귀납 편향을 구조화 행렬로 커스터마이징하는 연구가 ICML 2025에 채택되었고, "Small Batch Size Training for Language Models"(2025)도 발표했습니다.
여담
로트피는 딥러닝 이론이 "경험에 기반한 규칙"에서 "수학적으로 설명 가능한 원리"로 이행하는 과정을 추구하는 연구자입니다. 오컴의 면도날이라는 고전 철학 원리를 딥러닝 일반화에 연결하는 발상에서 보듯, 수학과 철학을 가로지르는 직관이 강합니다.
폴리나 키리첸코, 류저춘 등 OOD 및 양자화 전문가들과의 협업으로 연구 범위를 넓히고 있습니다.
주요 논문
- Bayesian Model Selection, the Marginal Likelihood, and Generalization (ICML 2022, Outstanding Paper)
- Unlocking Deterministic Robustness Certification on ImageNet (NeurIPS 2023)
- Pac-Bayes Compression Bounds So Tight That They Can Explain Generalization (NeurIPS 2022)
- Understanding Generalization in LLMs Through the Lens of Compression (ICML 2024 Workshop Best Paper)
- Customizing the Inductive Biases of Softmax Attention using Structured Matrices (ICML 2025)
- Small Batch Size Training for Language Models (2025)
- Quantized Reasoning Models Think They Need to Think Longer, but They Do Not (2025)