둥이

🏷️ 인물 강화학습 추론 LLM 수석과학자

개요

둥이(Yi Dong)는 NVIDIA Learning and Perception Research 팀의 수석 연구과학자로, 추론 모델 개발을 이끌고 있습니다. 얀 카우츠가 총괄하는 LPR 조직 안에서 모델 정렬과 후속학습 라인을 담당해 왔습니다.

생애

세부 이력에 대한 공개 정보는 제한적입니다. NVIDIA에서 모델 정렬 연구를 이어 왔고, RLHF 대안 기법과 정렬 툴킷 개발을 거쳐 최근에는 추론 모델과 에이전트 RL 인프라 쪽으로 범위를 넓혔습니다.

업적

SteerLM(EMNLP 2023)은 속성 조건부 SFT로 RLHF를 대체하는 접근입니다. 보상 모델과 PPO 루프 없이, 사용자가 응답의 속성을 추론 시점에 직접 조절할 수 있게 만든 것이 특징입니다.

NeMo-Aligner는 천 대 규모 GPU까지 확장되는 모델 정렬 툴킷으로, RLHF와 DPO, SteerLM, SPIN 같은 주요 정렬 패러다임의 최적화 구현을 제공합니다. 대형 오픈소스 LLM 정렬에 널리 쓰였습니다.

2026년 7월 Molt - A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning후젠과 함께 교신저자로 참여했습니다. NeMo-Aligner가 초대형 정렬 작업의 확장성을 목표로 했다면 Molt는 반대 방향, 즉 연구자가 통째로 읽을 수 있는 크기를 제약으로 삼은 설계입니다.