루정시

🏷️ 인물 강화학습 에이전트

저장대학교(Zhejiang University) REAL 연구실 소속 연구자입니다. 에이전틱 강화학습에서 온-폴리시 자기 증류(Self-Distillation)를 적용하는 연구를 하고 있으며, SDAR(Self-Distilled Agentic Reinforcement Learning, arXiv 2605.15155)을 공동 개발했습니다. SDAR는 ALFWorld·WebShop·Search-QA에서 표준 RL 대비 큰 성능 향상을 보인 논문으로, SEED가 직접 기반으로 삼는 선행 연구입니다.

AgentOPSD - Recursive Self-Distillation for Agentic Reinforcement Learning에도 Yongliang Shen과 함께 참여했습니다. AgentOPSD는 SDAR의 최적화 설정을 그대로 물려받은 뒤, SDAR가 국소 신호로 쓰던 교사-학생 격차를 턴 단위 믿음 갱신으로 바꾼 후속 작업에 해당합니다.