구치
메이퇀 소속 연구자로, 메이퇀·저장대학교·칭화대학교가 함께 굴리는 에이전틱 강화학습 연구 라인의 메이퇀 쪽 축입니다.
특권 컨텍스트를 받은 교사 분기에서 토큰 수준 밀집 감독을 끌어내는 SDAR(Self-Distilled Agentic Reinforcement Learning), 에이전트가 추론 시점에 동적으로 불러오는 절차적 지식 꾸러미를 다룬 SKILL0, 낯선 환경에서 조급하게 활용으로 넘어가는 실패를 자율 탐색으로 푸는 Look Before You Leap에 참여했습니다.
AgentOPSD - Recursive Self-Distillation for Agentic Reinforcement Learning의 교신저자입니다. 이 논문이 최적화 설정을 그대로 물려받은 SDAR, 그리고 특권 스킬을 꺼내오는 SkillBank가 모두 이 계보에서 나왔습니다.