왕쯔한

🏷️ 인물 강화학습 에이전트 LLM NeurIPS논문

칭화대학교 선전 국제대학원(Tsinghua Shenzhen International Graduate School)에서 Yujiu Yang 교수 지도로 인공지능 석사과정을 밟고 있는 연구자입니다. 도구를 쓰는 언어 모델의 신뢰성 문제에서 출발해 에이전틱 강화학습으로 넘어온 이력을 가지고 있습니다.

ICML 2025에 「Reducing Tool Hallucination via Reliability Alignment」, EMNLP 2025 본회의에 「Alignment for Efficient Tool Calling of Large Language Models」를 냈고, 모델 가중치를 갱신하지 않고 경험으로 학습하는 메모리 기반 프레임워크 Memento와 멀티턴 강화학습으로 에이전트의 자기진화를 분석한 RAGEN에도 참여했습니다.

AgentOPSD - Recursive Self-Distillation for Agentic Reinforcement Learning메이퇀 인턴십 기간에 수행한 작업이며, 코드는 본인 계정(github.com/ZethWang/AgentOPSD)으로 공개돼 있습니다.