마쯔위
개요
마쯔위(Ziyu Ma)는 알리바바 AMAP-ML 소속 연구자입니다. LLM 에이전트가 긴 과제를 어떻게 끝까지 밀고 나가는가를 여러 각도에서 다뤄 왔습니다. 스킬을 진화시키는 쪽(SkillClaw), 롤아웃 구조를 바꾸는 쪽(Tree-GRPO), 그리고 하네스 자체를 다시 짜는 쪽(LongHorizon-Harness)입니다.
업적
Tree-GRPO는 LLM 에이전트 강화학습에서 독립적인 체인 롤아웃 대신 트리 탐색 롤아웃을 쓰자는 제안입니다. ReAct 단계를 노드로 삼아 의미가 분명한 탐색 트리 위에서 샘플링하며, ICLR 2026에 채택되었습니다.
SkillClaw는 미리 정의된 정적 스킬을 쓰던 에이전트를 스스로 개선하는 스킬 생태계로 옮기려는 프레임워크로, 마쯔위가 1저자입니다.
LongHorizon-Harness(2026)에서는 공동 1저자로 참여했습니다. 장기 실행을 하나의 커지는 세션이 아니라 태스크 상태 관리 문제로 다시 정의하고, 관리·실행·감사 세 역할을 분리한 루프를 제안했습니다.
관련 인물
같은 AMAP-ML 팀의 추샹샹이 시니어 저자로, 왕융이 프로젝트 리드로 여러 논문에 함께 이름을 올립니다.