류자헝
개요
류자헝(Jiaheng Liu, 刘家恒)은 난징대학교(Nanjing University, NJU) 컴퓨터과학기술학부 조교수로, 2025년 부임해 NJU-LINK(NJU Large-scale Intelligence and Knowledge Laboratory) 랩을 이끌고 있습니다. LLM 사전학습, 정렬(alignment), 가속화, 코드 지능, 평가 분야를 아우르는 연구를 수행하며, 특히 LLM 추론과 에이전트 평가에서 두각을 나타냅니다.
ICML, NeurIPS, ICLR, ACL, CVPR 등 최상위 국제 학술 행사에 50편 이상의 논문을 발표했으며, 그중 1저자 및 교신저자 논문이 20편 이상입니다. Google Scholar 피인용 수 2,000회를 넘겼고, ACL 2024 Outstanding Paper Award를 수상했습니다.
NJU-LINK 랩은 매년 박사 2명, 석사 3명 규모로 학생을 모집하며 학부 연구 인턴도 받습니다. EMNLP 2025의 로컬 체어를 맡았으며, ICLR 2025에서는 오픈 사이언스 워크숍을 공동 주최했습니다. 2026년에는 텍스트-시각 혼합 보고서 생성을 위한 딥 리서치 에이전트 연구(TVIR)를 발표하며 에이전트 분야로 영역을 확장하고 있습니다.
생애
류자헝은 중국에서 자라 컴퓨터과학 분야로 진학했습니다. 학부와 대학원을 거치며 LLM과 자연어처리 분야에 집중했으며, 이미 대학원 시절부터 상위 학술 행사에 꾸준히 논문을 발표해 연구 역량을 쌓았습니다.
박사 졸업 후에는 산업계 또는 선도 연구기관에서 경력을 쌓다가 2025년 난징대학교 교수로 임용되었습니다. 임용과 동시에 NJU-LINK 랩을 설립하고 독립적인 연구 그룹을 운영하기 시작했습니다. 비교적 이른 나이에 독립 PI 위치에 오른 케이스로, 중국 AI 학계에서 주목받는 신진 연구자 중 한 명으로 꼽힙니다.
교수 임용 전후로 KORGym 개발과 관련 벤치마크 연구를 활발히 진행해 왔으며, ACL 2024 Outstanding Paper Award 수상은 학계에서의 위상을 높이는 계기가 되었습니다. 국제 학술 커뮤니티와의 접점도 넓혀 EMNLP 2025 로컬 체어로 초청받는 등 조직 역할도 맡고 있습니다.
업적
류자헝의 핵심 업적 중 하나는 KORGym(Knowledge Orthogonal Reasoning Gymnasium) 개발입니다. KORGym은 LLM 추론 평가를 위한 동적 게임 플랫폼으로, 텍스트 또는 시각 형식의 50개 이상 게임에서 19개 LLM과 8개 VLM을 평가합니다. 정적 벤치마크와 달리 멀티턴 대화와 강화학습 시나리오를 지원해 추론 능력을 보다 실제적으로 측정할 수 있다는 점에서 주목받았습니다.
코드 지능 분야에서는 OpenCoder와 Chinese-Tiny-LLM, MAP-Neo-7B 등 실제 공개 모델 개발에 기여했습니다. 이는 순수 학술 연구에 그치지 않고 오픈소스 생태계 발전에 직접 기여하는 방식으로 연구를 확장한 것입니다.
LLM 길이 확장 문제를 다룬 E2-LLM(ACL 2024)에서는 효율적인 문맥 창 확장 방법을 제안해 Outstanding Paper Award를 수상했습니다. ConceptMath(ACL 2024)에서는 수학적 추론 능력 측정의 새로운 척도를 제시했으며, RoleLLM에서는 역할극(role-play) 능력 벤치마크를 개발했습니다. 2026년에는 TVIR을 통해 텍스트와 시각 정보를 혼합한 딥 리서치 에이전트 연구를 발표했습니다.
여담
류자헝은 게임이라는 매개를 통해 LLM의 추론 능력을 평가하는 접근법을 적극적으로 밀어왔습니다. 게임은 규칙이 명확하고 결과가 객관적이어서 LLM의 전략적 사고와 다단계 추론을 측정하기에 적합한 환경이라는 것이 그의 핵심 주장입니다.
NJU-LINK 랩의 이름에서도 알 수 있듯이 "대규모 지능과 지식의 연결"을 연구 철학으로 내세웁니다. 사전학습, 정렬, 코드 지능, 에이전트 평가를 하나의 통합된 프레임워크에서 다루려는 시도가 랩 전체의 방향성에 녹아 있습니다.
젊은 나이에 독립 PI가 되었으나 이미 50편 이상의 논문과 2,000회 이상의 인용을 갖추고 있어, 연구 생산성 측면에서 동료 집단 중 상위에 해당합니다. 오픈소스 프로젝트 참여와 EMNLP 로컬 체어 역할 등 커뮤니티 기여에도 적극적입니다.
주요 논문
- E2-LLM: Efficient and Extreme Length Extension of Large Language Models (ACL 2024, Outstanding Paper Award)
- ConceptMath: A Bilingual Concept-wise Benchmark for Measuring Mathematical Reasoning of Large Language Models (ACL 2024)
- KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation (arXiv 2025)
- RoleLLM: Benchmarking, Eliciting, and Enhancing Role-Playing Abilities of Large Language Models (2024)
- OpenCoder: The Open Cookbook for Top-Tier Code Large Language Models (ACL 2025)
- MAP-Neo: Highly Capable and Transparent Bilingual Large Language Model Series (2024)
- TMGBench: A Systematic Game Benchmark for Evaluating Strategic Reasoning Abilities of LLMs (2024)
- Chinese-Tiny-LLM: Pretraining a Chinese-Centric Large Language Model (COLM 2024)
- TVIR: Building Deep Research Agents Towards Text-Visual Interleaved Report Generation (arXiv 2026)
- MMG2Skill: Can Agents Distill In-the-Wild Guides into Self-Evolving Skills (2025, corresponding author)