스정 스
개요
스정 스(Shuzheng Si)는 칭화대학교 컴퓨터과학기술과 박사과정 연구자입니다. 마오쑹 선(Maosong Sun) 교수 지도 아래 TsinghuaNLP 연구실에서 활동하고 있습니다. 데이터 중심 NLP 방법론과 LLM 할루시네이션 문제를 연결하는 연구로 주목받고 있으며, 2025년 EMNLP에서 SAC Highlights Award를 수상하면서 젊은 연구자로서 이름을 알렸습니다.
연구의 핵심 키워드는 데이터 선택(data selection), 데이터 합성(data synthesis), 노이즈 학습입니다. LLM이 왜 잘못된 정보를 생성하는지를 모델 구조가 아닌 학습 데이터의 질과 분포 문제로 접근한다는 점이 특징입니다. 이 관점은 방대한 파라미터 튜닝 대신 소수의 핵심 데이터를 선별해 성능을 끌어올리는 실용적인 방향으로 이어집니다.
2026년 현재 ACL Findings 게재 논문과 KnowFM@ACL 2026 워크숍 논문이 있으며, 허깅페이스에서 해당 연구가 2만 건 이상 다운로드되는 등 커뮤니티 파급력도 입증하고 있습니다.
생애
스정 스는 칭화대학교 컴퓨터과학기술과에서 박사과정을 밟고 있으며, TsinghuaNLP 연구실에 소속되어 있습니다. 지도교수인 마오쑹 선은 중국 NLP 연구를 대표하는 인물로, 스정 스는 그 아래에서 데이터 중심 접근법을 집중적으로 발전시켜 왔습니다.
연구 초기에는 데이터 합성과 노이즈 학습이라는 다소 고전적인 문제에서 출발했습니다. 이후 롱 컨텍스트 정렬(long context alignment)이라는 더 현실적인 문제로 관심을 확장하면서, 수천 개의 샘플 중 어떤 것이 진짜 장거리 의존 관계를 담고 있는지를 식별하는 GATEAU 프레임워크를 개발했습니다.
2025년 EMNLP에서 GATEAU 논문이 SAC Highlights Award(8,000편 이상 제출 중 상위 35편)를 수상했습니다. 이는 박사과정 재학 중 거둔 성과로, 장거리 컨텍스트 처리가 학계의 주요 관심사로 떠오른 시점과 맞물려 주목받았습니다.
업적
스정 스의 가장 큰 기여는 LLM 할루시네이션 문제를 데이터 관점에서 체계적으로 분석한 일련의 연구입니다. 모델 구조 변경 없이 학습 데이터를 정제하고 선별함으로써 할루시네이션을 줄일 수 있다는 주장은, 대형 모델을 다루는 연구자들에게 실용적인 대안을 제시했습니다.
GATEAU는 롱 컨텍스트 정렬에서 유익한 샘플을 선정하는 프레임워크입니다. 기존 데이터 선택 방법들이 샘플의 정보량이나 불확실성만 봤다면, GATEAU는 장거리 의존 관계의 밀도를 핵심 지표로 삼아 학습 효율을 높였습니다. EMNLP 2025 SAC Highlights로 선정되며 학계의 검증을 받았습니다.
멀티에이전트 과학 논문 그림 생성 연구인 Crafter - A Multi-Agent Harness for Editable Scientific Figure Generation from Diverse Inputs에서는 하오저 자오와 공동 1저자로 참여했습니다. 칭화대-UIUC-북경대 공동 연구에서 칭화대 측 핵심 기여자 역할을 담당했습니다. 2026년에는 지시 따르기와 할루시네이션 감소를 효과적 데이터 필터링으로 동시에 달성하는 연구(ACL 2025)도 발표하며 연구 범위를 넓히고 있습니다.
여담
스정 스의 연구 접근법은 "좋은 데이터가 좋은 모델을 만든다"는 단순한 명제를 엄밀하게 증명하려는 시도입니다. 파라미터를 늘리는 스케일링 경쟁 속에서, 소수의 고품질 샘플이 수백만 개의 무작위 샘플을 대체할 수 있다는 결론은 비용과 효율 두 측면에서 모두 주목받고 있습니다.
TsinghuaNLP는 마오쑹 선, 펑차오 치 등 중국 NLP의 핵심 인물들이 포진한 연구실로, 스정 스는 이 환경에서 다수의 공동 연구를 이어가고 있습니다. GATEAU 논문에만 10명의 공저자가 참여했을 만큼 협업 지향적인 연구 문화를 보여줍니다.
중국 NLP 커뮤니티에서 박사과정 재학 중 권위 있는 어워드를 받는 경우는 드물기 때문에, 스정 스의 EMNLP 2025 수상은 향후 연구 방향에 대한 기대를 높이고 있습니다.
주요 논문
- GATEAU: Selecting Influential Samples for Long Context Alignment (EMNLP 2025, SAC Highlights Award)
- Aligning Large Language Models to Follow Instructions and Hallucinate Less via Effective Data Filtering (ACL 2025)
- Teaching Large Language Models to Maintain Contextual Faithfulness via Synthetic Tasks and Reinforcement Learning (AAAI 2026, Oral)
- Crafter - A Multi-Agent Harness for Editable Scientific Figure Generation from Diverse Inputs
- On-Policy Self-Alignment with Fine-grained Knowledge Feedback for Hallucination Mitigation (arXiv 2024)
- 3DS: Medical Domain Adaptation of LLMs via Decomposed Difficulty-based Data Selection (arXiv 2024)
- Document Segmentation Matters for Retrieval-Augmented Generation (ACL 2025 Findings)