가오훙청
개요
Hongcheng Gao(高宏成)는 칭화대학교 College of AI 박사과정 연구자입니다. 2026년 7월 석사 학위 취득 예정이며, ZenoMind AI와도 협력 관계를 유지하고 있습니다. 연구 관심사는 대규모 추론 모델, AI 에이전트, 그리고 텍스트와 멀티모달을 아우르는 통합 모델이며, 그중에서도 공간적(spatial) 추론 과제에 특히 집중합니다. 개인 홈페이지는 hongcheng-gao.github.io에서 운영 중입니다.
멀티모달 에이전트가 실제 환경에서 얼마나 작동하는지를 정량화하는 데 집중하는 연구자입니다. 단순한 벤치마크 설계를 넘어, 에이전트가 현실 세계의 공간적 맥락을 어떻게 이해하고 행동으로 옮기는지를 묻는 시스템 설계에 관심을 둡니다. 벤치마크와 에이전트 프레임워크 양쪽에서 기여하는 연구 패턴이 특징적입니다.
NeurIPS 2025에서 GuardReasoner-VL 공저자로 이름을 올리며 VLM 안전성 평가 분야로도 연구 영역을 확장했습니다. 둥인펑과 같은 칭화대 라인에 속하며, 아직 박사과정임에도 1저자 또는 공동 1저자로 다수의 상위 학회 논문을 내고 있습니다.
생애
충칭 대학교(Chongqing University)에서 컴퓨터과학기술 학사를 2023년 6월에 취득한 뒤 칭화대학교 College of AI 석사·박사 통합 과정에 진학했습니다. 2026년 7월 석사 학위를 받고 박사 과정을 이어갈 예정입니다.
학부 시절부터 자연어 처리와 지식 편집, 적대적 견고성 분야 연구를 시작했습니다. 2022년부터 2023년에 걸쳐 LLM의 구조적 출력을 활용한 지식 편집 연구인 StruEdit를 발표했고, 이 시기의 작업이 이후 에이전트 및 멀티모달 연구로 이어지는 기반이 됩니다.
칭화대 진학 이후 둥인펑 지도 아래 멀티모달 에이전트 벤치마크 연구에 본격 진입했습니다. Spider2-V(NeurIPS 2024), SpatialWorld(2026), GuardReasoner-VL(NeurIPS 2025) 등 굵직한 협업을 이어가며 연구 이력을 쌓고 있습니다.
업적
가오훙청의 핵심 기여는 멀티모달 에이전트 평가 인프라 구축에 있습니다. NeurIPS 2024에 발표된 Spider2-V는 멀티모달 에이전트가 데이터 사이언스·엔지니어링 워크플로를 GUI 조작까지 포함해 끝까지 자동화할 수 있는지를 묻는 최초의 전문 벤치마크입니다. 494개의 실제 작업으로 구성되며, 20여 종의 엔터프라이즈급 소프트웨어를 다루는 이 벤치마크에서 당시 최고 모델조차 성공률 14% 수준에 그쳤습니다.
이 문제의식은 2026년 SpatialWorld 논문으로 이어졌습니다. AI2-THOR, CARLA, VirtualHome, EmbodiedCity 등 6종의 시뮬레이터 환경에서 760개 인간 주석 과제를 단일 인터페이스로 묶어 멀티모달 에이전트의 공간적 추론 능력을 평가합니다. GPT-5조차 Physical Overall TSR 14.4%에 머무는 결과가 나왔고, 현 세대 에이전트의 구체적 한계를 수치로 드러냈습니다.
안전성 분야에서도 GuardReasoner-VL(NeurIPS 2025)을 통해 강화 학습 기반 추론으로 VLM을 가드하는 접근을 제시했습니다. StruEdit 연구에서는 LLM의 구조적 출력(structured outputs)을 활용해 지식 편집의 속도와 정확도를 높이는 방법론을 탐구했습니다.
여담
아직 석사 과정에 있으면서도 NeurIPS 2024, NeurIPS 2025 등 최상위 학회에 공저자로 이름을 올린 연구자입니다. Spider2-V 결과 발표 당시 "당대 최고 모델의 성공률 14%"라는 수치는 에이전트 연구 커뮤니티에 상당한 반향을 일으켰고, 이 수치가 이후 SpatialWorld에서도 비슷한 방식으로 반복되었습니다.
ZenoMind AI와의 협력 관계를 병행하는 점도 눈에 띕니다. 산업계와의 접점을 일찍부터 넓히면서 벤치마크가 실제 시스템 평가로 이어지는 파이프라인에 관심을 두는 것으로 보입니다. 에이전트 평가 논문에서 공간 추론을 핵심 변수로 잡는 것도 독특한 시각입니다.
주요 논문
- Spider2-V: How Far Are Multimodal Agents From Automating Data Science and Engineering Workflows? (NeurIPS 2024)
- SpatialWorld - Benchmarking Interactive Spatial Reasoning of Multimodal Agents in Real-World Tasks (arXiv:2606.09669, 2026)
- GuardReasoner-VL: Safeguarding VLMs via Reinforced Reasoning (NeurIPS 2025)
- StruEdit: Structured Outputs Enable the Fast and Accurate Knowledge Editing for Large Language Models
- GuardReasoner: Towards Reasoning-based LLM Safeguards