하오저 자오
개요
하오저 자오(Haozhe Zhao)는 멀티모달 대형 언어 모델, 과학 피겨 자동 생성, 에이전트 파이프라인을 연구하는 AI 연구자입니다. 일리노이대학교 어바나-샴페인(UIUC) 컴퓨터과학과에서 민지아 장 교수의 지도 아래 연구를 수행하고 있으며, 연락처는 haozhez6@illinois.edu입니다.
연구의 핵심 주제는 "연구자가 실제로 마주하는 복잡한 워크플로우를 자동화하는 것"입니다. 스케치에서 피겨를 생성하거나 기존 피겨를 목적에 맞게 편집하는 작업처럼, 단순한 텍스트-이미지 변환을 넘어서는 복잡한 과학 시각화 파이프라인을 에이전트 시스템으로 다룹니다. 2025~2026년에는 Crafter와 CraftEditor 연구로 국제 AI 커뮤니티의 주목을 받았습니다.
이전에는 베이징대학교(PKU)에서 소프트웨어공학 석사 과정을 마쳤으며, PKU, UIUC, 위스콘신대학교, 칭화대학교, 마이크로소프트 리서치 아시아 등 복수 기관과 공동 연구를 진행해왔습니다.
생애
하오저 자오는 학사 과정을 마친 뒤 베이징대학교 소프트웨어공학 석사 과정에 진학하여 2025년 6월 졸업했습니다. 석사 재학 중 UIUC 민지아 장 교수 연구실에서 방문 인턴십을 수행하며 멀티모달 LLM과 데이터 중심 AI 연구를 본격적으로 시작했습니다.
인턴십 기간 동안 이미지 편집, 시각-언어 모델 정렬, 과학 피겨 생성 등 여러 방향의 연구를 동시에 진행했습니다. NeurIPS 2024에서 이미지 편집 관련 논문 UltraEdit이 채택되면서 국제 무대에서 성과를 인정받았습니다. 석사 졸업 전후로 UIUC 박사 과정에 합류하여 민지아 장 교수의 공식 지도 아래 연구를 이어가고 있습니다.
2025년에는 스정 스와 공동 1저자로 Crafter 논문(arXiv:2605.30611)을 발표하여 다중 에이전트 기반 과학 피겨 생성 프레임워크를 선보였습니다. 베이징대학교, UIUC, 마오송 선, 민지아 장 등 여러 기관 연구자들과의 긴밀한 협업으로 완성된 연구입니다.
업적
하오저 자오의 대표 연구 성과는 Crafter 프레임워크입니다. Crafter는 다양한 입력(텍스트, 스케치, 마스크, 기존 피겨)으로부터 출판 품질의 과학 피겨를 생성하고 편집할 수 있는 다중 에이전트 하네스입니다. 아키텍처 변경 없이 학술 피겨, 포스터, 인포그래픽 등 다양한 피겨 유형에 범용 적용이 가능하며, CRAFTBENCH라는 전용 평가 데이터셋도 함께 공개했습니다.
Crafter와 쌍을 이루는 CraftEditor는 생성된 래스터 이미지를 좌표 정합성이 보장된 편집 가능 SVG로 변환하는 시스템입니다. 연구자가 생성 결과를 세부적으로 수정할 수 있게 해주는 편집 단계를 에이전트 파이프라인으로 통합한 점이 특징입니다.
이 밖에도 대규모 명령 기반 이미지 편집 데이터셋을 활용해 세밀한 이미지 편집 성능을 높인 UltraEdit(NeurIPS 2024), 패션 스타일링 개인화 연구인 StyleTailor(2025), UI 코드 생성의 토큰 효율성을 높인 EfficientUICoder(2025) 등 멀티모달 LLM의 다양한 응용 분야에 걸쳐 연구 성과를 냈습니다. 총 8편 이상의 논문을 국제 최상위 학술대회에 발표했습니다.
여담
하오저 자오의 연구는 AI 도구가 학술 커뮤니케이션을 어떻게 바꿀 수 있는지를 구체적으로 보여주는 사례입니다. 과학 논문에서 피겨는 아이디어를 가장 효과적으로 전달하는 수단이지만, 출판 품질의 피겨를 만들기 위해 연구자들이 쏟는 시간은 상당합니다. Crafter는 이 병목 지점을 자동화하는 것을 목표로 합니다.
CRAFTBENCH 데이터셋 구축에도 큰 비중을 두어, 단순히 시스템을 만드는 데 그치지 않고 분야 자체의 평가 인프라를 마련했습니다. 이는 데이터 중심 AI 연구 방법론을 따르는 그의 연구 철학을 잘 보여줍니다.
민지아 장 교수 연구실은 시스템 효율화와 데이터 품질 향상을 연결하는 독특한 방향성으로 알려져 있으며, 하오저 자오는 그 방향성을 멀티모달 에이전트 응용으로 확장하는 역할을 맡고 있습니다.
주요 논문
- Crafter - A Multi-Agent Harness for Editable Scientific Figure Generation from Diverse Inputs (arXiv:2605.30611, 2025) -- 스정 스와 공동 1저자. 다중 에이전트 기반 과학 피겨 생성·편집 프레임워크.
- UltraEdit: Instruction-based Fine-Grained Image Editing at Scale (NeurIPS 2024) -- 대규모 명령 기반 세밀 이미지 편집 데이터셋 및 모델.
- StyleTailor: Towards Personalized Fashion Styling via Hierarchical Negative Feedback (2025) -- 계층적 부정 피드백을 활용한 패션 스타일링 개인화.
- EfficientUICoder: Efficient MLLM-based UI Code Generation via Input and Output Token Compression (2025) -- 토큰 압축 기반 UI 코드 생성 효율화.
- PosterCopilot: Toward Layout Reasoning and Controllable Editing for Professional Graphic Design (2024) -- 레이아웃 추론 기반 그래픽 디자인 자동화.