셰즈페이

🏷️ 인물 멀티모달

개요

Zhifei Xie(謝志飛)는 난양공과대학교(Nanyang Technological University, NTU) 소속 연구자로, 실시간 풀듀플렉스 음성 언어 모델 분야의 선도적 연구자입니다. Mini-Omni 시리즈를 통해 "듣는 동시에 말할 수 있는" 오디오 언어 모델의 구현 가능성을 보여줬으며, Audio-Reasoner, Mini-Omni-Reasoner 등 후속 연구로 실시간 음성 추론 모델의 흐름을 열고 있습니다.

생애

Xie는 초기에 칭화대학교 소속으로 Mini-Omni 연구를 시작했고, 이후 NTU로 소속을 옮겼습니다. NTU에서는 먀오춘옌, 예더헝, 옌수이청 등과 협력하며 음성 모델 연구를 이어가고 있습니다. 2024년 Mini-Omni를 처음 발표한 이후 빠른 속도로 후속 논문을 쏟아내고 있습니다.

Mini-Omni 초판이 아직 학계에서 잘 알려지지 않은 신진 연구자의 단독 주도 프로젝트였다는 점에서, 짧은 기간 내에 음성 대화 AI 커뮤니티에서 참조 기준이 되는 작업을 만들어냈다는 평가를 받고 있습니다.

업적

Xie의 핵심 기여는 Mini-Omni 계열 오디오 언어 모델 설계입니다. 2024년에 발표한 Mini-Omni는 텍스트로 지시를 받고 음성을 출력하는 기존 방식에서 벗어나, 스트리밍 환경에서 생각하면서 동시에 말하는 방식을 구현한 초기 오픈소스 시도입니다. 배치 병렬 추론을 활용해 실시간 음성 대화에 필요한 지연 시간을 줄였습니다.

2025년에는 Audio-Reasoner(EMNLP 2025)를 통해 오디오 언어 모델의 추론 역량을 강화하는 작업을 발표했습니다. 같은 해 Mini-Omni-Reasoner에서는 토큰 단위 추론과 발화를 동시에 진행하는 "Token-Level Thinking-in-Speaking" 메커니즘을 제안했습니다.

Audio Interaction Model 논문에서는 공동 1저자로, 오프라인 LALM과 단일 과제 스트리밍 모델을 하나의 always-on 아키텍처로 통합하는 SoundFlow 프레임워크를 제안했습니다. perceive-decide-respond 루프로 구성된 이 구조는 Mini-Omni에서 쌓은 경험을 체계화한 결과물입니다.

여담

Xie의 연구 궤적은 음성 AI의 패러다임 전환과 정확히 맞닿아 있습니다. GPT-4o가 실시간 음성 대화 기능을 공개하기 직전인 2024년에 오픈소스로 유사한 기능을 구현했다는 점에서, 방향성을 앞서 포착한 사례로 꼽힙니다.

NTU 그룹 내에서 양둥차오, 먀오춘옌 등과 이어진 협력 네트워크는 NTU가 음성 AI 연구의 중요 거점으로 부상하는 흐름과 맞물려 있습니다.

주요 논문