마쯔양

🏷️ 인물 음성

개요

마쯔양(Ziyang Ma, 马子阳)은 상하이교통대학교 X-LANCE 랩(MoE Key Lab of Artificial Intelligence) 소속 음성 연구자입니다. 음성 감정 표현을 자기지도로 사전학습하는 emotion2vec의 1저자로, 텍스트로 옮기지 않고 음성 신호에서 직접 감정을 뽑아내는 방향을 대표하는 연구자입니다.

생애

상하이교통대와 난양공과대학교 공동 박사 과정에 있습니다. 음성 표현 학습에서 출발해 최근에는 옴니모달 상호작용 모델 쪽으로 범위를 넓혀 Qwen3-Omni 계열 작업에도 참여했습니다.

업적

핵심 기여는 emotion2vec입니다. 레이블 없는 감정 음성 데이터를 자기지도 온라인 증류로 사전학습하면서 발화 단위 손실과 프레임 단위 손실을 함께 쓰는 구조로, 10개 언어의 음성 감정 인식 데이터셋에서 일관된 개선을 보였습니다. 노래 감정 인식, 대화 중 감정 예측, 감성 분석 같은 인접 과제로도 전이됩니다. ACL 2024 Findings에 발표됐습니다.

다국어·다코퍼스 음성 감정 인식 툴킷인 EmoBox도 공동 작업했습니다. 2026년에는 VoiceMem - Streaming Dual-Brain Memory for Real-Time Interaction에 참여해, 기억 시스템의 우뇌 쪽 감정 귀인 설계에 자신의 표현 학습 배경을 붙였습니다.