실시간 음성 대화에 기억을 붙이려면 검색이 500ms VAD 창 안에 끝나야 합니다. VoiceMem은 기억을 정보용 좌뇌와 감정용 우뇌로 나누고, 검색 전체를 사람이 말을 멈춘 침묵 안에 숨겨 134ms에 끝냅니다.
태그: 음성
9개의 게시물
-
-
단일 Transformer로 오디오·영상·텍스트를 동시에 처리하는 실시간 풀-듀플렉스 대화 모델 — 캐스케이드 파이프라인 없이 모델 측 200ms 지연과 25fps 영상 출력을 달성합니다.
-
Audio Interaction Model 2026-06-07오프라인 오디오 언어모델과 단일 과제 스트리밍 모델을 하나의 always-on 모델로 합친 Audio Interaction Model. 매 청크마다 말할지 침묵할지를 스스로 정하는 perceive-decide-respond 루프와 이를 데이터부터 추론까지 구현한 SoundFlow 프레임워크를 뜯어봅니다.
-
칵테일 파티 문제 2026-04-10여러 신호가 섞인 혼합 신호에서 원본 신호를 분리하는 신호 분리 문제
-
Pathway 공동창업자 겸 CTO. 어텐션 메커니즘을 음성인식에 처음 적용한 2015년 논문의 1저자로, 요슈아 벤지오와 함께 시퀀스 투 시퀀스 학습의 기틀을 놓았습니다
-
청화대학교 자동화학과 정교수. 음성 합성·인식·감정 처리 및 에이전틱 AI 분야를 연구하는 시니어 연구자.
-
음성 입출력 기반 멀티모달 상호작용 모델, 실시간 음성 대화
-
상하이교통대 X-LANCE 랩 소속 음성 연구자. 음성 감정 표현 학습 모델 emotion2vec의 1저자로, 감정을 음성에서 직접 뽑아내는 표현 학습을 이끌고 있습니다.
-
카카오에서 추천 시스템을 만들던 음악 기술 박사 출신으로, OpenAI에서 CLIP과 Whisper를 직접 만든 핵심 저자가 됐다