천젠뤼

🏷️ 인물 LLM 오픈소스 NLP

베이징인공지능연구원(BAAI)과 중국과학기술대학교(USTC)에 걸쳐 있는 연구자입니다. 텍스트 임베딩 모델, 특히 BGE 계열을 주로 다뤄 왔습니다.

대표 논문은 M3-Embedding의 공동 1저자입니다. 다국어(Multi-Linguality), 다기능(Multi-Functionality), 다입도(Multi-Granularity) 세 축을 한 모델에 담아 100개 넘는 언어를 지원하고, 다국어·교차언어 검색에서 당시 최고 성능을 냈습니다. 이후 텍스트 임베더를 few-shot 학습자로 만드는 연구와 이종 정보 검색 벤치마크인 AIR-Bench에도 참여했습니다.

Repo-To-Skill - Distilling GitHub Repositories Into AI4AI Skills(2026)의 공동 1저자입니다. 임베딩 모델을 만들며 다뤄 온 "대규모 자원을 어떻게 정리해 쓸 수 있는 형태로 내놓을 것인가"라는 문제를, 이 논문에서는 저장소 1,000개를 스킬 그래프로 바꾸는 작업으로 옮겼습니다.