Jet-Long - Efficient Long-Context Extension with Dynamic Bifocal RoPE
H. Tang, Z. Wang, Y. Gu, S. Han, H. Cai, "Jet-Long: Efficient Long-Context Extension with Dynamic Bifocal RoPE," arXiv:2607.07740, 2026.
긴 컨텍스트를 다루는 방법은 크게 둘로 갈립니다. 긴 데이터로 다시 학습시키거나, 학습 없이 위치 인코딩만 손봐 외삽하거나입니다. 앞쪽은 비용이 크고, 뒤쪽은 짧은 입력에서 성능이 깎이는 대가를 자주 치릅니다. MIT HAN Lab과 NVIDIA 연구진의 Jet-Long은 뒤쪽 방식을 택하되 그 대가를 줄이려 합니다.
Dynamic Bifocal RoPE
이름 그대로 초점이 둘입니다. 가까운 토큰과 먼 토큰을 다르게 봅니다.
로컬 구간은 원래 RoPE의 회전을 그대로 유지합니다. 가까운 위치 관계는 모델이 학습한 그대로 두어 짧은 입력 성능을 지키기 위해서입니다. 장거리 구간은 시퀀스 길이에 따라 재스케일 계수가 달라지는데, 이 계수를 학습하는 것이 아니라 해석적으로 계산합니다. 별도 파라미터가 없고 튜닝도 없습니다. 입력이 길어지면 먼 구간의 회전만 길이에 맞춰 자동으로 조정됩니다.
결과적으로 짧은 입력에서는 기존 모델과 똑같이 동작하고, 긴 입력에서만 외삽이 개선됩니다. 두 초점을 분리했기 때문에 한쪽을 얻으려고 다른 쪽을 내주지 않아도 됩니다.
결과
H100에서 FlashAttention-2 대비 최대 1.39배 처리량을 기록했습니다. RULER와 HELMET-RAG 같은 롱컨텍스트 벤치마크에서 베이스라인 대비 개선을 보였고, Qwen3 계열로 최대 128K 컨텍스트까지 검증했습니다. 추가 학습이 없으니 기존 모델에 바로 얹을 수 있다는 점이 실전에서는 특히 유리합니다.
한계
튜닝 없이 위치 인코딩만 다루는 방식이라, 긴 데이터로 구조를 재학습하는 접근이 도달할 수 있는 상한에는 못 미칠 여지가 있습니다. 실험은 Qwen3 계열과 128K 길이에 맞춰져 있어, 다른 모델 계열이나 더 긴 길이에서 같은 이득이 유지되는지는 확인이 필요합니다. 아직 동료 심사 전 프리프린트입니다.
방향은 실용적입니다. 롱컨텍스트가 필요할 때마다 재학습을 감당하기는 어렵고, 짧은 입력 성능을 지키면서 긴 길이만 싸게 여는 방법은 배포 관점에서 바로 쓸모가 있습니다.
출처: Jet-Long - Efficient Long-Context Extension with Dynamic Bifocal RoPE (arXiv:2607.07740)