Long-Horizon-Terminal-Bench - Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading

🏷️ 논문 에이전트 AI평가 LLM

Z. Li, Z. Li, Y. Shi, R. Wang, J. Yang, Z. Liu, X. Wu, A. Li, Y. Yu, N. Liu, L. Sun, H. Mi, and L. Liang, "Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading," arXiv:2607.08964, 2026.

현재 AI 에이전트 평가는 두 가지 맹점을 갖고 있습니다. 첫째, 대부분의 벤치마크가 수 분 안에 끝나는 짧은 태스크만 다룹니다. 둘째, 채점이 최종 상태의 성공/실패만 봅니다. 수십 단계를 거쳐 거의 완성했지만 마지막 검증에서 실패한 에이전트와, 시작부터 아무 진전이 없던 에이전트가 같은 점수를 받는 구조입니다.

Long-Horizon-Terminal-Bench(LHTB)는 이 두 맹점을 동시에 공략합니다. 수십 분에서 수 시간이 걸리는 현실적 워크플로우를 태스크로 삼고, 세분화된 서브태스크 점수로 부분 진행률을 직접 측정합니다.

저자

Zongxia Li와 Zhongzhi Li, Yucheng Shi가 공동 1저자입니다. Zongxia Li는 메릴랜드대학교(UMD) 박사과정 학생으로 Tencent HY LLM Frontier에도 소속되어 있으며, 에이전트 평가와 비전언어모델 자기보상 학습 분야에서 여러 논문을 발표했습니다. 시니어 저자 LeoweiLiang은 Tencent HY LLM Frontier의 수석 연구원으로, LLM 에이전트의 장기 자율 실행 연구를 이끌고 있습니다. Lichao Sun(Lehigh University)을 비롯해 UMD, University of Georgia, University of Minnesota, Indiana University, Hong Kong Polytechnic University 등 여러 기관이 공동 작업에 참여했습니다.

배경

지금까지의 터미널 에이전트 벤치마크, 예컨대 SWE-Bench나 Terminal-Bench 2는 주로 수 분 안에 끝나는 태스크를 다룹니다. 이 설계에는 구조적 한계가 있습니다.

첫째, 실제 전문가 워크플로우는 훨씬 깁니다. 논문 실험 재현, 복잡한 멀티모달 데이터셋 감사, 로봇공학 SLAM 파이프라인 수리, 기후 데이터 분석 같은 작업은 수백 단계와 수십 분에서 수 시간이 필요합니다.

둘째, 이진(binary) 성공/실패 채점은 정보 손실이 큽니다. 90%를 완성하고 마지막 숨은 검증에서 떨어진 에이전트가 0%에서 멈춘 에이전트와 동일한 점수를 받습니다. 이 채점 구조 아래에서는 에이전트가 실제로 어디서 무너지는지 알 수 없습니다.

LHTB는 이 두 문제를 해결하기 위해 설계된 벤치마크입니다.

어떻게 만들었나

lhtb-overview.png

각 LHTB 태스크는 Harbor 포맷을 따릅니다. 자연어 지시문, Docker 이미지(필요한 파일·코드·도구·데이터 전체 포함), 태스크 설정 파일, 그리고 채점용 참조 구현(oracle) 또는 시뮬레이터로 구성됩니다. 에이전트는 터미널 명령만으로 태스크를 완수해야 합니다.

채점 방식: 서브태스크 기반 밀집 보상

각 태스크는 의미 있는 중간 목표들로 분해됩니다. 서브태스크 \(\{s_1, \ldots, s_K\}\) 각각에 대해 정규화된 점수 \(r_k \in [0, 1]\)을 계산하고, 전체 태스크 보상은 가중 평균입니다.

\[R = \frac{\sum_{k=1}^{K} w_k r_k}{\sum_{k=1}^{K} w_k}\]

서브태스크는 세 종류입니다.

숨겨진 스트레스 테스트

공개 검사는 CLI 동작, 파일 형식, 간단한 예시만 확인하며 낮은 가중치를 부여합니다. 대부분의 보상은 동적으로 생성되는 숨겨진 스트레스 케이스에서 나옵니다. 중첩 매니페스트, gzip+base64 래퍼, 이름 바뀐 필드, 누락 값, 주입된 노이즈, 회전/잘린 이미지 같은 변형이 포함됩니다. 공개 케이스만 패치하거나 하드코딩해서는 높은 점수를 받을 수 없습니다.

난이도 조정

DeepSeek-V4-Pro를 1.5시간 예산으로 반복 실행하면서 원칙적으로는 풀 수 있지만 어려운 수준으로 태스크를 조정했습니다. 120개 후보 태스크 중 품질 필터링을 거쳐 최종 46개가 선정됐습니다.

무엇으로 구성돼 있나

lhtb-task-distribution.png

46개 태스크는 9개 카테고리에 걸쳐 있습니다. 소프트웨어·역공학(7개, 15%), 지구·기후·에너지(6개, 13%), 멀티모달·영상 분석(6개, 13%), 과학 컴퓨팅·시뮬레이션(6개, 13%), 연구 재현·ML(5개, 11%), 시스템·성능·보안(5개, 11%), APEX 전문 워크플로우(4개, 9%), 인터랙티브 게임(4개, 9%), 논리·제약 퍼즐(3개, 7%)입니다.

태스크 사례는 다양합니다. 로봇공학 SLAM 벤치마크 수리, 기후 NetCDF 극단 기상 이벤트 감사, 현미경 세포 계수 QC, 위성 홍수 변화 감지, 과학 논문 그림 데이터 재구성, 스캔 문서 표 레이아웃 복원, APEX 법률·투자은행·컨설팅 시뮬레이션이 포함됩니다. 평균 롤아웃 시간은 에피소드 기준 239회, 88.9분, 토큰 수 9.8M입니다.

결과

lhtb-leaderboard.png

17개 프런티어 모델을 Terminus-2 에이전트 하네스로 평가했습니다 (GPT-5.3은 Codex 하네스 사용).

모델

Pass@1 (R≥0.95) (%)

Pass@1 (R≥1.0) (%)

평균 보상 R

Grok 4.5

28.3

19.6

0.51

GPT-5.6-sol

15.2

8.7

0.45

GPT-5.5

15.2

10.9

0.44

MiniMax M3

6.5

6.5

0.39

Kimi K2.7 Code

6.5

4.3

0.37

DeepSeek V4 Pro

6.5

0.0

0.31

Qwen3.7 Max

4.3

0.0

0.30

Doubao Seed 2.1 Pro

4.3

0.0

0.29

Gemini 3.1 Pro

4.3

0.0

0.28

GLM 5.1

4.3

0.0

0.27

GPT-5.3 Codex

4.3

2.2

0.21

GLM 5.2

2.2

0.0

0.32

Qwen3.6 Plus

2.2

0.0

0.31

Hy3

2.2

0.0

0.29

GPT-5.4

2.2

2.2

0.27

Kimi K2.6

0.0

0.0

0.25

Grok 4.20

0.0

0.0

0.10

R≥1.0 기준에서 10개 모델이 0점, 전체 평균 Pass@1은 6.4%.

밀집 보상의 필요성. \(R \geq 1.0\) 기준에서 10개 모델이 태스크를 하나도 완료하지 못합니다. 이진 채점을 적용하면 이 모델들이 모두 동일한 "완전 실패"로 뭉뚱그려집니다. 그러나 평균 보상 \(R\)은 0.10(Grok 4.20)에서 0.32(GLM 5.2)까지 차이가 납니다. 실제 진행 상황이 크게 다름에도 이진 점수로는 구분이 안 되는 셈입니다.

Pass Rate와 평균 보상의 Spearman 상관관계는 \(\rho = 0.74\)로 양의 상관이지만 완전하지 않습니다. 두 지표가 서로 다른 것을 측정하기 때문입니다. Pass Rate는 태스크를 끝까지 완수했는지, 평균 보상은 중간까지라도 얼마나 일관되게 진행했는지를 봅니다.

Near-miss 현상. \(0.75 \leq R < 0.95\) 구간(거의 완성했지만 최종 검증 실패)의 실행이 완전 통과(50회)보다 거의 두 배(90회)나 많습니다. 예를 들어 Kimi K2.6은 \(R \geq 0.95\) 기준 Pass 0이지만, grammar-fuzz-coverage-hunt 태스크에서 \(R = 0.94\), spot-scheduler-traces에서 \(R = 0.90\)에 도달합니다. 이진 채점이라면 이 모든 진전이 보이지 않습니다.

비용 효율. 태스크당 평균 비용은 약 \(10.8이며, Grok 4.5가 약\)11로 가장 높은 Pass Rate를 달성하면서 비용 효율 프런티어에 위치합니다. GPT-5.6-sol·GPT-5.5는 비슷한 Pass Rate를 약 \(21에 내놓아 Grok 4.5 대비 두 배 이상 비쌉니다. GPT-5.4는 가장 비싸면서(\)26) Pass Rate는 낮습니다. 에피소드 수가 많기 때문입니다(GPT-5.5의 208회 대비 302회).

회고

핵심 병목은 로컬 추론이 아닌 장기 완주. 미해결 실행의 79%가 타임아웃으로 종료됩니다. 에이전트가 무언가 계속 시도 중에 90분 예산이 다 소진된 경우입니다. 이는 짧은 태스크에서 자주 관찰되는 "사양 위반, 단계 반복, 종료 조건 놓침" 같은 로컬 실행 오류와는 성격이 다릅니다. 에이전트가 부분적으로 옳은 행동을 이어가면서도 고정된 예산 안에 완성된 아티팩트를 내놓지 못하는 것입니다.

거짓 완료(False Finish). 스스로 종료한 124개 실행 중 14개가 \(R \geq 0.75\) 상태에서 조기 종료됐습니다. 시간이 20분 가까이 남은 상태에서 에이전트가 "완료"라고 판단하고 멈춘 것입니다. Kimi K2.7 Code는 duckdb-optimizer-closure에서 \(R = 0.92\) 상태로, GLM 5.2는 apex-ib244-matter에서 \(R = 0.90\) 상태로 멈췄습니다. 이는 자기 검증(self-verification) 능력이 부족하다는 신호입니다. 공개 테스트가 통과됐더라도 숨겨진 스트레스 케이스를 적극적으로 찾아내는 능력이 없으면 이런 패턴이 발생합니다.

저자들이 인정하는 한계도 있습니다. 46개 태스크는 특정 도메인(터미널 기반, 컨테이너화)에 국한됩니다. GUI 기반 작업, 다중 에이전트 협업, 지속적 환경 변화(online, streaming) 같은 시나리오는 다루지 않습니다. 또한 어떤 에이전트 하네스를 쓰느냐(Terminus-2 vs Codex)가 결과에 영향을 줄 수 있다는 점도 인정하고 있습니다.

정리