Sakana Fugu

🏷️ 정보 LLM 에이전트

이 글은 Sakana AI 공식 발표를 참고하여 작성했습니다.

Sakana AI가 2026년 6월 22일 멀티에이전트 오케스트레이션 시스템 Fugu를 정식 출시했습니다. 한 줄로 요약하면, "하나의 모델 API로 제공되는 멀티에이전트 시스템"입니다. 사용자는 OpenAI 호환 엔드포인트 하나만 호출하지만, 그 뒤에서는 여러 프런티어 모델이 협업합니다.

먼저 짚을 게 있습니다. Fugu는 GPT나 Claude 같은 단일 거대 모델이 아닙니다. 실제로 답을 추론하고 생성하는 일은 뒤에 있는 여러 프런티어 모델이 맡습니다. Fugu 자체는 그 모델들을 지휘하는 작은 LLM 하나와 오케스트레이션 시스템입니다. Sakana는 이것을 "파운데이션 모델"이라 부르는데, 지휘자 역시 강화학습으로 훈련된 LLM이고 사용자에게는 모델 하나처럼 보이기 때문입니다. 정리하면, 속은 멀티에이전트 시스템이고 겉은 모델 하나입니다.

지금까지 경쟁은 단일 모델을 얼마나 크고 강하게 키우느냐였습니다. Fugu는 다른 축을 봅니다. 이미 존재하는 최고 모델들을 문제마다 어떻게 조합하고 지휘하느냐입니다.

지휘자 모델

Fugu의 핵심은 작은 언어 모델 하나입니다. 이 모델은 답을 직접 생성하기보다, 들어온 문제를 쪼개고, 에이전트 풀에서 적절한 모델을 골라 일을 맡기고, 결과를 모아 합치는 역할을 합니다. Sakana는 이 지휘자를 "작은 언어 모델"이라고만 소개하고 정확한 파라미터 수는 공개하지 않았습니다. 일부 외신은 7B 규모라고 보도했지만 공식 확인된 수치는 아닙니다.

규칙 기반 라우팅이 아니라는 점이 중요합니다. "코딩 문제는 A 모델로" 같은 고정 규칙을 사람이 짜둔 게 아니라, 지휘자가 강화학습으로 직접 조합 전략을 학습했습니다. 문제 유형에 따라 어떤 모델을 부를지, 몇 단계로 나눌지, 서로 어떻게 대화하게 할지를 스스로 결정합니다.

에이전트 풀은 교체 가능합니다. Fugu가 내부에서 어떤 모델을 고르고 어떻게 엮는지는 공개하지 않는데(설계상 비공개), 덕분에 특정 제공사가 접근을 막아도 다른 모델로 우회할 수 있습니다.

재귀 호출

Fugu는 자기 자신을 다시 부를 수 있습니다. 한 번 낸 출력을 컨텍스트로 다시 읽어 들이고, 지휘 전략을 수정할지 판단합니다. Sakana는 이를 새로운 형태의 테스트 타임 스케일링이라고 설명합니다. 모델 크기를 키우는 대신, 추론 시점에 자기 결과를 되짚으며 협업 구조를 다듬어 성능을 끌어올리는 방식입니다. 에이전트가 에이전트를 부르는 이 구조는 재귀적 멀티에이전트 시스템의 한 갈래입니다.

두 가지 연구 기반

Fugu는 ICLR 2026에 발표된 두 논문 위에 서 있습니다.

두 논문의 공통점은 "어떻게 협업시킬지"를 사람이 손으로 짜는 대신 학습으로 찾는다는 점입니다.

두 변형

Fugu는 두 가지로 나옵니다.

벤치마크

Fugu Ultra는 Claude Fable 5, Mythos Preview, Gemini 3.1 Pro, Opus 4.8, GPT 5.5 같은 프런티어 모델들과 여러 벤치마크에서 대등하거나 앞섭니다. 공식 수치는 다음과 같습니다.

벤치마크

Fugu

Fugu Ultra

Opus 4.8

Gemini 3.1 Pro

GPT 5.5

SWE Bench Pro

59.0

73.7

69.2

54.2

58.6

TerminalBench 2.1

80.2

82.1

74.6

70.3

78.2

LiveCodeBench

92.9

93.2

87.8

88.5

85.3

GPQA-D

95.5

95.5

92.0

94.3

93.6

CharXiv Reasoning

85.1

86.6

84.2

83.3

84.1

SWE Bench Pro에서 73.7로 Opus 4.8(69.2)을 4.5점 앞선 점이 두드러집니다. 단일 모델 하나로 풀 때보다, 여러 모델을 문제마다 골라 쓰는 쪽이 더 높은 점수를 낸다는 뜻입니다.

벤치마크 외에도 AutoResearch(자동 연구), 루빅스 큐브, 기계 설계, 일본어 손글씨 분석, 원샷 체스, 금융 시계열 예측 같은 응용 과제에서 Gemini 3.1 Pro, Opus 4.8, GPT 5.5를 앞섰다고 밝혔습니다.

가격과 접근

API는 OpenAI 호환 단일 엔드포인트로 제공됩니다. 기존 시스템에 모델 이름만 바꿔 끼우는 수준으로 붙일 수 있습니다.

Fugu Ultra 종량제 요금(1M 토큰 기준)은 다음과 같습니다.

항목

기본

컨텍스트 272K 초과

입력

\(5 |\)10

출력

\(30 |\)45

캐시 입력

\(0.50 |\)1.00

일상 사용자용 구독은 Standard \(20/월, Pro\)100/월, Max $200/월 세 단계입니다. 대량·기업 워크로드는 종량제로 받습니다. 접근은 console.sakana.ai에서 가능합니다.


무조건 큰 모델이 답인가? 작은 지휘자 하나가 기존 최고 모델들을 잘 엮기만 해도 단일 프런티어 모델을 넘어선다면, 다음 경쟁의 무게중심은 모델 크기가 아니라 오케스트레이션으로 옮겨갈 수 있습니다.

구조상 의존도 문제는 남습니다. Fugu의 성능은 에이전트 풀에 든 외부 모델들의 성능에 묶여 있습니다. 풀이 교체 가능하다는 게 강점이지만, 동시에 자체 프런티어 모델을 가진 회사와는 출발선이 다릅니다. 지휘 기술이 모델 자체의 해자가 될 수 있을지는 더 지켜봐야 할 부분입니다.

이 글은 Sakana AI 공식 발표의 내용을 바탕으로 정리했습니다.