월드 모델을 키우는 병목이 데이터나 연산이 아니라 보상 채널이라고 보는 논문입니다. 코드에는 컴파일러가, 수학에는 정답 대조가 있었는데 공간 생성에는 없었습니다. 저자들은 그 자리를 게임 엔진이 이미 채우고 있다고 주장합니다.
태그: 강화학습
103개의 게시물
-
-
강화학습 그룹 안에서 정답 어노테이션은 채점 기준으로만 쓰이고 버려집니다. 이 논문은 정답을 롤아웃 하나로 그룹에 집어넣자고 제안하는데, 그냥 넣으면 학습이 오히려 망가집니다. 왜 망가지는지가 그룹 평균 식 한 줄에 들어 있습니다.
-
Zetta ζ - An Efficient Closed-Loop Embodied Harness for Self-Evolving Physical Intelligence 2026-08-23정책 모델의 가중치를 한 번도 건드리지 않고 로봇의 성공률을 73.6%에서 93.6%까지 올립니다. 대신 진화하는 것은 코드로 짜인 런타임 크리틱과 복구 스킬입니다. 세 개의 서로 다른 시간 규모 루프가 각각 액션 주기, 롤아웃 묶음, 검증 게이트를 맡고, 전용 롤아웃 인프라가 그 진화 속도를 20배로 끌어올립니다.
-
에이전트를 고치는 대신 에이전트가 학습하는 환경을 고칩니다. 벤치마크 코드를 한 줄도 건드리지 않고 reset/step 인터페이스만 감싸서 난이도를 조절하고, 궤적을 읽어 약점을 찾아낸 뒤 그 약점을 겨냥한 래퍼를 자동으로 짜냅니다. 검증기를 그대로 물려받는 설계가 강점이자 한계입니다.
-
촉각을 관측 컨텍스트에 하나 더 얹는 대신, 다가올 액션 청크가 만들어낼 접촉 변화를 예측하는 잠재 토큰으로 바꿔 액션 전문가에 직접 물린 VTLA 파운데이션 모델. 실기기 NeoReal 9개 태스크 전승, 20개 시뮬 태스크 평균 63.8% 대 44.0%
-
검증 불가능한 품질 목표를 근사하는 대신 과제 자체를 검증 가능한 프록시 환경으로 변환하는 RL 패러다임. "누가 스파이인가" 게임으로 구현한 SpyRL이 요약·창작에서 자기진화 베이스라인을 앞서고 수학 추론에서도 7개 벤치 평균을 8.97점 올렸습니다
-
재귀적 자기개선을 담론 대신 실행 가능한 테스트베드로 내려서 잰 작업입니다. Draft·Improve·Debug·Crossover 네 개 연산자를 학습과 추론에서 같은 어휘로 쓰게 만들어, 35B 모델의 MLE-Bench Lite 메달 평균을 39.39%에서 71.21%로 올렸습니다.
-
로봇 없이 사람이 손에 쥐고 모은 조작 데이터만으로 사후학습을 끝내고, 실기 로봇에 그대로 올려도 텔레오퍼레이션과 대등하다는 것을 세 가지 백본에서 실기 롤아웃 960회로 보인 논문입니다. 핵심은 규모가 아니라 3mm 궤적 정밀도라는 데이터 충실도입니다.
-
월드 모델의 계보 2026-07-29월드 모델은 하나가 아니라 두 갈래입니다. 1943년의 오래된 발상에서 Genie 3까지, 갈라졌다 다시 만나는 계보를 따라갑니다
-
Genie 2026-07-29Google DeepMind의 인터랙티브 월드 모델 계열, 라벨 없는 영상에서 잠재 행동을 학습해 조작 가능한 세계를 생성
-
GPU 수를 늘리지 않고 2M 토큰을 넘어서는 GRPO 훈련을 가능하게 하는 실행 스택. '프롬프트는 한 번, 응답은 하나씩'이라는 단순한 원칙으로 라이브 autograd 그래프를 $P+R$에서 $R$로 줄입니다.
-
완성된 트래젝토리에서 힌드사이트 스킬을 추출해 정책 모델에 다시 증류하는 자기진화 프레임워크. 기존 결과 기반 RL의 희소 보상 문제를 토큰 수준 밀집 감독으로 해결합니다.
-
검증가능 보상 강화학습을 큰 모델에 매번 다시 돌리는 비용을 없애려는 연구입니다. 작은 모델에서 싸게 RL을 돌린 뒤 정책이 바뀐 방향만 뽑아 큰 학생 모델에 이식합니다. Qwen3-1.7B의 AIME 2024 정확도를 48.3%에서 58.3%로 올렸고, 8장짜리 A100에서 네 시간이면 끝납니다.
-
에이전트가 실행 가능한 정책 코드를 128회 에피소드 예산 안에서 반복 개선하는 능력을 측정하는 벤치마크. GPT-5.5가 Core16 16개 환경 모두 Top-2, Claude Opus 4.7이 MiniGrid에서 가장 강한 두각을 보입니다.
-
단일 에이전트 경험 학습의 구조적 결함인 Self-Confirmation Trap을 공식화하고, 이종 병렬 실행·제3자 증류·합의 기반 검증의 EDV 프레임워크로 해결합니다.
-
청화대·절강대·홍콩중문대가 공동 제안한 에이전틱 RL 프레임워크. GRPO의 희박한 결과 보상을 보완하기 위해 완료된 온-폴리시 궤적에서 에피소드·스텝 두 계층의 스킬을 추출하고, 이를 token-level 자기 증류 신호로 변환합니다. 추론 시에는 외부 스킬 라이브러리가 필요 없습니다.
-
ByteDance Seed와 NUS가 제안한 on-policy 생성 필드 증류 프레임워크. 하나의 flow-matching 학생 모델에 T2I, 로컬 편집, 글로벌 편집 능력을 충돌 없이 합성하는 세 가지 설계 원칙을 제시합니다.
-
Qwen 팀이 코딩 에이전트 보상 설계의 실전 경험을 정리한 논문. 테스트 통과, 시각 판정, 사용자 피드백, 에이전트 평가자 네 가지 방식을 분석하고, 어떤 단일 검증 함수도 모델이 강해질수록 결국 부족해진다고 주장합니다.
-
교사를 그래디언트가 아닌 프롬프트 안에 가두는 소형 VLM 포스트 트레이닝 방법론 ZPPO. 지식 증류가 OOD 일반화를 훼손하는 반면 ZPPO는 0.8B 학생에서 VLM 벤치마크 +9.3pp를 달성하면서 동시에 훈련 외 도메인도 개선합니다.
-
DragMesh-2 - Physically Plausible Dexterous Hand-Object Interaction with Articulated Objects 2026-06-22관절형 오브젝트(서랍, 문)의 가동 부위를 손-핸들 접촉만으로 움직이는 접촉 주도 프레임워크 DragMesh-2. PICA는 물리 신호를 PPO에 주입해 감쇠 4배 조건에서 State-only PPO 대비 두 배 이상의 성공률을 달성합니다.
-
Orchestra-o1 - Omnimodal Agent Orchestration 2026-06-16CUHK·LIGHTSPEED·PKU·THU 공동 연구팀이 제안한 Orchestra-o1은 텍스트·이미지·오디오·영상을 넘나드는 복합 태스크를 오케스트레이터-서브에이전트 구조로 처리하는 옴니모달 에이전트 프레임워크입니다. OmniGAIA 벤치마크에서 Gemini-3-Pro 대비 10.3%p 높은 72.8%를 기록하며 SOTA를 세웠고, 오픈소스 모델 Orchestra-o1-8B도 30.0%로 이전 최고 기록을 9.2%p 앞질렀습니다.
-
PEFT를 비용 절감 수단이 아닌 수백만 개의 퍼스널 모델을 운용하는 스케일링 메커니즘으로 재정의한 Mind Lab의 연구입니다. Scale Up, Scale Down, Scale Out 세 축의 의존 구조와 MinT 인프라를 제시합니다.
-
PPO와 GRPO가 long-tail 어휘에서 흔들리는 이유를 파헤치고, hard mask 대신 smooth regularizer로 trust region을 구현한 DRPO를 소개합니다. 6가지 실험 설정에서 일관되게 안정적인 학습을 보여주었습니다.
-
DRPO 2026-06-13LLM 강화학습에서 비율 클리핑의 구조적 한계를 지적하고, 부드러운 정규화로 대체하는 DRPO(Divergence Regularized Policy Optimization) 방법론을 살펴봅니다
-
새 LLM 에이전트를 실제 환경에 굴려보지 않고 과거 로그만으로 성능을 가늠하는 오프폴리시 평가 프레임워크 ADWM을 에모리대와 상하이교통대 연구진이 내놨습니다. 핵심은 월드 모델 자체를 디퓨전 과정으로 세우고, 정책 유도 궤적 법칙을 단일 스텝 조건부로 정확히 분해해 평가 정책이 매 디노이징 스텝을 조종하게 한 것. 네 개 멀티턴 벤치마크에서 ADWM만 모든 셀에서 양의 순위 상관을 냈습니다.
-
짐 판 2026-06-06NVIDIA AI 디렉터이자 Distinguished Scientist. GEAR Lab 공동 리더이자 휴머노이드 프로젝트 GR00T의 공동 책임자로 Physical AI를 연구합니다.
-
MetaForge - A Self-Evolving Multimodal Agent that Retrieves, Adapts, and Forges Tools On Demand 2026-06-04멀티모달 에이전트는 도구를 써서 복잡한 추론을 풀지만, 미리 정해진 도구 목록은 처음 보는 상황에 일반화되지 못하고 도구를 마구 부르면 비용과 오류만 늘어납니다. MetaForge는 에이전트의 행동을 Decide, Retrieve, Adapt, Forge 네 단계로 나누고, 도구를 언제 쓸지와 도구를 어떻게 늘릴지를 강화학습으로 함께 배우게 합니다.
-
Composer 2.5 2026-05-19Cursor가 공개한 코딩 에이전트 모델 Composer 2.5의 학습 방법과 벤치마크를 정리합니다
-
19B 규모 joint audio-video diffusion 모델 LTX-2 위에 RL fine-tuning을 얹어 영상 품질·음향 품질·립싱크를 동시에 끌어올린 OmniNFT를 정리합니다. modality-wise advantage routing, layer-wise gradient surgery, region-wise loss reweighting 세 디자인이 multi-modal RL의 reward hacking 양상을 어떻게 바꾸는지, 그리고 한국 비디오 생성 스타트업·후반 작업 도구 관점에서 어떤 의미를 갖는지 봅니다.
-
멀티에이전트 LLM 시스템의 chain·star·mesh 토폴로지를 추론을 돌리기 전에 단 세 개의 고윳값으로 진단하자는 제안. successor representation을 통신 그래프에 얹어 drift·consensus·robustness를 closed-form으로 풉니다.
-
적합 가치 반복 2026-04-10연속 상태 공간에서 가치 함수를 함수 근사기로 표현하는 강화 학습 알고리즘
-
마르코프 결정 과정 2026-04-10상태, 행동, 전이 확률, 보상으로 구성되는 강화 학습의 수학적 프레임워크
-
벨만 방정식 2026-04-10현재 상태의 가치를 즉각 보상과 다음 상태 가치의 합으로 재귀적으로 표현하는 방정식
-
직접 정책 탐색 2026-04-10가치 함수를 거치지 않고 정책 매개변수를 직접 최적화하는 강화 학습 접근법
-
RLHF 2026-04-10인간의 선호도 피드백으로 훈련된 보상 모델을 사용해 LLM을 정렬하는 기법
-
부분 관측 마르코프 결정 과정 2026-04-10에이전트가 환경의 완전한 상태를 관측할 수 없는 강화 학습 프레임워크
-
가치 함수 2026-04-10강화 학습에서 특정 상태 또는 상태-행동 쌍의 장기적인 기댓값을 나타내는 함수
-
가치 반복 2026-04-10벨만 방정식을 반복 적용하여 최적 가치 함수를 구하는 동적 프로그래밍 알고리즘
-
정책 반복 2026-04-10정책 평가와 정책 개선을 교대로 수행하여 최적 정책을 찾는 강화 학습 알고리즘
-
이산화 2026-04-10연속 상태 공간을 유한한 이산 격자로 나눠 표 형태의 강화 학습을 적용하는 기법
-
강화 학습 2026-04-10환경과 상호작용하며 보상을 최대화하는 정책을 학습하는 머신러닝 패러다임
-
선형 이차 조절기 2026-04-10선형 동역학 시스템에서 이차 비용 함수를 최소화하는 최적 제어기
-
5장 - LLM 튜닝 2026-04-09인간 선호도로 LLM을 정렬하는 RLHF 파이프라인과 보상 모델, PPO를 이용한 정책 최적화, 그리고 대안인 DPO의 원리를 다룹니다
-
16장 - 독립 성분 분석과 강화 학습 2026-03-29칵테일 파티 문제를 푸는 독립 성분 분석을 마무리하고, 마르코프 결정 과정을 중심으로 강화 학습의 기본 틀과 정책 개념을 소개합니다
-
17장 - MDP와 가치 및 정책 반복 2026-03-28마르코프 결정 과정의 가치 함수를 정의하고, 최적 정책을 구하는 가치 반복과 정책 반복 알고리즘, 상태 전이 확률 추정 방법을 다룹니다
-
18장 - 연속 상태 MDP와 모델 시뮬레이션 2026-03-27연속 상태 공간을 다루는 이산화 기법의 한계를 짚고, 모델 기반 강화 학습과 시뮬레이터 구축을 거쳐 적합 가치 반복 알고리즘을 유도합니다
-
19장 - 보상 모델과 선형 동적 시스템 2026-03-26상태 행동 보상과 유한 지평 MDP로 프레임워크를 확장한 뒤, 선형 동적 시스템에서 근사 없이 최적 정책을 계산하는 LQR을 유도합니다
-
20장 - 강화 학습 디버깅과 진단 2026-03-25강화 학습 프로젝트에서 시뮬레이터, 보상 함수, 알고리즘 중 병목을 진단하는 체계적 방법과, 직접 정책 탐색인 REINFORCE 알고리즘을 다룹니다
-
LLM의 성능 향상을 위해 강화 학습을 흔히 사용하죠. 강화 학습 훈련을 위해서는 높은 학습 비용이 필요합니다. 이 논문은 훈련 없이 프롬프트만으로 훈련 없이 강화 학습 정책을 변경합니다.
-
대한민국 KAIST에서 제안하는 추론 모델의 메타 인지(meta-awareness) 능력 향상 방법입니다. 이 논문은 모델이 예측한 메타 정보와 실제 추론 과정 사이의 정렬(alignment)을 통해 메타 인지 능력을 향상시키는 MASA(Meta-Awareness via Self-Alignment) 프레임워크를 제안합니다. Qwen3를 기반으로 외부 소스 없이 메타 인지를 학습합니다.
-
Soft Tokens, Hard Truths 2025-09-23대형 언어 모델(LLM)의 추론 능력은 Chain-of-Thought(CoT) 기법을 통해 크게 향상되었지만, 기존의 discrete token 기반 접근법은 여러 추론 경로를 동시에 탐색하는 데 한계가 있습니다. 이러한 한계를 극복하기 위해 continuous token을 사용한 새로운 강화학습 기반 훈련 방법을 제안합니다.
-
LG AI Research의 EXAONE 4.0 논문을 요약합니다. 빠른 응답의 'Non-reasoning' 모드와 깊은 사고의 'Reasoning' 모드를 통합한 하이브리드 아키텍처가 특징입니다. 모델 구조, 훈련 데이터, 혁신적인 AGAPO 강화학습 알고리즘을 중심으로 설명합니다.
-
ByteDance 연구자. CoRT 공동 1저자. LLM 강화학습 후학습 연구.
-
UC 버클리 박사과정 연구자. 오프라인·비지도 강화학습과 RL 확장성 연구자.
-
Google DeepMind AI 안전·정렬 총괄. UC 버클리 EECS 부교수. 인간-로봇 상호작용과 정렬 연구.
-
ServiceNow AI 수석 연구 과학자, Mila 겸임 교수. 멀티모달 지각과 세계 표현 연구.
-
UCLA 컴퓨터과학과 부교수, UCLA AGI Lab 대표, 통계적 머신러닝과 딥러닝 이론 전문가
-
H Company의 모델링 총괄. Holo 컴퓨터 유즈 VLM 라인업을 이끄는 연구자
-
메이퇀 연구자. SDAR, SKILL0 등 에이전틱 강화학습과 스킬 내재화 연구를 이끄는 메이퇀 쪽 교신저자.
-
로봇 조작 데이터 생산 시스템 HiFi-UMI와 2,000시간 공개 데이터셋 HiFi-UMI-2K를 낸 로봇 학습 조직
-
미국 에모리대 컴퓨터과학과 교수. 오프라인 강화학습과 오프폴리시 평가(OPE)를 의료 의사결정에 적용해 온 연구자입니다.
-
알리바바 AMAP-ML 소속 연구자로 GPG·AdaCuRL 등 LLM 추론용 강화학습 기법을 다루며 LongHorizon-Harness 공동 1저자
-
Macaron AI 최고연구책임자(CRO), Mind Lab 리더. 청화대 자동화과 박사. 강화학습·다중에이전트 시스템 전문가.
-
상하이자오퉁대학교 연구자. ABSeeker 공동 1저자로 검색 에이전트의 스텝 단위 크레딧 할당을 다룸.
-
DrLIM·연속 학습·로봇 RL의 권위자, Google DeepMind VP of Research, 인문학 학부에서 ML 박사로 전환한 이력
-
Macaron AI 공동창업자 겸 수석 연구원. MIT 출신 AI 연구자. Mind Lab(MindLab) 설립 주도, 트릴리언-파라미터 RL 시스템 MinT·LongStraw 개발.
-
Tianjin University 연구자. LLM 강화학습 훈련 안정성과 off-policy RFT 전문.
-
칭화대학교 선전 국제대학원 석사과정 연구자. 도구 호출 정렬과 에이전틱 강화학습을 연구하며 AgentOPSD 1저자.
-
Moonshot AI 공동 창업자 겸 CEO, Transformer-XL·XLNet 제1저자, Kimi 시리즈 총괄
-
Tencent AI Lab(시애틀) 수석 연구원. LLM 자기진화 학습 계열을 이끌며 R-Zero와 WebEvolver의 공저자.
-
상하이교통대(SJTU) 컴퓨터과학부 교수. 강화학습·에이전트 AI·임바디드 AI 분야의 대가로 논문 200편 이상, 피인용 3만 회를 넘습니다.
-
알리바바 AMAP-ML 소속 연구자로 LLM 에이전트의 스킬 진화와 장기 실행 하네스를 연구하며 SkillClaw와 LongHorizon-Harness의 1저자
-
Frontis.AI Horizon Research 연구원. Frontis-MA1 / OpenMLE 프로젝트 공동 리더이자 1저자
-
텐센트 AI Applications 디렉터. MOBA 게임을 심층강화학습으로 정복한 JueWu(絕悟)로 알려진 대규모 ML·AI 에이전트 연구자. NTU 박사.
-
강화학습 분야를 정립한 앨버타대 교수. 시간차 학습과 정책 경사의 이론적 토대를 세웠고 2024년 튜링상을 수상했습니다. 에세이 "쓰라린 교훈"의 저자.
-
USTC 박사과정. masked image generation·autoregressive image generation에 GRPO 계열 정책 최적화를 적용해온 1저자로, OmniNFT에서는 joint audio-video diffusion으로 RL 프레임워크를 확장.
-
Group Relative Policy Optimization. 가치 함수 없이 그룹 내 상대 보상으로 정책을 갱신하는 강화학습 기법
-
ByteDance 연구자. CoRT 프로젝트 리드. LLM 지시 따르기 강화학습 연구.
-
알리바바 AMAP-ML의 LLM 에이전트 연구를 프로젝트 리드로 이끄는 연구자로 Tree-GRPO·CoEvolve·LongHorizon-Harness의 교신저자
-
UC 버클리 교수. 박사 시절 강화학습으로 헬리콥터에게 틱톡, 카오스 등 최상위 인간 조종사급 곡예비행을 가르쳤다
-
Reinforcement Learning with Verifiable Rewards. 정답을 결정론적으로 확인할 수 있는 영역에서 검증자 신호로 정책을 최적화하는 학습 패러다임
-
싱가포르국립대(NUS) 연구원. LLM 강화학습의 trust region 문제 전문가. DPPO 제안자.
-
Princeton 전기컴퓨터공학과 교수, 강화학습 이론과 LLM 에이전트 학습 연구
-
Princeton 전기컴퓨터공학과 박사후연구원, Gen-Verse 리더, 확산 모델과 에이전트 RL 연구
-
난징대학 소프트웨어신기술 국가중점실험실 소속 연구자. CoRT 공동 1저자. 루브릭 기반 강화학습 연구.
-
중국과학기술대학(USTC) 출신 강화학습·멀티에이전트 연구자. HiFi-UMI 공동 1저자
-
난카이대학 VCIP 박사과정. 시간 축 모델링과 개방어휘 이해를 거쳐 비디오 MLLM의 강화학습 후처리로 옮겨온 연구자
-
청화대학교 자동화학과 박사과정. 에이전틱 RL과 LLM 에이전트 훈련을 연구하며 SPARK, OPID, SEED 등을 발표한 연구자.
-
NVIDIA 시니어 딥러닝 엔지니어이자 OpenRLHF 프로젝트 리더로 REINFORCE++와 Molt 등 RLHF·에이전트 RL 인프라를 설계
-
칭화대 기계공학과 자율주행 의사결정·강화학습 연구자. HiFi-UMI 공동 1저자이자 프로젝트 리더
-
천진대학교 교수. Deep Reinforcement Learning Lab 주재. 다중 에이전트·LLM RL 연구.
-
Tencent Hunyuan 수석 연구과학자. 멀티모달 RL 테크리드. 생성 모델·강화학습·신뢰할 수 있는 AI 전문가.
-
Google DeepMind 디스팅귀시드 리서치 사이언티스트. TrueSkill 개발자, AlphaGo 공저자. 2025년 복귀 후 post-AGI 미래 팀을 이끌고 있습니다.
-
미국 에모리대 컴퓨터과학과 연구자. LLM 에이전트의 오프폴리시 평가와 디퓨전 월드 모델을 연구합니다.
-
Tencent Hunyuan LLM 리서치 사이언티스트. 에이전트 강화학습과 자기진화 AI를 연구하며 RST의 프로젝트 리드.
-
미국 수학자·전산학자. 노스이스턴대 교수. 역전파 1986 Nature 논문 3저자이자 REINFORCE 정책 그래디언트의 창시자.
-
청화대학교 자동화학과 소속 연구자. LLM 에이전트 훈련과 에이전틱 강화학습을 연구하며 SEED의 공동 1저자.
-
NVIDIA Learning and Perception Research 수석 연구과학자로 추론 모델 개발을 이끌며 SteerLM·NeMo-Aligner·Molt에 기여
-
천진대학교 특별채용 부교수. RL, 구현 AI, LLM 에이전트 연구. 60편 이상의 주요 학회 논문.
-
워싱턴대학교 세인트루이스 박사과정. R-Zero, G-Zero, VisPlay로 이어지는 자기진화 학습 계보를 만들어온 연구자이며 EnvHarness 1저자.
-
저장대학교(Zhejiang University) 소속 연구자. 에이전틱 RL과 자기 증류 분야를 연구하며 SDAR의 공동저자.
-
상하이교통대 John Hopcroft Center 테뉴어트랙 부교수. 강화학습·레스트리스 밴딧·온라인 순차 의사결정·에이전트를 연구하며 하버드 박사후연구원을 거쳤습니다.
-
Tianjin University 부연구원. Deep RL 불안정성(plasticity loss, policy churn) 연구자.