DeepSeek가 V4-Flash에 이미지 입력을 붙였습니다. 이미지 한 장이 최대 384토큰으로 고정되는 설계와, 벤치마크 표가 가리키는 경쟁자와 실제 사용량이 가리키는 경쟁자가 다르다는 점을 봅니다.
태그: Headliner
22개의 게시물
-
DeepSeek-V4-Flash-Vision-Exp 2026-08-24 -
2026년 7월, 이미 가진 신호를 다시 꺼내 쓰는 쪽으로 방향을 튼 연구자들을 돌아봅니다.
-
2026년 6월, 논문 폼이 돋보였던 연구자들을 돌아봅니다.
-
스트라이프가 OpenRouter를 76억 달러에 샀다 2026-08-213개월 전 13억 달러였던 라우팅 게이트웨이가 5.4배에 팔렸습니다. 결제 회사가 토큰 라우팅을 인프라로 본 이유를 자기 테이크레이트와 겹쳐 읽습니다.
-
Grok Bot - 컴퓨터를 가진 에이전트 2026-08-20xAI가 8월 11일 공개한 Grok Bot은 봇마다 클라우드 컴퓨터 한 대를 주고, 로그인·2FA·결제 같은 사람만 통과할 수 있는 벽에서만 사람에게 되돌려줍니다. 다만 이 컴퓨터는 계정 안 봇들이 공유하는 하나의 머신이라 격리가 아니라 신뢰 모델에 가깝습니다.
-
메모리 값이 1년에 500% 올랐다 2026-08-20AI가 메모리를 사간 게 아니라 같은 팹이 더 적은 비트를 만들고 있습니다. 웨이퍼 투입 비중과 비트 공급 비중을 나란히 놓으면 그 차이가 그대로 보입니다
-
클로드 워터마크 2026-08-11Claude가 2026년 8월부터 생성 텍스트에 워터마크를, 이미지·파일에 C2PA 서명 메타데이터를 넣기 시작했습니다. 두 방식이 각각 어떻게 작동하고 어디까지 막을 수 있는지 정리합니다.
-
총 2.4조 파라미터 중 요청당 95B만 활성화하는 MoE. 코딩 SWE 계열에서는 프런티어에 밀리지만 논문 재현 벤치 PaperBench에서는 Sol과 Fable 5, Opus 4.8을 모두 앞섰습니다
-
이미지 30장, 영상 10개, 오디오 10개를 동시에 참조하고 타임스탬프 단위로 편집합니다. 30초를 단일 패스로 뽑은 뒤 다회 연장으로 수분 길이를 만듭니다. 벤치마크 수치는 공개되지 않았습니다.
-
8×MI355X 구성에서 노드당 952 tok/s, 달러당 48 tok/s가 나왔습니다. B300은 33 tok/s/$입니다. 갈림길은 연산 성능이 아니라 288GB VRAM으로 2.8T 모델이 단일 노드에 들어갔다는 사실입니다.
-
Anthropic이 언어모델 내부에서 인간의 의식 접근(access consciousness)과 유사한 기능을 하는 신경 표상 집합을 발견했습니다. J-space라 이름 붙인 이 표상은 Claude가 무엇을 생각하고 있는지 겉으로 드러나지 않는 순간에도 읽어낼 수 있게 해주며, 안전성 모니터링에도 실제로 활용되고 있습니다.
-
Gated Attention for Large Language Models - Non-linearity, Sparsity, and Attention-Sink-Free 2026-06-15어텐션 출력 뒤에 헤드별 시그모이드 게이트 하나. PPL -0.2, MMLU +2점, 어텐션 싱크 소멸. NeurIPS 2025 Best Paper.
-
1.2B 파라미터로 고해상도 문서의 정확한 파싱을 달성한 MinerU2.5의 2단계 분리 아키텍처와 데이터 엔진을 분석합니다.
-
Google Cloud가 제안한 OKF는 AI 에이전트가 데이터를 이해할 수 있도록 마크다운과 YAML 프론트매터로 지식을 표현하는 개방형 표준입니다. CLAUDE.md와 옵시디언 볼트 같은 패턴의 데이터 카탈로그 버전입니다
-
Recursive Multi-Agent Systems 2026-04-30AI 에이전트 하나가 작업을 받습니다. 그 에이전트가 작업을 쪼갭니다. 쪼개진 작업들을 새로운 에이전트들에게 넘깁니다. 그 에이전트들도 또 쪼갭니다. AI가 AI를 낳는다. 재귀적 멀티에이전트 시스템이 무엇이고, AI의 불편한 미래는 어디로 향하는지 정리합니다.
-
벌써 4.5가 나온다구요? 두 달 정도밖에 안 지났습니다. 아직 4.5는 테크니컬 리포트가 없습니다. 대신 4.0 테크니컬 리포트를 가져왔습니다. 2K 해상도 이미지를 1.4~1.8초 만에 생성하며, T2I 생성과 이미지 편집 작업을 단일 모델에서 공동 학습합니다. 특히 복잡한 텍스트 렌더링, 다중 이미지 참조, 인컨텍스트 추론 생성 등 기존 모델들이 취약했던 영역에서 강점을 보입니다.
-
또이트댄스입니다. Depth Anything 3는 한 장의 이미지든 여러 장의 영상이든, 카메라 포즈 정보가 있든 없든 상관없이 3D 기하 정보를 예측하는 모델입니다. 평범한 트랜스포머 하나와 단순한 깊이-광선(depth-ray) 표현으로 이전 최고 성능을 44% 능가하는 성능을 달성했으며, 모든 데이터를 공개 학술 데이터셋으로만 학습했습니다.
-
Why Language Models Hallucinate 2025-09-17언어 모델의 환각(Hallucination) 현상을 통계적 관점에서 분석한 논문을 요약합니다. 환각이 사전훈련의 필연적 결과이며, '모르겠다'를 처벌하는 현재의 평가 방식 때문에 사후훈련 후에도 지속되는 구조적 문제를 지적하고 해결책을 제시합니다.
-
DINOv3 2025-09-15Meta AI의 70억 파라미터 자기지도학습 모델 DINOv3 논문을 요약합니다. 라벨 없이 이미지 특징을 학습하는 이 모델의 거대한 아키텍처, 데이터 큐레이션 전략, 그리고 패치 일관성을 유지하는 혁신 기술 'Gram Anchoring'을 중심으로 설명합니다.
-
Prefix-Tuning 논문을 요약하며, 대형 언어모델의 파라미터를 고정한 채 작은 연속적 프롬프트(prefix)만 최적화하는 효율적인 튜닝 방법을 설명합니다. 전체 파인튜닝 대비 적은 파라미터로 경쟁력 있는 성능을 내는 원리와 장점을 다룹니다.
-
실시간 객체 탐지의 시대를 연 YOLO(You Only Look Once) 논문을 요약합니다. 전체 이미지를 단일 신경망에 한 번만 통과시켜 객체의 경계 상자와 클래스를 동시에 예측하는 혁신적인 통합 아키텍처의 원리와 성능을 설명합니다.
-
Attention Is All You Need 2025-09-01'Attention Is All You Need'는 RNN을 버리고 셀프 어텐션만으로 시퀀스를 처리하는 Transformer 아키텍처를 제안한 2017년 논문입니다. 기계 번역에서 당시 SOTA를 경신했고, 이후 BERT·GPT·Claude를 포함한 거의 모든 대형 언어 모델의 기반이 되었습니다.