이미지·영상·문서 파일에 출처와 수정 이력을 암호서명으로 실어나르는 개방 표준. Coalition for Content Provenance and Authenticity가 만들었고, 소비자 대상 이름은 Content Credentials입니다.
태그: AI평가
107개의 게시물
-
C2PA 2026-08-11 -
20~124쪽짜리 사내 규정집을 컨텍스트에 넣어두면 에이전트가 그 규정을 따를까. 65개 회사 환경과 824개 결정론적 채점 기준으로 재보니 최고 구성이 36.2%, 프런티어 대부분이 25% 미만이었습니다. 실패는 네 가지 모양으로 반복됩니다.
-
유니콘은 논문을 쓰지 않는다 2026-08-011998년부터 2025년까지 유니콘에 오른 AI 스타트업 317곳을 전수 조사했더니, 절반 이상이 주저자로 논문이나 프리프린트를 한 번도 낸 적이 없었습니다. 다 합쳐도 2025년 AI 문헌의 0.1%입니다.
-
DecoEvo - Score-Decoupled Co-Evolution of Solver and Rubric-Generator Skills in Text Space 2026-07-31가중치를 건드리지 않고 자연어 스킬 문서만 고치는 텍스트 공간 최적화에서, 풀이 스킬과 채점 루브릭 생성 스킬을 서로 다른 목적함수로 동시에 진화시킨 논문입니다. 채점자를 풀이자의 점수로 평가하면 왜 무너지는지, 그걸 어떻게 끊어냈는지가 핵심입니다.
-
프런티어 AI 기업 직원 1,100명 이상이 미국 정부에 국제 페이싱 메커니즘의 기술·거버넌스 인프라를 지어 달라고 요구했습니다. 즉시 중단이 아니라 나중에 필요해졌을 때 검증 가능하게 늦출 수 있는 도구를 지금 만들어 두라는 요구입니다.
-
AI 회사가 희귀한 서적을 파쇄하고 있다 2026-07-28웹이 AI 생성문으로 포화되면서 2022년 이전 인쇄본이 마지막 비오염 인간 저작 코퍼스가 됐습니다. 중개업체가 팔레트 단위로 헌책을 사서 책등을 잘라 스캔한 뒤 원본을 펄프화합니다.
-
Claude Opus 5 2026-07-28Anthropic이 두 달 새 네 번째 Claude 5 계열 모델을 내놓았습니다. 단가는 Opus 4.8과 같게 두고, low/medium/high 노력 토글로 요청마다 계산량을 사용자가 정하게 했습니다.
-
HuggingFace 프로덕션 인프라에 자율 AI 에이전트 스웜이 17,000+ 행동으로 침투했습니다. 공격자도 AI 에이전트를 썼고, 방어자도 AI 에이전트를 썼습니다.
-
독일 ZAK, AI 검색에 미디어법 적용 - DSA 면책 조항 배제 첫 사례 2026-07-20독일 방송면허감독위원회(ZAK)가 Google AI Overviews와 Perplexity를 미디어 사업자로 판정했습니다. AI가 생성한 요약물을 '콘텐츠 생산'으로 보고 DSA 면책 조항을 배제한 세계 첫 사례입니다.
-
AI 에이전트가 얼마나 긴 작업을 완주할 수 있는지 측정하는 벤치마크. 46개 장기 터미널 태스크를 밀집 보상(dense reward)으로 채점해 "성공/실패" 이분법이 놓치는 중간 진행 상황까지 측정합니다.
-
Helsing 18억 달러 Series E 2026-07-18유럽 최대 방산 AI 스타트업 Helsing이 Series E로 18억 달러를 조달하며 기업가치 180억 달러를 달성했습니다. 우크라이나 전쟁 이후 유럽 재무장 흐름이 만들어낸 투자 규모입니다.
-
WAIC 2026 - 중국의 AI 거버넌스 독자 체계 구축 2026-07-18중국이 7월 17일 개막한 WAIC 2026에서 29개국이 서명한 세계인공지능협력기구(WAICO)를 출범시켰습니다. AI 거버넌스의 무게중심을 서방 중심 틀에서 끌어오려는 전략적 움직임입니다.
-
Ask HN - AI 생성 글에 플래그를 달아야 할까 2026-07-15HN 모더레이터 dang이 AI 텍스트 금지 정책을 재확인하며 'AI-generated' 플래그 도입을 제안했다. 955pts·415댓글 토론이 신뢰 역학, 집행 가능성, 기술적 한계를 파고든다.
-
The Illusion of Equivalency - Statistical Characterization of Quantization Effects in LLMs 2026-07-13양자화한 LLM을 정확도와 퍼플렉시티만으로 평가하면 원본과 같아 보입니다. 이 논문은 correctness agreement라는 결정 수준 지표를 도입해, 총점이 유지돼도 실제로 맞히는 문제의 집합이 달라진다는 것을 보입니다. 8비트에서 2비트까지 훑으며 어텐션의 쿼리·키 투영이 가장 취약함을 밝힙니다.
-
AI 2040 - 초지능 감속 협정 2026-07-10초지능 경쟁을 2040년까지 늦추자는 AI 2040의 국제 협정 시나리오를 검증, 연구 공개, 컴퓨트 억지라는 세 가지 메커니즘으로 분석합니다.
-
Claude Science - Anthropic의 과학자용 AI 연구 워크벤치 2026-07-08Anthropic이 과학 연구자들을 위해 공개한 Claude Science는 논문 탐색부터 실험 설계·데이터 분석까지 에이전트 방식으로 지원하는 AI 연구 워크벤치입니다.
-
OpenAI가 미국 정부에 5% 지분을 내놓겠다는 제안 2026-07-05OpenAI가 미국 정부에 5% 지분을 내놓겠다고 제안했습니다. 알래스카 영구기금 모델을 참고한 AI 수익 분배 구상인데, 좋은 취지와 복잡한 속내가 함께 들어 있습니다.
-
LLM 에이전트가 '지금 멈춰야 할 때'를 아는지 측정하는 첫 체계적 벤치마크. 웹·터미널·QA 3개 환경 28K 샘플로 평가한 결과, 대부분의 모델은 너무 늦게, 혹은 전혀 멈추지 않는다는 사실이 드러났습니다.
-
AI 해고 87,714건 데이터 발표 닷새 후 OpenAI, Anthropic, Amazon, Microsoft가 $500M 재교육 펀드 RAISE US를 출범했습니다.
-
Nature 계열 학술지 논문 90편에서 추출한 과학 태스크 벤치마크. 최강 모델도 17.8%만 SOTA를 넘었고, 성공의 절반 가까이는 과학적 발견이 아닌 지도학습 문제 변환에 기댄 것으로 드러났습니다.
-
AI 챗봇은 정치적으로 편향돼 있는가 - WaPo 대규모 실험 2026-06-26Washington Post가 Dartmouth·Stanford 연구진과 함께 주요 AI 챗봇 6종의 정치 편향을 대규모로 테스트했습니다. ChatGPT는 80% 이상 좌편향 응답, Grok은 보수 마케팅과 달리 좌편향, Gemini는 93% 균형이라는 결과가 나왔습니다.
-
Frontis.AI 팀이 실제 기업 에이전트 세션 5,291건에서 852개 재현 가능 태스크를 추출하는 EnterpriseClawBench를 공개했습니다. 모델 단독이 아닌 하네스-모델 조합을 평가 단위로 삼으며, 최고 점수 0.663으로 기업 에이전트 벤치마크가 아직 포화와 거리가 멀다는 것을 보입니다.
-
병원·직장·가정처럼 여러 사람이 한 AI 어시스턴트의 메모리를 함께 쓰는 환경을 평가하는 벤치마크. 잘 기억하는 것을 넘어, 권한 밖 정보를 막고 삭제 요청을 지키는 거버넌스까지 측정합니다. 어떤 방법도 유용성·접근제어·능동 망각 세 가지를 동시에 잡지 못했습니다.
-
NVIDIA SkillSpector 2026-06-21AI 에이전트 스킬(MCP 확장 포함) 보안 취약점 64개 패턴·16개 카테고리를 탐지하는 오픈소스 스캐너. 야생 스킬 26.1%에서 취약점 발견, 5.2%는 악의적 의도 의심.
-
Qualcomm의 Tenstorrent 인수 협상 2026-06-21Qualcomm이 스타트업 Tenstorrent를 80억~100억 달러에 인수 협상 중. Jim Keller가 이끄는 RISC-V 기반 AI 가속기 스타트업으로, 성사 시 Qualcomm의 엣지·데이터센터 AI 가속기 전략에 중대한 전환점.
-
현재 화면만 봐서는 다음 수를 알 수 없는 상황에서 MLLM이 얼마나 잘 기억하고 행동하는지 측정합니다. Matching Pairs 카드 게임과 3D 미로 탐색으로 구성된 RNG-Bench의 결과는 솔직합니다.
-
OpenAI가 신규 모델 출시 전 1.3M 익명화 실제 사용자 대화를 후보 모델로 재생해 배포 후 행동 분포를 사전 예측하는 평가 방법론을 공개했습니다. 합성 테스트 프롬프트로는 잡히지 않는 GPT-5.1의 '계산기 해킹' 같은 정렬 이탈을 출시 전에 탐지한 사례가 포함됩니다.
-
OpenAI 2026년 6월 악의적 AI 사용 보고서 2026-06-16OpenAI가 2026년 6월 발표한 분기별 악의적 사용 보고서. 북한 IT 위장취업, 캄보디아 로맨스 스캠, 친중국 영향 공작 등 40개 이상의 네트워크를 2024년 이후 차단했다.
-
MIT 미디어랩의 4주 실험 결과입니다. AI와 함께 쓰면 허위 정보 탐지율이 21% 오르지만, AI를 끄면 시작점보다 15.3%p 추락합니다. AI가 코치가 아니라 목발이 된다는 이야기, 그리고 이것이 우리에게 의미하는 것.
-
70개 이상 LLM을 2만 6천 개 개방형 질문으로 평가해 모델 간 출력 동질화를 실증한 NeurIPS 2025 Best Paper.
-
Continual Learning Bench 1.0 2026-06-10AI 시스템이 세션을 넘어 점진적으로 학습하는 능력을 측정하는 첫 번째 실질적 벤치마크
-
멀티모달 에이전트가 사람을 대신해 인터페이스를 조작하는 시대에, CAPTCHA는 봇과 사람을 가르는 마지막 검증 관문입니다. HLL은 이 관문을 에이전트가 넘을 수 있는지 정답 인식이 아니라 실제 상호작용으로 측정하는 벤치마크입니다. 8개 프런티어 에이전트는 깨끗한 화면에서는 곧잘 풀지만, 현실적인 방해와 행동 궤적 검증이 들어오면 무너집니다.
-
인터넷에는 사람을 위한 방법 안내가 넘쳐납니다. 위키하우, 게임 위키, 우분투 문서 같은 것들이죠. 문제는 이 가이드가 멀티모달이고 노이즈가 많고 사람이 실행한다고 가정한다는 점입니다. MMG2Skill은 이런 사람용 가이드를 에이전트가 실행할 수 있는 SKILL.md 절차로 증류하고, 실행 궤적의 진단으로 스스로 고쳐 나가는 폐루프 프레임워크입니다.
-
fine-tuning 없이 모델 외부에 safety 자산을 두는 LLM 안전 프레임워크입니다. 공격 스킬 라이브러리와 경량 보조 디펜더가 공진화하며, victim model을 바꿔도 safety 자산을 그대로 재사용할 수 있습니다.
-
전 Cohere VP of Research [[사라 후커]]가 공동창업한 Adaption Labs가 첫 제품 AutoScientist를 공개했습니다. 모델 학습·정렬 전체 research loop을 자동화하는 시스템으로, 데이터 큐레이션과 학습 recipe를 동시에 self-improve 합니다. 사내 AI 리서처가 직접 설정한 학습 대비 평균 +35%, win rate는 48%에서 64%로 올랐다고 합니다. 첫 30일 무료, $50M 시드 (Emergence Capital + Mozilla Ventures 리드).
-
Anthropic이 2026년 5월 발표한 미·중 AI 경쟁 보고서를 한국 독자 시선으로 정리합니다. 두 시나리오, 네 개 전선, 그리고 행간.
-
CoT가 왜 되는지 아무도 몰랐습니다. KisMATH는 추론 트레이스에서 인과 그래프를 자동으로 추출하고, 그 그래프 경로를 억제했을 때 모델이 실제로 붕괴하는지 실험으로 확인했습니다. "중간 토큰이 장식이냐 실제 계산이냐"는 질문에 처음으로 엄밀한 인과 답변을 내놓은 연구입니다.
-
메릴랜드대학교(UMD) 박사과정 겸 Tencent HY LLM Frontier 연구원. 에이전트 평가·LLM 추론·비전언어모델 자기보상 학습을 연구하며 LHTB의 공동 1저자.
-
GitHub 이슈를 실제로 해결시켜 채점. Mythos가 Verified 93.9%를 기록했고 2026년 6월 Fable 5는 Pro에서 최초로 80%대를 넘었다
-
2018년 Allen Institute for AI가 공개한 약 7,800문항의 과학 4지선다 문제로, 2023년 이후 프론티어 모델이 95%를 넘어 사실상 포화됐다
-
PDF·XLSX·PPTX 파일을 그대로 입력받아 학문적 지식이 아닌 실제 오피스 업무 처리력을 재는 평가
-
SambaNova Reconfigurable Dataflow Unit, 엔터프라이즈 추론
-
2021년 OpenAI가 공개한 8,500문항의 초등 수학 문장제로, 2023년 95%를 넘긴 뒤 2026년 기준 99%대로 포화됐다
-
Google DeepMind AI 안전·정렬 총괄. UC 버클리 EECS 부교수. 인간-로봇 상호작용과 정렬 연구.
-
2024년 공개. 모델 출시 이후 나온 코딩 컨테스트 문제만 골라 써서 훈련 데이터 오염을 구조적으로 차단한다
-
AWS 커스텀 AI 칩, 128GB HBM3e, UltraServer 144칩
-
256K~1M 토큰 컨텍스트 내 BFS 탐색 과제에서 Mythos는 80.0%를 기록해 Opus 4.6(38.7%)과 GPT-5.4(21.4%)를 큰 폭으로 앞섰다
-
AMD CDNA-3 AI 가속기, 192GB HBM3
-
Cursor 엔지니어링 팀의 실제 코딩 세션에서 뽑은 사내 벤치마크로, v3.1에서 Composer 2.5가 63.2%를 기록해 Opus 4.7 max effort(64.8%)에 근접했다
-
상하이 인공지능 연구소(SAIL) 포스닥. 멀티모달 LLM 평가 전문. MMBench·VLMEvalKit·RNG-Bench 주요 저자.
-
SenseTime Research의 spatial intelligence·평가 인프라 리드. SenseNova-SI·EASI 라인을 이끕니다.
-
RLHF용 인간 피드백과 강화학습 환경을 프런티어 랩에 공급하는 미국 데이터 회사. 외부 투자 없이 매출 10억 달러를 넘겼다
-
k=100 시도 기준 Mythos의 공격 성공률은 4.1%로, Opus 4.6(21.7%)·GPT-5.4(37.7%)·Gemini 3.1 Pro(56.1%)와 압도적 차이를 보였다
-
Groq Language Processing Unit, 초저지연 추론 특화
-
UC 샌디에이고 박사과정. 멀티에이전트 시스템과 LLM 에이전트 평가 연구
-
2023년 공개 MMMU(11500문항)의 강화판. 선택지 10개와 Vision-only 모드로 순수 텍스트 단서를 걷어냈다
-
2019년 공개된 약 12,000문항의 5지선다 상식 벤치마크로, 2022년 이후 프론티어 모델이 90%를 돌파해 지금은 변별력을 잃었다
-
198문항의 Google-proof 과학 문제로, Mythos 94.5%와 Gemini 3.1 Pro 94.3%의 격차가 0.2%p에 불과해 상단 포화 조짐을 보인다
-
확률 인식론과 과학철학을 하던 철학자에서 Surge AI 평가 설계로 옮겨온 우한대학교 철학과 교수
-
OpenAI가 미국 GDP 상위 9개 산업, 44개 직업군의 실제 업무 산출물을 전문가가 채점하며, 2026년 4월 GPT-5.4가 약 83%를 기록했다
-
ARC 유사 과제를 16개 개념 계열로 묶은 벤치마크. 총점 하나에 가려지는 능력 프로파일을 개념 단위로 드러냅니다
-
Prometheus 시리즈로 LLM-as-a-Judge 분야를 연 KAIST 출신 CMU 박사과정 연구자
-
57과목을 14개 비영어 언어로 확장한 시험. Mythos 92.67%가 Opus 4.6(91.1%)를 앞서지만 상위권 격차는 1~2%p뿐이다
-
2019년 공개 당시 인간 95.6%, GPT-2 48%였던 상식 추론 시험. 2022년 이후 LLM이 95%를 넘기며 포화됐다
-
실제 오픈소스 취약점 1,507개로 구성되며, Mythos가 pass@1 0.83을 기록해 Opus 4.5(0.51)에서 이어진 상승세를 이어갔다
-
폴란드 오픈 LLM Bielik을 만드는 SpeakLeash 재단 소속 연구자. BDH-CQ에서는 Pathway 외부 감사자로 참여해 블랙박스 재현 평가를 맡았습니다
-
칭화대학교 조교수. THUNLP 소속 NLP·LLM 정렬 연구자. NatureBench 교신저자
-
2020년 공개된 57과목 15900문항 지식 시험. 2026년 Gemini 3.1 Pro 94.3%로 상위권이 노이즈 수준까지 좁아져 outdated 취급을 받는다
-
Surge AI 창업자이자 CEO. 외부 투자 없이 100명 미만으로 연 매출 10억 달러를 넘긴 데이터 라벨링 회사를 만들었다
-
Frontis.AI / Horizon Research 교신저자. 에이전트 평가 벤치마크 파이프라인 구축 연구 주도
-
난양공과대학교(NTU) S-Lab 박사과정생. 비디오 품질 평가와 대형 멀티모달 모델 전문 연구자.
-
Mythos가 86.9%를 기록했고, 도구 없이 사전 지식만으로 푼 오염 기준선은 24.0%에 그쳐 실제 브라우징 능력과의 격차를 드러낸다
-
2024년 구글이 공개(arXiv:2405.14573, ICLR 2025)한 20개 앱 116개 태스크 환경으로, adb로 기기 상태를 직접 검사해 성공 여부를 판정한다
-
알리바바 AMAP CV Lab 연구원으로 인터랙티브 월드 모델 평가 벤치마크 WorldRoamBench의 1저자
-
2021년 OpenAI가 Codex 논문과 함께 공개한 164문항 코딩 시험. 2026년 GPT-5.4가 93.1%로 상단을 압축시켰다
-
칭화대 컴퓨터과학기술과·AI연구원 연구자. 머신러닝의 적대적 견고성(adversarial robustness)과 신뢰가능 AI(trustworthy ML)가 주전공. CCF 우수박사학위논문상, MSRA·바이두 펠로십 수상.
-
NVIDIA 차세대 칩, HBM4 288GB, 2026 하반기 예정
-
University of Leeds 및 Southwest Jiaotong University 소속 NLP 연구자. LLM 심리사회적 안전 평가 시스템 DialogGuard 개발 및 에이전트 abstention 연구.
-
University of Washington Information School 박사과정생. LLM abstention(답변 거절) 연구의 핵심 저자로, 벤치마크·서베이·강화학습 기반 abstention 개선 방법론을 연구.
-
12개 언어에 걸쳐 사실 환각을 측정하며, Mythos는 오답 비율 12.1%로 최저를 기록하고 불확실 응답 비율은 31.5%로 높게 나타났다
-
1,000문항 차트 이해 평가에서 Mythos는 도구 없이 86.1%, 도구 사용 시 93.2%를 기록해 Opus 4.6(61.5%/78.9%)을 크게 앞섰다
-
2024년 Epoch AI가 공개한 비공개 연구 수준 수학 문제로, 2026년 4월 기준 선두 GPT-5.4도 약 47.6%에 그친다
-
Apple Silicon M5, 온디바이스 AI 추론, M4 대비 4배
-
89개 터미널 복합 과제 평가. Mythos가 수정·연장 기회를 받으면 82%에서 92.1%까지 오르며 자체 교정력을 드러냈다
-
한국어 LLM 평가 인프라(KMMLU·HAE-RAE·BiGGen Bench·SOOHAK)를 주도한 연구자, OnelineAI 공동창업자
-
Alibaba AMAP CV Lab이 제안한 실행 가능 구현체 AI 벤치마크. UnrealZoo(Unreal Engine 5) 기반 16개 씬, 4단계 난이도, 200개 이상 태스크로 장기 멀티태스크 에이전트를 평가합니다.
-
미국 수학 올림피아드 증명 문제 시험. Mythos 97.6%와 Opus 4.6 42.3%가 55.3%p 격차를 벌리며 세대차를 드러냈다
-
웨이퍼 스케일 AI 칩, 4조 트랜지스터, 접시 크기
-
NVIDIA Hopper 아키텍처 AI 훈련/추론 표준 GPU
-
2500문항 초고난도 시험. Mythos가 도구 사용 시 64.7%로 Opus 4.6(53.1%)를 앞섰지만 65%를 못 넘겼다
-
Surge AI 연구자이자 노스이스턴대학교 컴퓨터과학 박사과정. 차등 프라이버시 시각화에서 에이전트 평가로 옮겨온 HANDBOOK.md 1저자
-
Microsoft 커스텀 AI 칩, TSMC 3nm, 216GB HBM3e
-
GUI와 CLI를 같은 워크플로 안에서 오가야 풀리는 114개 장기 실행 과제. 하이브리드 인터페이스 컴퓨터 유즈 에이전트를 재는 벤치마크
-
칭화대학·알리바바 Qwen 사업부 소속 연구자. DecoEvo 공동 1저자.
-
NVIDIA Blackwell 아키텍처, H100 대비 훈련 2.5배 GPU
-
모니터 몰래 숨은 과제를 완수하는지 재는 정렬 평가. Mythos 확장 사고 모드가 4-5%로 Opus 4.6(0-3%)보다 은밀 성공률이 높다
-
Scale AI 창립자 출신 Meta 수석 AI 책임자
-
비정렬 행동·아첨·기만 등 6개 지표로 모델당 362회 조사하는 정렬 평가. Mythos는 초기 버전임에도 최상위권을 기록했다
-
2026년 Gemini 3.1 Pro가 77.1%로 1세대 대비 점수를 2배 이상 끌어올렸지만, 인간 기준 95%+와는 여전히 격차가 크다
-
H100 후속, 141GB HBM3e 추론 최적화 GPU
-
2024년 공개 당시 프론티어 모델이 20% 미만이었지만, Mythos와 Opus 4.6이 나란히 100%를 기록하며 2년 만에 완전히 포화됐다
-
CUHK Shenzhen 데이터과학부 조교수. LLM 평가·생성 연구 전문가로 Tencent Rhino-bird 프로그램 선정자.
-
Google 7세대 TPU, 추론 최적화, 42.5 exaflops
-
실제 Ubuntu VM에서 GUI를 조작하는 시험. Mythos 79.6%가 인간 기준선 72.4%를 넘어선 드문 사례다
-
2016년 스탠퍼드 공개, 2.0은 15만 문항 규모. 2018년 BERT가 사람 상한을 넘기며 이후 LLM엔 완전 포화됐다
-
2024년 공개된 MMLU 후계. 선택지를 4개에서 10개로 늘려 프론티어 모델 점수를 14~16점 낮췄다
-
CAIS(Center for AI Safety) 설립자 겸 이사, MMLU·MATH·GELU 저자, AI 안전 및 평가 연구자