Source-linked AI summary

Artificial Intelligence Index Report 2026

Sha Sajadieh, Loredana Fattorini, Raymond Perrault, Yolanda Gil, Vanessa Parli, Lapo Santarlasci, Juan Pava, Nestor Maslej, Russ Altman, Erik Brynjolfsson, Carla Brodley, Jack Clark, Virginia Dignum, Vipin Kumar, James Landay, Terah Lyons, James Manyika, Juan Carlos Niebles, Yoav Shoham, Elham Tabassi, Russell Wald, Toby Walsh, Dan Weld

arXiv:2606.15708v3cs.AI

TL;DR

AI 시스템은 이를 따라잡는 데 필요한 거버넌스, 평가, 교육, 데이터 시스템보다 빠르게 발전하고 있다. 이 보고서는 테스트, 경제·노동 영향, 주권, 과학, 의학 전반에서 벌어지는 격차 확대를 추적하며, AI의 역량 증대가 그 영향을 측정하고 관리하기 위한 기존 시스템에 점점 더 큰 도전이 되고 있음을 보여준다.

  • 문제

    거버넌스, 평가, 교육, 데이터 시스템은 빠르게 발전하는 AI를 따라잡는 데 어려움을 겪고 있어, 그 영향을 측정하고 관리할 준비 역량이 제한되고 있다.

  • 방법

    이 보고서는 추론, 안전성, 실제 과제 수행 전반의 AI 테스트를 추적하는 한편, 경제적 가치, 노동 영향, 주권, 과학, 의학에 대한 분석을 추가한다.

  • 결과

    이 보고서는 여러 영역에서 시스템을 더욱 야심 차게 테스트함에 따라 AI 역량 측정 결과를 점점 더 신뢰하기 어려워지고 있다고 분석한다.

  • 시사점 및 한계

    이 보고서는 AI 역량과 이를 평가하고 거버넌스를 수행하는 데 필요한 시스템 사이의 격차 확대를 각 장의 핵심 과제로 제시한다.

  • 시사점 및 한계

    정부의 AI 지출 분석은 데이터의 가용성과 품질이 크게 다르기 때문에 모든 국가나 지역을 충분히 대표하지 못할 수 있다.

Abstract

from arXiv · show

Welcome to the ninth edition of the AI Index report. As AI continues to advance rapidly, the question becomes whether the systems built around it can keep up. Governance frameworks, evaluation methods, education systems, and the data infrastructure needed to track AI's impact are struggling to match the pace of the technology itself. That gap between what AI can do and how prepared we are to manage it runs through every chapter of this year's report. New in this edition, the report tracks how AI is being tested more ambitiously across reasoning, safety, and real-world task execution, and why those measurements are increasingly difficult to rely on. It also features new estimates of generative AI's economic value alongside emerging evidence of its labor market effects, an analytical framework on AI sovereignty, and a science chapter developed in collaboration with Schmidt Sciences. For the first time, the report features standalone chapters on AI in science and AI in medicine, reflecting AI's growing impact across these two domains.

1 연구 및 개발 … 부록

아홉 번째 AI Index 보고서는 빠르게 발전하는 AI의 속도를 거버넌스, 평가, 교육, 데이터 시스템이 따라갈 수 있는지 검토한다. 또한 AI의 도입과 배포가 확대되고 있음을 기록하는 한편, 측정 공백, benchmark 포화, 불균등한 정책 대응을 강조한다.

  • 부록: 이 보고서는 빠르게 발전하는 AI와 거버넌스, 평가, 교육, 영향 측정 시스템의 진전을 추적한다.역량과 대비 태세 사이의 격차가 보고서의 모든 장을 관통한다.
  • 부록: AI Index는 의사결정자를 위해 독립적으로 수집된 글로벌 데이터를 제공하는 동시에, 이용 가능한 현황이 여전히 불완전한 영역을 식별한다.AI가 일, 학습, 교실, 진료실, 입법부를 재편하는 가운데 정보에 입각한 의사결정을 지원하는 것이 보고서의 명시적 목적이다.
  • 부록: 생성형 AI는 3년 만에 인구 기준 도입률이 거의 53%에 도달했으며, 조직 도입률은 88%로 상승했다.2025년 글로벌 기업 투자는 두 배 이상 증가했고, 선도 AI 기업들은 이전 기술 세대보다 더 빠르게 유의미한 매출 규모에 도달했다.
  • 부록: Frontier model은 수렴하고 open-weight model은 더욱 경쟁력을 확보하는 가운데, 벤치마크는 포화되고 독립적 테스트가 개발자 보고를 항상 확인해 주지는 않는다.Frontier lab은 공개하는 정보도 줄이고 있어 평가를 점점 더 신뢰하기 어려워지고 있다.
  • 부록: 과학 분야의 AI는 개별 연구 단계를 가속하는 데서 전체 workflow를 대체하려는 방향으로 이동했으며, 임상 AI는 pilot에서 더 광범위한 배포로 나아갔다.Ambient AI scribe가 의료 시스템 전반으로 확장되고 있다.
  • 부록: 각국 정부는 2025년에 서로 다른 AI 정책을 채택했다. EU AI Act의 첫 금지 조항이 발효된 반면, 미국은 규제 완화로 방향을 전환했다.일본, 한국, 이탈리아는 국가 AI 법률을 통과시켰고, 새로 채택된 국가 AI 전략의 절반 이상은 개발도상국에서 나왔다.
  • 부록: AI sovereignty는 각국 정부의 정책 추진 전반을 조직하는 핵심 원칙으로 부상했다.보고서는 이러한 대응이 단일한 방향을 가리키기보다 다양하다고 제시한다.

의장·공동의장

보고서의 의장·공동의장 소속은 서던캘리포니아대학교 정보과학연구소다.

  • 의장·공동의장: 의장·공동의장은 서던캘리포니아대학교 정보과학연구소에 소속되어 있다.

회원

회원 기관은 JPMorgan Chase & Co., Google, University of Oxford, Stanford University, Salesforce, AI21 Labs에 걸쳐 있다.

  • JPMorgan Chase & Co.가 회원으로 등재되어 있다.
  • Google과 University of Oxford가 함께 회원으로 등재되어 있다.
  • Stanford University와 Salesforce가 함께 회원으로 등재되어 있다.
  • Stanford University와 AI21 Labs도 함께 회원으로 등재되어 있다.

수석 연구 관리자 및 편집장 … Ipsos

AI 역량, 인프라, 도입, 과학적 응용은 2025년에 빠르게 확대된 반면, 투명성, responsible-AI 평가, 교육, 인재 이동성, 거버넌스는 그 속도를 따라가지 못했다. 또한 AI의 편익과 위험이 국가, 부문, 물리적 환경, 과학 및 임상 과업 전반에 불균등하게 분포한다고 보고서는 분석한다.

  • 기술적 성능: AI 성능은 첨단 과학, multimodal reasoning, 수학, 코딩에서 인간 기준선에 도달하거나 이를 넘어섰지만 여전히 불균일했다. 에이전트의 OSWorld 성공률은 ~66%에 도달했고, 최고 성능 모델도 아날로그 시계를 정확히 읽은 비율은 50.1%에 불과했으며, 로봇이 완료한 가정 내 과업은 12%였다.통제된 로봇 조작은 RLBench에서 89.4%에 도달했으며, 이는 예측 가능한 시뮬레이션 환경과 예측 불가능한 가정 환경 사이의 격차를 보여준다.
  • Responsible AI: responsible-AI 측정은 역량 발전에 뒤처졌다. 문서화된 사고는 233건에서 362건으로 증가했고, 주요 개발자들은 responsible-AI 결과보다 역량 결과를 훨씬 더 일관되게 보고했으며, 안전성 개선은 정확도를 저하시킬 수 있었다.보고서는 시스템의 역량이 향상될수록 benchmark 신뢰성과 AI 시스템 평가가 점점 더 어려워진다고 설명한다.
  • 경제와 노동: 미국은 $285.9 billion으로 민간 AI 투자에서 선두를 차지했으며, 이는 중국의 $12.4 billion보다 23배 이상 많았다. 그러나 미국으로 유입되는 AI 연구자와 개발자는 2017년 이후 89% 감소했고, 생산성 향상은 22세에서 25세 사이 미국 개발자의 고용이 nearly 20% 낮아진 현상과 동시에 나타났다.Generative AI는 3년 만에 인구의 53%가 도입했으며, 2026년 초 미국 소비자에 대한 추정 연간 가치는 $172 billion에 도달했다.
  • 과학과 의학: AI는 과학 및 임상 분야에서 상당하지만 불균등한 가치를 보였다. frontier model은 평균적으로 인간 화학자보다 우수했지만 천체물리학 재현에서는 20% 미만을 기록했고, 임상 노트 도구는 엄밀한 근거가 제한적인 상황에서도 의사의 기록 작성 시간을 최대 83% 줄였다.더 작은 특화 모델도 일부 protein 및 genomics benchmark에서 훨씬 더 큰 시스템을 능가했다.
  • 연구와 개발: 산업계는 2025년 주요 AI 모델의 91.2%를 생산했으며, 미국은 중국의 35개에 비해 59개 모델을 공개했다. 한편 frontier-model 공개 자료에서 training code, 데이터, parameter를 공개하지 않는 사례가 점점 늘었다.training-code 접근성은 급격히 축소되었다. 주요 모델 102개 중 81개에는 해당 training code가 없었고, open source인 모델은 4개뿐이었다.
  • AI 인프라: 글로벌 AI compute capacity는 연간 3.3배 증가해 17.1 million H100-equivalents에 도달했지만, 인프라는 지리적·산업적으로 집중된 상태였다. 미국에는 5,427개의 data center가 있었고, TSMC는 사실상 모든 선도 AI chip을 제조했다.Nvidia는 전체 compute의 60% 이상을 공급했으며, 미국에는 다른 어떤 국가보다 10배 넘게 많은 data center가 있었다.
  • 환경 영향: AI의 환경 발자국은 배포와 함께 확대됐다. 데이터센터 전력 용량은 29.6 GW에 도달했고, Grok 4의 학습 배출량은 72,816톤의 CO2 환산량에 이르렀으며, 연간 GPT-4o 추론에 사용되는 물은 1.2 million명의 식수 수요를 초과할 수 있다.하드웨어는 10년 동안 와트당 효율이 약 열 배 향상됐지만, 모델 확장으로 총 학습 전력과 배출량은 계속 증가했다.
Loading 2606.15708v3…