Source-linked AI summary

ASI-Bench: At the Dawn of Artificial Superintelligence

Junwei Zhou, Zhen Sun, Binyu Li, Jiangyu Zhou, Yuexi Pan, Hengyu Wang, Honghe Ren, Xiaohan Jia, Xueyang Zhou, Xiaoyu Cao, Yongchao Chen, Yuanning Feng, Junhao Wu, Cheng Zhang, Sijia Chen, Haoyu Xue, Chengsong You, Huan Wang, Koutian Wu, Peigan Gao, Jiakun Wu, Wenzhe Li, Ergan Shang, Qingyuan Zheng, Jingjing Zhou, Ruixuan Jia, Yan Xu, Hongrui Zhang, Xiao-Han Ma, Zhengxiang Cheng, Yuexing Hao, Liting Mai, Xianglin Ji, Wenjun Zhang, Zhuofan Chen, Yixiao Huang, Chi Wang, Wenyue Hua, Yilun Hao, Yuantao Zhai, Ziyan Zhao, Jingyan Xie

arXiv:2608.17271v1cs.AI

TL;DR

기존 벤치마크는 문제와 방법이 인간에 의해 지정되지 않은 상황에서 AI가 과학 연구를 자율적으로 수행할 수 있는지에 대해 제한적인 근거만 제공한다. ASI-Bench는 방법론적 지침을 단계적으로 철회해 이 능력을 평가하며, 평균 점수가 50.91에서 29.10, 다시 26.62로 하락함을 확인한다.

  • 문제

    기존 평가는 문제와 방법이 인간에 의해 상당 부분 지정되지 않은 상황에서 AI가 과학 연구를 자율적으로 수행할 수 있는지에 대해 제한적인 근거만 제공한다.

  • 방법

    ASI-Bench는 11개 과학 분야의 프로젝트 수준 연구 과제 60개를 대상으로, 방법론적 지침을 단계적으로 줄인 동일 조건에서 평가하고 검증된 과제 구성을 사용한다.

  • 결과

    평균 성능은 완전한 지침이 제공될 때의 50.91에서 방법만 지정된 경우 29.10으로, 에이전트가 직접 방법을 결정하는 경우 26.62로 하락한다.

  • 시사점 및 한계

    ASI-Bench는 방법론적 지침이 철회되는 과정에서 범용 지능, 혁신, 자율적 실행을 향한 진전을 측정하기 위한 공통 기준점을 제공한다.

  • 시사점 및 한계

    고정된 벤치마크나 단일 연구팀만으로는 미래의 AI 시스템이 직면해야 할 어렵고 의미 있으며 검증 가능한 문제의 폭넓은 범위를 완전히 대표할 수 없다.

Abstract

from arXiv · show

Artificial superintelligence (ASI) requires AI to move beyond mastering existing knowledge toward exploring the unknown, creating new knowledge, and turning new ideas into verifiable results. However, the capabilities of today's AI systems are still largely built on learning, compressing, and applying existing human knowledge. Accordingly, existing benchmarks primarily test whether AI can produce correct answers based on learned knowledge, or whether it can complete tasks under extensive human guidance. We therefore introduce ASI-Bench, the first benchmark to jointly evaluate AI systems' capabilities of innovative exploration and autonomous scientific execution across general research domains, and the first to progressively withdraw human methodological guidance within the same research project to test how far AI can proceed on its own. Built by over 40 experts with the cost of 31,000+ human hours, ASI-Bench contains 60 project-level research tasks across 11 scientific domains and progressively reduces methodological guidance to test whether AI can independently select methods, conduct research, and produce verifiable results. All tasks undergo expert review, AI-assisted auditing, sandbox execution, and scorer validation. Across 18 state-of-the-art agent--model configurations, the average score drops from 50.91 with full methodological guidance to 29.10 with only the method specified and 26.62 when agents must determine the method themselves. This sharp decline shows that current systems remain heavily dependent on human guidance and are still far from autonomously conducting end-to-end, project-level scientific research. ASI-Bench is open to the world. We invite researchers and builders everywhere to contribute new tasks, challenge the limits of today's AI, and help accelerate humanity's collective path toward artificial superintelligence at https://asibench.apexin.ai/submit.

1 서론

ASI-Bench는 AI가 기존 인간 지식을 적용하는 데서 나아가 낯선 문제를 탐구하고, 새로운 해법을 창출하며, 검증 가능한 결과를 산출할 수 있는지 평가한다. 18개 Agent×Model 구성에서 방법론적 지침을 철회할수록 성능이 급격히 하락해 현재 시스템이 인간의 지시에 의존하고 있음을 드러낸다.

  • 동기와 기여: ASI-Bench는 기존 인간 지식을 적용하는 데서 나아가 낯선 문제를 탐구하고, 새로운 해법을 개발하며, 이를 검증 가능한 결과로 전환하는 AI의 능력을 평가한다.이 benchmark는 general intelligence, 혁신, autonomous execution에 필요한 역량을 다룬다.
  • Benchmark 구축: 과제는 추적 가능한 과학 자료에서 수집하고, 분야 전문가가 설계하며, AI-assisted auditing과 네 차례의 human cross-review를 거쳐 검증한다.검토에서는 과학적 논리, 과제 명세, reference artifact, scoring code, information leakage를 점검한다.
  • 경험적 결과: 방법론적 지침을 모두 제공할 때의 50.91은 방법만 지정하면 29.10으로, agent가 방법을 스스로 정해야 하면 26.62로 하락한다.이러한 큰 폭의 하락은 과학적 실행과 autonomous discovery 사이의 격차를 드러낸다.
  • 기여: ASI-Bench는 방법론적 지침이 철회될 때 general intelligence, 혁신, autonomous execution의 출현을 추적할 수 있는 공통 기준점을 제공한다.목적은 인간 지식을 학습하고 압축하며 적용하는 시스템에서 autonomous scientific capability로 이행하는 과정을 측정하는 데 있다.

2 벤치마크 설계

ASI-Bench는 인간의 방법론적 지침을 점진적으로 철회하면서 도메인 간 프로젝트 수준 연구, 독립적 방법 선택, end-to-end 실행을 함께 평가한다. 11개 과학 도메인에 걸쳐 60개 태스크를 포함하고, 대응되는 지침 조건을 사용하며, 엄격하게 구축·검증되었다.

  • 벤치마크 설계: ASI-Bench는 프로젝트 수준 연구와 B1–B3 지침 gradient를 통해 도메인 간 일반화, 방법론적 자율성, end-to-end 과학적 실행을 함께 측정한다.이 gradient는 인간의 방법론적 지침이 점진적으로 철회될 때도 역량이 유지되는지 검증한다.
  • 감소된 인간 지침을 활용한 자율 연구: 대응되는 지침 조건에서는 과학적 자율성을 분리해 측정할 수 있도록 태스크, 데이터, 요구 산출물, scoring criteria를 고정한 채 방법론적 지침을 점진적으로 줄인다.Agent가 정해진 절차를 실행하는 단계에서 스스로 방법을 선택하는 단계로 이동하더라도 동일한 연구 목표와 평가 조건을 유지한다.
  • 감소된 인간 지침을 활용한 자율 연구: 각 태스크는 문제 이해, 방법 선택, 구현, 실험, 실패 진단, 개선, 검증을 아우르는 장기 과정이 필요하며, 검증 가능한 과학적 산출물을 생성한다.60개 태스크 전체에서 이러한 과정은 2,600회 이상의 상호작용 턴, 2,400회의 실행 단계, 35시간 이상의 Agent 실행을 포함한다.
  • 폭넓은 과학적 범위: 이 벤치마크는 11개 과학 도메인에 걸친 60개 프로젝트 수준 연구 태스크로 구성되며, 하나의 Agent×Model 시스템이 데이터 유형, 방법, 검증 기준 전반에 걸쳐 일반화할 것을 요구한다.포함된 도메인은 수학, 물리학, 화학, 생물학, 천문학, 재료과학, 지구과학, 의학 및 생물통계학, 컴퓨터과학, 로보틱스, 전기공학이다.
  • 엄격한 구축과 검증: 이 벤치마크는 1,300개가 넘는 후보 연구 아이디어를 바탕으로 다섯 차례의 검토 라운드, 1,100건이 넘는 검토 할당, 2,000건이 넘는 태스크 수정을 거쳐 반복적으로 구축되었다.이 구축 과정은 단일 패스 수집이 아니라 대규모의 반복적 과정으로 제시된다.
  • 프런티어 진전 측정: 26.62는 18개 state-of-the-art Agent×Model 구성에 걸친 평균 B3 점수로, 최소한의 방법론적 지침 아래에서 향후 시스템이 개선할 여지가 상당함을 보여준다.이 벤치마크는 아직 포화 상태와 거리가 멀며, 더 자율적이고 고차원적인 지능으로의 진전을 구분하기 위해 설계되었다.

3 실험

60개 ASI-Bench task에 대한 18개 Agent×Model configuration의 실험은 자율적 과학 연구가 여전히 제한적이며, 성능이 세부적인 방법론적 guidance와 harness 설계에 크게 의존함을 보여준다. 완전한 guidance는 computational cost도 줄이지만, 더 높은 지출이 일관되게 더 나은 성능으로 이어지지는 않는다.

  • 과학적 자율성은 여전히 제한적이다: GPT-5.6 Sol inference가 xhigh에서 ultra로 증가하면 B3는 40.86에서 51.60으로 상승하며, 10.74의 향상을 보인다.더 강한 inference-time reasoning은 독립적인 method selection과 workflow construction을 개선하지만, 그 결과 얻는 capability는 전반적으로 여전히 제한적이다.
  • 세부적인 방법론적 guidance에 대한 의존: 평균 성능은 B1의 50.91에서 B2의 29.10으로 21.82 points 하락하며, B3에서 method를 제거하면 26.62로 추가 2.48-point 하락한다.이 결과는 method selection 자체보다 과학적 method를 완전한 research procedure로 변환하는 것이 주요 병목임을 보여준다.
  • Harness가 model의 capability를 형성한다: MiMo V2.5 Pro는 MiMo Code 사용 시 16.17에서 Claude Code 사용 시 23.25로 향상되며, Kimi K2.7은 19.72에서 27.34로 상승한다.harness 효과는 균일하지 않다. Kimi K3는 Kimi Code와 Claude Code 사이에서 36.22 대 37.09로 차이가 크지 않다.
  • 완전한 guidance는 compute cost를 줄인다: B1은 task당 평균 4.35M tokens와 37.8분을 요구하며, procedural guidance를 제거하면 B3에서는 consumption이 25%, B4에서는 30% 증가한다.B1은 method, implementation steps, parameter choices를 지정하므로 complete guidance가 가장 비용이 적은 setting이다.
  • 더 높은 비용이 더 나은 성능을 보장하지는 않는다: GPT-5.6 xhigh를 사용하는 Codex는 run당 약 $684의 비용으로 40.86%를 기록하며, $2,728의 비용에도 Claude Code를 사용하는 Claude Opus 5의 40.70%와 유사하다.더 높은 지출은 absolute performance를 향상시킬 수 있지만, 상당히 다른 computational budget에서도 유사한 scientific performance가 나타날 수 있다.

4 결론 · A 관련 연구 · B 저자

ASI-Bench는 과학 AI를 평가하기 위한 개방형·진화형 인프라로 자리매김하며, 기존 benchmark를 실행 가능한 project-level 자율성과 guidance dependence를 평가하는 방향으로 확장한다. 구축 과정에는 폭넓은 참여, expert review, 60개 task, 11개 scientific domain이 결합되었다.

  • 4 결론: ASI-Bench는 공유 research infrastructure로 발전하여 통제된 model–agent 비교를 가능하게 하고, 인간의 methodological guidance가 여전히 필요한 지점을 드러내는 것을 목표로 한다.B1–B4 구조와 domain-level 분석은 단일 leaderboard를 넘어선 비교를 지원한다.
  • 4 결론: 이 benchmark는 research problem, 실행 가능한 task, evaluation method, review, verified result를 커뮤니티가 기여하며 발전하도록 설계되었다.저자들은 역량이 발전함에 따라 scientist, engineer, model team, agent researcher, benchmark developer가 이를 시험하고 한계에 도전하기를 요청한다.
  • 4 결론: 개방적이고 엄밀하며 지속적으로 발전하는 community standard는 지능의 실질적 진전을 식별하고 artificial superintelligence를 향한 발전을 가속하는 토대로 제시된다.결론은 미래의 모든 문제를 대표하는 고정된 benchmark나 단일 research team보다 집단적 개발을 강조한다.
  • A 관련 연구: AI scientist system은 language model을 planning, retrieval, code execution, scientific tool과 결합하여 점점 더 완전한 research workflow를 자동화한다 [16].Coscientist는 tool-augmented chemistry planning과 experimentation을 시연했으며, The AI Scientist는 generation, implementation, experimentation, visualization, writing, review를 통합했다 [16].
  • A 관련 연구: Scientific-agent benchmark는 advanced knowledge test부터 executable programming, data-driven discovery, hypothesis-generation task까지 다양하지만, 선별된 capability만 다룬다 [21] [13] [12] [22] [23] [24].GPQA와 Humanity’s Last Exam은 knowledge를 평가하고, SciCode는 scientific programming을 평가하며, DiscoveryBench, BLADE, DSBench, HypoBench는 discovery 또는 hypothesis generation을 대상으로 한다.
  • A 관련 연구: 기존 autonomy benchmark는 사용 가능한 정보를 달리하지만, ScienceAgentBench는 method selection과 procedural guidance를 분리하지 않으며, ProjectionBench는 실행 가능한 project workflow보다 hypothesis generation에 초점을 둔다 [8] [33].이러한 차이는 project-level research에서 guidance를 점진적으로 줄여 평가해야 할 근거가 된다.
  • B 저자: ASI-Bench는 폭넓은 참여와 독립적인 expert review를 통해 구축되었으며, 21명의 researcher가 11개 scientific domain에 걸쳐 60개 project-level task를 남겼다.구축 과정에는 5회의 review round, 1,100건이 넘는 task-review assignment, 반복적인 revision이 포함되었다.

B.1 Task Contributors · B.2 Human Reviewers · B.3 Affiliations

부록은 최종 반영된 ASI-Bench task에 기여하고 human review에 참여한 연구자들을 식별하고, affiliation 번호를 기관에 대응시킨다. Human review는 5회에 걸쳐 1,100건을 초과하는 assignment로 구성됐다.

  • B.1 Task Contributors: 최종 ASI-Bench task contributors가 부록에 이름순으로 수록돼 있다.Contributor 목록은 두 개의 단락에 걸쳐 제시된다.
  • B.1 Task Contributors: Contributor 명단에는 Yuexi Pan, Hengyu Wang, Hengyu Wang 및 부록에 식별된 다른 연구자들이 포함된다.제공된 명단에는 Honghe Ren, Peigan Gao, Jiangyu Zhou, Sijia Chen, Junhao Wu, Huan Wang 등의 연구자도 포함된다.
  • B.2 Human Reviewers: 5회에 걸친 human review에서 1,100건을 초과하는 task-review assignment가 완료됐다.부록은 이 review 과정에 참여한 연구자들을 소개한다.
  • B.2 Human Reviewers: Human-reviewer 명단에는 Jiangyu Zhou, Yuexi Pan, Hengyu Wang, Honghe Ren 및 기타 이름이 제시된 참여자들이 포함된다.제공된 목록에는 Xiaohan Jia, Xueyang Zhou, Cheng Zhang, Yuanning Feng, Xianglin Ji도 포함된다.
  • B.3 Affiliations: Affiliation numbers 1–6은 Tsinghua University, MIT, Harvard University, Carnegie Mellon University, the University of Michigan, the University of Illinois Urbana–Champaign에 각각 대응한다.제시된 소재지는 Beijing, Cambridge, Pittsburgh, Ann Arbor, Urbana–Champaign에 걸쳐 있다.
  • B.3 Affiliations: Affiliation numbers 7–13은 Boston University, the University of Queensland, USTC, the Flatiron Institute, Microsoft Research, AG2 AI 및 independent researchers에 각각 대응한다.부록은 각 대학의 소재지와 Flatiron Institute의 소재지인 New York을 제시한다.

C ASI-Bench에 기여하기

ASI-Bench는 지속적으로 발전하는 커뮤니티 주도 benchmark로 설계되었으며, 11개 scientific domain에 걸친 초기 60개 task는 출발점에 불과하다. 기여자는 표준화된 B1–B4 task 형식, 로컬 테스트, scientific·technical review를 통해 실제로 재현 가능한 scientific problem을 추가할 수 있다.

  • Research Community와 함께 ASI-Bench 확장하기: 각 기여 task는 실제적이고 사소하지 않은 scientific objective를 정의하며, 명시적이고 재현 가능한 기준으로 평가할 수 있는 artifact를 생성해야 한다.기여자는 문제의 scientific substance를 유지하면서 이를 표준화된 ASI-Bench 형식으로 표현한다.
  • 완전한 Task란 무엇인가?: 완전한 기여에는 scientific objective, 네 가지 prompt variant, 명시적 input/output specification, evaluation configuration, runtime dependency, local-testing evidence가 포함된다.이 package는 scientific question을 단순히 설명하는 데 그치지 않고 재현 가능한 실행과 평가를 지원하도록 설계되었다.
  • B1–B4 Information Gradient 구성하기: B1–B4 gradient는 B1의 완전한 procedural guidance부터 B3의 objective-and-constraint specification까지 methodological information을 조절하며, B4에서는 비필수 정보만 추가한다.B2는 의도된 methodological approach를 제공하되 implementation decision은 agent에 맡긴다. B3와 B4는 동일한 task objective와 required artifact를 유지한다.
  • 테스트, 제출, 수정: 제출 전에 기여자는 B1–B4를 테스트하고, difficulty, leakage, reproducibility, evaluation stability를 평가하기 위해 execution, environment, sandbox, scorer-replay evidence와 함께 score를 보고한다.이 과정은 public task template, online submission portal 또는 CLI launcher를 사용한 뒤 review와 revision을 진행한다.
  • 앞으로의 여정을 위한 Open Benchmark: 이 benchmark는 연구자에게 새로운 scientific challenge를 기여하고, 개발자에게 evaluation을 개선하며 failure case를 식별하고 AI capability가 발전함에 따라 task를 검증할 것을 요청한다.현재 60개 task는 폐쇄적인 test set이 아니라 명시적으로 출발점으로 간주된다.

D 사례 연구 … B1 프롬프트 — 전체 방정식 및 솔버 가이드

사례 연구는 에이전트가 2차원 비선형 동역학계의 관측을 분석하고, 그 동역학을 재구성하며, 미래 시점의 장을 예측하고, 검증 가능한 과학적 산출물을 생성할 수 있는지 평가한다. 완전한 지침이 제공되는 B1 조건에서 프롬프트는 비등방성 Kuramoto–Sivashinsky-type 방정식, Fourier pseudospectral 이산화, dealiasing, ETDRK4 적분을 지정한다.

  • 과제: 2D 비등방성 강직 동역학: 과제는 주기적 공간 영역에서 2차원 비선형 동역학계의 관측을 제공하고 에이전트에게 그 동역학을 특성화하도록 요구한다.
  • 과제: 2D 비등방성 강직 동역학: 에이전트는 모델을 구성하고, 미래의 목표 시점에서 장을 예측하며, 물리적 진단량을 추출하고, 실행 가능한 과학적 출력을 제공해야 한다.필수 산출물에는 예측된 장, 공간 스펙트럼, 물리적 진단량, 시각화, 데이터 분석 결과, 완전한 시뮬레이션 코드가 포함된다.
  • 과제: 2D 비등방성 강직 동역학: 과학적 목표, 입력 데이터, 산출물, 평가 기준은 B1–B4에서 고정되며, 프롬프트 정보만 달라진다.
  • B1 프롬프트 — 전체 방정식 및 솔버 가이드: B1은 이중 주기 영역에서 보존형 비등방성 Kuramoto–Sivashinsky-type 방정식 전체를 제시하고 모든 영역 및 방정식 매개변수를 제공한다.
  • B1 프롬프트 — 전체 방정식 및 솔버 가이드: 지정된 공간 해법은 보존형 비선형 평가와 2/3-rule dealiasing을 사용하는 2차원 Fourier pseudospectral scheme이다.
  • B1 프롬프트 — 전체 방정식 및 솔버 가이드: Fourier-space 선형 연산자는 제공된 계수와 함께 이차 및 사차 비등방성 미분 항을 결합한다.
  • B1 프롬프트 — 전체 방정식 및 솔버 가이드: 사차 항으로 인해 시스템이 stiff해지므로, B1은 에이전트가 미리 계산된 지수함수와 Kassam–Trefethen contour-integral 계수를 사용해 ETDRK4를 적용하도록 지시한다.프롬프트는 E, Q, f1, f2, f3를 사용한 중간 ETDRK4 상태와 최종 Fourier-state 업데이트도 지정한다.
  • B1 프롬프트 — 전체 방정식 및 솔버 가이드: B1 과제는 관측 데이터를 분석하고, 수치 솔버를 재구성하며, 목표 시점의 장을 예측하고, 요구된 과학적 산출물을 생성하는 것이다.

B2 프롬프트 — 방법 배경

이 과제는 두 공간 차원에서 방향에 따라 불균일하고 복잡한 동역학을 보이는 강직한 네 번째 차수 비선형 PDE를 다룬다. 관측된 시스템을 모델링하고, 미래 장을 예측하며, 해석 가능한 물리 진단량을 추출해야 한다.

  • 과제: 목표는 관측 데이터를 분석하고, 주어진 초기 조건에서 동역학을 재현하는 수치 모델을 구축하며, 미래 장을 예측하고, 물리 진단량을 복원하는 것이다.적절한 경우 두 공간 방향을 별도로 분석한 뒤 solver를 선택해야 한다.
  • 물리적·수치적 배경: 이 시스템은 불안정화를 일으키는 두 번째 차수 성장, 교차 미분 결합을 포함한 안정화 네 번째 차수 소산, 비선형 에너지 전달, 방향 의존적 거동이 결합된 형태다.이러한 요소들은 단순한 정상 확산이 아니라 불규칙한 패턴 동역학을 만들어낸다.
  • 물리적·수치적 배경: 네 번째 차수 항에서 발생하는 심각한 선형 강직성 때문에 ETDRK4와 semi-implicit spectral integrator를 포함한 강직성 인식 시간 적분과 spectral discretization이 요구된다.ETD 계열 spectral solver가 경쟁력 있는 선택이지만, 유일하게 타당한 방법은 아니다.

B3 프롬프트 — 연구 목표 및 데이터만 · B4 프롬프트 — 산만한 정보가 포함된 연구 목표

프롬프트는 관측된 2D 비선형 동역학의 탐색, 모델 식별, 장 예측, 물리량 추출을 포함하는 프로젝트를 정의한다. B3는 지배방정식과 시간 발전 전략을 제시하지 않으며, B4는 무관한 과학적 제안과 배경 잡음을 추가하되 이를 무시해야 한다.

  • B3 프롬프트 — 연구 목표 및 데이터만: 이 과제는 주기적 영역의 2D 비선형 시스템에서 관측된 시공간 데이터를 사용하며, 해당 장은 시간에 따라 구조적이고 복잡한 패턴을 형성한다.
  • B3 프롬프트 — 연구 목표 및 데이터만: 제공된 파일에는 시스템 매개변수와 시간 메타데이터, 관측된 2D 장 스냅샷, 예측을 위한 초기장이 포함된다.
  • B3 프롬프트 — 연구 목표 및 데이터만: 연구 목표는 공간적·시간적 구조를 특성화하고, 동역학을 재현하는 모델을 구성하며, 목표 시간의 장을 예측하고, 물리량을 추출하는 것이다.
  • B3 프롬프트 — 연구 목표 및 데이터만: B3는 지배방정식, 수치적 표현, 유효한 시간 발전 전략을 명시하지 않으므로, 접근법 식별 자체가 과제의 일부가 된다.
  • B4 프롬프트 — 산만한 정보가 포함된 연구 목표: B4는 동일한 네 가지 목표를 유지하지만, B3에서 명시적으로 요구한 초기 조건과 system_info.json의 사용 요건을 제거한다.
  • B4 프롬프트 — 산만한 정보가 포함된 연구 목표: B4는 무관한 PDE 계열, 추측성 예비 노트, 주제에서 벗어난 배경 잡음으로 과제를 둘러싸면서, 에이전트에게 제공된 데이터에 집중하고 무관한 정보를 무시하도록 지시한다.
Loading 2608.17271v1…