Source-linked AI summary
Running the Gauntlet: Re-evaluating the Capabilities of Agents Beyond Familiar Environments
Mykola Vysotskyi, Runqi Lin, Grzegorz Biziel, Michal Zakrzewski, Sebastian Montagna, Damian Rynczak, Shreyansh Padarha, Kumail Alhamoud, Zihao Fu, William Lugoloobi, Kai Rawal, Hanna Yershova, Xander Davies, Taras Rumezhak, Guohao Li, Fazl Barez, Baoyuan Wu, Arkadiusz Drohomirecki, Yarin Gal, Chris Russell, Christopher Summerfield, Adam Mahdi, Volodymyr Karpiv, Philip Torr, Adel Bibi
TL;DR
기존 벤치마크는 단순하고 익숙한 과제와 협소한 능력을 사용하는 경우가 많아, 복잡한 환경에서 에이전트 일반화를 평가하는 데 한계가 있다. GauntletBench는 전문 애플리케이션 전반에서 시간적 지각, 그래픽 이해, 3D 추론을 평가하며, 최고 성능 에이전트의 성공률이 19.1%에 불과함을 확인했다.
문제
기존 벤치마크는 익숙한 애플리케이션, 단순한 과제, 협소한 능력을 사용해 복잡한 실제 환경에서 에이전트 성능을 평가하는 데 한계가 있다.
방법
GauntletBench는 충분히 탐구되지 않은 세 가지 능력과 상대적으로 덜 다뤄진 다섯 가지 전문 애플리케이션을 아우르는 시각적 근거 기반 과제를 통해 에이전트 일반화를 평가한다.
결과
최고 성능 에이전트의 성공률은 19.1%였으며, 인간 주석자는 벤치마크에서 80%를 초과했다.
시사점 및 한계
GauntletBench는 복잡한 실제 환경의 도전적이고 시각 집약적인 과제에서 현재 에이전트가 신뢰할 수 있는 인간 수준의 성능에 여전히 크게 미치지 못함을 보여준다.
시사점 및 한계
GauntletBench는 다섯 가지 전문화된 영역과 일부 상호작용 패러다임만 다루므로, 실제 환경의 다양성을 포착하지 못할 수 있다.
Abstract
from arXiv · showhide
As agentic systems continue to evolve and are widely deployed in real-world scenarios, there is a growing demand to faithfully evaluate their capabilities. However, current benchmarks are typically built on popular applications with relatively simple tasks and focus on a narrow set of capabilities while overlooking broader dimensions, resulting in saturated performance on modern agents and failing to probe their limitations. To this end, we introduce GauntletBench, a web-based benchmark for evaluating agent generalisation in challenging scenarios, focusing on three underexplored capabilities (temporal perception, graphical understanding, and 3D reasoning), across five less-covered professional applications (Video Editor, Workflow Builder, 3D Modeller, Flight Analyser, and Circuit Designer), each with 20 vision-intensive tasks (100 in total). Our benchmark provides a modular pipeline that comprises an environment compatible with both open- and closed-source agent frameworks, a controlled web-based application, a well-structured task suite, and an automated evaluation engine with diverse metrics. Contrary to widespread expectations, our empirical results reveal that frontier agentic systems remain far from achieving human-level performance. Even the state-of-the-art agent achieves only a 19.1% success rate on our GauntletBench, highlighting the limitations in these overlooked capabilities and generalisation. By comparison, non-expert human annotators achieve over 80% success on our challenging yet feasible tasks, revealing the substantial gap between current agent capabilities and those required for complex real-world scenarios.
1 서론
GauntletBench는 기존의 포화된 benchmark의 한계를 드러내는, 도전적이고 시각적 근거가 있는 시나리오에서 agent generalisation을 평가한다. temporal perception, graphical understanding, 3D reasoning을 5개 전문 애플리케이션과 100개 task에 걸쳐 평가하며, SOTA agent의 성공률은 19.1%에 불과한 반면 비전문 human annotator는 80%를 초과한다.
- Benchmark 설계: 이 benchmark는 5개의 통제된 web-based application과 100개의 vision-intensive task로 구성되며, 자동화된 evaluation engine이 이를 지원한다.모듈형 platform은 environment, application, task, evaluation으로 구성되며, open-source, API-based, closed-source agent framework를 지원한다.
- 동기: 기존 benchmark는 대체로 동질적인 설정, 단순한 task, 인기 application 또는 이와 거의 동일한 복제본을 사용해 포화된 성능을 만들어내며, 실제 세계의 복잡성을 반영하지 못한다.이러한 한계는 덜 다뤄진 application과 더욱 도전적인 시나리오를 아우르는 평가의 필요성을 뒷받침한다.
- Benchmark 기여: GauntletBench는 3가지로 충분히 탐구되지 않은 capability인 temporal perception, graphical understanding, 3D reasoning을 대상으로 한다.이 benchmark는 도전적인 시나리오에서 agent generalisation을 평가하기 위해 시각적 근거가 있는 task를 사용한다.
- 실증 결과: 대부분의 open-source MLLM agent는 거의 0에 가까운 성능을 보이며, GauntletBench에서 API-based MLLM agent 중 성공률이 13.2%를 초과하는 agent는 없다.이 대목에서는 Qwen-3-VL 과 Llama-4-Maverick 을 open-source agent의 예로 제시한다.
- 실증 결과: 특정 application 전문성이 없는 human annotator는 80%를 초과하는 성공률을 달성하며, frontier agentic system보다 30% 적은 step을 필요로 한다.이 격차는 현재 system이 benchmark에서 간과된 capability와 generalisation 측면에서 중대한 한계를 지님을 보여준다.
- 실증 결과: GauntletBench에서 SOTA agent의 성공률은 19.1%로, 복잡한 실제 세계 시나리오에서 여전히 human-level performance와 큰 격차가 있음을 보여준다.비전문 human annotator는 80%를 초과하는 성공률을 보여 상당한 capability 격차를 드러낸다.
2 GauntletBench
GauntletBench는 익숙하지 않은 전문 애플리케이션과 vision-intensive task를 통해 복잡한 실제 시나리오에서 agent generalisation을 평가하는 modular web-based benchmark다. open- 및 closed-source agent를 대상으로 visually grounded interaction, structured task design, automated application-specific evaluation을 결합한다.
- 2 GauntletBench: GauntletBench는 통합 web environment, controlled application, structured task, automated evaluation engine을 하나의 modular pipeline으로 통합한다.인터페이스는 open-source/API-based MLLM agent와 closed-source framework를 모두 지원한다.
- 2.1 통합 환경: Agent는 high-level browser command와 visually grounded observation을 통해 상호작용하며, 3D Modeller, Flight Analyser, Circuit Designer에서는 canvas-only interface를 사용한다.Low-level browser API는 제공되지 않으므로 agent는 screenshot에 의존해야 하며, action에는 click, type, select, scroll, navigation이 포함된다.
- 2.2 애플리케이션: 이 benchmark는 Video Editor, Workflow Builder, 3D Modeller, Flight Analyser, Circuit Design이라는 익숙하지 않은 5개 전문 애플리케이션을 다루어 agent generalisation을 평가한다.이 애플리케이션들은 temporal perception, graphical understanding, 3D reasoning과 함께 기본적인 UI understanding, tool use, long-term reasoning을 지원한다.
- 2.3 Task Suite: 이 benchmark는 애플리케이션별로 20개씩, easy·medium·hard 난이도에 걸친 인간 수행 가능 task 100개를 제공한다.각 애플리케이션에는 easy 2개, medium 9개, hard 9개가 포함되며, 사용자가 task를 정의하고 ground truth를 업로드할 수도 있다.
- 2.4 Evaluation Engine: Application-specific evaluator는 agent output을 ground truth와 자동으로 비교하며, open- 및 closed-source framework 모두에 대해 다양한 metric을 지원한다.Evaluation engine은 task 완료 후 실행되며, closed-source invocation process에 접근하지 않고 맞춤형 evaluator를 사용한다.
3 실험
GauntletBench는 난도 높은 vision-intensive task에서 14개의 open-source, API-based, closed-source agent를 평가해 human-level performance와의 큰 격차를 드러낸다. 또한 실패는 불안정한 long-horizon 실행, 제한적인 관계 이해, 반복되는 상호작용 오류를 반영하는 경우가 많았다.
- 최첨단 Agentic System도 Human-Level Performance와 여전히 큰 격차를 보인다: 19.1%: Claude-Opus-4.6 Computer Use가 가장 높은 평균 성공률을 기록했으며, Gemini-3.1-Pro의 13.7%와 Claude-Opus-4.6의 13.2%를 앞섰고, 인간은 75–85%에 도달했다.모든 open-source MLLM agent는 모든 application에서 1.7% 미만을 기록했으며, 평가된 system 대부분은 application 전반에서 0.0%를 기록했다.
- 현재 Agent는 Reliable Performance에 얼마나 못 미치는가?: Over 50%: Claude-Opus-4.6 Computer Use의 평균 progress rate는 agent가 중간 단계에서 상당한 진전을 이루는 경우가 많지만, long-horizon task를 안정적으로 완료하는 데 어려움을 겪는다는 점을 보여준다.이는 실패가 진전을 이루지 못해서라기보다 task complexity가 누적되기 때문에 발생한다는 것을 시사한다.
- 현재 Agent가 가장 부족한 Capability는 무엇인가?: 11.7%: Flight Analyser와 Circuit Designer는 가장 어려운 application으로, 관계·상호작용·그에 따른 behavior를 충분히 이해하지 못한 채 기본적인 graphical recognition만 수행한다는 점을 보여준다.이 benchmark는 5개의 professional application에서 temporal perception, graphical understanding, 3D reasoning을 평가한다.
- Vision Modality는 Agent의 Task 완료를 돕는가?: vision-intensive Video Editor와 Workflow Builder task에서는 structured information에만 의존하는 것보다 visual input을 사용할 때 성능이 일관되게 향상된다.최소한의 structured information만 제공되면 text-only agent는 매우 작은 일부 task만 완료한다.
- Model Scale의 영향: model scale을 높이면 성공률과 progress rate가 일관되게 향상되며, 각 family에서 가장 큰 model은 step당 inference cost가 더 높음에도 가장 적은 token을 사용한다.Scale 비교에서는 성능에 100개 전체 task를, 효율성에 45개의 medium-difficulty task를 사용한다.
- Reasoning의 역할: Extended reasoning은 일반적으로 충분한 capability를 갖춘 model의 성능을 향상시키지만 token 및 interaction cost를 증가시키며, Qwen-3-VL은 이를 사용해도 성능이 향상되지 않는다.효율성과 reasoning 비교는 45개의 medium-difficulty task에서 보고된다.
4 관련 연구
기존 computer-use benchmark는 웹, 모바일, 데스크톱, 엔터프라이즈 workflow를 아우르지만, 점차 consumer-style interaction을 강조하면서 professional software가 요구하는 지각적·공간적 부담은 충분히 다루지 않는다. GauntletBench는 시각적으로 조밀한 specialist interface와 structured check, partial-credit judging, efficiency metric을 결합한 더 풍부한 평가로 이 간극을 메운다.
- 기존 Benchmark: 기존 benchmark는 웹, 모바일, 데스크톱, 엔터프라이즈 workflow를 다루지만 [18], 대체로 consumer-style information seeking, navigation, form-based workflow를 강조한다.이러한 평가 지형은 professional software의 요구를 충분히 반영하지 못할 위험이 있다.
- 웹 Agent Benchmark: MiniWoB 와 MiniWoB++ [18] 같은 초기 웹 benchmark는 단순화된 interaction task를 정립했지만, 실제 웹사이트의 복잡성을 포착하지 못하는 synthetic, toy-like interface에 의존했다.이러한 task에는 버튼 클릭, form 작성, menu 탐색과 같은 기본 조작이 포함됐다.
- Agentic 평가: LLM judge는 trajectory와 최종 visible state를 바탕으로 graded progress score를 부여할 수 있지만, progress를 일관되지 않게 hallucinate할 수 있으므로 신중한 prompt 설계와 calibration이 필요하다.따라서 GauntletBench는 model-based partial-credit judging을 structured check 및 efficiency metric과 결합한다.
- Computer-Use Agent Benchmark의 포화: Modern agent는 대부분의 MiniWoB++ [16] task에서 거의 만점에 가까운 score를 기록하며, WebArena 에서 상위 agent와 인간 간 격차도 좁아지고 있어 benchmark 간 변별력이 약화될 우려가 있다.이러한 포화는 강력한 system에도 여전히 어려운 평가 설정의 필요성을 제기한다.
- GauntletBench: GauntletBench는 평가의 초점을 graphical editing, circuit design, flight tracking, 3D manipulation을 아우르는 시각적으로 조밀하고 동적이며 전문적인 interface로 전환한다.browser-based environment의 재현성 이점은 유지하면서 task distribution을 변경한다.
5 결론 및 논의
GauntletBench는 전문 애플리케이션에서 간과된 능력을 겨냥한 도전적이고 vision-intensive한 과제를 통해 agent generalisation을 평가한다. 범위에는 한계가 있지만, 이 benchmark는 강건하고 신뢰할 수 있으며 믿을 수 있는 agent의 더욱 엄밀한 평가와 향후 개발을 지원하는 것을 목표로 한다.
- 결론: GauntletBench는 다양한 전문 애플리케이션과 신중하게 설계된 vision-intensive 과제를 통해 temporal perception, graphical understanding, 3D reasoning을 평가한다.
- 한계: 이 benchmark는 5개의 전문화된 domain과 일부 interaction paradigm만 다루므로, 실제 환경의 다양성을 포착하지 못하고 evaluation bias를 초래할 수 있다.
- 한계: GauntletBench는 충실한 평가를 보장하기 위해 visually grounded interaction을 제한하므로, 다른 능력과 결합될 때 agent의 잠재력을 충분히 발휘하지 못하게 할 수 있다.
- 향후 연구: 향후 확장에서는 더 많은 전문 애플리케이션, 풍부한 multimodal interaction, 더 긴 horizon의 과제와 함께 robustness, safety, failure recovery를 포함한 평가 차원을 추가할 예정이다.
- 광범위한 영향: GauntletBench는 실제 애플리케이션을 위한 더 안전하고 신뢰성 높은 autonomous agent의 엄밀한 평가 관행과 연구를 촉진할 수 있다.
인간 평가
인간 평가는 agent 상호작용 화면을 그대로 반영한 웹 기반 harness를 사용해, 15명의 숙련된 참가자가 완료한 300개 task에 대해 직접 비교 가능한 trajectory와 scoring을 제공한다. 참가자에게는 동일한 prompt가 주어지고 task당 40분의 제한 시간이 적용되며, 인간에 특화된 scoring 조정은 없다.
- Harness 개요: harness는 task 전달, screenshot 캡처, answer 수집을 위한 instrumentation만 추가해 agent 상호작용 화면을 그대로 반영한다.따라서 동일한 web application 내에서 인간과 agent의 trajectory는 구조적으로 비교 가능하다.
- 모집: application당 3명씩 총 15명의 참가자가 300개 task를 완료했으며, 모든 참가자는 CS 배경과 관련 tool의 실무 경험을 보유했다.harness는 application별 여러 annotator로 확장되도록 설계되었다.
- Scoring: 인간의 output은 인간에 특화된 조정 없이 agent의 output과 동일한 pipeline을 통해 scoring되었다.Finish를 클릭하면 answer가 최종 확정되고 session은 다음 task로 진행되었다.
B 효율성에 관한 추가 Ablation Studies · C 진행률 기준
추가 ablation은 쉬운 과제, 중간 난이도 과제, 어려운 과제 전반의 효율성을 정량화하며, model-scale 및 reasoning 비교를 위해 소비된 token과 step을 보고한다. 이러한 측정값은 본 논문의 Tables 3 및 4에 제시된 중간 난이도 열도 제공한다.
- B 효율성에 관한 추가 Ablation Studies: 난이도별 효율성 측정값은 본 논문의 Tables 3 및 4에 제시된 중간 난이도 열의 원자료를 제공한다.원자료는 model-scale 및 reasoning ablation을 모두 포괄한다.
- B 효율성에 관한 추가 Ablation Studies: model-size ablation은 GPT-5.4 Nano, Mini, full model과 Claude-4.6 Haiku, Sonnet, Opus를 비교한다.소비 token 결과는 서로 독립적인 세 번의 실행에 대한 mean ± standard deviation으로 보고한다.
- B 효율성에 관한 추가 Ablation Studies: 소비된 step은 각 난이도 구간과 전체에 대해 동일한 GPT-5.4 및 Claude-4.6 model-size 비교별로 따로 보고한다.표는 서로 독립적인 세 번의 실행에 대한 mean ± standard deviation을 사용한다.
- B 효율성에 관한 추가 Ablation Studies: reasoning ablation은 extended reasoning을 사용하거나 사용하지 않는 GPT-5.4, low와 high reasoning의 Gemini-3.1-Pro, thinking을 사용하거나 사용하지 않는 Claude-Opus-4.6을 비교한다.소비 token 결과는 난이도별로 세분화하고 전체 100개 과제에 대해 pooled하여 제시한다.
- B 효율성에 관한 추가 Ablation Studies: 소비된 step은 쉬운 과제, 중간 난이도 과제, 어려운 과제 및 pooled 과제에 걸쳐 세 reasoning pair 모두에 대해 측정한다.비교에는 reasoning-token 분석과 동일한 model configuration을 사용한다.
C.1 LLM을 심판으로 사용
부록에서는 프롬프트가 입력된 두 LLM 호출을 각각 Stage 1과 Stage 2로 구분하며, 각각 gpt-4o-mini와 gpt-5.1로 구현한다.
- C.1 LLM을 심판으로 사용: 부록에서는 프롬프트가 입력된 두 LLM 호출을 Stage 1과 Stage 2로 명명한다.이 명명 규칙은 부록 전반에서 명확성을 위해 사용된다.
- C.1 LLM을 심판으로 사용: Stage 1은 gpt-4o-mini를 사용한다.
- C.1 LLM을 심판으로 사용: Stage 2는 gpt-5.1을 사용한다.
C.1.1 세부 사항 · C.2 LLM-as-a-Judge 프롬프트
judge pipeline은 screenshot trajectory를 필터링하고, 남은 transition을 보수적으로 파싱한 뒤, 최종적으로 근거 기반 outcome assessment를 수행한다. 프롬프트는 screenshot에서 확인 가능한 근거, 구조화된 JSON 출력, 누적 state 추적, 그리고 최종 state 세부 정보의 누락이나 중복에 대한 penalty를 우선시한다.
- C.1.1 세부 사항: pipeline은 먼저 image-difference metric을 사용해 의미 있는 시각적 변화가 없는 screenshot pair를 제거한 뒤, 남은 pair를 judge에 전달한다.Screenshot을 320×200으로 resize하고 grayscale로 변환한 다음 RMSE, perceptual-hash distance, changed-pixel fraction을 사용해 비교한다.
- C.1.1 세부 사항: Stage 1은 각 남은 screenshot pair를 task context, intervening action, screenshot, 그리고 간결한 이전 visible-state summary와 함께 비교하며, local transition parsing에는 gpt-4o-mini를 사용한다.이 단계는 확인 가능한 변화를 식별하고 간결한 running state summary를 갱신한다.
- C.1.1 세부 사항: Stage 2는 파싱된 출력을 trajectory event로 압축하고, 이를 final screenshot, task information, agent answer, 그리고 이용 가능한 objective 또는 reference signal과 결합하며, 통합 outcome judgment에는 gpt-5.1을 사용한다.이 단계는 trajectory 전반의 근거를 통합한 뒤 최종 assessment를 부여한다.
- C.2.1 Stage 1 System Prompt: Stage 1 prompt는 연속된 screenshot을 보수적이고 근거 기반으로 비교하도록 요구하며, action text와 이전 summary는 proof가 아니라 context로 취급한다.judge가 hidden-state 가정을 피하고, 모순되는 memory보다 screenshot을 신뢰하며, 근거가 모호할 때 unknown 또는 no clear change를 우선하도록 지시한다.
- C.2.2 Stage 1 Task Prompt: Stage 1은 visible action, change type, task relevance, progress, confidence, uncertainty, 그리고 갱신된 cumulative visible-state summary를 위한 structured fields를 출력한다.신뢰할 수 있는 갱신이 불가능할 때 schema는 이전 summary를 보존하며, 명시적인 no_clear_change judgment를 지원한다.
- C.2.3 Stage 2 System Prompt: final-outcome prompt는 screenshot 기반 event, final screenshot, task requirement, final answer를 사용해 확인 가능한 completion을 1부터 5까지 점수화하며, objective evaluation은 보조 context로 취급한다.제공된 objective result가 0일 때 score 5를 부여하는 것을 금지하며, 근거가 모호할 때 보수적으로 점수화하도록 요구한다.
- C.2.3 Stage 2 System Prompt: 최종 rubric은 누락되었거나 잘못되었거나 중복되거나 redundant하거나 추가된 visible element에 penalty를 부과하며, 대략적인 의도보다 precise details를 요구한다.score 5는 의미 있는 실수나 redundant artifact 없이 완전한 성공이 명확히 확인되는 경우를 뜻하며, 더 낮은 점수는 거의 성공, 부분적 progress, 제한적 progress, 또는 의미 있는 progress 없음에 해당한다.
- C.2.4 Stage 2 Task Prompt: Stage 2 task prompt는 judge가 주로 final screenshot에 근거해 strict JSON score와 간략한 reason을 반환하고, 뒷받침되는 trajectory progress를 보수적으로 반영하며, 충족된 핵심 세부 정보와 누락된 핵심 세부 정보를 명시하도록 지시한다.최종 agent answer와 objective result는 성공의 proof가 아니라 명시적으로 supporting evidence로 취급된다.
D 오류 분석
실패한 trajectory를 수동으로 검사한 결과, 에이전트 전반에서 네 가지 반복적인 실패 범주가 드러났다. 잘못 멈추기, action grounding 부실, execution loop 지침 위반, 그리고 open-source model이 손상되었거나 지나치게 일찍 중단된 trajectory를 생성하는 문제가 그것이다.
- 에이전트는 언제 멈춰야 하는지 모른다: 에이전트는 task를 올바르게 완료한 뒤에도 계속 행동하는 경우가 많으며, 때로는 멈추지 않고 자신의 결과를 손상시키기도 한다.3D Editor 사례에서 한 에이전트가 객체를 요청된 위치에 배치한 뒤, 변경 사항을 “확인”하기 위해 주변을 클릭하는 모습을 볼 수 있다.
- Grounding 실패: Grounding 실패로 인해 에이전트는 의도한 요소를 놓치거나, 시각적으로 유사한 control을 선택하거나, 올바른 값을 잘못된 field에 입력한다.에이전트는 일반적으로 이러한 mapping 오류를 스스로 인식하지 못한다.
- Instruction-following 문제: 에이전트는 한 번 행동한 뒤 다음 observation을 기다리는 대신, 계획한 여러 action을 한꺼번에 출력함으로써 execution loop를 자주 위반한다.Llama-4-Maverick은 전체 계획을 text로 출력한 뒤 browser action을 실행하지 않고 종료하는 경우가 많다.
- Open-source Model의 실패: Open-source model의 FSR은 거의 0에 가깝다. trajectory가 문법적으로 손상되었거나 반복적이며, 불과 몇 단계 뒤에 중단되는 경우가 많기 때문이다.저자들은 이러한 model이 agentic한 multi-step browser-control data에 대한 학습이 부족하고, 대신 정적이고 single-turn인 instruction following 및 tool use에 맞춰 조정되었기 때문이라고 가설을 세운다.
E 맞춤형 평가 · F 작업 형식
GauntletBench는 5개 웹 애플리케이션에서 공정한 비교를 지원하기 위해 엄격한 애플리케이션별 평가기와 통합 작업 형식을 사용한다. 작업은 프롬프트, 상호작용 안내, 목표, 단계, 구조화된 출력을 표준화하면서도 도메인별 인터페이스와 정답성 규칙은 유지한다.
- E 맞춤형 평가: 각 테스트 사례는 검사된 모든 속성이 일치할 때만 통과하며, 부분 점수는 없고 5개 환경에 애플리케이션별 매칭 규칙을 적용한다.이 규칙에는 집합/속성 매칭, 타임스탬프 및 색상 허용 오차, UUID 재매핑, 대칭을 고려한 3D 매칭, 진리표 동치성이 포함된다.
- E 맞춤형 평가: Video Editor 평가는 콘텐츠를 기준으로 미디어 블록을 전역적으로 매칭하고, 타이밍, 재생 시간, 트림 오프셋을 ±1 s 이내에서 검사한다.비디오 위에 배치된 텍스트는 올바른 트랙 배치도 충족해야 하지만, 독립형 텍스트는 다르게 처리된다.
- F.1 프롬프트 템플릿: 통합 프롬프트 템플릿은 애플리케이션 맥락, 기능, UI 상호작용 패러다임, 상위 수준 목표, 순서가 있는 단계, JSON 형식 출력을 표준화한다.또한 에이전트가 작업을 정확히 따르고 관련 없는 변경을 피하도록 지시한다.
- F.2.1 Video Editor: Video Editor 작업은 미디어 패널, 미리보기 플레이어, 타임라인을 통해 미디어 관리, 타임라인 편집, 텍스트와 효과, 재생 제어, 드래그 앤 드롭 상호작용을 제공한다.편집은 타임라인에 미디어를 배치하고 재생 헤드에서 분할하거나 선택한 효과를 조정하는 등 맥락에 따라 달라지는 제어 기능을 사용하는 방식으로 이루어진다.
- F.2.3 3D Modeller: 3D Modeller 작업은 뷰포트, 장면 계층 구조, 인스펙터, 프롬프트 사이드바를 사용해 객체를 선택하고 변환, 외관, 와이어프레임 설정을 편집한다.객체 선택에 따라 인스펙터에 표시되는 속성이 결정되며, 정확한 구조적·시각적 변경은 수치로 입력한다.
- F.2.4 Flight Analyser: Flight Analyser 작업은 다시 재생할 수 있는 지도에서 시간 탐색, 항공기 검색, 비행 상세 정보 검사, 반경 그리기를 요구하며, UTC 타임라인은 스크럽할 수 있다.데이터셋은 12시간 구간의 OpenSky historical state vectors를 사용하며, 1분 단위 720개 timestep으로 다운샘플링된다.
- F.2.5 Circuit Designer: Circuit Designer는 컴포넌트 배치, 드래그 배선, 속성 대화상자, 연속 시뮬레이션, 실시간 측정을 통해 아날로그 및 디지털 회로 구성을 지원한다.논리 입력은 올바른 방향을 위해 오른쪽에서 왼쪽으로 배치해야 하며, 회로 구축 작업은 진리표 동치성으로 평가되고 아날로그 측정값에는 5 % 상대 허용 오차가 적용된다.
G GauntletBench 과제 예시
부록에서는 5개 환경에 걸친 GauntletBench 과제 100개를 목록화하고, 과제 식별자, 설명, 정답, 해당하는 경우 초기 상태와 testcase 난이도를 명시한다.
- G GauntletBench 과제 예시: 부록에서는 5개 환경에 걸친 GauntletBench 과제 100개를 모두 제시한다.과제 표에는 해당하는 경우 식별자, 과제 설명, 정답, 초기 상태가 포함된다.
- G GauntletBench 과제 예시: 각 과제 표에는 해당하는 경우 과제 식별자, 과제, 정답, 초기 상태가 기록된다.
- G GauntletBench 과제 예시: Testcase는 easy, medium, hard 난이도로 분류된다.
G.1 Video Editor · G.2 Workflow Builder
G.1과 G.2는 정밀한 시간 편집, 멀티모달 구성, 구조적 워크플로 조작을 평가하는 비전 집약적 과제를 정의한다. 과제는 단순한 설정 작업부터 복잡한 시퀀싱, 분기, 재연결, 조건 보존 편집까지 아우른다.
- G.1 Video Editor: G.1 Video Editor는 대비만 보정하기, 마지막 몇 초에 페이드아웃 적용하기, 순서가 지정된 비디오 집합에 서로 다른 보정 적용하기를 포함해 국소적·클립별 시각 효과를 평가한다.벤치마크는 단일 클립 효과와 연속 클립 또는 인터리브된 세그먼트에 대한 서로 다른 보정을 모두 지정한다.
- G.1 Video Editor: G.1 Video Editor는 순서가 지정된 비디오 시퀀스, 배경 오디오, 전환 구간을 가로지르는 오디오, 텍스트 오버레이, 타이틀 카드를 통해 여러 미디어 유형을 합성하도록 요구한다.과제는 비디오 끝부분이나 전환 구간에 오디오를 배치하고, 정확한 지속 시간과 스타일 또는 병렬 재생을 갖는 텍스트 오버레이를 지정한다.
- G.1 Video Editor: G.1 Video Editor는 중간 지점 삽입, 앞뒤 절반 교체, 비대칭 트리밍을 적용한 클립 복제, 비디오 사이의 빈 간격 삽입과 같은 정확한 구조 조작으로 난도를 높인다.이러한 과제는 타임라인 구조를 수정하면서 지정된 순서와 타이밍을 보존해야 한다.
- G.2 Workflow Builder: G.2 Workflow Builder는 이름이 지정된 3노드 워크플로를 구성하고 HTTP Request를 설정하는 것에서 시작한 뒤, 기존 파이프라인을 확장하거나 수정하도록 한다.기본 워크플로는 Manual Trigger, HTTP Request, No Operation을 연결하며, 요청은 지정된 URL에 대해 GET으로 설정된다.
- G.2 Workflow Builder: G.2 Workflow Builder에는 기존 출력을 보존하면서 노드를 삭제하고, 포트를 비활성화하고, 분기를 재배선하고, 사이드 분기를 추가하며, 조건부 또는 Switch 기반 경로를 생성하는 고난도 그래프 편집이 포함된다.과제는 활성 사용자와 비활성 사용자를 라우팅하고, priority_urgent Switch 케이스를 추가하며, 관련 없는 노드나 경로를 변경하지 않고 연결을 수정하도록 요구한다.
G.3 3D 모델러 · G.4 비행 분석기
벤치마크의 3D 모델러 과제는 기하학적 구성, 공간 배치, 물리적 접촉, 대칭, 수식 기반 변환을 평가한다. 비행 분석기 과제는 시간 추적, 공간 필터링, 근접성, 공항 이벤트, 다단계 구역 전이를 평가한다.
- G.3 3D 모델러: 이 과제군은 서로 겹치지 않는 스택, 면이 맞닿는 구, 노출 부피 최소화, 객체 부피에 기반한 반복적 삭제 및 스케일링을 통해 물리적·관계적 장면 구성도 평가한다.이 과제들은 여러 객체 또는 반복 과정에서 유지되어야 하는 접촉, 중첩, 부피, 표면 제약과 고정 변환 또는 위치를 결합한다.
- G.3 3D 모델러: 여러 3D 모델러 과제는 누락된 팔이나 행의 끝점을 완성하고, 비어 있는 축을 채우며, 기준 객체를 중심으로 대칭을 강제하는 등 시각적 구조에서 공간적 추론을 요구한다.이 과제들은 기존 요소를 유지하면서 추가 객체의 형태, 간격, 방향, 크기, 높이, 장면 내 객체 수를 제약한다.
- G.3 3D 모델러: 다른 3D 모델러 과제는 부피 일치, 표면적 최소화, 부호가 있는 스케일 순열 열거, 표면적과 부피에 따른 객체 정렬 등 정량적 기하 추론을 요구한다.명세는 cuboid, cylinder, sphere, cone, ellipsoid 계산을 위한 수식 또는 제약을 제공하며, 그에 따른 장면 편집도 요구한다.
- G.4 비행 분석기: 비행 분석기 과제군은 시간과 공간에 걸쳐 항공기를 추적하여 국경 통과, 공중에서 가장 가까운 항공기 쌍, 공항 착륙 및 출발, 직전에 운항한 항공편을 보고하도록 요구한다.예시는 재생 시간, 공항 또는 지리적 영역, 지상 항공기 제외, 반경 제약, callsign 또는 UTC 시간 출력 등을 지정한다.
- G.4 비행 분석기: 여러 비행 분석기 과제는 지리적 구역 내 소속 항공기의 변화를 추적하며, 가장 오래 남아 있는 항공편, 초기 항공편이 이탈하는 시점, 신규 항공편 점유가 임계값에 도달하는 시점을 묻는다.과제는 공항 주변의 모니터링 원, 지정된 항공편 집합, 순방향 재생, 이탈 시간·진입 callsign·4대 항공기 점유와 같은 여러 시간 출력을 사용한다.
- G.4 비행 분석기: 가장 복잡한 비행 분석기 과제는 접근 중인 두 항공편 사이의 2단계 시간 관계를 요구한다. 첫 번째 구역 진입을 식별하고, 내부에 있는 두 번째 항공편을 판별한 뒤, 두 항공편이 함께 최종 이탈하는 시점을 보고한다.이 과제는 Ostend-Bruges International Airport 주변 35 km 반경을 사용하며, 두 항공편이 모두 구역을 벗어날 때까지 11:43 UTC부터 추적하도록 요구한다.
G.5 Circuit Designer
Circuit Designer 섹션은 기본 게이트와 parity circuit부터 순차 조합 설계 및 analog circuit에 이르는 logic-circuit construction task에서 agent를 평가한다. 제공되는 task output에는 여러 circuit configuration에 대해 측정된 frequency와 signal amplitude가 포함된다.
- Advanced Digital Circuits: 더 고급 digital task에서는 full-adder SUM 및 COUT function, 2-operation 1-bit ALU, decoder, demultiplexer, sequence detection, squaring, priority encoding이 필요하다.Full adder는 SUM = A XOR B XOR CIN 및 COUT = (A AND B) OR (A AND CIN) OR (B AND CIN)을 사용하며, ALU는 OP를 사용해 AND 또는 OR를 선택한다.
- BJT Differential Pair with Resistor Loads: Differential-pair output peak-to-peak measurement에서 191.615 mV가 보고되었다.이 task는 resistor collector load와 NPN current-mirror tail을 갖는 BJT differential pair를 구성하고, 작은 differential input을 인가한 뒤 right collector output을 측정한다.
- Circuit Measurement: MSB output frequency로 62.5 Hz가 보고되었다.
- Circuit Measurement: Amplifier output peak-to-peak measurement에서 2.605 V가 보고되었다.