Source-linked AI summary

Seed2.0 Model Card: Towards Intelligence Frontier for Real-World Complexity

Bytedance Seed

arXiv:2607.00248v1cs.AI

TL;DR

기존 평가는 신뢰성 있는 지시 실행과 멀티모달 이해가 필요한 복잡하고 장기적인 현실 과제를 충분히 포착하지 못한다. Seed2.0은 사용자 요구 기반 평가 프레임워크를 도입하고 long-tail knowledge와 복잡한 instruction following을 주요 대상으로 삼아, 강력한 추론·시각 이해·검색 능력과 함께 복잡한 현실 과제에 대한 초기 수행 역량을 입증한다.

  • 문제

    기존 평가 및 모델링 노력은 정확한 지시 실행과 장기적 수행이 필요한 복잡한 다단계 현실 과제를 제한적으로만 다룬다.

  • 방법

    Seed2.0은 Science Discovery, Vibe Coding, Context Learning, Real-World Tasks를 아우르는 사용자 요구 기반 평가 프레임워크를 구축해 모델 개발을 이끈다.

  • 결과

    Seed2.0은 복잡한 현실 과제에서 초기 수행 역량을 보이며, 세계적 수준의 추론·시각 이해·검색 능력을 제공한다. Seed2.0 Pro는 τ 2-Bench에서 0.781을 기록한다.

  • 시사점 및 한계

    Seed2.0은 복잡하고 장기적인 현실 과제를 처리하고 수억 명의 사용자를 대상으로 하는 애플리케이션 전반에 더 큰 가치를 제공하기 시작한다.

  • 시사점 및 한계

    복잡한 API 오케스트레이션과 장기적인 코드 실행은 Seed2.0 Pro에 여전히 해결되지 않은 한계로 남아 있다.

Abstract

from arXiv · show

We present Seed2.0, a model series that takes a meaningful step toward solving complex, real-world tasks. Our approach begins with identifying users' genuine needs and constructing a reliable, forward-looking evaluation system by selecting and abstracting benchmarks grounded in these needs and in realistic, complex scenarios. Guided by this evaluation system, Seed2.0 targets two persistent challenges, long-tail knowledge and complex instruction following, substantially improving the model's reliability on intricate, long-horizon tasks. Beyond these, Seed2.0 delivers world-leading reasoning intelligence, visual understanding, and search capabilities that address the most common needs of a broad user base. Through extensive real-world use cases documented in this model card, we demonstrate that Seed2.0 begins to exhibit the ability to handle initial complex real-world tasks, delivering greater value to hundreds of millions of users.

1 서론

Seed2.0은 visual understanding, 빠른 inference, 신뢰할 수 있는 복잡한 instruction 실행, coding assistance를 우선시해 real-world complexity에 대응한다. 또한 복잡하고 장기적인 과제의 진척을 추적하는 four-dimensional evaluation framework를 도입하는 한편, international frontier models와 비교해 여전히 남아 있는 격차를 인정한다.

  • 사용자 중심 설계: Seed2.0은 대규모 online deployment 환경에서 visual 및 multimodal query, inference latency, 신뢰할 수 있는 복잡한 instruction 실행, seamless coding assistance를 우선시한다.이러한 우선순위는 interactive user experience에 직접적인 영향을 미친다는 점에서 도출된다.
  • 사용자 중심 설계: Seed2.0은 hallucination 감소 [28] [44] [127]를 통해 visual reasoning을 강화하고, documents와 figures에서의 structured extraction을 개선한다 [75, 110].이는 screenshots, charts, scanned documents, mixed-media content가 포함된 real-world query의 상당한 비중을 반영한다.
  • 사용자 중심 설계: Seed2.0은 Pro, Lite, Mini models를 제공해 개발자가 각 use case에 맞춰 performance와 inference speed 사이의 균형을 조정할 수 있게 한다.이 설계는 latency를 user experience를 직접 결정하는 요인으로 본다.
  • 사용자 중심 설계: Seed2.0은 복잡한 multi-step instruction의 신뢰할 수 있는 실행을 first-class requirement로 취급하며, factual recall을 넘어 structured reasoning과 constraint satisfaction에 대응한다.DeR2 [125]와 CL-bench [34] 같은 benchmark가 이러한 요구를 포착한다.
  • 동기와 범위: competition-level problem에서 강력한 performance를 보이더라도, current agent는 real-world work가 긴 horizon에 걸쳐 진행되고 effective autonomous workflow를 요구하기 때문에 practical end-to-end task에서 자주 실패한다 [5] [47] [70].따라서 Seed2.0은 Erdős problem과 Scientific Coding을 포함한 research-level reasoning으로 목표를 확장한다 [4] [80] [86].
  • Real-World Complexity: Seed2.0은 Science Discovery, Vibe Coding, Context Learning, Real-World Tasks로 구성된 four-dimensional framework를 수립해 복잡하고 장기적인 agent performance를 benchmark하고 발전을 이끈다.이 framework는 benchmark suite이자 반복적인 development guide로 활용되도록 설계되었다.

2 Seed2.0 배포 패턴과 개발자 행동

중국 본토에서 Seed2.0 배포는 기업 대상 디지털 산업과 이기종 데이터 처리, 긴 컨텍스트, 구조화된 생성, 도구 증강 실행이 필요한 인지 집약적 워크플로에 집중된다. Agentic coding 사용은 프론트엔드 개발과 유지보수가 주도하며, 계층형 가격 정책은 복잡한 기업 워크로드와 대규모 처리량의 기업 워크로드를 모두 지원한다.

  • 배포 패턴: 기업 MaaS 사용은 인터넷 및 기타 정보 집약적 산업에 집중되며, 비정형 정보 처리, 교육, 콘텐츠 제작, 검색 또는 추천이 배포 시나리오의 대부분을 차지한다.제조, 자동차, 통신을 포함한 전통 산업은 각각 사용량의 1% 미만을 차지하며, 전문 애플리케이션은 여전히 초기 배포 단계에 머물러 있다.
  • 개발자 행동: 프론트엔드 개발이 agentic coding 요청에서 압도적으로 큰 비중을 차지하며, 페이지 레이아웃, 스타일링, UI 로직 관련 질의가 백엔드, 클라이언트 측, 풀스택 대안보다 훨씬 많다.이러한 분포는 부분적으로 프론트엔드 작업의 반복적인 시각적 피드백 루프에 기인하며, 이 루프는 모델과의 빈번한 상호작용을 유도한다.
  • 비용과 모델 계층: Seed2.0의 token 가격은 최첨단 모델보다 대략 한 자릿수 낮으면서도 이에 상응하는 사용자 경험을 제공하므로, 더 비싼 대안으로는 실행이 어려울 수 있는 대규모 처리량의 기업 워크플로를 가능하게 한다.Table 1은 주요 foundation model의 API token prefill 및 decode 가격을 비교하며, 여기서의 주장은 특정 기재 가격이 아니라 production reasoning 및 generation 품질에 관한 것이다.
  • 배포 패턴: Seed Model은 워크플로 지향 MaaS 기반으로 기능하며, 멀티모달 이해, 긴 컨텍스트 추론, 구조화된 생성, 도구 증강 실행을 결합해 기업 과제 완수를 지원한다.주요 워크플로는 대규모 이기종 데이터 처리, 도메인 간 지식 종합, 다단계 지시 따르기, 고충실도 구조화 출력 생성을 요구한다.
  • 개발자 행동: 프론트엔드 언어가 코드에서 다뤄지는 부분을 종합적으로 지배하며, Vue.js는 React보다 3배를 초과해 앞서고, 버그 수정이 가장 일반적인 작업이며 그다음은 리팩터링과 문서화다.이러한 패턴은 오류, 스택 트레이스, 프로그램 상태 추적을 포함해 프론트엔드 이해 및 디버깅 역량에 대한 강한 수요를 보여준다.
  • 비용과 모델 계층: Seed2.0 Pro는 복잡한 추론과 긴 컨텍스트 작업을 목표로 하고, Lite는 범용 역량과 비용의 균형을 이루며, Mini는 대규모 처리량 애플리케이션을 위해 million tokens당 $0.50 미만의 decode 가격을 제공한다.각 계층은 워크로드 요구사항에 따라 설계되며, 질의당 비용 최소화가 필수적인 지연 시간 민감 사용 사례도 포함한다.

3 종합 평가 프레임워크 및 방법론

평가 프레임워크는 frontier model 비교와 전문적·agentic workflow에 기반한 benchmark를 사용해 Seed2.0을 기본 추론, instruction following, 광범위한 지식, vision, 현실적인 장기 과제 전반에서 평가한다. 또한 long-tail 지식, multimodal capability, scientific discovery, software repository completion, context learning, end-to-end task fulfillment을 신뢰성 있게 평가하는 데 중점을 둔다.

  • 기본 Capability: Seed2.0은 추론, 복잡한 instruction following, 광범위한 지식 이해, 광범위한 benchmark suite 전반에서 대표적인 frontier model과 비교 평가된다.이 suite에는 높은 가치의 capability를 반영하도록 설계된 academic, coding, knowledge, instruction-following benchmark와 internal benchmark가 포함된다.
  • 지식 평가: LPFQA, Encyclo-K, HLE-Verified는 현실적인 질문, 책에서 도출한 조합적 테스트, 전문가 검증 문제를 통해 long-tail 전문 지식과 전문가 지식의 신뢰성 있는 평가를 목표로 한다.LPFQA는 programming, finance, engineering, medicine, applied science를 포함한 영역을 다루며, Encyclo-K는 zero-shot 및 few-shot 평가를 지원하고, HLE-Verified는 불명확하거나 검증할 수 없는 질문을 걸러낸다.
  • Vision 평가: Vision 평가는 multimodal mathematics, STEM, visual puzzles, perception, VQA, spatial understanding, documents, charts, long-context understanding을 포함한 범주에서 50개의 public image benchmark와 24개의 public video benchmark를 아우른다.방법론은 범주별 benchmark suite와 metric을 사용하며, aggregated MMMU-Pro scores, normalized HiPhO scores, worst-case DynaMath accuracy를 포함한다.
  • Scientific Discovery: 이 프레임워크는 서로 교차된 텍스트 및 시각적 증거에 기반해 scientific coding과 multimodal biological reasoning을 평가하는 Ainstain Bench와 BABE를 도입한다.이 benchmark들은 과학적 workflow와 research-style inference에 관련된 연구 지향 capability를 평가한다.
  • Vibe Coding: NL2Repo-Bench는 자연어 명세로부터 end-to-end repository construction을 측정하며, 장기 실행, 파일 간 일관성, dependency management를 포함한다.이 benchmark는 새롭게 등장하는 극단적 “vibe coding” 시나리오를 반영한다.
  • Context Learning 및 현실 과제: 이 suite는 noisy-document context learning, enterprise 및 developer scenario, rubric 기반 task fulfillment, comparable expert task, executable multi-step planning을 통해 agentic real-world capability를 평가한다.DeR2는 긴 technical document에서 정보를 추출하고 사용하는 능력을 측정하며, GDPVal-Verified, XpertBench, WorldTravel [107]은 신뢰성 있는 end-to-end completion과 goal decomposition을 평가한다.

4 결과

Seed2.0 Pro는 언어, 추론, 시각-언어, 비디오 이해 과제 전반에서 선도적 성능을 보이며, 특히 장문맥 처리, 수학, 지각, 공간 추론, 비디오 추론에서 강점을 보인다. Seed2.0 Lite와 Mini는 지연 시간 및 비용 제약이 있는 배포 환경을 위한 경쟁력 있는 효율성 중심 대안을 제공한다.

  • 언어, 지식, STEM: Seed2.0 Pro는 핵심 언어 능력 전반에서 국제 선도 그룹에 속하며, instruction following, long-tail knowledge, long-context 안정성, code reasoning, front-end generation에 맞춰 최적화되었음을 보여준다.HealthBench에서 선두를 차지하고, SuperGPQA와 Encyclo-K에서는 GPT-5.2 및 Gemini-3-Pro와 경쟁력 있는 성능을 유지하며, 여러 STEM benchmark에서는 Gemini-3-Pro와 동률이거나 앞선다.
  • 수학, 코드, STEM 추론: Seed2.0 Pro는 고급 수학, 코딩, formal theorem-proving, STEM 추론 능력을 보이며, Codeforces Elo 3020과 금메달 수준의 Olympiad 수학 성능을 포함한다.AIME, HMMT, IMOAnswerBench, MathApex, Putnam-200, FrontierSci-research에서 경쟁력 있는 성능을 보이며, 여러 STEM 사례에서 Seed2.0 Pro는 Gemini-3-Pro와 동률이거나 앞선다.
  • Instruction Following: Table 7의 75.26%는 Seed1.8 대비 +2.37% absolute gain을 나타내며, tone control (+15.16%), phrasing adherence (+10.31%), few-shot learning (+9.53%)에서 가장 큰 향상이 나타난다.이러한 향상은 미묘한 중국어 화용 표현과 다중 제약 prompt에 대한 신뢰성을 높인다.
  • Lite 및 Mini 변형: Seed2.0 Lite와 Mini는 강한 효율성–품질 trade-off를 제공하며, Lite는 수학과 추론에서 뛰어난 성능을 보이는 동시에 지연 시간 및 비용 제약이 있는 배포 환경에서도 견고한 instruction-following 성능을 유지한다.소형 모델들은 폭넓은 benchmark 범위에서 OpenAI 및 Google의 대응 모델과 경쟁력을 유지하며, Mini는 비디오 과제에서도 강한 성능을 보인다.
  • 시각-언어 이해: Seed2.0 Pro는 수학, 지각, 공간 추론, 문서 이해, 장문맥 이해를 포함한 시각-언어 과제 전반에서 state-of-the-art 결과를 달성한다.MathVision에서 88.8, DA-2K에서 92.3, BLINK에서 79.5, DUDE에서 72.4, MMLongBench에서 74.8을 기록하며, 여러 visual puzzle 및 VQA benchmark에서 선두를 차지한다.
  • 비디오 이해: Seed2.0은 motion perception, reasoning, streaming, long-video understanding에서 state-of-the-art 결과를 달성하며 비디오 이해의 frontier를 확장하고, VideoMME에서 89.5를 기록한다.VideoReasonBench에서는 인간 성능을 능가하고, Morse-500에서는 37.4% 정확도에 도달하며, 전체 model family에 장시간 비디오 추론을 위한 VideoCut tool use를 탑재한다.

5 Seed2.0 활용 사례

repository 구축, software maintenance, GUI control, code generation, competitive problem solving, scientific debugging 전반에서 Seed2.0는 구조화된 분석, 반복적 수정, 엄격한 검증을 통해 복잡한 현실 세계 과제를 처리한다. 사례 연구는 모호성, 부분적 실패, 전문 기술 제약이 있는 상황에서도 안정적으로 실행됨을 보여준다.

  • Project repository 구축: Seed2.0는 요구사항으로부터 완전한 repository를 구축하고 검증하며, 37 interaction rounds 만에 NL2Repo를 완료하고 설치 및 디렉터리 간 import 검사를 포함한 all 22 tests를 통과한다.workflow는 요구사항에서 implementation, debugging, testing, documentation, packaging verification으로 진행된다.
  • Software maintenance 및 refactoring: Software refactoring에서 Seed2.0는 단계적 검증을 통해 production-level maintainability를 달성하며, 56 passing unit tests, 검증된 import compatibility, 정확한 handler outputs, 완전한 reference coverage를 제공한다.작업은 OS compatibility, logging, CLI/API consistency, concurrency safety, 사용자에게 표시되는 output correctness를 포괄하며, --all-commits flag의 end-to-end propagation도 포함한다.
  • Competitive problem solving: Seed2.0 Pro는 Pass@8 score 73.02%를 달성해 GPT-5.2와 Gemini-3-Pro를 크게 앞섰으며, human teams와의 all five contests에서 Gold Medals를 획득했다.결과는 Figure 7에 보고된다.
  • GUI understanding 및 control: Seed2.0는 state를 추적하고, micro-plans를 사용해 tool 및 dialog errors에서 복구하며, canonical workflow invariants에 맞춰 action을 다시 정렬함으로써 semantic GUI tasks를 수행한다.시연된 tasks에는 CAD operations와 audio editing이 포함되며, missed clicks, incorrect selections, misaligned placement 이후 reflective self-correction도 수행한다.
  • Real-world code generation: Seed2.0는 지정된 interactive website features를 구현하고 projected input으로부터 3D phase space를 생성해 application-oriented coding tasks를 해결한다.website recreation에는 animations, 3D card effects, dynamic progress-bar textures가 포함되며, phase-space example은 scientific visualization을 위한 code generation을 보여준다.
  • Scientific 및 cryptanalytic reasoning: 전문 scientific software에서 Seed2.0는 SU(2)/SO(3) representation mismatch를 추적하고, pure π phase sign flip을 검증하며, recursion이 아니라 post-processing을 수정해 Qiskit Solovay–Kitaev bug를 진단하고 해결한다.이 사례에서는 failure 재현, solovay_kitaev.py에서 phase assignment 위치 특정, 수학적 근거에 기반한 debugging이 필요하다. 관련 cryptanalytic work에서는 repository analysis, 32 pairs에 대한 key validation, 100 ciphertexts의 decryption도 수행했다.

6 결론

Seed2.0은 사용자 요구와 현실적인 시나리오에 기반해 평가를 구축하고 long-tail knowledge와 복잡한 instruction following을 겨냥함으로써 복잡한 현실 세계 과제 해결을 진전시킨다. 또한 대규모 사용자층의 일반적 요구를 충족하는 강력한 reasoning, visual understanding, search 역량과 복잡한 장기 과제에 대한 초기 처리 능력을 보여준다.

  • 6 결론: Seed2.0은 사용자의 요구와 복잡한 현실 세계 시나리오를 중심으로 선정하거나 추상화한 benchmark를 바탕으로 신뢰할 수 있고 미래지향적인 evaluation system을 구축한다.이 model series는 특히 long-tail knowledge와 복잡한 instruction-following 문제를 겨냥한다.
  • 6 결론: 고득점 τ 2-Bench 사례는 31.4 turns와 7.3 tool calls로 특징지어지는 반면, 저득점 사례는 55.0 turns (+75.2%)와 9.6 calls (+31.5%)를 보인다.고득점 Seed2.0 Pro 사례는 중복된 device checks를 동적으로 건너뛰고, 통제된 tool-call budget 안에서 문제를 해결하며, 단일 단계 JSON 제약을 따른다. 저득점 사례는 기계적으로 항목을 열거하고 turns를 과도하게 소모한다.
  • 6 결론: Seed2.0은 다수 사용자의 일반적 요구를 충족하는 world-leading reasoning intelligence, visual understanding, search capabilities를 제공한다.이 model card는 이러한 역량이 수억 명의 사용자에게 기여한다고 제시한다.
  • 6 결론: Seed2.0은 model card의 광범위한 현실 사용 사례 근거가 보여주듯 복잡한 장거리 현실 세계 과제를 처리하기 시작한다.결론은 이를 수억 명의 사용자에게 더 큰 가치를 제공하는 초기 능력으로 규정한다.

7 기여자 · FreeCAD Parametric Modeling: GUI Agent Case Study

이 절에서는 연구 기여자를 식별하고, 이름의 알파벳순으로 나열하며 일부 이름이 회사 내부 별칭임을 밝힌다. 제공된 본문은 기여자 명단만 다루며 FreeCAD 사례 연구 내용은 포함하지 않는다.

  • 7 기여자: 기여자는 이름의 알파벳순으로 나열된다.이 절은 정렬 기준이 이름의 알파벳순임을 명시한다.
  • 7 기여자: 나열된 이름 중 일부는 회사에서 사용하는 내부 별칭이다.이 단서는 기여자 명단에 관한 설명에 함께 제시된다.
  • 7 기여자: 명단은 이름이 Allan에서 Chen까지인 기여자로 시작한다.명단의 첫 부분에는 Allan으로 시작해 Chen까지 이어지는 이름이 제시된다.
  • 7 기여자: 중간 명단은 Cheng, Fan, Feng, Jian 등이 이름에 포함된 기여자까지 이어진다.이어지는 본문은 이 이름 범위까지 알파벳순 명단을 확장한다.
  • 7 기여자: 이후 명단에는 Jing, Kai, Liang, Peng, Tian에 걸친 이름의 기여자가 포함된다.기여자 본문은 이 이름 범위를 가로질러 알파벳순으로 계속된다.
  • 7 기여자: 명단은 Yuan, Zhi, Zhong, Zuquan에 걸친 이름의 기여자로 끝난다.마지막 본문은 알파벳순의 끝부분을 제시하며 Zuquan Song으로 마무리된다.

A.1 과제 개요 … 단계 3: F-function 역함수 구현

사례 연구는 프로그래밍 방식 검증을 포함한 96단계 FreeCAD 모델링 workflow와 F-function 역함수가 여러 test vector를 통과한 FEAL cryptanalysis workflow의 안정적인 실행을 보여준다. 이를 통해 adaptive error recovery, structured interaction strategy, 그리고 cipher structure를 활용한 attack complexity 감소를 강조한다.

  • A.1 과제 개요: FreeCAD 과제에서는 Ubuntu의 FreeCAD 1.0.2에서 parametric solid를 생성하고 최종 volume과 surface area를 계산해야 했다.workflow에는 cylindrical base, rectangular top boss, 그리고 Python으로 작성한 verification이 포함됐다.
  • A.2 전체 Workflow 시각화: 96단계 modeling workflow는 software configuration과 sketching부터 extrusion, scripting, final verification까지 9개 phase로 진행됐다.Figure 19는 주요 milestone을 식별하며, agent는 interface challenge를 성공적으로 처리하고 error에서 복구했다.
  • 단계 4: 첫 번째 Pad Extrusion (단계 40-52): 완성된 CAD workflow는 constrained sketch와 두 번의 pad extrusion을 사용해 cylindrical base와 rectangular boss를 생성하고 compound solid model을 완성했다.base에는 80mm diameter와 40mm height를 사용했으며, rectangular sketch를 정의한 뒤 두 번째 pad에는 20mm length를 사용했다.
  • 단계 7: Programmatic Verification (단계 83-96): 완성된 FreeCAD solid를 Python으로 verification한 결과 Volume = 231061.93 mm³ 및 Surface Area = 23306.19 mm²를 얻었다.model은 80mm-diameter, 40mm-high cylindrical base와 50mm × 30mm × 20mm rectangular boss로 구성된다.
  • A.3 세부 실행 Trace: agent는 모호한 toolbar icon에서 menu navigation으로, 신뢰하기 어려운 direct click에서 Elements panel로 전환해 8회의 실패한 tool selection에서 복구했다.이러한 adaptation은 circle selection, dimensional constraint, pad creation 및 기타 핵심 modeling operation을 지원했다.
  • A.6 GUI Agent Design을 위한 시사점: GUI 사례 연구는 icon ambiguity, 불안정한 geometric selection, 그리고 hybrid fallback strategy의 필요성을 automation system의 design consideration으로 제시한다.OCR 기반 tooltip reading, 향상된 icon classification, hierarchical element tree, menu 기반 navigation을 대응 방안으로 제안한다.
  • 단계 3: F-function 역함수 구현: F^-1(F(x)) = x가 여러 test vector에 대해 성립하여 FEAL meet-in-the-middle attack에 구현된 inverse F-function을 검증했다.inverse는 right rotation, modular subtraction, XOR reconstruction, byte recombination을 사용해 rotation 기반 G-transformation을 역전한다.

Phase 4: 키 복구 구현

키 복구 공격은 후보 k0 값에 대한 reverse map과 delta map을 미리 계산한 뒤, 암호문 후보 k3에서 역방향으로 매칭하여 나머지 키를 도출하고 검증한다. 이 과정은 여러 pair에 걸친 일관성 검사를 거쳐 후보 키를 생성한다.

  • Step A: k0 Delta Map 구축: 공격은 2^20개의 후보를 열거하여 비단사 함수 expand()에 대한 reverse lookup을 구축하고, 충돌이 있는 1,047,882 entries를 얻는다.각 entry는 expanded value를 candidate k에 매핑한다.
  • Step A: k0 Delta Map 구축: k0 delta map은 ∆ = A0 ⊕ A1 7→ (k0, A0, A1)를 저장하며, 933,294 unique deltas를 포함한다.이 map은 pair 0과 1에 대해 계산된 intermediate values로 구성된다.
  • Step B: k3와 매칭: 공격은 k3 ∈[0, 220)를 순회하며 암호문에서 역방향으로 계산해 매칭을 search한다.매칭이 성립하면 potential K2 = A0 ⊕ B0를 얻고, 이를 exp_map에 대해 검사한 뒤 k1을 도출한다.
  • Step B: k3와 매칭: 후보 키는 exp_map을 통해 K2를 검증하고, 다른 pair에서 k1을 도출하며, pair 3과 K1의 일관성을 검사한 뒤에만 발견된다.이 검사들은 최종적인 cross-pair 일관성 검증을 제공한다.

Phase 5: 검증 및 복호화

복구한 키를 전체 32개의 plaintext–ciphertext pair에 대해 검증하고, 제공된 복호화 binary로 독립적으로 교차 검증했다. 이후 네 개의 Feistel round를 역순으로 되돌려 100개의 target ciphertext를 성공적으로 복호화했다.

  • 전체 pair에 대한 키 검증: 전체 32개의 plaintext–ciphertext pair가 성공적으로 검증되어 복구한 키가 정확함을 확인했다.
  • 전체 pair에 대한 키 검증: 제공된 decrypt binary는 복구한 키를 사용해 ciphertext 14898973196205001976에서 예상 plaintext 367472469947502207를 재현했다.
  • Target ciphertext 복호화: 복호화는 final swap을 되돌린 뒤 네 개의 Feistel round를 round key의 역순으로 역방향 처리했다.
  • Target ciphertext 복호화: 100개의 ciphertext 값을 성공적으로 복호화해 plaintexts.txt에 저장했다.

B.3 공격 성능 분석 · B.4 주요 발견 및 에이전트 행동

에이전트는 실행 불가능한 brute-force cryptanalysis를 meet-in-the-middle attack으로 대체해 보고된 ∼1018배의 speedup을 달성했다. 또한 inverse F-function을 도출하고, 복구한 key를 체계적으로 검증했으며, 효율적인 modular code와 precomputation을 구현했다.

  • B.3 공격 성능 분석: 2 × 220 ≈2.1 × 106 operations 대 280 ≈1.2 × 1024 operations로, meet-in-the-middle attack에서 보고된 ∼1018배의 speedup을 달성했다.brute-force 접근은 실행 불가능한 것으로 설명된 반면, meet-in-the-middle 전략은 Feistel structure를 활용했다.
  • B.4 주요 발견 및 에이전트 행동: 에이전트는 직접적인 brute force가 실행 불가능하다는 점을 식별하고, Feistel structure를 통해 complexity를 O(221)로 줄이는 meet-in-the-middle 전략을 자율적으로 설계했다.이는 cipher의 structure에 맞춘 cryptanalytic reasoning을 보여준다.
  • B.4 주요 발견 및 에이전트 행동: 에이전트는 G-functions의 composition, rotation operations, modular arithmetic, bit-rotation properties를 분석해 F −1을 도출했다.inversion에는 이러한 operations가 F-function 내부에서 어떻게 조합되는지 이해하는 과정이 필요했다.
  • B.4 주요 발견 및 에이전트 행동: 에이전트는 pairs 0과 1로 delta map을 구축하고, pair 2에서 k1을 도출했으며, pair 3과의 consistency를 확인하고, all 32 known pairs에 대해 검증했다.또한 원래 decrypt binary와 대조해 결과를 cross-check했다.
  • B.4 주요 발견 및 에이전트 행동: 에이전트는 search phase에서 중복 계산을 피하기 위해 expand map과 delta map에 대한 reverse lookup tables를 사용했다.이는 attack implementation 과정에서 optimization awareness를 보여준다.
  • B.4 주요 발견 및 에이전트 행동: implementation은 clean하고 modular했으며, getleft, getright, merge, g_function, f_function, f_inv_function을 포함한 helper functions를 사용했다.나열된 helpers는 block manipulation, G 및 F functions, inverse computation을 포괄했다.

B.5 복구한 키와 최종 결과 · B.6 Cryptanalysis Agent 설계의 교훈 · C NL2Repo: Python-Decouple Library 구현

이 사례 연구에서는 모든 round key를 복구하고 검증했으며, ciphertext corpus를 복호화하고 plaintext를 저장한 뒤 원본 binary와 결과를 교차 검증했다. 또한 cryptanalysis agent에 필요한 역량으로 알고리즘 분석, 수학적 추론, 자율적 공격 전략 설계를 제시한다.

  • B.5 복구한 키와 최종 결과: 4개의 round key를 모두 복구하고 32개 pair에 대해 100% 정확도로 검증했으며, 100개의 ciphertext를 성공적으로 복호화했다.복구한 20-bit round key seed는 Table 18에 보고했다.
  • B.5 복구한 키와 최종 결과: 복호화한 plaintext를 plaintexts.txt에 저장하고 원본 decrypt binary를 사용해 결과를 교차 검증했다.
  • B.6 Cryptanalysis Agent 설계의 교훈: 이러한 역량은 자율적 보안 연구 agent의 필수 구성 요소로 제시된다.
  • B.6 Cryptanalysis Agent 설계의 교훈: 알고리즘 분석에는 cryptographic implementation을 읽고, Feistel network의 구조적 약점을 식별하며, 축소된 keyspace를 인식하는 과정이 포함된다.
  • B.6 Cryptanalysis Agent 설계의 교훈: 수학적 추론에는 대수적 조작을 통해 inverse function을 도출하고, ciphertext에서 역으로 추적하기 위해 composition property를 이해하는 과정이 필요하다.
  • B.6 Cryptanalysis Agent 설계의 교훈: 공격 전략 설계에는 meet-in-the-middle method를 비롯해 적절한 cryptanalytic technique을 자율적으로 선택하는 과정이 포함된다.

C.1 작업 개요 · C.2 에이전트 실행 추적 · C.3 입증된 핵심 에이전트 역량

이 과제는 39KB 자연어 명세로부터 완전하고 설치 가능한 Python configuration-management library를 구현하는 것이었다. 에이전트는 암묵적 요구사항을 호환 가능한 코드로 변환하고, 반복적으로 테스트했으며, 명세 파싱·디버깅·호환성 보존 역량을 입증했다.

  • C.1 작업 개요: 벤치마크는 multi-source configuration, type conversion, validation, Docker secrets, packaging, tests, 그리고 specification-matching API를 지원하는 production-ready Python library를 요구했다.구현 대상은 39KB 자연어 명세로부터 생성하는 repository-level code였다.
  • C.2 에이전트 실행 추적: 에이전트는 먼저 workspace documentation에서 정확한 interface, file-structure 요구사항, parsing 규칙, embedded test specifications를 추출했다.명세의 code snippet은 암묵적 behavioral test로 기능했다.
  • C.2 에이전트 실행 추적: 핵심 구현은 300 lines를 넘겨 RepositoryEnv, RepositoryIni, RepositorySecret, Config, AutoConfig, Csv, Choices를 포괄했다.에이전트는 library의 central module인 decouple.py를 우선 구현했다.
  • C.2 에이전트 실행 추적: 구현 결정은 empty-string booleans, Python 3.12 ConfigParser compatibility, matching-quote stripping, missing Docker-secrets directories를 처리했다.이러한 선택은 명세 분석 중 식별된 edge case와 compatibility constraint를 다뤘다.
  • C.2 에이전트 실행 추적: 에이전트는 package를 installation에 맞게 구성하고, documentation과 development tooling을 추가했으며, library 기능을 포괄하는 22 tests를 작성했다.프로젝트에는 setup.py, README.rst, repository configuration files, tests/test_decouple.py가 포함되었다.
  • C.2 에이전트 실행 추적: Test-driven iteration으로 empty-string boolean conversion과 fixture scope 오류를 수정한 뒤, all 22 tests passed하고 package installation을 검증했다.workflow는 한 건의 failure에서 네 건의 error를 거쳐 passing test suite로 진행되었다.
  • C.3 입증된 핵심 에이전트 역량: 입증된 역량에는 structured requirement extraction, Python 3.12 documentation을 바탕으로 한 error-driven debugging, backwards compatibility를 위한 expected API exports 보존이 포함되었다.이러한 역량은 자연어 요구사항을 구현 변경 및 compatibility check와 연결했다.

C.4 성능 지표 … D.2 에이전트 실행 추적

구현 결과 완전히 기능하는 설치 가능한 Python 패키지가 완성되었으며, SWE-bench Pro 리팩터링은 동작, 호환성, 테스트 커버리지, warning filtering의 정확성을 유지했다. 에이전트는 구현, import, 테스트, 검증 전반의 마이그레이션을 조율했다.

  • C.4 성능 지표: 이 작업은 모든 사양을 충족하는 완전히 기능하는 설치 가능한 Python 패키지로 완료되었다.
  • D.1 작업 개요: 이 작업에서는 filtering 동작, import, 테스트, warning suppression을 유지하면서 QtWarningFilter와 hide_qt_warning을 qtlog.py로 이동해야 했다.
  • D.2 에이전트 실행 추적: 에이전트는 qutebrowser 모듈과 테스트 전반의 변경을 조율했으며, repository 탐색 중 일관성 보존을 위해 필요한 세 가지 편집을 식별했다.
  • D.2 에이전트 실행 추적: record.msg.strip().startswith()가 앞뒤 공백이 있어도 warning pattern과 일치하므로, 마이그레이션은 정확한 공백 처리를 유지했다.
  • D.2 에이전트 실행 추적: log.py에서 hide_qt_warning과 QtWarningFilter를 re-export하여 backward compatibility를 유지했으며, 두 import 경로 모두 동일한 function object로 확인되었다.
  • D.2 에이전트 실행 추적: 이동된 테스트는 pass-through 동작, exact 및 prefix suppression, 공백 처리를 다루었으며, 실제 사용에서는 대상 warning만 filtering되었다.
  • D.2 에이전트 실행 추적: 구현과 테스트 커버리지를 이동한 뒤 리팩터링은 5 qtlog tests와 51 log tests를 통과했다.

D.3 리팩터링 분석 · D.4 핵심 소프트웨어 엔지니어링 관행

리팩터링은 compatibility preservation, dependency analysis, test-first validation을 바탕으로 한 저위험 점진적 migration process로 수행됐다. 문서화된 결과는 breaking change 0건, 개선된 code organization, 그리고 56개 테스트 전체 통과였다.

  • D.3 리팩터링 분석: 코드 migration은 Table 20에 요약돼 있다.
  • D.4 핵심 소프트웨어 엔지니어링 관행: 에이전트는 bulk copy-paste 대신 5개의 systematic steps로 리팩터링을 수행해 breaking change 위험을 줄였다.
  • D.4 핵심 소프트웨어 엔지니어링 관행: Python re-export pattern인 from qtlog import *를 사용해 내부 구조를 재구성하면서 기존 API surface를 보존했다.
  • D.4 핵심 소프트웨어 엔지니어링 관행: 코드와 함께 테스트를 이동하고 성공을 선언하기 전에 모든 테스트를 검증해 behavior regression이 없음을 보장했다.
  • D.4 핵심 소프트웨어 엔지니어링 관행: 에이전트는 변경 전에 영향을 받는 모듈을 식별하기 위해 grep -r "hide_qt_warning"를 포함한 모든 usage를 codebase에서 검색했다.
  • D.4 핵심 소프트웨어 엔지니어링 관행: migration 결과 breaking change 0건, 개선된 code organization, 그리고 56개 테스트 전체 통과를 달성했다.

E 고급 수학적 추론 평가 세부사항 · E.1 자연어 증명

Seed2.0 Pro는 고급 자연어 수학 증명을 위해 반복적 solve–verify–refine 파이프라인을 사용한다. 모델은 후보 해를 생성하고 논리적 결함을 탐지한 뒤 엄격한 올림피아드 채점 기준에 맞도록 증명을 개선한다.

  • E 고급 수학적 추론 평가 세부사항: 엄격한 올림피아드식 기준에 따른 자연어 증명을 통해 고급 수학적 추론을 평가한다.
  • E.1 자연어 증명: Seed2.0 Pro는 후보 해를 생성하고 논리적 결함을 자율적으로 식별한 뒤 엄격한 올림피아드 채점 기준을 충족하도록 출력을 개선한다.이 접근법은 solve-verify-refine framework [52]에 기반한다.
  • E.1 자연어 증명: Table 2는 Seed2.0 Pro의 자연어 증명 결과를 보고한다.
  • E.1 자연어 증명: Seed2.0 Pro의 높은 점수는 단순히 환각된 정답을 제시한 결과를 넘어서는 증거로 제시된다.
  • E.1 자연어 증명: 모델은 수학적 증명 구성에서 체계적 추론 능력이 뛰어남을 보여준다.
  • E.1 자연어 증명: 반복적 파이프라인은 각 추론 단계를 논리적으로 검증하고 개선하도록 설계되었다.

E.2 형식 정리 증명 … E.3.2 Erdos 1051: 무한급수의 무리성

Seed2.0은 형식화된 Putnam 문제에서 35.5% Pass@8을 달성해, 비슷한 범용 모델과 Seed-1.5-Prover를 능가한다. 사례 연구에서는 지정된 무한급수가 무리수라는 증명을 포함해 Erdős 문제에 대한 에이전트 도출 해법도 제시한다.

  • E.2 형식 정리 증명: 35.5% Pass@8로 Seed2.0 Pro는 유사한 범용 모델 가운데 state-of-the-art이며, Putnam-200에서 Gemini-3-Pro와 Seed-1.5-Prover를 능가한다.Putnam-200은 Lean과 Python을 사용할 수 있는 에이전트 기반 멀티턴 설정에서 평가한 200개의 형식화된 Putnam 문제로 구성된다.
  • E.3 Erdos 문제 사례 연구: Erdős 사례 연구는 조합기하학과 해석적 수론의 난도 높은 미해결 문제를 다룬다.문제는 Erdős 652와 Erdős 1051이다.
  • E.3.1 Erdos 652: 평면 점 집합의 서로 다른 거리: Erdős 652에서는 선택된 점을 중심으로 하는 원들로 incidence graph를 구성하고, 그 평행 간선 중복도를 kt(k + 1) 이하로 제한한다.그 결과 얻는 단순 그래프는 적어도 kn − k − kt(k + 2)개의 간선을 갖는다.
  • E.3.1 Erdos 652: 평면 점 집합의 서로 다른 거리: Erdős 652의 증명은 crossing-number 논증을 위해 그래프를 단순화하기 전에 점과 원 사이의 kn − k incidences를 센다.이 incidence 수는 중심이 아닌 점에서의 k(n − k) 기여와 중심에서의 k(k − 1) 기여를 합한 것이다.
  • E.3.2 Erdos 1051: 무한급수의 무리성: Erdős 1051에서는 유리수라고 가정하면 균일한 하한 xm ≥1/Q를 얻지만, tail과 logarithmic recurrence는 xm →0을 강제한다.이 모순은 정규화된 logarithmic variable을 제한하고, 수렴을 증명하며, 기하급수적으로 감소하는 tail을 얻는 데 의존한다.
  • E.3.2 Erdos 1051: 무한급수의 무리성: 이 모순으로 Erdős 1051의 무한급수가 irrational임을 확립한다.xm →0이 지속적인 하한 xm ≥1/Q > 0과 충돌하기 때문에 증명이 성립한다.
Loading 2607.00248v1…