Source-linked AI summary
The AI Scientist-v2: Workshop-Level Automated Scientific Discovery via Agentic Tree Search
Yutaro Yamada, Robert Tjarko Lange, Cong Lu, Shengran Hu, Chris Lu, Jakob Foerster, Jeff Clune, David Ha
TL;DR
엔드투엔드 자율 과학적 발견 시스템은 여전히 자율성과 폭넓은 적용 가능성에 한계가 있다. The AI Scientist-v2는 사람이 작성한 코드 템플릿을 제거하고 VLM 피드백을 활용하는 agentic tree search를 사용해 워크숍 논문 3편을 작성했으며, 그중 1편은 reviewer score 6.33을 받아 사람이 작성한 논문이었다면 meta-review 후 채택되었을 수준이다.
문제
기존 엔드투엔드 과학적 발견 시스템은 사람이 작성한 코드 템플릿에 의존했기 때문에 자율성과 폭넓은 적용 가능성이 제한되었다.
방법
The AI Scientist-v2는 템플릿 없는 실험, experiment manager가 이끄는 agentic tree search, 병렬 실행, 원고 개선을 위한 VLM 피드백을 결합한다.
결과
완전 자율적으로 작성된 워크숍 제출 논문 3편 중 1편은 평균 reviewer score 6.33을 받았으며, 사람이 작성한 논문이었다면 meta-review 후 채택되었을 수준이다.
시사점 및 한계
이 시스템은 워크숍에서 peer review를 성공적으로 통과함으로써 자율 과학 연구를 향한 초기 이정표를 보여준다.
시사점 및 한계
이 시스템은 아직 최상위 학회 기준에 일관되게 도달하지 못했으며, 워크숍 수준에서 제출 논문 3편 중 1편만 채택되었다.
Abstract
from arXiv · showhide
AI is increasingly playing a pivotal role in transforming how scientific discoveries are made. We introduce The AI Scientist-v2, an end-to-end agentic system capable of producing the first entirely AI generated peer-review-accepted workshop paper. This system iteratively formulates scientific hypotheses, designs and executes experiments, analyzes and visualizes data, and autonomously authors scientific manuscripts. Compared to its predecessor (v1, Lu et al., 2024 arXiv:2408.06292), The AI Scientist-v2 eliminates the reliance on human-authored code templates, generalizes effectively across diverse machine learning domains, and leverages a novel progressive agentic tree-search methodology managed by a dedicated experiment manager agent. Additionally, we enhance the AI reviewer component by integrating a Vision-Language Model (VLM) feedback loop for iterative refinement of content and aesthetics of the figures. We evaluated The AI Scientist-v2 by submitting three fully autonomous manuscripts to a peer-reviewed ICLR workshop. Notably, one manuscript achieved high enough scores to exceed the average human acceptance threshold, marking the first instance of a fully AI-generated paper successfully navigating a peer review. This accomplishment highlights the growing capability of AI in conducting all aspects of scientific research. We anticipate that further advancements in autonomous scientific discovery technologies will profoundly impact human knowledge generation, enabling unprecedented scalability in research productivity and significantly accelerating scientific breakthroughs, greatly benefiting society at large. We have open-sourced the code at https://github.com/SakanaAI/AI-Scientist-v2 to foster the future development of this transformative technology. We also discuss the role of AI in science, including AI safety.
1. 서론
AI Scientist-v2는 인간이 작성한 템플릿을 제거하고 agentic tree search와 VLM feedback을 활용하며, 공인된 machine learning workshop에서 AI가 생성한 원고가 peer review를 통과했음을 입증하는 end-to-end 자율 과학적 발견 프레임워크다.
- 동기: End-to-end AI 발견 프레임워크는 가설을 자율적으로 수립하고, 실험을 수행하며, 결과를 분석하고, 원고를 작성함으로써 과학을 변혁할 수 있다.자동화된 과학적 발견은 최근 상당한 관심을 받아 왔다 (Cornelio et al., 2023; Gil et al., 2014; King et al., 2009; Kitano, 2021; Wang et al., 2023; Xu et al., 2021).
- 기여: AI Scientist-v2는 자율적 코드 생성, agentic tree search, VLM feedback, 병렬 실험 실행을 결합해 자율성, 유연성, 탐색 깊이를 향상한다.인간이 제공한 코드 템플릿에 대한 의존성을 제거하고, experiment manager를 사용해 복잡한 가설을 체계적으로 탐색한다.
- 방법론적 발전: VLM-based feedback 메커니즘은 생성된 figure, caption, 텍스트 해석을 개선해 품질, 명확성, 정합성을 높인다.이 메커니즘은 review 및 refinement 단계에서 작동한다.
- Workshop 논문: 채택된 논문은 compositional regularization이 synthetic arithmetic expression dataset에서 compositional generalization을 유의하게 개선하지 못했음을 밝혔다.이 방법은 sequence model에서 연속한 time step 사이의 큰 embedding 편차에 페널티를 부과했다.
- 평가: 이 시스템은 AI가 생성한 원고가 공인된 machine learning workshop의 peer review를 통과하도록 하며, AI science의 이정표를 세운다.평가에서는 완전히 AI가 생성한 원고 세 편을 peer review에 제출했다.
2. 배경
이 절은 AI Scientist-v1의 인간 템플릿 의존성과 근시안적 실험을 배경으로 자동화된 과학적 발견을 위치시키고, agentic scaffolding과 tree-search exploration의 필요성을 제시한다. 또한 Reflexion의 반복적 자기 개선과 AIDE의 code-generation tree search를 관련 선행 사례로 조명한다.
- 배경: AI Scientist-v1은 인간이 제작한 baseline code template을 바탕으로 코드 작성, 실험, 시각화, 원고 생성을 자동화했지만, 이러한 템플릿 의존성은 핵심적인 한계였다 (Lu et al., 2024).이는 과학적 발견과 결과 제시를 완전히 자동화한 최초의 시스템으로 소개되었다.
- Language Model Agent Scaffolding: Reflexion (Shinn et al., 2024)은 모델이 이전 응답을 반복적으로 성찰하게 함으로써 견고성을 높이지만, 이 과정에서 계산 오버헤드가 증가하고 추론이 느려질 수 있다.이 framework는 과거 출력에 대한 비판적 평가를 활용해 자기 개선을 유도한다.
- 대규모 언어 모델을 활용한 Tree Search: AI Scientist-v1은 근시안적 실험을 자주 생성했으며, 이는 개방형 가설 생성, steppingstone 수집, 반복적 가설 개선의 필요성을 제기했다.인간이 주도하는 과학적 과정은 탐색과 개선을 위한 대조적 모델로 제시된다.
- 대규모 언어 모델을 활용한 Tree Search: AIDE 는 LLM-based code generation과 tree search를 결합하고, validation accuracy와 같은 scalar evaluation score에 따라 debugging 또는 refinement를 위한 solution state를 선택한다.AIDE는 MLEBench benchmark 에서 state-of-the-art 성능을 달성했으며, 그 탐색 전략은 tree search를 자동화된 과학적 발견에 통합하는 데 영감을 주었다.
3. The AI Scientist-v2
The AI Scientist-v2는 template와 code에 조건화된 연구를 개방형 아이디어 생성, 단계적 실험, 유연한 agentic tree search로 대체해 자율성과 일반화 성능을 높인다. 워크플로는 명시적 experiment-management 단계, 최적 node 선택 및 재현 실험, 구조화된 실행, VLM 기반 visualization refinement를 결합한다.
- 아이디어 생성: 시스템은 기존 codebase에 의해 제약된 점진적 변경이 아니라, 상위 수준의 개방형 연구 방향, 가설, 실험 설계에서 출발한다.이 일반화된 아이디어 생성 단계는 더 새롭거나 기초적인 아이디어를 지원하도록 설계되었으며, Semantic Scholar와 같은 literature-review 도구를 활용한다.
- 실험: The AI Scientist-v2는 사전에 정의된 인간 작성 template code와 순차적 code adaptation에 대한 The AI Scientist-v1의 의존을 제거해 실험의 유연성과 자율성을 높인다.초기에 생성된 개념은 고정된 시작 구현 없이 실험 단계로 이어진다.
- 실험 관리: experiment progress manager는 preliminary investigation, hyperparameter tuning, research agenda execution, ablation studies의 네 단계를 조정한다.각 단계는 명시적 중단 기준을 사용하고, LLM evaluator가 선택한 최고 성능 node를 다음 단계로 전달하며, checkpoint를 기록하고, 엄밀성과 재현성을 위해 선택된 실험을 반복한다.
- Agentic tree search: The AI Scientist-v1의 선형 refinement와 달리, The AI Scientist-v2는 bug-focused debugging, best-first refinement, 특화된 hyperparameter node와 ablation node를 사용해 여러 tree node를 병렬로 확장한다.이보다 느슨한 구조는 일관성을 유지하면서 empirical research cycle 전반을 체계적으로 탐색할 수 있도록 한다.
- Agentic tree search: 각 node는 Python code를 생성하고 실행하며, 구조화된 실험 결과를 저장하고, visualization을 생성하며, Vision-Language Model feedback을 사용해 figure의 명료성과 미적 완성도를 개선한다.node는 plan, error, metric, script, 생성된 figure, LLM feedback, VLM feedback, 그리고 최종 buggy 또는 non-buggy 상태를 보존한다.
4. The AI Scientist-v2가 생성한 원고의 인간 평가
인간 심사자들은 완전 자율적으로 생성된 원고 하나가 워크숍 채택에 충분히 설득력 있다고 평가했지만, 상세 평가에서는 유망한 음성 결과의 통찰과 함께 인용, 엄밀성, 데이터셋 중복, 일반화에 관한 우려가 확인됐다. 채택된 논문의 핵심 발견은 temporal/compositional regularization이 산술 일반화를 안정적으로 향상시키지 못했으며, 과제 복잡도가 증가할수록 학습을 저해할 수 있다는 점이었다.
- 인간 평가: 6, 7, and 6이라는 점수로 심사자들은 AI가 생성한 원고를 채택했으며, 이는 전체 제출물 중 상위 45%에 해당하고 워크숍 수준의 연구 품질을 뒷받침했다.이 원고는 이후 출판 전에 철회됐으며, 저자들은 AI 생성 연구를 과학 기록에 통합하는 방식에 대한 학계의 합의가 아직 형성되지 않았다고 밝혔다.
- 한계: 시스템은 때때로 citation inaccuracies를 산출했고, 표준 실험 파이프라인을 성공적으로 실행했음에도 주요 학회 채택에 요구되는 방법론적 엄밀성과 깊이가 부족했다.심사자들은 regularizer가 compositionality를 향상시켜야 하는 이유에 대해 더 명확한 직관, 관련 연구 인용, 이론적 동기 또는 시각적 설명을 추가로 요청했다.
- 논문 평가: 논문의 temporal consistency regularizer는 예상한 compositional-generalization gains를 만들어내지 못했으며, regularization과 무관하게 산술 표현의 복잡도가 증가하면 일반화가 악화됐다.이 결과는 regularization만으로 compositional structure를 강제하는 것이 주된 학습 목표와 충돌할 수 있음을 시사한다.
- 논문 평가: 평가자들은 약 57%의 training–test dataset overlap, embedding과 hidden states 사이의 용어 혼동, 그리고 과제 복잡도가 증가하면서 저하된 apparent 100% accuracy result를 확인했다.평가자들은 attention-augmented LSTM의 성능이 주로 과제의 단순성에 기인한다고 보았으며, 이 논문이 워크숍에는 경계선상에서 수용 가능하지만 정규 학회 논문으로는 충분히 엄밀하지 않다고 판단했다.
- 인간 워크숍 심사자: 심사자들은 논문의 예상 밖 음성 결과에 대한 명확한 분석, 제안된 compositional regularization method, 그리고 operator complexity가 neural-network performance의 병목이 될 수 있음을 보인 점을 높이 평가했다.심사자들은 결과를 일반화하기 전에 다양한 과제와 아키텍처에 걸친 더 폭넓은 실험도 권고했다.
5. 한계 및 윤리적 고려사항
The AI Scientist-v2의 workshop acceptance는 신중하게 해석해야 한다. 세 편의 제출물 중 하나만 채택되었고, workshop review는 leading conference track보다 선택성이 낮기 때문이다. 고영향 scientific reasoning에는 여전히 큰 과제가 남아 있으며, 책임 있는 배포를 위해서는 투명성, 공개 규범, peer review를 악용하는 행위를 막기 위한 안전장치가 필요하다.
- 성과의 범위: AI가 생성한 세 편의 제출물 중 one of three만 workshop에서 채택되었다. 이 workshop의 일반적인 acceptance rate는 60–80%인 반면, leading machine-learning conference에서는 20–30%다.따라서 채택 결과는 main-conference-level validation이 아니라 workshop-level success를 보여준다.
- Scientific limitations: 이 시스템은 여전히 진정으로 새로운 high-impact hypotheses를 수립하고, 진정으로 혁신적인 실험을 설계하며, 깊은 domain expertise를 바탕으로 선택을 정당화하는 데 어려움을 겪는다.예비적이거나 점진적인 scientific work를 넘어가려면 향후 iterations에서 이러한 한계를 해결해야 한다.
- Evaluation and governance: 저자들은 AI가 생성한 research의 적절한 승인을 받은 sample을 일반적인 peer review에 제출하고 studying its quality를 수행할 것을 주장하면서, 향후 systems가 현재의 한계를 극복할 수 있음도 인정한다.제출된 papers는 철회되었으며, ICLR workshop organizers와의 합의에 따라 OpenReview’s public forum에 게재되지 않는다.
- 윤리적 고려사항: Scientific community에는 disclosure and timing을 포함하는 AI-generated science의 규범이 필요하며, 조기 공개가 bias를 초래할 수 있다는 우려와 transparency 사이의 균형을 찾아야 한다.저자들은 AI systems가 peer review를 악용하거나 부정직한 researchers의 CV를 인위적으로 부풀리는 일을 막기 위해 research community와 계속 협력할 예정이다.
6. 관련 연구
관련 연구는 end-to-end automated research systems, LLM 기반 scientific idea generation, scientific-task benchmarks, 그리고 AI-driven discovery를 위한 산업적·개념적 framework를 아우른다.
- 관련 연구: The AI Scientist-v1 (Lu et al., 2024)와 AI-Researcher (Data Intelligence Lab, 2025) 같은 end-to-end system은 research pipeline 전반의 탐색을 자동화한다.
- 관련 연구: Human evaluation에 따르면 LLM이 생성한 scientific idea는 대체로 human expert가 제안한 idea보다 더 novel하지만 실현 가능성은 낮으며, GraphEval (Feng et al., 2025)는 idea를 graphically 평가한다.
- 관련 연구: MLEBench 와 Aide 는 research-engineering capability를 benchmark하고, METR의 benchmark는 sub-2-hour task에서 AI가 우수함을 보여준다 (Wijk et al., 2024).
- 관련 연구: 산업계의 노력으로는 AI Co-Scientist라고도 불리는 Google의 AI Research Copilot (Gottweis et al., 2025)이 있으며, Bengio et al. (2025)는 agentic AI와 Scientist AI를 구분한다.
7. 결론
The AI Scientist-v2는 인간이 제작한 템플릿을 제거하고, 실험 관리자 감독하의 agentic tree search를 사용하며, VLM 피드백을 통해 시각화를 개선함으로써 자율적 과학적 발견을 진전시킨다. 완전한 AI 생성 논문이 최초로 peer review를 통과한 사례는 진전을 보여주는 동시에, 지속되는 품질 및 가설 생성의 과제와 공개적으로 개발되는 AI 과학이 인류에 기여할 잠재력을 부각한다.
- The AI Scientist-v2는 인간이 제작한 템플릿을 제거하고, 실험 관리자 감독하의 agentic tree search를 추가하며, 시각화 개선을 위한 VLM feedback loops를 통합해 자율성과 탐색 능력을 향상한다.
- 이 시스템은 peer review를 통과한 최초의 완전한 AI 생성 논문을 산출했으며, workshop 및 conference 기준과 비교한 한계에도 불구하고 이정표를 세웠다.일관되게 최상위 수준의 품질을 달성하고 진정으로 획기적인 가설을 생성하는 일은 여전히 중요한 과제로 남아 있다.
- The AI Scientist-v2와 같은 시스템을 공개적으로 개발하고 확장하면, AI가 생성한 발견이 인간의 번영과 인류의 더 나은 미래에 기여하도록 도울 수 있다.제시된 목표에는 질병 치료와 우주를 지배하는 법칙에 대한 지식 확장 같은 응용이 포함된다.
보충 자료 … 여기서 T는 입력 시퀀스의 길이다.
보충 자료는 The AI Scientist-v2의 실행 시간과 prompting 인프라를 명시한 뒤, AI가 생성한 세 편의 workshop 원고를 제시하고, 결과가 의도한 이점을 반박한 한 compositional-regularization 연구를 검토한다. 해당 연구는 operator complexity가 generalization의 어려움을 악화시킨다는 사실을 밝혀, 시스템의 연구 workflow와 한계를 함께 보여준다.
- A. Hyperparameters: 보충 hyperparameter 자료는 agentic tree-search와 실험 단계 진행 한계와 함께 language model 및 vision-language model 설정을 기록한다.이 설정은 Tables 2와 3에 제시되어 있다.
- A. Hyperparameters: 논문 한 편을 생성하는 데는 보통 몇 시간이 걸리며, 15-hour runtime limit으로 제한된다.실행 시간은 문제의 복잡도에 따라 달라진다.
- B. Prompts: prompt는 적어도 하나의 문헌 검색에 근거한 새롭고 실행 가능한 제안을 요구하며, 이어지는 reflection에서는 새로운 tool 정보를 반영하고 아이디어를 정교화한다.시스템에는 academic lab이 감당할 수 있는 자원 안에서 작업하고, 자동으로 parsing 가능한 structured output을 생성하도록 지시한다.
- B. Prompts; Supplementary Material: 작성 및 figure prompt는 truthful results, non-hallucinated data, 과학적으로 의미 있는 plot, 정확한 citation, workshop의 페이지 제한 안에서 review를 반영한 공격적인 figure 선별을 강조한다.VLM은 수정 전에 figure 내용, caption, reference, presentation을 검토하며, 보충 자료에는 추가 세부 사항과 plot이 수록된다.
- C. AI Generated Papers: 시스템은 세 편의 완성된 원고를 생성해 ICLR 2025 ICBINB workshop에 제출했으며, 각 원고에는 scientific review 및 code review 주석이 함께 제공되었다.Table 4는 원고 전문을 제시하기 전에 제출작을 요약한다.
- 1 INTRODUCTION; 3 METHOD; 여기서 T는 입력 시퀀스의 길이: compositional-regularization 연구는 예상된 compositional structure에서 벗어나는 정도를 penalize하고 보지 못한 조합으로 generalize하는 representation을 장려하도록 설계된 explicit loss term을 추가한다.이 방법은 광범위한 실험으로 평가되었으며 operator complexity의 영향을 분석했다.
- COMPOSITIONAL REGULARIZATION: UNEXPECTED OBSTACLES IN ENHANCING NEURAL NETWORK GENERALIZATION: regularization 여부와 관계없이 Operator complexity는 모델의 compositional-generalization 어려움을 악화시켰으므로, 제안된 접근법은 예상한 이점을 가져오지 못했다.이 연구는 이러한 예상 밖의 결과를 regularization으로 compositionality를 강제하는 것이 단순히 효과적이지 않다는 증거로 해석한다.
- 3 METHOD; 여기서 T는 입력 시퀀스의 길이: 이 방법은 arithmetic-expression evaluation을 위해 LSTM-based model을 사용하며, mean-squared-error task loss를 λ로 가중된 compositional regularizer와 결합한다.regularizer는 연속한 hidden state 사이의 큰 변화를 penalize하며, 실험에서는 그 효과를 평가하기 위해 λ를 변화시켰다.
4 실험 … B.1 실험 설정
합성 산술 표현식에 대한 실험에서 조합적 정규화는 일반화를 개선하지 못한 반면, 연산자 복잡도가 높아지면 일반화가 크게 악화되는 것으로 나타났다. 추가 분석에서는 더 큰 임베딩만으로는 조합적 일반화를 개선하기에 충분하지 않았으며, 비교를 위해 attention이 강화된 LSTM을 구현했다.
- 4 실험: 실험에는 1,000개의 학습 표현식과 200개의 미관측 테스트 표현식을 사용했으며, 기본 설정으로 Adam, 평균 제곱 오차, 30 epochs, λ = 0.1을 적용했다.하이퍼파라미터와 연산자 복잡도를 변화시키고, 조합적 손실과 함께 허용 오차 내 테스트 정확도를 평가했다.
- 4 실험: baseline LSTM은 84% 테스트 정확도에 도달했지만, 조합적 손실이 꾸준히 나타난 점은 정규화 없이는 조합적 표현을 본질적으로 형성하지 못했음을 보여준다.baseline은 합성 산술 표현식 데이터를 사용했으며, 새로운 조합과 더 높은 연산자 복잡도를 포함한 미관측 표현식에서 평가했다.
- 4 실험: λ가 높아지면 조합적 손실은 감소했지만 테스트 정확도는 개선되지 않았고 때로는 낮아졌으며, 이는 조합성 강제와 주요 학습 목적 사이의 상충 관계를 드러낸다.Figure 2는 λ가 학습 손실, 조합적 손실, 최종 테스트 정확도에 미치는 영향을 보고한다.
- 4 실험: 연산자 복잡도가 증가할수록 baseline과 정규화 모델 모두에서 학습 손실과 검증 손실이 상승했으며, 최종 검증 정확도는 크게 감소했다.결과는 조합적 정규화만으로는 더 높은 연산자 복잡도를 가진 표현식을 처리할 수 없었음을 보여준다.
- 5 결론: 조합적 정규화는 일반화를 개선하지 못했고 때로는 학습을 방해했으며, 산술 표현식의 복잡도가 증가하면 모델의 일반화 어려움이 심화되었다.결론에서는 주요 학습 목적과의 충돌 및 정규화기가 측정하는 조합성과 과제 관련 조합성 사이의 불일치 가능성을 실패 원인으로 제시한다.
- 보충 자료: 추가 논의에서는 대안적 정규화, 조합성의 정교한 정의, 더 복잡한 데이터셋, 높은 연산자 복잡도를 위한 재귀적 또는 계층적 모델을 권고한다.또한 엄격한 평가와 부정적 결과 또는 결론이 나지 않은 결과를 공개적으로 보고하는 것의 중요성을 강조한다.
- A 임베딩 차원의 영향: 더 큰 임베딩 차원은 테스트 정확도를 일관되게 개선하지 못했으며, 병목은 표현 용량이 아니라 조합 구조 포착에 있었음을 시사한다.Figure 4는 임베딩 차원 16, 32, 64, 128에서 학습 손실과 조합적 손실이 유사한 추세를 보였음을 나타냈다.
- B.1 실험 설정: attention 비교에서는 LSTM 출력 뒤에 attention layer를 추가하여 baseline LSTM을 수정하고, 최종 예측을 위한 hidden-state 기반 context vector를 구성했다.이 설정은 관련 입력 시퀀스 부분에 집중하는 attention 통합 강화 모델과 baseline을 비교했다.
B.2 결과 … C.3 Dropout 영향
결과와 추가 실험 전반에서 attention, compositional regularization, recurrent-unit 선택, dropout은 compositional generalization에 제한적인 향상만 가져왔다. 이러한 결과는 문제가 특정 training 또는 regularization 선택 하나보다는 더 근본적인 architecture 또는 representation의 한계를 반영함을 시사한다.
- B.2 결과: attention을 사용해도 training dynamics는 소폭만 향상되었고, 최종 test accuracy는 baseline과 유사하게 유지되었다.compositional loss도 비슷하게 나타나 attention이 compositional representation을 크게 향상시키지 못했음을 보여준다.
- C 추가 실험: 실험 결과를 종합하면 compositional generalization의 어려움은 attention, compositional weighting, recurrent-unit 유형, 또는 dropout만으로 설명되지 않는다.오히려 결과는 더 근본적인 architecture의 한계 또는 compositionality를 포착하기 위한 더 정교한 mechanism의 필요성을 가리킨다.
- B.2 결과: attention은 baseline과 유사한 test accuracy를 보였고 training loss와 compositional loss도 비슷했으므로 generalization을 유의미하게 향상시키지 못했다.이는 관련 있는 input 부분에 집중하는 것이 compositional generalization의 주요 한계는 아님을 시사한다.
- C.1 Compositional Weight에 대한 Ablation Study: compositional weight λ를 높이면 compositional loss는 감소했지만 training loss는 증가했으며 최종 test accuracy는 향상되지 않았고 오히려 감소할 수 있었다.이는 primary learning objective와의 interference 및 compositional regularization과 generalization 사이의 trade-off를 나타낸다.
- C.2 LSTM과 RNN Architecture 비교: LSTM은 simple RNN보다 최종 test accuracy가 근소하게 높았지만 두 architecture 모두 compositional generalization에 어려움을 겪었다.두 모델의 유사한 convergence pattern은 recurrent-unit 선택만으로는 근본적인 문제를 해결할 수 없음을 보여준다.
- C.3 Dropout 영향: dropout을 늘려도 generalization은 유의미하게 향상되지 않았으며, 이는 표준 regularization만으로는 compositional structure를 학습하기에 충분하지 않음을 시사한다.이 실험에서는 서로 다른 dropout rate에서 최종 test accuracy를 평가했다.
D 하이퍼파라미터 및 학습 세부사항 … AI SCIENTIST-V2가 자율적으로 생성
검토된 연구는 통제된 실험을 통해 조성적 일반화와 label-noise 효과를 살펴보며, 구현 세부사항, 데이터셋의 한계, reviewer 평가를 함께 기록한다. 제안된 regularizer와 calibration 완화 기법의 이점은 제한적이었으며, 재현성 설정과 방법론적 우려도 보고한다.
- D 하이퍼파라미터 및 학습 세부사항: 더 높은 dropout 비율은 조성적 일반화를 향상시키지 못했으며, 이는 이 맥락에서 dropout의 효과가 제한적임을 나타낸다.시험한 dropout 값은 0.0, 0.2, 0.5였지만, 제공된 figure 설명에서는 최상의 configuration만 제시한다고 언급한다.
- 약점; 추가 의견; 점수: 이 논문은 기술적으로 견고하지만 evaluation scope, 부정확한 regularizer 설명, 누락된 references, 그리고 regularizer가 조성적 representations를 유도하는지에 대한 불확실성 때문에 제한적이라고 평가되었다.Review scores에는 Soundness 3/5, Presentation 2/5, Contribution 3/5, Workshop 5/10, Conference 4/10이 포함되었다.
- 데이터셋 생성 과정 점검: 데이터셋 generator는 상당한 train-test overlap을 허용한다. sanity check에서는 1,000개의 training samples와 200개의 test samples를 사용했을 때 평균 test-set overlap이 약 57%임을 확인했다.generator는 최대 81 ∗ k개의 조합을 생성하며, 여기서 k는 operators의 수이므로 overlap은 sample counts와 operator choices에 따라 달라진다.
- 모델 architecture, loss function, evaluation function: 모델은 compositional regularization에 embedding states를 사용하고, ground-truth digits와 일치시키기 위해 regression을 수행하며, embedding layer, single LSTM layer, linear head로 구성된 architecture를 사용한다.코드 검토에서는 “hidden states”가 LSTM hidden states와 혼동될 수 있으므로 embeddings를 h_t가 아닌 e_t로 표기할 것을 권고한다.
- Attention-augmented LSTM: numbers [1-9]를 사용한 attention-augmented LSTM의 100% test accuracy는 [10-19]에서 56%로 하락했으며, baseline LSTM 결과도 두 설정 모두에서 평가되었다.제공된 passage는 attention-augmented LSTM의 처음 두 값은 보고하지만 baseline 결과는 잘려 있다.
- C.2. Unveiling the Impact of Label Noise on Model Calibration in Deep Learning; 1 INTRODUCTION; 3 METHODOLOGY: label-noise 연구는 여러 수준과 benchmark datasets에서 symmetric noise와 asymmetric noise를 ECE 및 reliability diagrams를 사용해 조사하며, noise가 calibration을 악화시키고 완화 기법의 개선 효과는 제한적임을 확인한다.명시된 기여는 과도하게 확신하는 miscalibrated predictions를 강조하며, asymmetric noise가 더 해로운 영향을 미친다고 설명한다.
- C.2.1. The AI Scientist-v2 Idea; 2 RELATED WORK; AI SCIENTIST-V2가 자율적으로 생성: 제안된 label-noise 실험은 ResNet-18과 함께 CIFAR-10, MNIST, Fashion-MNIST를 사용하고, 10%에서 50%까지의 synthetic noise rates와 post-hoc temperature scaling을 적용한다.review에서는 citation 및 benchmark 정당화 문제를 지적하며, 데이터셋의 prior use에 관한 일부 주장이 완전히 정확하지 않다고 설명한다.
4 실험 및 결과 … A 추가 실험 및 그림
실험 결과, label noise는 데이터셋 전반에서 accuracy를 낮추고 calibration을 악화시키며, 표준 완화 기법은 개선 효과가 제한적이다. 연구는 noisy-label 설정에서 강건한 calibration 방법과 신뢰할 수 있는 uncertainty 추정이 여전히 필요하다고 결론짓는다.
- 4 실험 및 결과: 실험에서는 단계적 감쇠 대신 Cosine Annealing Schedule을 사용하며, 이는 보고된 결과를 해석할 때 고려해야 할 조건이다.
- 4 실험 및 결과: CIFAR-10, MNIST, Fashion-MNIST 전반에서 label noise는 일관되게 accuracy를 낮춘다. MNIST는 더 높은 noise 수준에서도 90% 이상을 유지하지만, asymmetric noise에서는 ECE가 증가한다.데이터셋 간 분석은 generalization을 평가하기 위한 것이며, Figure 2는 training epoch에 따른 accuracy와 ECE를 요약한다.
- 표준 label noise 완화 기법이 calibration을 개선하는지 평가했다. 구체적으로,: 기본 CNN 모델은 accuracy에서 ResNet-18과 대등할 수 있지만 calibration은 더 나쁘며, 제공된 Figure 3에는 이러한 비교를 뒷받침할 ECE 결과가 없다.
- 표준 label noise 완화 기법이 calibration을 개선하는지 평가했다. 구체적으로,: Temperature scaling은 제한적인 개선만 제공했으며, ECE를 소폭 낮추었지만 label-noise로 인한 성능 저하를 상쇄하지 못했다. 인용된 figure에는 temperature-scaling 결과가 포함되어 있지 않다.
- 5 논의: 논의에서는 asymmetric noise가 과도하게 확신하는 예측과 뚜렷한 calibration 손상을 유발한다고 설명하지만, robust loss function과 temperature scaling은 여기서 실험적 뒷받침이 부족하다고 지적한다.
- 6 결론: 결론에서는 label noise가 miscalibration을 악화시키고 기존 완화 기법의 개선 효과가 제한적이라고 밝히며, noisy-label calibration을 위한 새로운 방법의 필요성을 제기한다.
- 6 결론: 향후 연구에서는 실제 응용에서 신뢰할 수 있는 uncertainty 추정을 위해 calibration을 고려한 training objective와 noisy environment에 맞춘 robust calibration 방법을 탐구해야 한다.
A.1 NOISE RATE SENSITIVITY ANALYSIS … 4 EXPERIMENTAL SETUP
논문은 label noise가 accuracy를 꾸준히 낮추고 calibration을 악화시키며, asymmetric-noise 설정에 더 큰 영향을 준다고 보고한다. 한편 더 폭넓은 실험에서는 generalization과 deployment의 과제를 검토한다. 리뷰와 코드 검토에서는 누락되거나 사용되지 않은 실험, 중복되거나 빠진 figure, 불명확한 근거, reproducibility 및 presentation의 취약점이 확인되었다.
- A.1 NOISE RATE SENSITIVITY ANALYSIS; C.2.2. AI Scientist Team Review; Strengths: Asymmetric label noise는 symmetric noise보다 calibration error가 높게 나타나며, 두 noise 유형 모두에서 noise가 증가할수록 accuracy가 꾸준히 감소한다.분석에는 CIFAR-10과 ResNet-18이 사용되었으며, asymmetric noise에서 감소 폭이 더 컸다.
- A.2 CALIBRATION CURVES AND RELIABILITY DIAGRAMS; Weaknesses: 훈련 중 ECE increases하며, 특히 noise rate가 높을수록 증가 폭이 커진다. reliability diagram은 예측이 점점 더 overconfident해짐을 나타낸다고 보고되었지만 제시되지 않았다.reliability diagram과 일부 calibration-method 결과가 누락되어 논문의 calibration 근거가 비판받았다.
- A.3 HYPERPARAMETERS; 0.1 at epochs 50 and 75 Number of Epochs 100 Batch Size 128 Weight Decay 5e-4: 실험에는 Momentum 0.9의 SGD, initial learning rate 0.1, batch size 128, cosine annealing이 사용되었지만, 보고된 epoch 수와 weight decay 사용은 명시된 표와 일치하지 않았다.해당 부분에서는 100 epochs가 아니라 20 또는 30 epochs였고 weight decay는 preliminary 단계에서만 사용되었다고 설명한다. 반면 다른 figure의 맥락에는 100 epochs와 weight decay 5e-4가 제시되어 있다.
- A.4 ADDITIONAL DATASETS; noise, complementing the findings in Section 4: 추가 SVHN 실험에서도 label noise가 calibration metrics에 adversely affects한다는 결과가 재현되었다고 보고되었지만, 해당 실험에는 figure가 없었다.supplementary material에는 noise-level model comparison을 포함한 중복 figure도 들어 있었다.
- C.2.2. AI Scientist Team Review; Strengths; Scores; Additional Comments: 리뷰어들은 연구 질문이 중요하고 noise-model 효과가 강건하다고 보았지만, 제시된 결과가 결론을 충분히 뒷받침하지 못한다고 판단해 제출작을 rejection으로 평가했다.우려 사항에는 불명확한 메커니즘, 누락된 calibration-method 결과, 읽기 어렵거나 중복된 figure, 누락된 citation, 불충분한 reproducibility가 포함되었다.
- C.2.3. AI Scientist Team Code Review; Temperature scaling; Dataset class; Evaluation function: 코드 검토 결과 temperature scaling은 구현되었지만 never used되었고, dataset class는 처음에 symmetric/asymmetric noise 지원을 빠뜨렸으며, 최종 asymmetric mapping에는 (i+1) % NUM CLASSES가 사용되었다.ECE 구현은 torchmetrics의 MulticlassCalibrationError에서 norm=‘l1’을 사용한 결과와 대조해 검증되었으며, 작은 수치 차이를 제외하고 일치했다.
- C.2.4. Workshop Reviews: Workshop 리뷰어들은 label noise가 calibration을 저하시킨다는 데 동의했지만, 분석이 불명확하고 주장과의 연결이 불충분하며 metric 범위가 좁고 temperature scaling에 대한 논의가 불완전하다고 보았다.두 리뷰어 모두 rating 3과 no award를 부여했으며, 한 리뷰어는 missing references와 읽기 어려운 figure 때문에 논문이 review-ready가 아니라고 평가했다.
- C.3. Real-world Challenges in Pest Detection using Deep Learning: an Investigation into Failures and Solutions; C.3.1. The AI Scientist-v2 Idea; REAL-WORLD CHALLENGES IN PEST DETECTION USING DEEP LEARNING: AN INVESTIGATION INTO FAILURES AND SOLUTIONS; 1 INTRODUCTION; 2 RELATED WORK; 3 METHODOLOGY; 4 EXPERIMENTAL SETUP: 이 해충 탐지 연구는 ResNet-18, learning-rate 실험, augmentation, multi-dataset training을 활용해 데이터 품질, 환경 변동성, 모델의 한계를 조사했으며, 낮은 learning rate가 generalization을 개선할 수 있지만 robustness에는 여전히 한계가 있음을 확인했다.Crop Pest and Disease dataset은 22개 클래스로 구성되며, 실험에는 EuroSAT, MedMNIST, CIFAR-10도 사용했지만 dataset을 수동으로 다운로드해야 했다.
5 실험 및 결과 … 보충 자료
실험 결과, 낮은 learning rate는 수렴을 개선하고 환경적 강건성을 안정화하지만, 데이터셋에 따라 성능 변동이 크며 특히 domain shift 상황에서 두드러진다. 논의와 결론은 hyperparameter tuning만으로는 실제 환경의 강건한 해충 탐지를 보장하기 어렵고, 특화된 domain-aware 전략이 필요하다고 강조한다.
- 5 실험 및 결과: 낮은 learning rate(1e−4 및 5e−4)는 더 매끄러운 수렴, 꾸준히 감소하는 training loss, 그리고 더 안정적인 Environmental Robustness Scores (ERS)를 만들어내며, 더 나은 일반화와 강건성을 나타낸다.이 결과는 Crop Pest and Disease dataset으로 학습한 ResNet-18에서 보고되었다.
- 5 실험 및 결과: EuroSAT와 CIFAR-10은 높고 안정적인 training 및 validation accuracy를 달성하는 반면, MedMNIST는 domain discrepancies와 취약한 일반화에 연관된 불규칙한 accuracy를 보인다.비교 대상은 세 데이터셋에 대해 각각 별도로 fine-tuning한 ResNet-18 모델이며, 이들을 하나의 모델로 공동 학습한 경우가 아니다.
- 5 실험 및 결과: EuroSAT와 CIFAR-10은 epoch 전반에서 더 높고 안정적인 ERS를 유지하는 반면, MedMNIST는 낮고 불안정한 ERS를 보여 환경 변화에 더 민감함을 나타낸다.ERS 분석은 testing 중 적용한 환경적 augmentation에 대한 강건성을 평가한다.
- 6 논의: Hyperparameter optimization은 일반화와 강건성을 어느 정도 개선하지만, 모델은 환경 변동성에 여전히 취약하므로 learning-rate tuning만으로는 실제 환경 성능의 강건성을 보장할 수 없다.이 한계는 농업 환경에서 해충 탐지에 배포할 때 특히 중요하다.
- 6 논의: Multi-dataset 실험은 데이터셋 특성과 domain shift가 학습, overfitting, 강건성에 상당한 영향을 미치며, 이러한 차이에서 MedMNIST의 성능이 낮음을 보여준다.논의에서는 별도로 학습한 모델 간 비교를 단순한 joint multi-dataset training으로 해석해서는 안 된다고 주의한다.
- 6 논의: 논의에서는 데이터 품질 문제와 환경 변동성을 해결하기 위해 현실적인 data augmentation, robust training 방법, domain-specific model adaptations를 권고한다.이러한 전략은 실제 모델 성능을 개선하기 위해 필요한 방향으로 제안된다.
- 7 결론: 결론은 환경 변동성, domain discrepancies, dataset compatibility를 지속적인 배포 과제로 제시하며, multi-dataset training이 복잡성과 일관되지 않은 이점을 추가할 수 있다고 지적한다.따라서 향후 연구에서는 관련 데이터의 compatibility와 특성에 맞춘 고급 기법을 개발해야 한다.
A 추가 그림 및 상세 결과 … 환경 잡음 구현
보충 결과는 EuroSAT와 CIFAR-10에서 안정적인 학습이 이루어지지만 MedMNIST에서는 불규칙한 거동이 나타남을 보여준다. 한편 구현 세부 사항과 리뷰에서는 방법론적 한계, 제시 방식의 한계, 도메인 전이의 한계가 확인된다. Code review는 환경 잡음 augmentation과 Environmental Robustness Score 계산을 확인했지만, 의도한 domain-adaptation 구현은 최종적으로 사용되지 않았다고 보고한다.
- 적용됨.: 실험에는 PyTorch 1.9.0, ImageNet-pretrained ResNet-18, β1 = 0.9 및 β2 = 0.999인 Adam, 그리고 batch size 64와 early stopping을 사용하는 30 epochs의 multi-dataset training이 사용된다.제공된 구현 설명에는 weight decay가 1e−4라고도 보고되어 있지만, 주석에는 그 값이 0.01이어야 한다고 적혀 있다.
- A 추가 그림 및 상세 결과: EuroSAT와 CIFAR-10에서는 training loss가 꾸준히 감소하는 반면, MedMNIST에서는 loss와 accuracy가 불규칙하게 나타나 ImageNet-pretrained model의 불안정성을 시사한다.Figure 4는 데이터셋별 training loss를 비교하고, Figure 5는 불규칙한 MedMNIST accuracy 및 loss 거동을 보고한다.
- C.3.2. AI Scientist Team Review: 이 논문은 deep learning을 활용한 해충 예측을 대상으로 하며, 비해충 vision dataset 전반에서 environmental robustness, learning-rate effects, out-of-distribution testing을 연구한다.리뷰는 주제 적합성과 데이터셋별 differential augmentation effects에 대한 관심을 설명한다.
- 약점: 리뷰어들은 EuroSAT, MedMNIST, CIFAR-10 결과와 해충 예측 사이의 연결이 약하다고 비판하며, 실험이 논문의 더 넓은 결론을 뒷받침하지 못한다고 주장한다.또한 평가를 단순한 설정으로 규정하고, 주장된 domain-adaptation framing에 의문을 제기한다.
- 점수: 리뷰는 soundness에 2점, presentation에 1점, contribution에 1점, overall에 3/10을 부여하고 workshop rejection을 권고한다.비판에는 기술적 결함, 불충분한 증거, 잘못된 설명, 중복된 그림, 약한 재현성이 포함된다.
- 추가 의견: 추가 의견은 presentation의 대폭적인 개선, 누락된 citation의 보완, learning-rate effects와 multi-model-single-dataset terminology에 대한 오해를 유발하는 설명의 수정을 요구한다.Code review는 구현된 domain-adaptation 시도들이 실패했으며, 선택된 최종 구현에서는 domain adaptation과 적절한 multi-dataset training이 제외되었다고 추가로 밝힌다.
- Domain Adaptation 및 Multi-dataset training: Code review에서는 세 데이터셋 전체에 대한 single-model training을 올바르게 결합한 domain-discriminator 구현이 발견되었지만 실패했으며, 최종 시스템은 해당 domain-adaptation technique 없이 오류가 없는 구현을 사용했다.검토된 domain-adaptation code는 Figure 11에 제시되어 있다.
- 환경 잡음 구현: Testing-time ColorJitter, GaussianBlur, RandomAffine augmentation은 환경 변화를 모사하며, ERS는 augmentation이 적용된 test 성능과 표준 조건의 성능을 비교한다.Code review는 augmentation 구현과 명시된 ERS ratio definition을 모두 확인한다.
C.3.4. 워크숍 리뷰
워크숍 리뷰어들은 이 논문이 실제 환경의 해충 탐지에서 중요한 강건성 문제를 다루고 hyperparameter tuning과 multi-dataset training을 탐구한다는 점에는 동의했지만, 채택 여부에 대해서는 의견이 크게 엇갈렸다. 주요 비판은 실험 동기의 부족, 불충분한 방법론적 세부 정보와 근거, 불명확한 이론적 토대, 그리고 발표상의 문제에 집중되었다.
- 리뷰어 합의: 리뷰어들은 이 논문이 simulated environmental changes하에서 ResNet-18 해충 탐지를 연구하고, generalization과 robustness를 평가하기 위해 learning-rate tuning, augmentation, multi-dataset training을 수행했다고 보고했다.보고된 metric에는 accuracy, loss, Environmental Robustness Score (ERS)가 포함되었다.
- 리뷰어 합의: 보고된 결론은 EuroSAT와 CIFAR-10으로 학습하면 improved generalization을 얻는다는 것이었지만, 리뷰어들은 환경 변동성과 domain-discrepancy 문제가 여전히 존재한다고 지적했다.한 리뷰어는 multi-dataset training과 hyperparameter tuning에 대한 분석이 새롭고 중요하다고 평가했다.
- 방법론적 비판: 리뷰어들은 augmentation과 실제 환경 변동성의 연관성, ERS의 선택, learning-rate generalization 주장 등을 포함해 불명확하고 weakly motivated experiments를 비판했다.한 리뷰에서는 단 5개의 learning rate와 10개의 training epoch만으로 learning-rate 결론을 뒷받침했다고 지적했다.
- 수정 요청: 한 리뷰어는 insufficient experimental detail 때문에 근거가 약해졌다고 결론 내리고 rejection을 권고했으며, 다른 리뷰어는 결론을 강화하기 위해 substantial revision과 실제 환경 배포가 필요하다고 주장했다.리뷰들은 실험이 실제 real-world deployment setting에서 수행되지 않았다는 점을 강조했다.
- 수정 요청: 리뷰어들은 stronger theoretical grounding, 더 충실한 dataset 및 방법론 세부 정보, 최신 deep learning model과의 비교, 더 명확한 evaluation 제시, 그리고 가독성 높은 figure를 요청했다.또한 누락된 참고문헌, 언어 문제, BibTeX 오류도 지적했다.