Source-linked AI summary
CORE: Contrastive Reflection Enables Rapid Improvements in Reasoning
Linas Nasvytis, Simon Jerome Han, Ben Prystawski, Satchel Grant, Noah D. Goodman, Judith E. Fan
TL;DR
언어 모델은 검증 가능한 보상으로부터 향상되기 위해 상당한 데이터와 계산량이 필요한 경우가 많다. CORE는 성공 및 실패 reasoning trace를 대조해 간결하고 효용이 검증된 insight를 생성하며, 더 적은 rollout과 평가 시 context로 다양한 과제에서 경쟁 방법을 능가한다.
문제
검증 가능한 보상으로부터 학습하는 기존 방법은 대량의 데이터와 계산량을 요구하는 경우가 많아, 소수의 연습 문제만으로도 인간과 유사한 효율을 달성할 수 있는 방법이 필요하다.
방법
CORE는 성공 및 실패 rollout을 대조해 일반적인 reasoning strategy나 constraint에 관한 간결한 자연어 insight를 생성하고, 검증하고, 저장하고, 검색한다.
결과
CORE는 네 가지 추론 과제의 12개 task-by-data-regime 조건 중 9개에서 가장 높은 평균 held-out 정확도를 달성한다.
시사점 및 한계
전체 reasoning trace 대신 contrastive insight를 저장하고 재사용하면 reasoning, planning, problem-solving task 전반에서 sample, rollout, context 효율을 향상할 수 있다.
시사점 및 한계
CORE는 검증 가능한 보상을 가정하므로 적용 범위가 검증 가능한 domain으로 제한되며, 더 개방적인 환경에서의 성능은 실험으로 확인되지 않았다.
Abstract
from arXiv · showhide
Language models can use verifiable rewards to improve at a wide variety of reasoning tasks. However, both parametric (e.g. RLVR) and non-parametric (e.g. prompt optimization) approaches to doing so typically require hundreds of training samples and thousands of model rollouts, making them expensive in the best case and intractable in the worst. To address this challenge, we introduce Contrastive Reflection (CORE), a non-parametric learning algorithm that compares past reasoning traces to generate insights: short natural-language descriptions of reasoning strategies and constraints that capture differences between successful and unsuccessful problem attempts. Across four reasoning tasks, we demonstrate that CORE enables more rapid improvement than both parametric (GRPO) and non-parametric (GEPA, episodic RAG, and MemRL) methods, while using fewer rollouts. Under fixed rollout budgets with as few as five training samples, CORE achieves the strongest performance in most task-data regimes. Finally, we highlight how CORE is substantially more context-efficient than non-parametric baselines, requiring fewer prompt tokens while storing learned knowledge as compact, interpretable natural-language insights. Our results therefore suggest that distilling contrasts between successful and unsuccessful reasoning traces into abstract and useful insights can provide a more efficient and interpretable route to model self-improvement than weight updates, prompt optimization, or direct reuse of stored reasoning traces.
1 서론
CORE는 과거의 성공과 실패에서 대조적 통찰을 발견함으로써 검증 가능한 보상으로부터 학습할 때 발생하는 높은 데이터 및 계산 수요를 해결한다. 이는 축적된 자연어 통찰을 통해 효율성, 해석 가능성, 성능을 개선하는 비파라미터 방법으로 소개된다.
- 동기: CORE는 기존 방법의 높은 데이터 및 계산 수요를 겨냥하며, 이러한 방법에는 수십만 회의 rollout 또는 수백 개의 학습 및 검증 샘플이 필요할 수 있다 [10] [3].서론에서는 이러한 요구 사항을 제한된 경험만으로도 크게 개선할 수 있는 인간의 능력과 대조한다.
- 동기: 대조적 성찰은 성공과 실패를 비교하면 경험을 고립된 상태에서 성찰하는 것보다 더 추상적이고 명시적이며 간결하고 재사용 가능한 원칙을 얻을 수 있다는 증거에 기반한다.이 접근법은 현재의 관련성 또는 이전의 유용성에 기반한 선택적 통찰 적용에서도 착안한다.
- 방법: CORE는 통찰을 생성하고 축적함으로써 언어 모델이 검증 가능한 보상으로부터 학습하도록 하는 비파라미터 알고리즘이다.생성된 통찰과 과거 rollout을 위한 외부 메모리를 사용하며, 대조적 성찰이 문제 해결에 도움이 되면 통찰 메모리를 업데이트한다.
- 결과: 논리, 계획, 문제 해결 과제 전반에서 CORE는 파라미터 및 비파라미터 baseline을 능가하며, 더 빠르게 학습하고 평가 시 사용하는 context를 크게 줄인다.이러한 우위는 사용 가능한 학습 샘플 수와 무관하게 유지된다.
- 해석 가능성 및 분석: CORE 통찰은 경험적 유용성 추정치를 포함하는 해석 가능한 자연어 학습 산물이며, ablation을 통해 대조적 성찰과 utility-aware retrieval의 기여를 분리한다.이러한 특성은 불투명한 파라미터 업데이트와 관련된 원치 않는 행동을 줄이는 것을 목표로 한다.
2 관련 연구
관련 연구는 검증 가능한 보상으로부터의 parametric 및 non-parametric 학습, 외부 메모리 시스템, 그리고 sample 및 rollout 효율을 높이는 방법을 아우른다. 이러한 접근법은 모델 가중치와 context 중 무엇을 업데이트하는지, 무엇을 저장하고 검색하는지, 학습 효율의 여러 측면 사이에서 어떻게 절충하는지에 따라 구분된다.
- 검증 가능한 보상으로부터의 학습: 검증 가능한 보상으로부터의 학습은 기존 방법을 모델 가중치를 업데이트하는 parametric 접근법과 모델을 고정한 채 context를 개선하는 non-parametric 접근법으로 나눈다.parametric 학습의 예로는 STaR [32]와 GRPO [5] [25] [10]가 있으며, non-parametric 학습의 예로는 MIPRO와 GEPA [22]가 있다.
- 언어 모델을 위한 외부 메모리 시스템: 외부 메모리 시스템은 저장하는 내용에 따라 다양하며, raw reasoning traces와 reflections [27]부터 executable programs [30], distilled behavior descriptions [7] [23], AGENTS.md [3]와 같은 procedural guidance까지 포함한다.저장된 항목을 검색 대상으로 선택하는 방식도 서로 다르며, 이 두 차원 모두 sample efficiency에 영향을 준다.
- 학습 효율: 학습 효율에는 서로 구별되는 sample-efficiency와 rollout-efficiency 차원이 있으며, 한쪽을 개선하면 다른 쪽을 희생할 수 있다.Sample efficiency는 서로 다른 training problem의 수를 의미하는 반면, rollout efficiency는 해당 문제에 필요한 시도의 수를 의미한다.
3 CORE: Contrastive Reflection
CORE는 성공한 추론 trace와 실패한 추론 trace의 대조를 간결하고 utility-aware한 자연어 insight로 변환해 frozen language model을 개선하는 non-parametric 방법이다. 학습 중 이 insight를 검색하고 검증한 뒤, 학습된 memory를 고정해 held-out evaluation을 수행한다.
- CORE: Contrastive Reflection: CORE는 어떤 추론 전략이나 제약이 성공한 rollout과 실패한 rollout을 구분하는지 가설화한 짧은 insight를 생성해 frozen language model을 개선한다.이 insight는 이전 rollout의 요약이 아니라, 미래 문제에 대한 credit-assignment 가설로 기능한다.
- Insight retrieval: CORE는 의미적으로 유사한 training problem에서의 local utility와 exploration bonus를 결합해 insight를 검색한 뒤, baseline-relative reward를 사용해 검색된 insight를 업데이트한다.baseline normalization은 update-conditioned attempt가 해당 problem의 기대 성능을 향상시킬 때만 positive evidence를 부여하며, 검색된 insight는 group-level credit을 받는다.
- Contrastive reflection: 학습에 실패하면 CORE는 실패한 rollout을 의미적으로 유사한 correct rollout과 대조하고, 동일한 frozen model에 의미 있는 candidate insight를 제안하도록 prompting한다.이전에 correct solution이 존재하면 positive rollout은 동일한 problem에서 나올 수 있으며, 의미적 유사성은 미묘한 성공 요인과 실패 요인을 드러내는 데 도움을 준다.
- Contrastive reflection: Candidate insight는 memory에 들어가기 전에 개별적으로 admission-test되며, admission criterion을 충족하는 candidate만 trial에서 얻은 utility evidence와 함께 보존된다.실험에서는 admission sample 하나와 margin 0을 사용하므로, insight가 해당 originating problem에서 first-attempt solution을 가능하게 하면 admission된다.
- Evaluation: Evaluation 중 CORE는 memory 두 개를 모두 고정하고, training-problem rollout에서 exploitation-only retrieval을 사용하며 reflection, admission testing, exploration, memory update를 수행하지 않는다.Held-out test rollout은 어느 memory에도 절대 추가되지 않는다.
4 평가
네 가지 검증 가능한 추론 과제에서 CORE는 빠르게 향상되며 대부분의 training-data regime에서 가장 강한 결과를 달성하고, 경쟁 방법보다 evaluation-time context를 크게 적게 사용한다. 학습된 insight는 compact하고 기능적으로 조직되어 있으며, 그중 일부가 가장 큰 향상을 이끈다.
- 평가 설정: 평가는 5개, 10개 또는 100개의 training problem과 별도의 100문제 held-out set을 사용하며, 세 번의 independent run에서 mean verifier accuracy를 보고한다.benchmark suite는 algorithmic, arithmetic, logical, symbolic reasoning을 아우르며, Tower of Hanoi, MathGAP, ZebraLogic, Matchstick arithmetic으로 구성된다.
- Rollout 효율: 350회의 training rollout에서 CORE는 모든 baseline의 최고 evaluation performance를 능가하고, baseline의 4,000회에 비해 2,100회의 rollout만 사용하면서 더 높은 최종 성능에 도달한다.과제 전반에서 held-out accuracy는 rollout 0의 0.445에서 rollout 350의 0.712로 59.9% 상승하며, rollout 2,100에서 0.717에 도달한다.
- Sample 효율: CORE는 12개 task-by-data-regime 조건 중 9개에서 가장 높은 mean held-out accuracy를 달성하며, 5개, 10개, 100개 example에서 no learning 대비 각각 54.8%, 56.2%, 52.3% 향상된다.MemRL은 5개와 100개 example의 Tower of Hanoi에서, GEPA는 100개 example의 ZebraLogic에서 우세하다.
- Context 효율: CORE는 evaluation item당 0.92k context token을 추가하는 반면, Episodic RAG는 33.6k, MemRL은 32.7k, GEPA는 1.29k를 추가한다.따라서 이 방법의 향상은 evaluation 중 대규모 reasoning trace를 retrieval하는 대신 training experience를 추상적이고 재사용 가능한 insight로 압축하는 데서 비롯된다.
- Insight 분석: 대부분의 admitted insight는 non-negative utility를 가지며, high-utility insight는 search space를 조직하고 intermediate state를 추적하거나 constraint를 verify하고 validate한다.non-negative weighted utility는 모든 과제에서 91%를 초과하며, high-utility insight 중 더 작은 부분집합이 가장 큰 향상을 이끈다.
5 대조적 성찰을 통한 학습을 설명하는 요인은 무엇인가?
CORE의 성능 향상은 대조적 insight 생성과 utility-aware insight 재사용에서 모두 비롯된다. 네 과제 전반에서 full CORE는 변형들 중 가장 우수하며 GEPA를 능가한다. utility-aware retrieval을 사용하면 최종 평균 향상이 0.227에서 0.268로 개선된다.
- Insight 생성: Contrastive reflection은 모든 양의 평가 checkpoint에서 rollout 0 대비 가장 큰 개선을 보이며, incorrect trace만 또는 correct trace만을 사용한 reflection을 능가한다.CORE는 동일하거나 유사한 문제에서 실패한 reasoning trace와 성공한 reasoning trace를 비교하는 반면, 대안 방법들은 한 종류의 trace만 사용한다.
- Insight 재사용: 0.268 대 0.227: utility-aware retrieval을 제거하면 최종 평균 향상이 감소하며, 이는 최상의 성능을 위해서는 semantic relevance만으로 충분하지 않음을 보여준다.Full CORE는 insight를 retrieval할 때 semantic relevance와 학습된 utility 추정치를 결합한다.
- Ablation 결과: Full CORE는 최종 held-out-accuracy 향상에서 가장 큰 성과를 달성하며, 네 과제 평가 전반에서 GEPA와 모든 ablated variant를 능가한다.비교는 10-training-example 설정을 사용하며 네 과제 전체의 결과를 집계한다.
6 논의
CORE는 전체 rollout이나 그 요약이 아니라 성공 및 실패 reasoning trace에 관한 contrastive insight를 저장함으로써 sample, rollout, context 효율을 높인다. 그러나 verifiable reward에 대한 의존성, 거친 credit assignment, 추가 inference cost, 그리고 reasoning·planning·problem-solving task에 편중된 평가로 인해 적용 범위가 제한된다.
- CORE는 네 가지 logic·planning·problem-solving task에서 강력한 baseline보다 sample·rollout·context 효율을 높인다.
- CORE는 성공한 rollout과 실패한 rollout을 대조하는 insight를 저장하므로, episodic-memory method와 비교해 저장하고 재사용하는 experience의 형태가 달라진다.Standard episodic-memory method는 전체 rollout 또는 rollout의 summary를 저장하고 검색한다.
- 향후 연구 방향으로는 CORE와 RLVR-style training의 결합, insight의 축적 및 검색을 통한 continual learning, 그리고 CORE를 single-turn reasoning 너머로 확장하는 것이 있다.
- CORE는 verifiable reward를 가정하므로 적용 범위가 검증 가능한 domain으로 제한되며, 그 utility update는 검색된 모든 insight에 동일한 outcome을 부여한다.여러 insight 사이의 더 세밀한 credit assignment는 여전히 해결되지 않은 문제다.
- Reflection과 admission testing은 inference cost를 추가하며, 실험은 reasoning·planning·problem-solving task에 초점을 둔다.
부록 개요
부록에서는 CORE의 pseudocode를 제시하고, training rollout에 따른 insight memory의 성장과 insight utility 분포를 분석한다.
- 부록 개요: 부록에서는 CORE 알고리즘의 pseudocode를 제시한다.
- 부록 개요: training rollout에 따른 insight memory의 성장을 살펴본다.
- 부록 개요: insight utility의 분포를 보고한다.
CORE 알고리즘 의사코드
알고리즘 1은 rollout 및 insight memory를 초기화하고, 실패 편향으로 문제를 샘플링하며, insight를 검색하고, 생성된 해를 평가하고, memory 통계를 갱신하는 CORE의 학습 절차를 명시한다. rollout이 실패하면 절차는 대조적 처리를 위해 positive rollout을 검색한다.
- CORE 알고리즘 의사코드: CORE는 빈 rollout 및 insight memory를 초기화하고, 학습 문제에 대한 memory 미사용 baseline을 추정한 뒤, 학습 단계에 걸쳐 반복한다.이 절차에는 training set, frozen model, verifier, rollout memory, insight memory가 필요하다.
- CORE 알고리즘 의사코드: 각 단계에서 CORE는 실패 편향으로 문제를 샘플링하고, 인접 rollout에서 top-K insight를 검색하며, 해를 생성하고 검증한 뒤, reward에서 baseline을 뺀 값으로 utility를 계산한다.생성된 rollout은 rollout memory에 저장되며, 검색된 insight 통계는 계산된 utility를 사용해 갱신된다.
- CORE 알고리즘 의사코드: 실패한 해에 대해 CORE는 대조적 reflection과 insight admission testing을 위해 rollout memory에서 positive rollout을 검색한다.제공된 의사코드는 실패 처리가 insight 검색, 대조적 reflection, admission testing을 포함하는 더 광범위한 절차의 일부임을 보여준다.
B 학습 rollout에 따른 insight memory 성장
Figure 5는 각 task에서 학습 rollout에 따라 admitted insight 수가 어떻게 변하는지 추적하며, run 간 95% 신뢰구간 리본으로 불확실성을 나타낸다.
- B 학습 rollout에 따른 insight memory 성장: Figure 5는 각 task에서 학습 rollout에 따른 admitted insight 수의 변화를 보고한다.
- B 학습 rollout에 따른 insight memory 성장: 이 분석은 학습 rollout이 진행되는 동안 task 간 insight memory 성장을 비교한다.
- B 학습 rollout에 따른 insight memory 성장: 리본은 run 간 95% 신뢰구간을 나타낸다.
C 인사이트 효용의 분포
이 절에서는 네 과제에 걸친 인사이트 효용을 살펴보고, rollout 동안 인사이트 메모리가 증가하는 양상과 함께 분석한다.
- C 인사이트 효용의 분포: Figure 5는 각 과제에서 rollout에 걸쳐 학습 중 누적된 저장된 인사이트 수를 추적하며, 실행별 95% confidence interval을 함께 제시한다.
- C 인사이트 효용의 분포: Figure 6은 네 과제에 걸친 추정된 인사이트 효용의 분포를 보여준다.