Source-linked AI summary

Graph-Native Reinforcement Learning Enables Traceable Scientific Hypothesis Generation through Conceptual Recombination

Subhadeep Pal, Shashwat Sourav, Tirthankar Ghosal, Markus J. Buehler

arXiv:2607.00924v1cs.AIcond-mat.mtrl-scics.CLcs.LG

TL;DR

재료과학 가설 생성에는 선형 언어 모델 추론이 명시적으로 표현하지 못하는 방식으로 단편화된 개념, 메커니즘, 증거를 연결하는 작업이 필요하다. Graph-PRefLexOR는 graph-native 구조화 추론을 사용하며, 100개의 개방형 질문에서 해당 base model을 능가하고 더 높은 추적 가능성과 추론–답변 정렬을 보인다.

  • 문제

    재료과학 가설 생성에는 단편화된 개체, 메커니즘, 제약조건, 결과를 조직해야 하지만, 표준 언어 모델의 추론 trace에는 명시적인 관계 및 인과 구조가 부족하다.

  • 방법

    Graph-PRefLexOR는 탐색, graph construction, pattern extraction, hypothesis synthesis를 위한 GRPO-trained reasoning stages를 사용해 언어 생성을 검사 가능한 symbolic structure와 연결한다.

  • 결과

    Graph-PRefLexOR는 100개의 개방형 재료과학 및 mechanics 질문 전반에서 해당 base model을 일관되게 능가했으며, reasoning traceability에서 가장 큰 향상과 더 강한 reasoning–answer alignment를 보였다.

  • 시사점 및 한계

    Graph-native reasoning은 추적 가능한 중간 경로와 반복적인 개념 재조합을 갖춘 과학적 가설 생성을 위한 해석 가능한 framework를 제공한다.

  • 시사점 및 한계

    보상 설계에는 서로 경쟁하는 structural terms가 포함되므로, 각 term의 절대 수준은 직접 비교할 수 없으며 total reward는 설계상 1.0 미만에서 포화된다.

Abstract

from arXiv · show

Accelerating materials discovery requires AI systems that can generate scientifically valid hypotheses through multi-step, domain-grounded reasoning. Standard large language models often produce fluent but weakly traceable responses to open-ended materials design problems, making it difficult to determine whether final answers are supported by coherent intermediate reasoning. We develop Graph-PRefLexOR, a family of graph-native reasoning models fine-tuned with Group Relative Policy Optimization (GRPO) to organize reasoning into explicit phases for mechanism exploration, graph construction, pattern extraction, and hypothesis synthesis. This design links neural language generation with symbolic relational structure, enabling causal connections to be constructed, inspected, and reused. On 100 open-ended questions from materials science and mechanics literature, Graph-PRefLexOR achieves 40-65% improvements over corresponding base models, with the largest gains in reasoning traceability. Embedding analyses show broader semantic exploration and approximately 2-3 times greater semantic diversity than baselines. Semantic backtracking and layer-wise hidden-state analyses further show stronger alignment between structured reasoning and final answers. Finally, test-time graph expansion reveals that additional compute primarily increases long-range conceptual recombination within a bounded semantic space, rather than simply expanding semantic coverage. These results establish graph-native reinforcement learning as a pathway toward interpretable AI systems for scientific hypothesis generation in materials design and other scientific applications.

1 서론

재료과학의 가설 생성에는 여러 스케일과 도메인에 걸쳐 메커니즘과 근거를 연결하는 작업이 필요하지만, 표준 LLM의 추론은 추적하기 어렵다. Graph-PRefLexOR는 가설이 생성되고 재조합되는 방식을 재구성하는 구조화된 추론 단계를 노출해 이 간극을 해소한다.

  • 동기: 재료과학과 mechanics에서의 과학적 가설 생성에는 분자 구조, mesoscopic 조직, 계면, 결함, 공정 이력, 경계 조건을 연결하는 작업이 필요하다.거시적 물성은 이러한 스케일과 요인에 걸친 결합 과정에서 출현한다.
  • 동기: 표준 LLM의 응답은 추적하기 어려울 수 있어 과학적 추론에서 비추적성, 환각 또는 모순의 위험을 높인다.이러한 한계는 메커니즘과 관계 구성을 위한 명시적 중간 표현의 필요성을 제기한다.
  • 관련 연구: Graph 표현은 개념을 노드로 나타내고, 명시적 메커니즘·의존성·유추를 통해 개념 간 관계를 표현함으로써 과학적 관계를 점검 가능하게 만든다.검색 증강 생성, knowledge graph, agentic workflow는 더 큰 문제의 상호보완적 부분을 다룬다.
  • 방법: Graph-PRefLexOR는 <brainstorm>, <graph>, <graph_json>, <patterns>, <synthesis> 단계를 포함하는 sentinel 기반 trace를 노출해 과학적 추론을 구조화한다.이 단계들은 synthesis에 앞서 메커니즘 탐색, 개념 추상화, graph 구성을 분리한다.
  • 평가: 평가는 도메인 간 연결, 인과 관계 매핑, 숨은 변수, 모델 추상화, 가설 생성을 다루는 재료과학 및 mechanics 문헌의 100개 수작업 큐레이션 open-ended question을 사용한다.이 benchmark는 표준 factual 또는 multiple-choice 평가로는 충분히 측정하기 어려운 능력을 대상으로 한다.
  • 기여: 이 접근법은 가설이 생성되고 정렬되며 반복적으로 재조합되는 intermediate computational pathway를 재구성함으로써 가설 생성을 변화시킨다.이 기여는 최종 답변만을 바꾸는 것이 아니라 intermediate reasoning organization에 관한 것이다.

2 결과 및 논의

Graph-PRefLexOR는 대응하는 base model보다 종합 성능과 reasoning traceability를 일관되게 향상시키며, 명시적 phase 기반 graph reasoning은 더 구조화되고 다양하며 방향성이 정렬된 latent trajectory를 생성한다. 이러한 reasoning 경로가 서로 다름에도 모델들은 의미적으로 유사한 최종 답변으로 수렴한다.

  • Benchmark 성능: 대응하는 baseline 대비 모델 규모 전반에서 40–65%의 종합 성능 향상을 보였으며, Reasoning Traceability에서 가장 큰 향상이 나타났다.Figure 2는 세 가지 graph-native GRPO variant와 대응하는 base model을 세 가지 평가 지표에 걸쳐 비교한다.
  • Reasoning 의존성: reasoning을 비활성화하면 전체 성능이 30–50% 감소하며, 이는 architecture 차이를 넘어 관찰된 향상의 대부분을 명시적 reasoning이 이끈다는 것을 보여준다.이러한 성능 저하는 no-thinking 설정에서 Llama baseline의 저하 양상과 밀접하게 일치한다.
  • Scale 효과: 8B model은 모든 지표에서 1.7B variant보다 약 25–30% 높은 점수를 기록했으며, 이는 표현력 있는 graph construction과 pattern extraction을 위한 더 큰 capacity와 일치한다.이 비교는 model scale에 따라 Fig. 2d에 보고되어 있다.
  • Traceable reasoning: phase-separated reasoning은 mechanism exploration을 entities, relations, patterns, synthesis로 변환하여 immune-system 개념과 multi-agent AI mechanism을 연결하는 inspectable graph를 생성한다.trace와 extracted representation은 Figures 4 and 5에 제시되어 있으며, adaptive memory expansion에서 clonal selection 및 long-term robustness로 이어지는 제안된 bridge를 포함한다.
  • Latent-space dynamics: Graph-PRefLexOR reasoning trajectory는 더 broader하고 more directional하며 phase-separated되어 있는 반면, baseline은 localized되고 entangled된 상태로 남는다. 그럼에도 final-answer embedding은 조밀한 clustering과 강한 overlap을 보인다.structured model은 synthesis 이전에 더 일찍 다양화되지만, 두 model class 모두 의미적으로 유사한 endpoint로 수렴한다.
  • Semantic organization: 1.7B와 8B에서 각각 mean inter-phase cosine distance가 2.9× 및 2.6× 향상된 것은 대응하는 base model보다 더 큰 semantic diversity를 보여준다.거리는 1.7B에서 0.07에서 0.20으로, 8B에서 0.08에서 0.21로 증가하며, reasoning stage 간 differentiation이 더 강해졌음을 나타낸다.

3 결론

Graph-PRefLexOR는 GRPO와 단계적 graph-native reasoning을 사용해 추적 가능한 과학적 가설을 생성한다. 100개의 materials science 및 mechanics open-ended 질문에서 reasoning quality와 traceability를 향상시키며, 답변을 구조화된 trace에 연결하고 반복적 conceptual recombination을 가능하게 한다.

  • 3 결론: Graph-PRefLexOR는 GRPO와 sentinel 기반 <brainstorm>, <graph>, <graph_json>, <patterns>, <synthesis> 단계를 결합해 해석 가능한 과학적 가설 생성을 수행한다.이 단계들은 reasoning을 mechanism exploration, concept abstraction, machine-readable graph construction, pattern extraction, final hypothesis synthesis로 분해한다.
  • 3 결론: 100개의 materials science 및 mechanics open-ended 질문에서 Graph-PRefLexOR는 reasoning quality, intellectual depth, reasoning traceability 측면에서 대응하는 base model보다 우수한 성능을 보였다.가장 큰 향상은 traceability에서 나타났으며, 이는 graph-structured reasoning이 intermediate reasoning의 조직화와 causal transparency를 강화함을 보여준다.
  • 3 결론: Graph-PRefLexOR의 최종 답변은 자체 structured reasoning pathway에 강하게 고정되어 있으며, 가장 빈번하게 <synthesis> 단계로 backtracking한다.반면 Qwen3-8B의 답변은 소수의 경우에만 자체 visible thinking trace와 정렬되며, 더 자주 Graph-PRefLexOR에서 도출된 output에 semantic하게 접근한다.
  • 3 결론: 누적된 <graph_json> output과 expansion policy는 Graph-PRefLexOR를 test-time ideation을 반복 수행하는 self-expanding graph engine으로 전환한다.추가적인 test-time compute는 semantic territory를 단순히 무한히 확장하지 않고, 대신 탐색되는 embedding volume과 maximum explored distance를 변화시킨다.
  • 3 결론: Null-model 분석은 enriched relation-typed motif, chance를 넘어서는 modularity, 그리고 semantic하게 상이한 개념 간의 systematic link를 보여주며, novelty는 two-hop conceptual bridge에 집중된다.직접적인 graph edge는 약한 homophily를 유지하는 반면, two-hop bridge는 일반적으로 관련되지 않은 개념을 연결한다.

4 재료 및 방법 … Stage 1: ORPO Cold Start

Graph-PRefLexOR는 1.7B, 3B, 8B 모델 전반에 걸쳐 2단계 graph-native 학습 레시피를 사용하며, 구조화된 선호 쌍을 이용한 ORPO cold-start 정렬로 시작한다. 추론 형식은 탐색에서 graph formalization, pattern abstraction, synthesis로 진행되므로 중간 추론을 파싱하고 점검할 수 있다.

  • 4.1 Training Strategy: Graph-PRefLexOR는 reasoning 및 standard instruction-tuned backbone에 하나의 2단계 레시피를 적용해 1.7B, 3B, 8B 모델을 학습한다.Qwen3 backbone은 고유한 reasoning 능력을 활용하는 반면, Llama-3.2-3B-Instruct는 graph-native 형식을 부여받는다.
  • 4.1.1 Dataset Construction: Teacher distillation은 streaming general 및 domain-specific text를 질문, 답변, 선택된 trace, 거부된 응답, 추출된 graph를 포함하는 구조화된 graph-native 선호 레코드로 변환한다.잘못 형성된 graph_json 또는 빈 답변 예시는 폐기하여, 보존된 레코드가 유효한 graph와 완전한 답변을 포함하도록 한다.
  • Stage 1: ORPO Cold Start: Figure 18은 세 backbone 모두에서 ORPO loss가 감소하고 선호 정확도가 1.0 부근에서 포화됨을 보여주며, 1.7B 모델의 더 큰 reward margin은 더 높은 learning rate에 기인한다.ORPO 실행은 각각 1.7B, 3B, 8B에서 약 480, 480, 240 step 동안 진행된다.
  • 4.1.1 Dataset Construction: 선호 구성은 풍부한 graph-reasoning trace와 얕은 직접 답변을 대조하므로, ORPO cold start에서 순서를 쉽게 학습할 수 있다.이후 Graph-GRPO는 prompt와 gold answer만 사용하므로 chosen 및 rejected field는 사용되지 않는다.
  • 4.1.2 Training Approach: 모델은 <brainstorm>, <graph>, <graph_json>, <patterns>, <synthesis> 순으로 구조화된 trace를 출력하고, </think> 바깥에 최종 답변을 제시한다.이 sequence는 자유 형식 chain-of-thought가 아니라 exploration → formalization → abstraction → explanation을 인코딩한다.
  • 4.1.2 Training Approach: Graph-GRPO 학습은 구조화된 trace에 대한 composite reward를 사용하며, 모든 모델 규모에서 graph utility가 가장 낮은 reward component로 유지된다.Figure 19는 8B가 가장 높은 값에서 시작하고 3B가 서로 다른 training duration에 걸쳐 가장 크게 상승함을 보고한다.
  • Rationale for This Reasoning Structure: 명시적 graph 구조는 relational faithfulness, 검증 가능성, answer faithfulness를 지원한다. graph_json은 파싱 가능하고 reward에 접근할 수 있으며 최종 synthesis를 뒷받침해야 하기 때문이다.Validity, structure, diversity, graph-utility 항은 canonical graph object에 직접 작용한다.
  • Stage 1: ORPO Cold Start: ORPO 는 선호 응답 NLL 항과 비선호 응답에 대한 odds-ratio penalty를 사용해 각 backbone을 정렬하며, frozen reference model은 사용하지 않는다.이 단계는 one epoch, 5% held-out split, seed 42를 사용하며, reinforcement learning에 앞서 안정적인 형식 준수를 확립한다.

Stage 2: Graph-GRPO · Semantic rewards (judge-graded) · Format reward

Stage 2는 composite reward를 적용한 critic-free GRPO로 graph-native reasoning을 학습하며, group sampling과 LoRA adaptation으로 업데이트의 메모리 효율을 유지한다. 보상은 judge-graded answer quality와 graph utility를 programmatic graph 및 format check와 결합하며, malformed output의 점수를 제한하는 parsing gate를 포함한다.

  • Stage 2: Graph-GRPO: GRPO는 prompt당 G = 8개의 completion을 샘플링하고, composite reward에서 group-normalized advantage를 계산한 뒤 KL penalty가 포함된 clipped policy objective를 최적화한다.이 방법은 learned value network를 사용하지 않으며, 처리량을 높이기 위해 vLLM으로 생성한다.
  • Stage 2: Graph-GRPO: LoRA-only adaptation은 GRPO 업데이트를 경량화하고 black-box reward를 최적화할 때 catastrophic forgetting을 완화한다.보상은 differentiable signal을 제공하는 대신 judge call과 graph analytics를 결합한다.
  • Semantic rewards (judge-graded): 각 completion은 [0, 1]로 정규화된 여섯 components의 고정된 convex combination으로 구성된 scalar reward를 받는다.Trainer의 headline total reward는 completion 간 per-step mean이다.
  • Semantic rewards (judge-graded): 두 reward components는 external LLM judge를 사용하고, 나머지 네 components는 parsed graph G = (V, E)에서 programmatically 계산된다.External judge는 grok-4-1-fast-non-reasoning이다.
  • Semantic rewards (judge-graded): Correctness는 post-think answer를 gold answer와 직접 대조해 평가하며, graph utility는 방출된 graph_json만으로 재구성한 answer를 평가한다.따라서 graph utility는 외부 지식 없이 answer를 재현할 충분한 정보가 graph에 포함되어 있는지 검증한다.
  • Format reward: Format reward는 필수 reasoning section, parseable graph_json, patterns, synthesis, non-empty node set에 점수를 부여한다.Section credit은 think 0.15, brainstorm 0.10, graph 0.15, graph_json 0.20, patterns 0.15, synthesis 0.15, non-empty nodes 0.10이다.
  • Format reward: Malformed graph_json은 graph_json 및 이후 credit을 gate하여 parsing에 실패하면 format score를 제한한다.Parsing requirement에 따라 structural validity가 이후 format component의 전제조건이 된다.

NetworkX 유효성 보상 · 다양성 보상 · 구조 보상

보상은 그래프 유효성, 의미 다양성, 위상 구조를 결합해 내부적으로 일관되고, 붕괴되지 않으며, 연결된 계층적 추론 그래프를 선호한다. 구조 항은 그래프 크기, 밀도, 내부 추론, 추론 깊이, 연결성을 명시적으로 조정한다.

  • NetworkX 유효성 보상: 유효성 보상은 invalid-edge와 self-loop 수량을 사용해 그래프 일관성을 평가한다.Einv는 존재하지 않는 노드를 참조하는 edge를, ℓ은 self-loop의 개수를 나타낸다.
  • NetworkX 유효성 보상: Eval = m −|Einv|는 존재하지 않는 노드를 참조하는 edge에 패널티를 부여해 내부적으로 일관되고 연결된 그래프를 보상한다.유효성 정의에서는 잘못된 edge 참조에 Einv를 사용하며, 주변 정의에서는 ℓ을 통해 self-loop도 추적한다.
  • 다양성 보상: 다양성은 그래프 요소의 텍스트에 대한 Sentence-BERT embedding 사이의 평균 비대각 cosine similarity로 측정한다.embedding 대상 요소에는 node id와 source-relation-target triple이 포함되며, all-MiniLM-L6-v2 를 사용한다.
  • 다양성 보상: 풍부성 보너스 b = min(0.1, m′/100)는 validity와 structure를 reward-hack할 수 있는 거의 중복된 node로 이루어진 퇴화 그래프에 패널티를 부여한다.이 보너스는 0.1로 제한되며, 붕괴된 그래프 표현을 억제하기 위한 것이다.
  • 구조 보상: 위상 보상 rstruct는 크기, 밀도, 내부 node, 깊이, 연결성 항의 합을 [0,1]로 clipping한다.크기 항은 5–20개 node인 그래프에서 최대가 되며, 밀도는 directed density ρ를 기반으로 한다.
  • 구조 보상: 구조 보상은 directed density sdens = min(0.2, 2ρ)와 internal-node 항 sint = 0.3 nint를 사용한다.이 항들은 directed relation과 추론을 매개하는 node를 포함하는 그래프 위상을 보상한다.
  • 구조 보상: 깊이와 weak-connectivity 항은 그래프를 연결된 계층적 scaffold로 형성하며, 최장 DAG 경로 L은 추론 사슬의 길이를 나타낸다.Internal node는 중간 추론에 해당하고, L은 추론 사슬의 길이를 포착한다.

설계 근거 … 최적화 진단

보상 설계는 semantic correctness와 graph utility를 우선시하는 한편, programmatic shaping term을 사용해 유효하고 다양하며 구조화된 trace를 강제한다. 세 모델 크기 모두에서 ORPO는 Graph-GRPO가 보상을 개선하기 전에 reasoning format을 정착시키며, 최적화 거동은 backbone의 reasoning ability와 reward dispersion에 의해 형성된다.

  • 설계 근거: 보상 가중치의 0.55는 correctness와 graph utility에, 0.45는 dense shaping과 anti-hacking을 위한 programmatic validity, diversity, structure term에 할당된다.Format과 NetworkX-validity는 1.0에 도달할 수 있지만 diversity와 structure term에는 soft cap이 적용된다. 따라서 total reward는 설계상 1.0 미만에서 포화된다.
  • 학습 동역학 및 결과: 세 모델 크기 모두에서 cold start는 Graph-GRPO가 composite reward를 개선하기 전에 reasoning format과 preference ordering을 정착시키며, backbone type이 향상 여지를 결정한다.Backbone과 model size가 초기 조건과 달성 가능한 reward improvement의 크기를 좌우한다.
  • Graph-PRefLexOR-1.7B: Qwen3-1.7B 학습에서는 ∼2.11→∼1.38 ORPO loss, 0.95→1.0 preference accuracy, 0.14→∼1.0 reward margin이 관찰된다.더 큰 5 × 10−5 learning rate에서 odds-ratio penalty가 무시할 수 있을 정도로 작기 때문에 NLL은 total loss와 거의 일치한다. 큰 margin은 model scale이 아니라 learning rate를 반영한다.
  • Graph-PRefLexOR-3B: Llama-3.2-3B-Instruct에서는 ∼2.1→∼1.47 ORPO loss, ∼0.02–0.03 component separation, ≈1.0 preference accuracy, 0.03→0.16 reward margin이 관찰된다.Instruction backbone은 한 epoch 안에 안정적으로 수렴하고 ∼300 step 이후 plateau에 도달하며, held-out split에서도 동일한 accuracy를 보인다.
  • Graph-PRefLexOR-8B: Qwen3-8B에서는 ∼240 step 동안 ∼1.69→∼1.31 ORPO loss와 처음부터 ≈1.0 preference accuracy가 나타나며, reward는 ∼0.60에서 ∼0.63으로 완만하게 상승한다.강력한 base가 즉시 preference를 구분하므로 cold start는 주로 output format을 정착시킨다. 또한 reward는 학습 중반 ∼0.60까지 하락한다.
  • 생성 길이 동역학: 1.7B와 8B 모델은 completed trace를 각각 ∼2.6k와 ∼2.4k token으로 늘리면서 truncation을 ≤3%로 유지하는 반면, 3B는 truncation을 ∼20%에서 ∼1%로 줄인다.3B의 reinforcement-learning dynamics는 평균 termination behavior도 동시에 단축시키는 반면, 다른 모델은 8000-token budget을 소진하는 경우가 드물다.
  • Optimization Diagnostics: 3B의 초기 보상 분산 ∼0.11은 1.7B와 8B의 ∼0.05–0.06보다 커서 3B에 가장 강한 GRPO 학습 신호를 제공하며, 이후 ∼0.07을 향해 감소한다.모든 모델에서 Policy entropy는 완만하게 감소하고, 분산이 0인 그룹은 계속 0으로 유지되므로 gradient는 전 과정에서 사용 가능한 상태를 유지한다.

4.2 벤치마크 질문 생성 · 4.3 답변 역추적 및 hidden-state 분석

Sections 4.2–4.3에서는 100-question open-ended scientific reasoning benchmark를 구축하고, model reasoning이 최종 답변과 어떻게 연결되는지 추적하기 위한 재현 가능한 semantic backtracking 및 hidden-state analyses를 정의한다.

  • 4.2 벤치마크 질문 생성: 벤치마크 pipeline은 논문을 Markdown으로 변환하고, 고수준 mechanistic field를 추출하며, materials science와 large language models를 포함한 영역에서 질문을 생성한다.Marker는 layout-aware 변환을 수행하고, gpt-4o-mini는 제목, DOI, 초록, 결과, 논의, 결론을 추출한다. 서론, 방법, 참고문헌은 제외한다.
  • 4.2 벤치마크 질문 생성: 벤치마크는 사전에 정의된 5개 과학적 추론 범주를 아우르는 100개의 독립적으로 이해 가능한 연구 수준 질문으로 구성된다.질문은 연구 논문에서 생성한 뒤, 시스템, 변수, 인과 구조, 질문 유형 또는 의도된 추론 과제를 변경하지 않는 방식으로 다듬는다.
  • 4.2 벤치마크 질문 생성: 두 번째 gpt-5.4 refinement pass는 각 질문의 과학적 추론 과제를 보존하면서 가독성, 문법, 정확성 및 벤치마크 적합성을 향상한다.편집 단계에서는 새로운 과학적 주장을 도입하거나 과제를 단순화하지 않으며, 정제된 JSONL 벤치마크를 출력한다.
  • 4.3 답변 역추적 및 hidden-state 분석: Semantic backtracking은 정규화된 BGE embedding space에서 cosine similarity가 가장 높은 candidate reference에 각 최종 답변을 할당한다.이 방법은 최종 답변의 embedding과 candidate text를 비교하며, 절대 similarity threshold를 적용하는 대신 수치적 동률을 해소하기 위해 deterministic candidate ordering을 사용한다.
  • 4.3 답변 역추적 및 hidden-state 분석: Qwen3-8B에서는 backtracking을 통해 최종 답변과 모델의 thinking trace 및 4개의 Graph-PRefLexOR stage를 비교하고, full 및 binary source distribution을 보고한다.Binary split은 backtracking이 Qwen 자체의 thinking trace로 이어지는지, 아니면 다른 source로 이어지는지를 구분한다.
  • 4.3 답변 역추적 및 hidden-state 분석: Graph-PRefLexOR 8B에서는 cross-model backtracking을 통해 최종 답변과 4개의 internal stage 및 Qwen3-8B output을 비교하고, internal-only analysis에서는 가장 가까운 structured stage를 분리해 분석한다.Internal stage는 <brainstorm>, <graph>, <patterns>, <synthesis>이며, cross-model analysis에서는 답변이 내부로 backtracking되는지 Qwen output으로 backtracking되는지도 보고한다.
  • 4.3 답변 역추적 및 hidden-state 분석: Layer-wise hidden-state analysis는 Qwen3-8B와 Graph-PRefLexOR 8B의 reasoning–answer distance를 측정하며, stage-specific comparison과 one-standard-deviation band를 포함한 평균을 보고한다.추가적인 linear-probe 및 logit-lens-style 분석은 reasoning–answer distinction이 선형적으로 decoding 가능한지 검증하고 span 간 token preference를 비교한다. 이러한 분석은 관찰적이다.

4.4 반복적 Graph-native 발상 생성 및 스케일링 분석 · 확장 전략

모델은 구조화된 reasoning trace가 graph 업데이트로 변환되어 후속 질문을 생성하는 자기 확장형 발상 생성 엔진으로 평가된다. 네 가지 확장 정책은 test-time compute를 graph frontier, semantic periphery, distant recombination, 또는 language-level follow-up에 배분한다.

  • 4.4 반복적 Graph-native 발상 생성 및 스케일링 분석: 각 iteration은 현재 질문에 답하고, reasoning trace를 typed node와 labeled relation으로 파싱한 뒤, local graph를 global directed graph에 병합한다.이를 통해 생성된 reasoning이 graph를 확장하는 동시에 이후 발상 생성 방향을 결정하는 반복 루프가 형성된다.
  • 확장 전략: 네 번의 run은 각 expansion policy가 누적된 graph를 다음 질문 batch로 매핑하는 방식만 다르며, 서로 다른 idea-space frontier에 compute를 배분한다.정책들은 graph degree, betweenness, node embedding, 또는 language-level questioning을 사용해 확장을 유도한다.
  • 확장 전략: frontier strategy는 방문되지 않은 low-degree node와 가장 높은 betweenness를 갖는 hub를 선택한 다음, 미해결 mechanism에 관한 후속 질문을 제시한다.이는 충분히 개발되지 않은 영역을 외부로 탐색하는 동시에 구조적으로 중심적인 concept를 중심으로 통합한다.
  • 확장 전략: novelty strategy는 현재 centroid와 가장 낮게 정렬된 node를 선택해 후속 질문을 제시함으로써 embedding periphery를 탐색한다.이를 통해 graph-central structure가 아니라 의미적으로 주변적인 concept에 computation을 집중한다.
  • 확장 전략: leap strategy는 주변 concept를 가장 유사하지 않은 graph partner와 연결하고, 비관련 분야의 원리를 도입해 mechanistic recombination과 cross-domain transfer를 강제한다.이러한 연산은 기존 graph에서 멀리 떨어진 concept와 connection을 촉진한다.
  • 확장 전략: converse strategy는 별도의 questioner를 사용해 seed question과 latest answer로부터 비고정형 후속 질문을 제안하며, iteration당 두 번의 call로 포화된 영역 너머의 부재 concept를 도입한다.이 prompt는 node 또는 node-pair에 고정된 대안들과 달리 implication, tension, cross-domain analogy, 또는 deeper mechanism을 겨냥한다.

Surprising-insight Yield의 Scaling · Growth Dynamics

분석에서는 test-time compute에 따라 surprising conceptual recombination이 어떻게 누적되는지 정량화하고, embedding geometry와 community structure를 통해 graph growth를 특성화한다. 또한 long-range recombination과 homophilic link를 구분하고, conceptual novelty와 consolidating in-fill을 분리한다.

  • Surprising-insight Yield의 Scaling: Scaling analysis에서는 t = 0부터 2000까지 40개 compute checkpoint에서 누적 graph를 재구성하며, model을 다시 실행하지 않는다.birth iteration이 ≤ t인 node와 edge를 유지하고, node label은 google/embeddinggemma_300m을 사용해 한 번만 embedding한다.
  • Surprising-insight Yield의 Scaling: test-time compute에 따른 insight yield의 scaling을 정량화하기 위해 distinct concepts를 포함한 graph-size-robust quantity를 측정한다.제시된 passage에서는 네 가지 robust metric을 도입하지만, 여기서는 distinct-concept metric만 확인된다.
  • Surprising-insight Yield의 Scaling: Surprising recombination은 final-graph pairwise cosine similarity의 exact mean µ와 standard deviation σ에 기반한 global null distribution을 사용해 정의한다.Concept pair는 combination score가 −1보다 작을 때 atypical로 간주한다.
  • Surprising-insight Yield의 Scaling: Cumulative yield는 graph distance two에서 shared intermediate concept을 통해 연결되는 atypical concept pair를 세며, 직접 연결된 pair는 제외한다.각 bridged pair에는 해당 pair가 실현된 최초 iteration을 부여하며, 이는 두 endpoint의 maximum birth iteration으로 결정된다.
  • Growth Dynamics: 새로운 concept은 running concept centroid로부터의 embedding distance를 사용해 novel 또는 consolidating in-fill로 분류하며, exploration radius는 seed로부터 측정한다.도착 concept을 iteration별 bin으로 나누고, 각 bin에 novel-concept fraction과 seed distance의 mean 및 interquartile range를 보고한다.
  • Growth Dynamics: 30개 checkpoint에 걸친 edge replay는 graph가 connected가 된 이후 greedy-modularity community, modularity Q, recombination edge를 추적한다.Recombination edge는 prior path로 이미 연결된 endpoint를 잇고, community count와 Q는 mesoscale sub-field의 형성과 상호연결을 나타낸다.

진술 및 선언

이 연구는 주로 미국 에너지부의 SciDAC FORUM-AI 프로젝트 지원을 받았으며, 선언된 이해상충은 없다. 학습 데이터, 벤치마크 데이터, 코드, 모델 및 분석 산출물은 연결된 저장소를 통해 또는 요청 시 이용할 수 있다.

  • 연구비: 주요 지원은 미국 에너지부의 FORUM-AI 프로젝트 산하 SciDAC 프로그램에서 제공되었다.지원은 Office of Science를 통해 제공되었으며, Advanced Scientific Computing Research와 Basic Energy Sciences를 포함한다.
  • 이해상충: 저자들은 이 논문과 관련된 재정적 또는 비재정적 이해상충이 없음을 선언한다.
  • 데이터 및 코드: 학습 데이터, 벤치마크 데이터, 분석 산출물 및 전체 학습·분석 코드는 Hugging Face와 GitHub를 통해 공개적으로 이용할 수 있다.추가 자료는 합리적인 요청이 있을 경우 교신저자에게서도 받을 수 있다.
  • 모델 이용 가능성: 학습된 Graph-PRefLexOR 8B, 3B 및 1.7B 모델은 Hugging Face를 통해 이용할 수 있다.모델 저장소는 Graph-Preflexor-8b_12292025, Graph-Preflexor-3b_08012026 및 Graph-Preflexor-1.7b_08012026에 대해 제공된다.
  • LLM 사용: 대규모 언어 모델은 벤치마크 구축, 응답 생성, 질문 개선 및 독립적 평가를 지원했으며, 생성된 모든 자료는 저자들이 검토하고, 필터링하고, 분석했다.

보충 정보

보충 정보에는 MIT, Oak Ridge National Laboratory, Washington University in St. Louis, Lawrence Berkeley National Laboratory에 소속된 저자와 소속 기관이 제시되어 있다.

  • Subhadeep Pal과 Markus J. Buehler는 MIT 토목·환경공학과에 소속되어 있다.
  • Tirthankar Ghosal은 Oak Ridge National Laboratory 컴퓨팅·계산과학 부서에 소속되어 있다.
  • Shashwat Sourav는 Washington University in St. Louis와 Oak Ridge National Laboratory 컴퓨팅·계산과학 부서에 소속되어 있다.
  • 제시된 소속 기관에는 미국 테네시주 오크리지의 Lawrence Berkeley National Laboratory도 포함된다.
  • Markus J. Buehler는 MIT 기계공학과와 Schwarzman College of Computing에도 소속되어 있다.

S1 대표 Qwen3-8B 베이스라인 응답

이 절에서는 대표 벤치마크 질문에 대한 전체 Qwen3-8B 응답을 제시하여 베이스라인의 선형적이고 장황하며 반복적인 추론 스타일을 보여준다. 또한 Graph-PRefLexOR-8B의 구조화된 단계별 추론과 비교할 기준점을 제공한다.

  • 전체 Qwen3-8B 응답은 Graph-PRefLexOR-8B의 단계별 추론과 비교하기 위한 대표 베이스라인으로 기능한다.이 절에서는 해당 응답을 사용해 선형적인 베이스라인 추론과 구조화된 추론을 대조한다.
  • 베이스라인은 구성 요소와 기능을 순차적으로 회상하면서 생물학적 면역 시스템과 multi-agent AI 프레임워크를 비교하는 것으로 시작한다.B-cells, T-cells, memory cells, signaling, adaptation, feedback loops를 논의한다.

S2 Qwen3-8B의 7–10층 행동 분석

Qwen3-8B에서 7–10층은 사고 상태와 답변 상태가 기하학적으로 더 분리되는 표현 전환을 이루며, 이후 층은 직접 복원 가능한 답변 내용을 더 많이 담는다. 이러한 분석은 graph-structured reasoning이 reasoning-to-answer 생성의 안정성과 해석 가능성을 높인다는 해석을 뒷받침한다.

  • Qwen3-8B 층별 행동: 7–10층은 사고 표현과 답변 표현이 기하학적으로 더 분리되는 초기 전환 구간을 이루지만, 최종 답변 자체를 저장하지는 않는다.모델은 답변 생성 모드에 진입했지만, 답변 내용은 아직 완전히 통합되지 않았다.
  • Qwen3-8B 층별 행동: Near-perfect probe AUROC는 7–10층에 앞서 나타나며, hidden-state divergence는 해당 구간에서 증가하고 최종 층에서 급증한다.Probe decodability는 생성 모드를 이른 시점에 식별할 수 있음을 보여주지만, divergence 측정값은 이후의 기하학적 분리를 나타낸다.
  • Qwen3-8B 층별 행동: 이후 층, 특히 around layer 30에서는 activation patching을 통해 7–10층보다 최종 답변 유사성이 더 강하게 복원된다.이는 이후 표현이 더 직접적으로 복원 가능한 답변 특이적 내용을 포함함을 시사한다.
  • Qwen3-8B 층별 행동: 분석은 중간 층이 가시적 추론에서 답변 형성으로의 전환을 진단하는 반면, 이후 층은 명시적 답변 내용을 담는다는 점을 분명히 한다.Probe와 representation distance는 hidden state에서의 분리 가능성 또는 존재를 드러내지만, 그 자체로 인과적 사용을 입증하지는 않는다.
  • Qwen3-8B 층별 행동: Graph-structured reasoning은 최종 답변 품질과 추론에서 응답 생성으로 이어지는 경로의 안정성과 해석 가능성을 높이는 것으로 제시된다.이 결론은 분석에서 강조된 reasoning trace와 최종 응답 간의 대조에 근거한다.
Loading 2607.00924v1…