Source-linked AI summary

How Can Rhetoric Reward-Hack AI Reviewers? Dissecting Rhetorical Sensitivity in AI-Based Peer Review

Ming Li, Chenguang Wang, Xirui Li, Xinyue Zeng, Dianqi Li, Peng Shi, Dawei Zhou, Tianyi Zhou

arXiv:2608.08975v1cs.CLcs.AI

TL;DR

논문은 기저의 과학적 내용이 보존될 때 어떤 수사적 선택이 AI review 점수를 변화시키는지 묻고, 표현과 과학적 공헌을 분리해 검증한 통제 연구의 부족을 다룬다. 저자들은 익명화된 ICLR 2026 제출물 120편으로부터 full-paper manuscript 4,200편을 구성하고, 여섯 가지 수사적 차원에 걸쳐 상반된 rewriting을 적용한다. Evidence framing과 novelty stance가 가장 큰 점수 대비를 만들며, 수사적 효과는 초기 reviewer 점수, rewriting 구성, reviewer, rewriter, protocol에 따라 달라진다.

  • 문제

    논문은 기저의 과학적 내용이 보존될 때 어떤 수사적 선택이 AI review 점수를 변화시키는지 묻고, 표현과 과학적 공헌을 분리해 검증한 통제 연구의 부족을 다룬다.

  • 방법

    저자들은 익명화된 ICLR 2026 제출물 120편으로부터 full-paper manuscript 4,200편을 구성하고, 여섯 가지 수사적 차원에 걸쳐 상반된 rewriting을 적용한다.

  • 결과

    Evidence framing과 novelty stance가 가장 큰 점수 대비를 만들며, 수사적 효과는 초기 reviewer 점수, rewriting 구성, reviewer, rewriter, protocol에 따라 달라진다.

  • 시사점 및 한계

    AI scientific review는 종합적 일치도나 평균 점수에만 의존하기보다 여러 model과 조건에서 수사적 robustness를 평가해야 한다.

  • 시사점 및 한계

    이 benchmark는 full-paper source와 공개 review metadata를 복원할 수 있는 ICLR 2026 제출물로 제한되므로, 다른 venue와 과학 분야로의 일반화를 제약한다.

Abstract

from arXiv · show

As large language models increasingly participate in scientific evaluation, we investigate a potential form of reward hacking: how rhetorical choices shape AI-review judgments when reported scientific content is preserved and how these effects vary across evaluation conditions. We construct a controlled corpus of 4,200 full-paper manuscripts derived from 120 anonymized ICLR 2026 submissions. Two LLM rewriters transform six rhetorical dimensions in opposing directions, and five LLM reviewers evaluate the resulting manuscripts under standard and strict protocols. We also test joint, recursive, and reviewer-guided rewriting. Our results show that rhetorical sensitivity is structured rather than uniform. Evidence framing and novelty stance produce the largest positive-negative contrasts in overall assessment, with scope framing forming a weaker second tier; the remaining dimensions have smaller or less stable effects. This hierarchy persists across human-assessed quality levels, but score movement depends strongly on the AI reviewer's original score: lower scores tend to rise, higher scores tend to fall, and directional contrasts are clearest in the middle ranges. More elaborate workflows do not reliably yield larger gains. Joint rewriting is strongly rewriter-dependent, reviewer guidance does not consistently outperform an unguided second pass, and repeated rewriting yields diminishing, configuration-dependent returns. Across conditions, the rewriter primarily determines the separation between opposing variants, whereas the reviewer determines the magnitude and sign of their score effects. Strict review lowers mean OA by 1.36 points without consistently changing rhetorical sensitivity. These findings identify when rhetorical presentation influences AI scientific review and motivate evaluation systems robust to content-preserving variation in scientific writing.

1 서론

이 연구는 content-preserving rhetorical rewrite가 AI scientific reviewer의 판단을 바꾸어 reward hacking을 일으킬 수 있는지 검증한다. 통제된 corpus와 다중 reviewer 평가를 통해 rhetorical influence가 보편적이 아니라 선택적이며 reviewer와 configuration에 따라 달라짐을 보인다.

  • 서론: AI system이 manuscript를 수정하고 평가할 수 있기 때문에, rhetorical choice는 reviewer-dependent merit signal이 될 수 있지만 그 영향은 선택적이고 configuration-dependent하며 때로는 역효과를 낸다.이 연구는 LLM judgment가 presentation, evaluation design, 반복 judgment의 불일치에 따라 달라질 수 있다는 광범위한 증거 속에서 이 우려를 다룬다.
  • 서론: 이 framework는 4,200 full-paper manuscript를 사용해 rhetorical presentation과 scientific merit를 분리한다. 여기에는 120개 original과 여섯 rhetorical dimension에 걸친 4,080개 content-preserving rewrite가 포함된다.통제된 rewriting, paired analysis, multi-model AI review, standard 또는 strict protocol을 결합한다.
  • 서론: Evidence framing과 novelty stance가 가장 큰 rewrite effect를 내며, 그다음은 scope framing이다. Positive evidence framing은 OA를 최대 0.93까지 높이고 negative novelty stance는 최대 0.73까지 낮춘다.Evidence framing은 weak-accept probability도 평균 13 percentage point 변화시키며, 이 hierarchy는 human-assessed quality level 전반에서 안정적으로 유지된다.
  • 서론: 더 정교한 rewriting은 configuration-dependent하고 diminishing한 gain을 낳는다. Joint rewriting은 Opus 4.8에서 상당한 도움이 되지만 GPT-5.5에서는 거의 전혀 그렇지 않으며, reviewer guidance의 효과는 일관되지 않다.Gain은 두 번째 pass 이후 감소한다.
  • 서론: Rewriter는 주로 positive variant와 negative variant 사이의 separation을 결정하는 반면, reviewer는 OA effect의 magnitude와 sign, 그리고 변화가 contribution 또는 soundness에 나타나는지를 결정한다.Strict review는 절대 OA scale을 이동시키지만 rewrite effect를 일관되게 강화하거나 약화하지는 않는다.

2 관련 연구

선행 연구에 따르면 LLM 기반 평가는 프롬프트, 제시 방식, 샘플링, 평가자 정체성에 민감하며, 과학적 리뷰 시스템은 실질적 약점을 식별하고 논문의 품질을 구분하는 데 어려움을 겪는 경우가 많다.

  • 2 관련 연구: LLM 평가는 여전히 프롬프트, 제시 방식, 샘플링, 평가자 정체성에 민감하며, 과학적 리뷰 시스템은 실질적 약점을 식별하고 논문의 품질을 구분하는 데 어려움을 겪을 수 있다.루브릭 기반 방법은 인간의 선호와 정렬될 수 있지만, 원고 측 연구에서는 평가에 영향을 미치는 숨은 지시와 기타 요인도 검토한다.

3 AI 리뷰에서 수사적 재작성을 분석하기 위한 통제 분석 프레임워크

이 프레임워크는 검증된 원고 기준선, 여섯 차원에 대한 양방향 개입, 블라인드 AI 리뷰 비교를 통해 내용을 보존한 수사적 변이를 검증한다. 표준 및 엄격 평가 프로토콜에서 단일 차원, 공동, 재귀적, 리뷰어 유도 재작성을 다룬다.

  • 코퍼스 구성: 코퍼스는 폭넓은 품질 스펙트럼을 포괄하도록 120 ICLR 2026 papers를 여섯 인간 overall-assessment 구간에 균등하게 배분해 표집한다.시드 세트에는 각 구간에서 20 papers씩 포함되며, [1, 3)부터 [7, 8.5]까지를 아우른다.
  • 수사적 개입 공간: 여섯 수사적 차원을 동일한 익명화 기준선에서 긍정적 방향과 부정적 방향으로 독립적으로 재작성해, 방향성 민감도와 재작성으로 유발된 점수 변화를 분리한다.차원은 novelty stance, scope, evidence framing, contribution structure, technical register, lexical or syntactic complexity를 포함한다.
  • 프레임워크 수준 효과: 개입 공간 전반에서 evidence framing과 novelty stance가 overall-assessment 변화를 가장 크게 유발하고, scope framing이 그 뒤를 이으며, 효과는 rewriter, reviewer, protocol에 따라 달라진다.Table 3은 prompt-matched originals 대비 긍정적 및 부정적 개입의 논문 수준 평균 변화를 보고한다.
  • 단일 차원 재작성: 단일 차원 설계는 paper와 rewriter마다 12개 variant를 생성하며, 개입을 누적하지 않고 총 2,880 rewritten manuscripts를 산출한다.각 paper는 동일한 익명화 기준선에서 여섯 차원 모두에 대해 양방향 재작성을 받는다.
  • 확장 재작성 워크플로: 이 프레임워크는 단일 패스 재작성을 공동, 3라운드 재귀적, reviewer-guided workflows로 확장해 조정된 목표나 리뷰 피드백을 추가한다.공동 재작성은 여섯 긍정적 방향을 결합하고, 재귀적 재작성은 그 절차를 3라운드 반복하며, reviewer-guided rewriting은 rewriting backbone의 standard review를 사용해 두 번째 패스를 수행한다.
  • AI 리뷰 평가: 블라인드 평가는 standard 및 strict prompts 아래 five AI reviewers를 사용하며, strict protocol은 높은 평점에 구체적 증거를 요구하고 presentation-based rewards를 억제한다.리뷰어에게는 rewrite condition이나 rewrite model을 알리지 않으며, 판단은 prompt-matched original과 동일한 paper 내에서 비교한다.

4 어떤 수사적 차원이 가장 중요한가?

수사적 민감성은 evidence framing과 novelty stance에 집중되며, scope framing은 상대적으로 약한 두 번째 층위를 이룬다. 효과는 사람이 평가한 품질 수준 전반에서 지속되는 반면, 점수가 상승할지 하락할지는 주로 AI reviewer의 시작 점수가 결정한다.

  • 4 어떤 수사적 차원이 가장 중요한가?: Evidence framing과 novelty stance는 overall assessment에서 가장 크고 일관된 대비를 만들어내며, scope framing의 더 약한 효과가 그 뒤를 따른다.제시된 configuration 전반에서 positive evidence variant와 novelty variant가 선호되며, scope도 같은 방향을 따른다.
  • 4 어떤 수사적 차원이 가장 중요한가?: Evidence framing, novelty stance, scope framing의 weak-accept 대비는 각각 13.0, 12.0, 9.0 percentage points다.Standard evaluation에서는 novelty가 약간 더 강하고 strict evaluation에서는 evidence가 더 강하다. 이 패턴은 더 강한 수사 전반에 대한 보상이라기보다 merit framing에 대한 선택적 민감도를 반영한다.
  • 4 어떤 수사적 차원이 가장 중요한가?: 차원 간 위계는 human-assessed quality levels 전반에서 지속되며, human rating이 높아질수록 rewrite effect가 일관되게 증가하거나 감소하지는 않는다.Evidence framing, novelty stance, scope framing은 가장 뚜렷한 대비를 유지하며, 각각 120개 manuscript 중 100개를 넘는 경우에서 의도한 순서를 보인다.
  • 4 어떤 수사적 차원이 가장 중요한가?: [1, 3]의 original score에서는 +1.05 OA인 반면 [8, 10]의 score에서는 −0.19라는 결과는 낮은 시작 점수가 상승하고 높은 시작 점수가 하락하는 경향을 보여준다.이러한 이동은 부분적으로 scale bound와 regression to the mean을 반영할 수 있고, 극단값에서는 의도한 rewrite 방향을 압도할 수 있으며 reviewer에 따라 달라진다.

5 더 복잡한 재작성은 신뢰할 수 있는 향상을 가져오는가?

더 정교한 재작성은 AI review 점수를 일관되게 향상시키지 않는다. 향상 폭은 rewriter–reviewer configuration에 좌우되며, 대체로 두 번째 라운드에 집중된 뒤 감소한다. Joint rewriting은 Opus 4.8에 유리하지만, reviewer guidance와 추가 라운드는 일관된 model-agnostic 이점을 제공하지 않는다.

  • Joint rewriting: Joint rewrites는 개별적으로 유리한 objective를 일관되게 능가하지 않는다. Opus 4.8은 six-rewrite mean보다 +0.160 OA 높아지는 반면, GPT-5.5는 그보다 −0.074 낮다.이 cross-batch 비교는 synergy 추정이 아니라 기술적 서술이다.
  • Score dependence: Joint-rewrite 효과는 human-assessed quality보다 starting AI-review score와 더 밀접하게 연동되며, initial score가 [1, 3]인 경우의 +1.42에서 score가 [8, 10]인 경우의 −0.88까지 감소한다.이 기술적 패턴은 부분적으로 scale bounds와 regression to the mean을 반영할 수 있다.
  • Joint rewriting: Opus 4.8의 joint rewriting은 standard evaluation에서 reviewer-averaged OA를 +0.289에서 +0.396으로, strict evaluation에서 +0.463에서 +0.557로 향상시키지만, GPT-5.5는 그렇지 않다.GPT-5.5는 standard evaluation에서 +0.021에서 +0.015로, strict evaluation에서 +0.045에서 +0.032로만 변한다. 전체 증가폭은 +0.204에서 +0.250이며, 이는 Opus 4.8이 주도한다.
  • Guided rewriting: Reviewer guidance는 네 가지 rewriter-prompt average 모두에서 unguided second pass보다 성능이 낮았으며, guided-minus-unguided contrast는 Opus 4.8에서 −0.008부터 −0.067까지, GPT-5.5에서 −0.035부터 −0.042까지 나타났다.각 workflow가 독립적으로 생성된 first-pass rewrite를 사용하므로, 이 비교는 feedback의 인과적 추정이 아니라 기술적 서술이다.
  • Recursive rewriting: Recursive rewriting은 대부분의 추가 향상을 두 번째 라운드까지 만들어내며, Opus 4.8은 standard evaluation에서 +0.410, strict evaluation에서 +0.624에 도달하지만 세 번째 라운드의 추가 효과는 작다.GPT-5.5는 여전히 반응성이 훨씬 낮고, reviewer별 trajectory는 더 이른 단계에서 향상이 정체되거나 반전될 수 있다.

6 Rewriter, Reviewer, Protocol은 Rhetorical Effect를 어떻게 형성하는가?

Rewriter는 주로 rhetorical variant 간 분리를 결정하고, reviewer는 score의 크기와 방향, rubric 연관성을 결정한다. Strict review는 절대적 OA score를 낮추지만 rewrite sensitivity를 일관되게 변화시키지는 않는다.

  • Review protocol: Strict review에서 mean OA는 6.296에서 4.934로 1.36 points 감소하지만, paper ranking은 대체로 안정적으로 유지된다.Strict evaluation에서 95.0%의 paper가 더 낮은 average score를 받고, mean standard–strict Spearman correlation은 .862다.
  • Review protocol: Strict review는 mean rewrite effect를 +.003에서 +.020으로만 변화시키며, rhetorical sensitivity를 일관되게 강화하거나 약화하지 않는다.Paper-level rewrite effect의 mean cross-protocol Spearman correlation은 .081에 불과하고, 방향은 reviewer마다 다르다.
  • Rewriter와 reviewer: Rewriter는 rhetorical separation을 형성하는 반면, reviewer는 score change와 연관된 크기, 부호, rubric dimension을 결정한다.Reviewer는 대체로 positive novelty, evidence, scope variant를 선호하지만, 이러한 변화가 score에 미치는 영향의 강도에는 의견이 엇갈린다.
  • Reviewer heterogeneity: Reviewer는 유사한 OA change를 서로 다른 merit dimension에 대응시킨다. Contribution과 soundness가 presentation보다 대체로 더 중요하며, 연관성은 reviewer별로 다르다.Qwen 3.5 F는 OA change를 주로 contribution과 연결하고, strict Gemini 3.5 FL은 contribution과 soundness를 강조한다. Sonnet 5는 더 약하고 안정성도 낮다.

7 결론

보고된 과학적 내용이 보존되더라도 AI scientific review는 수사적 표현에 체계적으로 민감하다. 이러한 민감성은 하나의 안정적인 평균 효과가 아니라 수사적 차원, rewriting process, model identities, review protocol에 따라 달라진다.

  • 보고된 과학적 내용이 보존되더라도 AI scientific review는 수사적 표현에 체계적으로 반응한다.
  • 수사적 민감성은 차원, rewriting process, rewriter 및 reviewer model, review protocol에 따라 달라진다.
  • 관찰된 변이는 하나의 평균 효과로 환원할 수 없으며, 단일 model configuration의 안정적인 속성으로 취급할 수도 없다.

한계

이 연구의 결론은 ICLR 2026을 넘어 일반화되지 않을 수 있으며, 비슷한 데이터를 가진 분야로도 확장되지 않을 수 있다. 또한 비용이 많이 드는 평가에서 비무작위 결측이 발생했으며, 이는 모델 safeguard를 반영할 수 있다.

  • 벤치마크는 복구 가능한 full-paper source와 공개 review metadata를 갖춘 ICLR 2026 제출물로 제한된다.따라서 결과는 다른 venue나 과학 분야에 일반화되지 않을 수 있다.
  • Full-paper rewriting과 다중 모델 평가는 계산 비용이 높아 연구의 실용적 확장성을 제약한다.
  • 일부 계획된 review에는 유효한 structured record가 없었으며, 이러한 결측은 비무작위일 수 있다. 실패가 model safeguard를 유발하는 주제와 관련된 것으로 보이기 때문이다.

윤리적 고려사항 · 부록 · 관련 연구 상세

이 연구는 공개 자료를 사용하고, 모델 평가 전에 신원을 식별할 수 있는 정보를 제거하며, 집계 결과만 보고한다. 연구 프레임워크는 이중 용도 가능성을 지닌다. 수사적 민감도를 진단할 수 있지만, AI reviewer의 선호에 맞춰 원고를 조정하는 데 악용될 수도 있다.

  • 윤리적 고려사항: 이 연구는 API 제출 전에 원고를 익명화하고, 집계 결과를 보고하며, 통제된 rewriting framework가 AI reviewer에 맞춰 원고를 최적화하는 데 악용될 수 있음을 인정한다.제거된 정보에는 저자명, 소속, 감사의 글, 제출 상태 관련 문구, 신원을 식별할 수 있는 링크가 포함되며, 개별 저자는 평가하지 않는다.

A.1 LLM 기반 평가 … C.6 엄격 프롬프트 인간 OA 범위 분석

관련 연구, 실행 점검, 세부 실험을 종합하면, 이 논문은 AI 리뷰의 판단이 제시 방식과 평가 조건에 따라 달라지는 동시에, 통제된 수사적 재작성은 구조화된 reviewer·rewriter 의존적 효과를 낳는다는 점을 보인다. 또한 review 누락, human score 불일치, secondary score spillover, weak-accept 변화, 논문 품질 범위별 이질성도 분석한다.

  • A.1 LLM 기반 평가; A.2 AI 지원 scientific evaluation: LLM은 rubric 조건부 scoring, pairwise comparison, customized evaluator, manuscript prediction, evidence-linked comment, fluent feedback을 통해 reference-free evaluation과 scientific review를 지원하지만, 판단 품질은 과제와 평가 조건에 따라 달라진다.선행 연구는 human preference와의 상당한 정렬 및 유용한 GPT-4 feedback을 보고하는 한편, review competence와 condition sensitivity를 면밀히 검토할 필요성도 제기한다.
  • A.1 LLM 기반 평가; A.3 Rhetorical rewriting과 presentation effect: Rhetorical rewriting은 LLM evaluation이 candidate order, length, prompt, anchor, familiarity, sampling, model-family identity에 따라 변한다는 선행 증거에 근거하며, 이 연구는 방법과 보고된 결과를 보존한 채 여섯 차원에 걸친 opposing edit를 검증한다.이 설계는 유리한 candidate만 선택하지 않고 lower-scoring rewrite도 유지하므로, 차원별 rating sensitivity 비교가 가능하다.
  • B.1 AI-review 실행; B.2 Review missingness와 잠재적 safeguard trigger: 평가 pipeline은 OCR, browsing, retrieval, reviewer metadata 없이 OpenRouter를 통해 PDF를 제출했으며, 계획된 42,480건의 evaluation 중 42,396 valid structured review를 생성했다.누락된 84건의 evaluation은 missing으로 유지하고, 분석에는 이용 가능한 matched pair를 사용했다. Sonnet 5는 26 JULI evaluation cell에서 반복적으로 실패했으며, 이는 plausibly safety mechanism을 반영한다.
  • B.4 Human overall assessment와의 비교: AI와 human overall assessment의 차이는 prompt에 따라 달라진다. standard-prompt AI rating은 human OA보다 0.418–2.934점 높았고, strict-prompt 차이는 human OA보다 낮은 수준부터 1.676점 높은 수준까지 분포했다.strict prompt에서 GPT-5 mini, GPT-5.5, Sonnet 5의 점수는 인간 OA보다 낮고, Qwen 3.5 F는 거의 일치하며, Gemini 3.5 FL은 여전히 1.676점 높다. paper-level MAE는 1.029점에서 2.934점까지 분포한다.
  • C 개별 rhetorical dimension의 세부 결과; C.1 Overall-rating effect; C.6 Strict-prompt human-OA 범위 분석: 부록은 고정된 reviewer–rewriter pair와 human-OA 범위별로 overall-rating change를 분해하고, original-to-rewrite mean, paired change, confidence interval, strict-prompt 범위별 효과를 유지한다.Pooled 결과는 논문 내 reviewer evaluation을 평균내며, fixed-model 및 strict-prompt 표는 여섯 rhetorical dimension에 걸친 configuration-level heterogeneity를 보존한다.
  • C.1 Overall-rating effect; C.2 Fixed-model directional heterogeneity; C.4 Paper-level directional consistency: Novelty, evidence, scope는 가장 일관된 방향성 효과를 보이는 반면, technical register, contribution structure, lexical complexity는 고정된 reviewer–rewriter pairing에서 효과가 더 작거나 덜 안정적이다.의도한 순서는 novelty, evidence, scope에서 120편 중 100편을 넘는 논문에 대해 성립했으며, lexical complexity는 62 wins, 7 ties, 51 losses로 거의 균형을 이뤘다.
  • C.3 Secondary AI-review score spillover; C.5.1 Panel 및 configuration summary; C.5.2 Full fixed-model rate와 transition count: Rhetorical change는 presentation, contribution, soundness score에도 spillover를 일으키며, methods와 reported value가 고정되어 있으므로 이를 reviewer-response change로 간주한다.Secondary-score 분석은 두 rewrite model과 다섯 reviewer model을 모두 pooling하며, weak-accept 분석은 configuration-level 및 panel-aligned probability change와 함께 upward 및 downward cutoff crossing을 보고한다.

C.7 AI 원점수 구간 분석 … C.7.5 평점 척도 전반의 상세 보조 점수 프로필

분석은 reviewer와 매칭된 AI 원점수 구간별로 overall rating 변화를 층화한 뒤, 통합·경계 중심·reviewer별·보조 점수 프로필을 제시한다. 이러한 기술적 분해는 평가 조건의 세부사항을 보존하면서, 극단 구간의 변화가 rhetorical steering이 아니라 척도 상한·하한, 평균으로의 회귀, 희소한 셀을 반영할 수 있음을 함께 주의한다.

  • C.7 AI 원점수 구간 분석: Strict-prompt 구간 표는 네 AI 원점수 구간에 걸쳐 고정된 rewriter–reviewer 행을 유지하며, 각 행 안에서 여섯 rhetorical dimension의 평균만 제시한다.구간은 [1, 3], [4, 5], [6, 7], [8, 10]이며, prompt와 reviewer에 매칭된 원래 overall rating을 사용해 할당한다.
  • C.7 AI 원점수 구간 분석: AI 원점수 구간은 기술적 rewrite 반응을 정리하지만, 극단 구간의 변화는 제한된 척도 효과, 평균으로의 회귀, 희소한 고정 조건 셀을 반영할 수 있다.구간은 각 prompt–reviewer 조합별로 별도 할당되므로, 같은 논문이 서로 다른 열에 나타날 수 있다. 따라서 이 프로필은 quality moderation의 불편추정량이 아니다.
  • C.7.1 본문 표시를 위한 Panel-Aligned Values: Panel-aligned 표시에서는 각 paper, protocol, rhetorical condition, original-score range 내에서 reviewer-model 변화량을 평균내되 두 rewrite model을 별도로 유지한다.Table 23은 rating 변화량을, Table 24는 percentage point 단위의 weak-accept probability 변화량을 보고하며, paper 내 다섯 reviewer의 값을 모두 평균낸다.
  • C.7.2 통합 Overall-Rating 추론: 통합 추론은 모든 점수 구간·dimension·방향·protocol에 걸쳐 원래 평균, rewrite 평균, 부호 있는 변화, 절댓값 기준 변화량, paper-bootstrap interval을 요약한다.두 rewrite model과 다섯 reviewer model은 paper 안에서 평균한다.
  • C.7.3 결정 경계 부근의 통합 Rating-6 Transition: 경계 분석은 [4,5]와 [6,7]에서만 rating-6 transition을 집계한다. 이 구간에서는 transition이 상승 또는 하락 방향으로 일어날 수 있으며, 희소한 극단 구간 분해는 제외한다.극단 구간의 panel 값은 계속 제공하지만, transition의 완전한 집계별 분해는 보고하지 않는다.
  • C.7.4 전체 Reviewer-Model 분해: 전체 reviewer-model 분해는 rewrite model과 reviewer model을 모두 고정하고, 변화와 함께 원래 값과 rewrite 값을 보고해 reviewer별 baseline을 가시적으로 유지한다.이 분해는 통합 요약과 경계 요약을 따른다. primary score-range 결과를 대체하지 않는다.
  • C.7.5 평점 척도 전반의 상세 보조 점수 프로필: 보조 진단은 overall-rating 구간별로 presentation·contribution·soundness 응답을 결합하지만, 구간은 각 보조 점수가 아니라 원래 overall rating을 기준으로 정의한다.Table 29는 두 rewrite model과 다섯 reviewer model을 모두 통합하므로, 이 프로필은 보완적 진단에 해당한다.

D 다단계 수사적 재작성의 상세 결과 … E.1 다섯 Reviewer 비교

부록에서는 joint, reviewer-guided, recursive workflow에 걸친 다단계 수사적 재작성을 자세히 설명한 뒤, 다섯 reviewer의 응답 분포, 점수 변화, reviewer 간 일관성을 비교한다.

  • D 다단계 수사적 재작성의 상세 결과: 부록에서는 joint rewriting, recursive reapplication, reviewer-guided 비교를 구분하며, 중간 review가 없는 독립 생성 no-review endpoint도 포함한다. 이는 matched causal treatment가 아니다.no-review reference는 중간 review가 없는 별도의 two-pass endpoint다.
  • D.1 Reviewer Model별 Joint Rewrite: Joint-rewrite 분석에서는 rewriter, review prompt, reviewer를 고정하고, 여섯 개 single-dimension rewrite와의 비교는 descriptive cross-batch differences로 다룬다.Table 30은 matched-endpoint effect와 여섯 개 positive single-dimension rewrite의 paper-matched mean을 보고한다.
  • D.2 Reviewer Model별 최종 Reviewer-Guided Endpoint: Reviewer-guided endpoint 분석에서는 original 및 Final level, paired change, threshold shift, 그리고 독립 생성된 no-review two-pass endpoint와의 descriptive contrast를 보고한다.부록에서는 standard 및 strict review 아래의 reviewer, prompt, rewriter 조합 20개를 모두 다룬다.
  • D.3 전체 Recursive Joint-Rewrite Trajectory: Recursive joint-rewrite 분석에서는 standard 및 strict review 아래에서 연속적인 successive rounds에 걸친 reviewer-pooled overall-rating 및 weak-accept-probability trajectory를 추적한다.Reviewer별 decomposition에서는 각 round에 대해 matched original에서의 누적 변화를 보고한다.
  • E Reviewer 및 Secondary-Score 상세 결과: Reviewer 분석에서는 전체 prompt-level calibration 비교를 유지하면서 reviewer differences와 reviewer 간 일관성에 추가 결과를 집중한다.이 분석은 Section 6의 reviewer 및 secondary-score 결과를 확장한다.
  • E.1 다섯 Reviewer 비교: 다섯 reviewers에 걸쳐 Figure 4는 전체 response distribution을 제시하고, Table 37은 rewriting-induced OA change의 정확한 mean과 열 개 pairwise rank correlation의 range를 보고한다.비교한 reviewer는 Gemini 3.5 FL, Qwen 3.5 F, GPT-5 mini, GPT-5.5, Sonnet 5다.

E.2 보조 점수 연관성과 리뷰어 간 일관성

보조 점수의 변화는 리뷰어와 프롬프트에 따라 ΔOA와 서로 다른 연관성을 보였으며, 리뷰어들은 rewriting의 영향을 가장 크게 받은 논문이 무엇인지에 대해 약한 일치를 보였다. 레코드 수준의 논문 내 상관에서는 soundness와 contribution이 presentation보다 더 강한 동시 변화를 유지했다.

  • 보조 점수 연관성: ΔOA와 보조 점수의 연관성은 리뷰어와 프롬프트에 따라 달랐으며, GPT-5.5에서 contribution의 ρΔOA=.635, Strict Gemini 3.5 FL에서 soundness의 ρΔOA=.587을 포함했다.paper-first 추정치는 각 논문 내 12개의 단일 차원 rewriting을 평균하고 paper-bootstrap 구간을 사용한다.
  • 리뷰어 간 일관성: 리뷰어 간 일치는 OA와 세 가지 보조 점수 모두에서 약했으며, 리뷰어들이 부호가 같은 aggregate change를 산출한 경우에도 그러했다.Table 39는 리뷰어 간 논문 수준 평균 rewrite response의 pairwise Spearman correlation을 사용해 일치를 측정한다.
  • 레코드 수준 분석: 각 논문의 평균 response를 제거한 뒤, 상관은 soundness에서 .210 to .691, presentation에서 .020 to .239, contribution에서 .171 to .841의 범위였다.이 범위는 20개의 rewriter, reviewer, prompt 조합을 포괄한다.

F 반복 검토 샘플링에서의 안정성 · G 완전 재작성 및 검토 프롬프트 템플릿

부록은 단일 검토 추정치가 3회 검토 평균과 밀접하게 일치함을 보여 주어 기본 프로토콜을 뒷받침하고, 방향성·전체 논문·공동·검토자 유도 재작성을 위한 content-preserving 프롬프트를 명시한다. 이 템플릿들은 원고의 과학적 내용, 근거, 보호된 기술적 구조를 유지하면서 수사적 표현을 체계적으로 바꾼다.

  • F 반복 검토 샘플링에서의 안정성: 단일 검토 추정치는 12개 baseline-paired 효과에서 3회 검토 평균과 밀접하게 일치했으며, Pearson r = 0.995, Spearman ρ = 0.993, 평균 절대 차이는 0.040 points였다.보조 감사에서는 6개 positive-versus-negative 대조에서 Pearson r = 0.996, Spearman ρ = 0.943을 확인했으므로, 본 분석에서는 각 cell마다 지정된 검토 1회를 사용했다.
  • G 완전 재작성 및 검토 프롬프트 템플릿: 검토 프롬프트는 각 PDF에 함께 제공된 complete evaluation 및 structured-output 지침을 그대로 보존하며, 고급 템플릿은 여러 라운드에 걸쳐 결합된 6차원 프롬프트를 재사용한다.고급 workflow 템플릿에서 달라지는 것은 reviewer-guided 최종 재작성뿐이다.
  • G.1 방향별 재작성 프롬프트: 방향별 프롬프트는 논문의 기저 내용과 과학적 정확성을 유지하면서 한 번에 하나의 수사적 차원만 변경한다.차원에는 claim 및 novelty stance, scope 및 generalization, quantitative evidence framing, contribution salience, technical register, lexical 및 syntactic complexity가 포함된다.
  • G.1 방향별 재작성 프롬프트: 긍정 및 부정 지침은 수사적 framing을 서로 반대로 바꾼다. 예를 들어 단정적 주장과 신중한 주장, 더 넓은 scope와 제한된 scope를 대비시키되, dataset, task, method, 보고된 결과는 변경하지 않는다.Quantitative-evidence 프롬프트는 기저의 수치적 사실과 비교를 보존하도록 요구하며, technical-register 및 complexity 프롬프트도 기술적 내용과 의미를 유지한다.
  • G.2 공통 전체 논문 재작성 요구사항: 공통 요구사항은 caption과 결과 서술을 포함한 모든 주요 section을 문단별로 재작성하도록 하며, 새로운 실험, data, baseline, 수치 또는 근거 없는 결론의 추가를 금지한다.보호된 LaTeX command, displayed mathematics, code, algorithm, bibliography file, graphics path, URL, label, filename은 유효한 상태로 유지되어야 한다.
  • G.3 공동 및 검토자 유도 재작성 프롬프트: 공동 재작성은 원 논문에 하나의 조정된 6차원 editorial profile을 적용하고, recursive 재작성은 직전 source에 변경되지 않은 지침을 다시 적용한다.공동 profile은 더 강하게 뒷받침된 주장, 정당화된 더 넓은 scope, 더 명확한 evidence, 더 두드러진 contribution, 더 높은 technical formality, 정교한 표현을 결합한다.
  • G.3 공동 및 검토자 유도 재작성 프롬프트: 모든 재작성 변형은 confidence, breadth, empirical emphasis가 기존 근거에 grounded in existing evidence 상태로 남도록 요구하며, 근거 없는 확신, domain, capability 또는 generalization 주장을 도입하지 않는다.프롬프트는 주장을 실질적으로 규정하는 qualification을 명시적으로 보존하고, 동일한 method, dataset, task, assumption, evaluation setting 및 입증된 capability를 유지한다.
Loading 2608.08975v1…