Source-linked AI summary

Do Thinking Tokens Help with Safety?

Narutatsu Ri, Abhishek Panigrahi, Sanjeev Arora

arXiv:2606.25013v1cs.LGcs.AIcs.CL

TL;DR

추론 모델에서 extended thinking이 안전성을 향상하는지는 여전히 불분명하다. 이 논문은 frontier open-weight 모델 전반에서 refusal/compliance 결정이 언제 형성되는지 조사하고, 안전성 결과가 visible thinking 이전에 대부분 인코딩되며 초기 궤적이 이후 거의 바뀌지 않음을 보인다.

  • 문제

    유해한 compliance를 줄이면서 불필요한 refusal을 늘리지 않아 safety–helpfulness trade-off를 개선하는지 여부는 여전히 불분명하다.

  • 방법

    이 논문은 네 open-weight model family에 걸쳐 hidden-state predictability, truncated thinking prefix, sentence-level stance change, 기존 inference-time 및 training-based safety intervention을 분석한다.

  • 결과

    첫 token probe는 0.84–0.95 AUROC와 최대 88% balanced accuracy를 달성하지만, 이후 thinking은 refusal/compliance trajectory를 거의 바꾸지 않으며 defense는 over-refusal을 증가시키는 경우가 많다.

  • 시사점 및 한계

    현재 reasoning model은 safety deliberation에 thinking을 약하게만 사용하므로, thinking trace가 실제로 safety decision에 영향을 미치게 하는 방법이 필요하다.

  • 시사점 및 한계

    이 연구는 moderate-sized open-weight model과 유해 및 무해 prompt에서의 refusal/compliance만 다루며, 더 넓은 safety dimension은 다루지 않는다.

Abstract

from arXiv · show

Today's reasoning models use thinking tokens to attain stronger performance on benchmarks than their instruction-tuned counterparts. It is also generally believed that this more "deliberative" mode should improve alignment and safety, by providing the model a safe space to consider whether its planned answer to a request violates its safety principles. We present evidence that this intuition is not always correct. Across frontier open-weight reasoning models spanning GPT-OSS, Qwen, Olmo, and Phi families, we find that the eventual refusal/compliance outcome is already strongly predictable via a trained head on the first token's hidden representation ($0.84$-$0.95$ AUROC and $\sim88\%$ balanced accuracy for predicting refusal/compliance) before any visible thinking. The thinking process turns out to be more akin to prefix completion than to deliberative revision, with the final outcome rarely changing after the first $\sim20\%$ of thinking, despite giving the appearance of deliberation at the text level ($\sim74\%$ of text-level deliberations occur when the response distribution is already locked to one refusal/compliance side). We also find that existing inference-time and training-based safety interventions, despite being motivated by the goal of inducing deliberation, largely shift model behavior toward over-refusal while suppressing already-scarce deliberation signals. Our results suggest that safety behavior in current reasoning models is much less deliberative than commonly assumed, and highlight the need for methods that induce real safety deliberation.

1 서론

서론은 reasoning trace가 대규모 reasoning model의 safety decision을 실제로 개선하는지 질문한다. 논문은 safety outcome이 초기에 대부분 결정되고 thinking은 deliberation에 거의 기여하지 않으며, 기존 defense가 ASR–ORR tradeoff를 악화시키는 경우가 많다는 근거를 제시한다.

  • 동기: Safety를 위해서는 harmful prompt에서 Attack Success Rate (ASR)와 benign prompt에서 Over-Refusal Rate (ORR)를 함께 최소화해야 하므로, 핵심적인 evaluation tension이 발생한다.안전하고 유용한 model은 ASR과 ORR을 동시에 낮게 유지해야 한다.
  • 기여: 네 개의 frontier open-weight model에서 linear probe는 visible thinking이 시작되기 전에 첫 thinking-trace token으로부터 최종적인 refusal 또는 compliance를 decode한다.이 결과는 safety behavior가 reasoning trace가 시사하는 것보다 덜 deliberative할 수 있다는 논문의 주장을 뒷받침한다.
  • 기여: 짧은 thinking prefix가 고정되면 이후 continuation은 대체로 초기 refusal 또는 compliance trajectory를 유지하며, 이는 thinking이 개선된 safety decision에 거의 기여하지 않음을 보여준다.Text는 sentence level에서 safety deliberation처럼 보일 수 있지만, 논문은 이러한 외양이 의미 있는 decision revision을 뜻하지 않는다고 밝혔다.
  • 기여: 기존 inference-time defense는 영향이 제한적이거나 ASR을 낮추는 대신 ORR을 높이며, 이미 약한 safety-deliberation signal도 억제한다.논문은 safety behavior와 deliberation에 미치는 영향을 조사하기 위해 inference-time defense와 training-based defense를 모두 평가한다.

2 추론 모델의 안전 행동

Qwen3, Olmo-3, Phi-4, GPT-OSS 추론 모델 전반에서 refusal/compliance는 가시적 thinking이 시작되기 전에 강하게 인코딩된다. 이 신호는 prompt 처리 후반에 나타나며 첫 thinking token에 계승된다.

  • 평가: 평가는 harmful 및 benign prompt pool을 사용해 Qwen3-8B, Olmo-3-7B-Think, Phi-4-Reasoning, GPT-OSS-20B를 포괄한다.harmful suite에서는 표준 benchmark가 연구 대상 모델에서 거의 포화 상태이므로 더 어려운 benchmark를 중점적으로 다룬다.
  • 첫 Token Representation에서 Refusal/Compliance는 강하게 Decodable하다: 0.840–0.948 AUROC와 0.763–0.878 BAcc는 첫 token의 hidden state가 모델 전반에서 최종 refusal/compliance outcome을 강하게 예측함을 보여준다.Table 1은 첫 thinking-token representation으로부터의 linear separability와 정확한 binary prediction을 보고한다.
  • 첫 Token Representation에서 Refusal/Compliance는 강하게 Decodable하다: Fisher discriminant는 추론 모델 전반에서 첫 thinking position에서 가장 높고, trace를 따라 하락한 뒤 trace 끝부분에서 상승한다.이 U자형 패턴은 가시적 thinking token이 생성되기 전에 refusal/compliance representation이 이미 뚜렷함을 나타낸다.
  • Readout Signal은 Prefill 끝에서 급증한다: Readout은 대부분의 prefill 구간에서 약하게 유지되지만 모델 전반에서 input 끝부분에 급증하며, 가시적 thinking에 계승되는 late-prefill consolidation을 나타낸다.이 효과는 Fisher discriminant에서 가장 강하며, AUROC와 BAcc도 최종 급증 직전에 소폭 상승한다.

3 사고의 효용

사고는 초기 prefix 이후 안전성 결과를 거의 바꾸지 않으며, 사고를 활성화해도 ASR–ORR tradeoff가 일관되게 개선되지는 않는다. 문장 수준 분석은 표면적인 입장 변화의 대부분이 결정을 바꾸기보다 수행적임을 추가로 보여준다.

  • Prefix completion: 모든 모델에서 자연 trace의 20% 시점에 continuation variance가 이미 0.2 미만이며, prefix가 길어질수록 감소한다.따라서 independent continuation은 대체로 짧은 prefix가 정한 decision을 유지하며, 이후 사고가 그 decision에서 벗어나게 하는 경우는 드물다.
  • 사고와 효용: 사고를 사용해도 70–97%의 prompt가 동일한 label을 유지하며, ASR–ORR tradeoff의 양쪽을 일관되게 개선하는 모델은 없다.Qwen3-8B, Olmo-3-7B-Think, Phi-4-Reasoning은 과잉 순응하는 경향을 보이는 반면, GPT-OSS-20B는 반대의 tradeoff를 보인다.
  • 강건성 점검: test-time compute를 추가로 강제해도 이러한 행동은 바뀌지 않으며, 사고의 유익성을 더 허용적으로 판정하는 기준에서도 같은 결론이 성립한다.분석에서는 independent trace를 샘플링하고, refusal-leaning, neutral, compliance-leaning 문장 label을 사용해 입장 oscillation을 평가한다.
  • 문장 수준의 deliberation: rollout의 15–34%에 oscillation이 포함되지만, 이러한 변화의 71–92%는 수행적이며 72.8–76.6%는 결과가 이미 고정된 뒤에 발생한다.이전 refusal probability가 ≤0.05 또는 ≥0.95이면 oscillation을 locked로 분류하며, 최종 response distribution을 유의하게 이동시킬 때만 meaningful한 것으로 본다.

4 기존 방어 기법은 무엇을 하는가?

기존 inference-time 및 training-based 방어 기법은 일반적으로 ASR–ORR tradeoff를 개선하기보다 모델을 over-refusal 쪽으로 이동시킨다. 또한 더 deliberative한 reasoning을 유도하지 못하고, safety deliberation과 연관된 oscillation과 early signal을 억제하는 경우가 많다.

  • Inference-time 방어 기법: Inference-time 방어 기법은 nonperformative safety deliberation을 늘리기보다 sentence-level oscillation을 줄인다.24개 inference cell 중 22개에서 방어 기법이 oscillation을 줄였으며, 두 oscillation measure 모두에서 감소폭은 Phi-4-Reasoning의 경우 95%에 달했고 Olmo-3-7B-Think의 경우 60%를 넘었다.
  • 전체 결과: Inference-time 및 training-based 방어 기법은 harmful compliance와 benign refusal을 모두 개선하기보다 일반적으로 ASR–ORR tradeoff를 이동시킨다.ThinkSafe는 Qwen3-8B의 ASR을 86.9에서 30.9로 낮추는 동시에 ORR을 6.0에서 44.6으로 높였으며, RAPO는 Olmo-3-7B-Think에서 유사한 tradeoff를 보인다.
  • Training-based 방어 기법: Training-based 방어 기법 역시 on-policy trace를 사용하는지 off-policy trace를 사용하는지와 무관하게 reasoning trace를 더 deliberative하게 만들지 못한다.On-policy ThinkSafe와 STAIR는 first-token readability를 유지하면서 meaningful 및 performative oscillation을 줄였고, off-policy STAR-1과 SafeKey는 meaningful oscillation을 대체로 유지하면서 early refusal/compliance signal을 0.11 AUROC만큼 억제했다.

5 논의

논의에서는 현재 reasoning language model이 진정한 safety deliberation을 위해 thinking을 사용하는 경우가 드물다고 주장한다. refusal/compliance는 처음부터 인코딩되는 경우가 많으며, 기존 방어 기법도 deliberation을 안정적으로 유도하지 못할 수 있다. 또한 이 결과를 얕은 safety alignment와 chain-of-thought faithfulness에 관한 선행 연구의 맥락에 배치하면서, 모델 규모의 한계와 아직 해결되지 않은 training 관련 질문을 지적한다.

  • 논의: 현재 LRM은 safety deliberation을 위해 thinking을 효과적으로 사용하지 않는다. 첫 번째 thinking token이 이미 refusal/compliance를 강하게 인코딩하며, 이후 thinking의 영향은 제한적이기 때문이다.저자들은 thinking이 safety decision을 일관되게 개선하지도 않는다는 사실을 확인했다.
  • 관련 연구: 이 연구는 instruction-tuned model에서 관찰된 얕은 safety alignment의 증거를 reasoning model로 확장해, thinking 초기에 refusal/compliance를 강하게 decodable하게 판별할 수 있음을 보인다 [Qi et al., 2025, Liu et al., 2026, Zhao et al., 2025c, Yin et al., 2025].선행 연구에서는 refusal behavior가 소수의 초기 token에 의존할 수 있으며 단순한 prefix manipulation에도 여전히 취약하다는 사실이 밝혀졌다.
  • 한계: 이 연구는 중간 규모의 open-weight LRM으로 제한되므로, 상당히 더 큰 reasoning model도 유사하게 작동하는지는 불확실하다.선행 연구는 규모만으로 safety failure를 해결하거나 adversarial pressure 하에서 refusal robustness를 보장하지 못할 수 있음을 시사한다.
  • 향후 연구: 향후 연구에서는 초기 refusal/compliance signal이 pretraining, instruction tuning, post-training 중 어느 단계에서 발생하는지 규명하고, 진정한 safety deliberation을 유도하는 방법을 찾아야 한다.저자들은 gold-trace supervision, harmful data와 benign data의 혼합, 또는 final label에 대한 최적화만으로는 충분하지 않을 수 있다고 지적한다.

더 넓은 영향과 윤리 성명 · A 관련 연구 · B 보충 세부사항

이 논문은 유해 요청과 무해한 요청을 구분하는 안전 능력을 향상할 가능성이 있는 연구 결과를 제시하는 한편, 초기 안전 부호화와 거부 편향 방어가 더 강력한 jailbreak를 가능하게 할 수 있음을 경고한다. 관련 연구는 이 분석을 reasoning 기반 alignment, 얕은 안전 메커니즘, jailbreak 견고성, mechanistic 연구, chain-of-thought faithfulness와 연결한다.

  • 더 넓은 영향과 윤리 성명: 연구 결과는 모델이 유해 요청과 무해한 요청을 구분하는 데 도움을 줄 수 있지만, 초기 안전 부호화와 거부 편향 방어를 노출함으로써 jailbreak를 가능하게 할 수도 있다.저자들은 집계된 경험적 측정에 초점을 맞추어 이러한 위험을 완화한다.
  • A 관련 연구: Reasoning trace는 어려운 과제의 성능을 향상하며, inference-time deliberation이 alignment와 safety도 향상할 수 있다는 가설을 뒷받침한다 [Wei et al., 2022, Kojima et al., 2022, Zhou et al., 2023, Shao et al., 2024, DeepSeek-AI, 2025].이 연구는 이러한 더 넓은 safety 가설이 대규모 reasoning model에서도 성립하는지 검토한다.
  • A 관련 연구: Jailbreak 연구는 정교하게 설계된 prompting 전략이 safety alignment를 우회할 수 있음을 보여주며, 견고한 safety deliberation을 밀접한 관련 과제로 만든다.이 논문은 jailbreak 공격을 직접 연구하지 않는다.
  • A 관련 연구: 선행 연구는 safety alignment가 얕을 수 있음을 시사한다. 거부는 소수의 초기 token에 좌우될 수 있고 prefix 조작으로 우회될 수 있으며, 약한 alignment는 더 강력한 model에 대한 jailbreak를 촉진할 수 있다 [Qi et al., 2025; Zhao et al., 2025c].Liu et al. [2026]도 adversarial steering이 safety behavior에 영향을 줄 수 있음을 보였다고 인용된다.
  • A 관련 연구: Mechanistic chain-of-thought 연구는 reasoning trace가 최종 응답과 어떻게 연결되는지 검토하며, 더 쉬운 문제의 답은 reasoning이 끝나기 전에 decoded될 수 있다는 증거도 제시한다 [Baker et al., 2025, Korbak et al., 2025, Emmons et al., 2025].논의에서는 Boppana et al. [2026]과 Cox et al. [2026]을 특히 관련성이 높은 연구로 식별한다.
  • A 관련 연구: Chain-of-thought faithfulness 연구는 생성된 trace가 최종 답을 산출하는 내부 계산을 반드시 반영하지는 않음을 보여준다 [Turpin et al., 2023, Lanham et al., 2023, Arcuschin et al., 2025, Boppana et al., 2026].이 논문은 이러한 우려를 기저의 decision process를 반영하지 않을 수 있는 겉보기에 deliberative한 구간과 연결한다.

B.1 평가 · B.2 추론 시점 방어

평가는 표준화된 생성 및 라벨링 절차를 사용해 전용 벤치마크 세트에서 유해 요청 거부와 무해 프롬프트 과잉 거부를 구분한다. 추론 시점 방어는 safety priming, chunk-level reflection 및 backtracking, 또는 entropy-triggered reminder를 통해 thinking 중 개입한다.

  • B.1 평가: Safety 평가는 유해 프롬프트에 WildJailbreak와 FORTRESS를, 무해 프롬프트에 5개의 전용 벤치마크를 사용해 유해 요청 거부와 무해 프롬프트 과잉 거부를 구분한다.WildJailbreak에는 직접적인 유해 요청, jailbreak 스타일 프롬프트, 대조적 무해 프롬프트가 포함되며, FORTRESS는 고위험 요청을 다룬다. 무해성 평가는 OR-Bench-Hard, FalseReject, CoCoNot, PHTest, ORFuzzSet을 사용한다.
  • B.1 평가: ASR은 모델이 준수할 때 유해 프롬프트를 성공으로 집계하는 반면, ORR은 모델이 거부할 때 무해 프롬프트를 과잉 거부로 집계한다.데이터셋에서 제공하는 reference response는 라벨링에 사용하지 않는다.
  • B.1 평가: 평가는 vLLM BF16에서 각 모델이 권장하는 sampling 기본값을 사용하며, ASR과 ORR split 모두에서 thinking trace를 16,384 tokens로 제한한다.정확한 decoding parameter는 Table 5에 제시하며, 평가 데이터셋은 Table 4에 요약한다.
  • B.1 평가: First-token probe feature는 trace-normalized Fisher discriminant를 계산하기 전에 각 position에서 pooled refusal/compliance sample 전체에 대해 좌표별로 표준화한다.이는 전체 within-class covariance가 아니라 전체 within-class variance에 의한 discriminant의 normalization을 반영한다.
  • B.1 평가: Visible thinking trace는 GPT-5.4, Gemini 3 Pro, Sonnet 4.6에서 문장 수준의 stance를 compliance-leaning, refusal-leaning, neutral로 주석화한다.주석화 template은 모델 전반에서 stance가 어떻게 변화하는지 분석하며, 주석화 평가는 §C.3에 별도로 기술한다.
  • B.2 추론 시점 방어: SafePath ZS 는 parameter update 없이 열린 thinking block 앞에 “Let’s think about safety first.”를 붙이며, 공통 thinking-budget과 force-close 절차를 유지한다.Prompt 측 개입은 최대 context length 24,576 tokens를 사용하며, GPT-OSS-20B에서는 16,384를 사용한다.

B.3 학습 기반 방어

이 연구는 세 reasoning-model family와 두 parameter scale에 걸친 네 reasoning model을 대상으로, LoRA 기반 및 full-parameter recipe를 모두 사용해 여러 safety defense를 학습한다. 평가 방법에는 supervised fine-tuning, auxiliary safety objective, curriculum preference learning, distillation, controlled safety-reasoning optimization이 포함된다.

  • 학습 설정: 학습 대상은 세 reasoning-model family와 두 parameter scale에 걸친 Qwen3-8B, Olmo-3-7B-Think, Phi-4-Reasoning (14B), GPT-OSS-20B다.실행은 NVIDIA H100-80GB GPU에서 bfloat16으로 수행되며, 소형 모델에는 GPU 한 대에서 다섯 대가 사용되고 GPT-OSS-20B에는 DeepSpeed ZeRO-3가 사용된다.
  • 방어 방법: 방어 suite는 full-parameter SFT 방법인 STAR-1과 SafeKey, 그리고 LoRA-based R1-ACT, STAIR, ThinkSafe recipe를 결합한다.STAR-1은 safety-reasoning trace로 학습하고, SafeKey는 key-sentence annotation과 auxiliary head를 추가한다. R1-ACT는 early-refusal trace를 사용하고, STAIR는 MCTS-driven preference learning을 추가하며, ThinkSafe는 forward-KL distillation을 사용한다.
  • 방어 방법: RAPO는 controlled safety-reasoning prefix를 먼저 유도한 뒤 risk-aware reward를 최적화하는 2단계 SFT→GRPO pipeline을 사용한다.SFT data는 400개의 STAR-1 benign prompt와 400개의 Strata-Sword prompt를 결합하며, two-pass prompting procedure를 사용한다.
  • 구현 조정: Phi-4-Reasoning과 GPT-OSS-20B는 channel 또는 think-delimiter 동작이 Qwen3의 ChatML structure와 다르기 때문에 RAPO에 target-specific infrastructure changes가 필요하다.Phi-4-Reasoning에서는 maximum budget에서 thinking block을 강제로 닫고, GPT-OSS-20B에서는 analysis channel을 safety-reasoning trace에 매핑한 뒤 그곳에 prefix를 주입한다.
  • 평가: Table 6은 각 benchmark에 대한 base-model attack-success and over-refusal rates를 보고하며, 두 metric 모두 낮을수록 바람직하다.값은 fractional four-guardrail vote 하에서 네 차례 rollout의 평균이며, benchmark prompt에 대한 95% bootstrap confidence interval을 함께 제시한다.

C 보충 결과 · C.1 ASR/ORR 평가 · C.2 Fisher 판별

보충 평가에서는 표준화된 four-rollout 설정에서 benchmark별 ASR/ORR 결과를 보고하고, 추가 thinking model 5개가 primary model에서 관찰된 Fisher-discriminant valley signature를 재현함을 보인다. 보충 model들은 parameter scaling과 RLVR post-training이 safety decision을 visible thinking trace 안으로 명확히 이동시키지 않음을 추가로 시사한다.

  • C.1 ASR/ORR 평가: Table 6은 널리 사용되는 benchmark에서 4개 primary model의 전체 benchmark별 ASR 및 ORR 결과를 보고한다.각 prompt는 각 model의 default sampling setting과 논문의 evaluation setting에서 M = 4개의 independent rollout을 받는다.
  • C.1 ASR/ORR 평가: WildJailbreak와 FORTRESS는 4개 primary model 모두에서 명확히 분리되는 ASR 값을 산출하며, 그 범위는 12–97%다.이는 본문에서 사용한 주요 ASR benchmark다.
  • C.2 Fisher 판별: Fisher-discriminant analysis는 Qwen3-32B, Qwen3.5-9B, Phi-4-Reasoning-Plus, 그리고 2개의 DeepSeek-R1 distilled model을 포함한 추가 thinking model을 다룬다.2개의 DeepSeek-R1 distilled model은 DeepSeek-R1-Distill-Llama-8B와 DeepSeek-R1-0528-Qwen3-8B [DeepSeek-AI, 2025]로 식별된다.
  • C.2 Fisher 판별: Qwen3.5-9B는 successive Qwen release 전반에서 효과가 지속되는지를 검증하고, Phi-4-Reasoning-Plus는 RLVR-trained successor인 Phi-4-Reasoning을 검증한다.보충 model set에는 evaluation setup에서 설명한 2개의 DeepSeek-R1 distilled open-weight model도 포함된다.
  • C.2 Fisher 판별: 5개의 보충 model은 primary model의 Fisher-discriminant 결과에서 관찰된 valley signature를 재현한다.이는 관찰된 pattern을 primary model set 너머로 확장한다.
  • C.2 Fisher 판별: Qwen3-32B는 Qwen3 family 내에서 parameter를 4× scale-up한 뒤에도 효과를 유지한다.Qwen3-32B는 32B-parameter variant이며, primary Qwen3-8B model과 동일한 thinking-mode chat template을 사용한다.
  • C.2 Fisher 판별: Phi-4-Reasoning-Plus는 Phi-4-Reasoning과 동일한 first-token 및 last-token concentration을 보이며, mid-trace separability가 급격히 감소한다.이 결과는 RLVR post-training이 safety decision을 visible thinking trace 안으로 효과적으로 이동시키지 못할 수 있음을 시사한다.

C.3 사고의 효과

추가 분석 결과, 더 관대한 no-think-to-think 측정치도 주요 결론을 뒷받침하며, 사고를 연장할 때의 safety 이득은 미약하고 모델에 따라 달라진다. 그럼에도 thinking-trace annotation에서는 감사자 간 상당한 일치도가 나타난다.

  • 더 관대한 No-Think-to-Think Change Measure: 두 관대한 change measure 모두 다수 레이블 flip 분석을 대체로 뒷받침하며, Phi-4-Reasoning은 경미한 예외다.이 측정치들은 원하는 방향으로의 영이 아닌 모든 변화량을 집계하고, 부호 있는 변화량의 평균과 표준편차를 보고한다.
  • Extended Thinking과 ASR/ORR: 사고를 더 많이 하면 약하고 모델 의존적인 ASR–ORR 이득이 나타난다. GPT-OSS-20B는 ORR 상승을 대가로 ASR이 개선되지만, 다른 모델들은 점점 더 compliance하는 경향을 보인다.자연스러운 종료 지점을 넘어 사고를 강제해도 behavior는 의미 있게 달라지지 않는다.
  • Thinking Trace Annotator의 Inter-Annotator Agreement (IAA): Annotator 간 일치도는 상당한 수준이다. Fleiss’ κ는 0.636 ± 0.031, three-way concordance는 64.4%이며, 완전한 불일치는 segment의 1.3%에서만 발생한다.일치도는 base trace와 defense trace 간, 그리고 네 base model 전체에서 안정적으로 유지된다.
  • Thinking Trace Annotator의 Inter-Annotator Agreement (IAA): Sonnet 4.6은 세 번째 annotator로 충분하며, Opus 4.7과 일치도가 비슷한 동시에 거부하는 trace는 더 적다.Sonnet은 trace의 4.6%를 거부하는 반면 Opus는 9.4%를 거부하며, mean pairwise κ는 각각 0.646과 0.663이다.

C.4 Thinking Trace 효과의 split별 분석

Figure 10은 harmful ASR 및 benign ORR prompt에 대해 rollout별 oscillation과 segment별 Locked × Significant 결과를 구분해 제시하고, Figure 11은 ASR–ORR tradeoff를 통해 defense를 비교한다.

  • 프롬프트 풀별 분석: Figure 10은 유해한 ASR 및 무해한 ORR 프롬프트에 대해 rollout별 진동률과 segment별 Locked × Significant 분해를 각각 보고한다.각 모델에서 유해한 프롬프트는 왼쪽 그룹에, 무해한 프롬프트는 오른쪽 그룹에 나타난다. 개요 막대는 최소 하나의 진동을 포함하는 M=4 rollout의 비율을 보여준다.
  • Defense tradeoff: 대부분의 defense는 성능을 bottom-left Pareto region 쪽으로 이동시키기보다 base model의 ASR–ORR tradeoff를 따라 이동한다.Figure 11은 모든 base-model–defense pairing을 표시하며, dashed line은 각 base model의 defense-specific Pareto frontier를 추적한다.

C.5 방어 평가

네 개의 base model에 아홉 가지 방어를 적용한 결과, ASR과 ORR 모두에서 base model보다 개선되는 방어 적용 조합은 없다. ASR이 낮아지면 일관되게 ORR이 높아지며, 일부 방어는 반대 방향으로 tradeoff를 만들거나 두 metric 모두를 악화시킨다.

  • 방어 평가: 아홉 가지 방어와 네 개의 base model 전체에서 ASR과 ORR 모두를 개선하는 방어 적용 조합은 없다.Figure 11은 ASR–ORR 평면에서 모든 방어를 비교한다.
  • 방어 평가: 낮은 ASR은 항상 높은 ORR을 동반하며, 이는 safety–over-refusal 간의 직접적인 tradeoff를 나타낸다.이상적인 영역은 ASR과 ORR이 모두 낮은 왼쪽 아래 모서리다.
  • 방어 평가: 일부 방어는 대신 더 높은 ASR과 더 낮은 ORR을 tradeoff하며, 소수의 방어는 base model에 비해 두 metric 모두를 악화시킨다.
Loading 2606.25013v1…