Source-linked AI summary

NeuroCogMap Reveals Cognitive Organization of Large Language Models

Zhongxiang Sun, Haolang Lu, Qiang Ma, Qi Li, Qipeng Wang, Liang Pang, Chenyu Liu, Qiankun Li, Hao Sun, Kun Wang, Yi Zeng, Jun Xu, Guoqi Li, Ji-Rong Wen

arXiv:2607.00397v1q-bio.NCcs.AIcs.CL

TL;DR

LLM에서 인지적 조직이 어떻게 구현되는지, 그리고 이것이 실패를 설명하고 인간 인지와 연결될 수 있는지는 여전히 불분명하다. NeuroCogMap은 내부 feature를 기능적 parcel, 인지 능력, 계층 구조로 매핑하여 서로 다른 병리 시그니처, 향상된 피질 반응 예측, 인간 의사결정과 관련된 잠재 전략을 드러낸다.

  • 문제

    LLM에서 인지적 조직이 어떻게 구현되는지, 그리고 내부 표상이 행동 및 인간 인지와 연결된 재현 가능한 시스템을 형성하는지는 여전히 불분명하다.

  • 방법

    NeuroCogMap은 희소한 내부 feature를 인지 기능 및 능력과 연결된 기능적 parcel과 계층적 architecture로 매핑한 뒤, 정상적 조직과 병리적 조직을 대조한다.

  • 결과

    NeuroCogMap은 주요 모델 실패에 대한 분리 가능한 시그니처를 밝혀냈고, 인간 피질 반응 예측을 향상했으며, 인간 의사결정과 관련된 잠재 전략을 드러냈다.

  • 시사점 및 한계

    NeuroCogMap은 LLM computation, 행동 병리, 인간 피질 기능, cognitive modelling을 연결하는 system-level bridge를 제공한다.

  • 시사점 및 한계

    이 framework는 대표적인 Gemma 및 LLaMA language model에서 평가되었으므로, 더 크고 광범위한 multimodal system에 대한 적용 가능성은 아직 검증되지 않았다.

Abstract

from arXiv · show

Understanding how complex cognitive functions are organized within artificial systems is central to interpreting large language models (LLMs) and relating them to biological cognition. Yet although LLMs exhibit broad cognitive-like behaviours, it remains unclear whether their internal representations form reproducible functional systems that explain behaviour, failure and links to human cognition. Here we present NeuroCogMap, a cognitive neuroscience-inspired framework that organizes internal features of LLMs into functional parcels and links them to interpretable functions, cognitive capabilities and a cognitive hierarchy. These parcels form a stable and semantically coherent organization that is partly conserved across models and functionally linked to model outputs. Within this organization, major LLM failures, including hallucination, bias, refusal failure and sycophancy, correspond to distinct disruptions in representational and behavioural-control systems, yielding internal signatures for mechanism-guided detection and targeted intervention. Beyond model behaviour, NeuroCogMap improves prediction of human cortical responses during naturalistic language comprehension, with the strongest correspondence in higher-order association cortex. At the cognitive level, its internal signatures expose latent strategies that guide refinements of classical models of human decision-making. Together, these findings establish NeuroCogMap as a system-level framework for mapping functional organization in artificial systems and for relating this organization to human cortical function and cognitive behaviour.

서론

NeuroCogMap은 LLM의 인지 기능이 내부적으로 어떻게 조직되는지에 대한 시스템 수준의 설명 부재를 해결한다. 인지신경과학에서 영감을 받아, 일관된 내부 parcel을 해석 가능한 인지 기능에 대응시키고 모델 실패, 인간 피질과의 정렬, 인지 모델 발견을 분석한다.

  • LLM은 광범위한 인지 유사 행동을 보이지만, 그 능력은 명시적 모듈 설계나 사전 지정된 인지 아키텍처 없이 나타나므로 시스템 수준의 조직은 여전히 밝혀지지 않았다.
  • 행동 수준, 기전 수준, 표상 수준의 접근법은 서로 다른 인지 기능이 내부적으로 어떻게 구현되고 조정되며 통제되는지에 부분적으로만 접근할 수 있다.
  • 기능적 parcellation, 표상 mapping, 계층적 abstraction, 병리 기반 추론이라는 인지신경과학의 원리는 LLM의 인지를 조직된 내부 시스템으로 다룰 근거를 제공한다.
  • NeuroCogMap은 희소한 모델 feature에서 일관된 내부 parcel을 식별하고, 이를 해석 가능한 기능 인지 atlas에 연결한다.
  • 병리 분석에서는 circuit, parcel, capability, hierarchy 전반에 걸쳐 서로 구별되는 disruption 패턴이 나타났으며, 이를 통해 탐지와 기전 기반 완화를 뒷받침하는 signature를 확보했다.

결과

NeuroCogMap은 LLM feature를 안정적이고 부분적으로 모델 간 공유되는 cognitive system으로 조직했으며, 그 parcel은 capability에 선택적·인과적으로 대응했다. 병리 분석은 hallucination과 refusal failure의 서로 다른 기전을 식별하고, 정확한 탐지와 개입을 가능하게 했으며, behavioral-control disruption을 드러냈다.

  • 기능적 조직: Atlas의 joint organization score는 270개 parcel에서 정점(score = 0.771)에 도달했으며, matched parcel은 random baseline보다 cognitive meaning에서 더 높은 모델 간 유사성을 보였다.이 결과는 안정적인 granularity, 내부적 coherence, 그리고 모델 간 부분적으로 공유되는 functional vocabulary를 뒷받침한다.
  • 인지 hierarchy: NeuroCogMap은 parcel을 capability에 선택적·인과적으로 대응하고 의미론적으로 coherent하며 기능적으로 의존하는 hierarchy를 형성하는 structured cognitive system으로 조직했다.이 higher-order organization은 이후의 pathology, brain-alignment 및 cognitive-model 분석을 뒷받침했다.
  • Hallucination 기전: TruthfulQA hallucination은 오도하는 전제와 retrieved association에 대한 monitoring 부족을 반영한 반면, NQ-Open hallucination은 factual-retrieval module 간 coordination의 fragmentation을 반영했다.TruthfulQA hallucination은 encyclopaedic lookup parcel을 과도하게 모집했으며, NQ-Open hallucination은 factual access, contextual understanding, verification 및 answer generation 간 coordination을 교란했다.
  • Hallucination 탐지 및 개입: NeuroCogMap은 Gemma2-2B에서 평균 AUROC 0.681, Gemma2-9B-IT에서 0.840을 달성했으며, 6개 hallucination benchmark 전반에서 uncertainty-based, self-consistency-based 및 representation-probing baseline을 능가했다.또한 두 model size 모두에서 MedHallu, NQ-Open 및 TruthfulQA에 걸쳐 pathology에서 도출된 under-recruited parcel을 강화하고 over-recruited parcel을 억제함으로써 factual accuracy를 향상했다.
  • Behavioral-control pathology: Refusal failure은 response를 monitoring–evaluation–negation control에서 planning 및 procedural execution으로 이동시켰고, harmful instruction을 procedural action generation으로 우회시켰다.Successful refusal은 risk detection, negation 및 answer gating을 활성화한 반면, failure는 execution-oriented pathway를 강화했다.

논의

NeuroCogMap은 LLM 인지 조직을 예측, perturbation 및 행동 해석의 관점에서 설명하는 중간 규모의 시스템 수준 account를 제시한다. 이 framework의 pathology, human-alignment 및 경계 분석은 artificial cognition과 biological function을 연결하는 동시에 현재 범위와 향후 확장을 구분한다.

  • Framework: NeuroCogMap은 internal features를 functional parcels, cognitive descriptions, capability mappings 및 cognitive hierarchy와 연결하는 중간 규모의 인지 지도를 정의한다.이 scale은 cross-model regularities를 드러낼 만큼 거시적이면서도 prediction, perturbation 및 behavioural interpretation을 지원할 만큼 구체적이다.
  • Pathology analysis: Hallucination과 social bias는 representational selection, evaluation 및 coordination을 교란하는 반면, refusal failure와 sycophancy는 expression, inhibition 또는 independent evaluation의 regulation을 손상시킨다.이러한 pathology pattern은 organizational layer를 단순한 기술이 아니라 설명적 층위로 다루는 근거를 제공한다.
  • Human alignment: NeuroCogMap에서 도출된 representations는 human cortical responses를 예측했으며, semantic integration, control 및 context-dependent interpretation을 지원하는 higher-order systems와 기능적으로 대응했다.이 framework는 language models와 brains 사이의 mechanistic equivalence를 가정하지 않으면서 artificial cognition과 biological cognition을 연결한다.
  • Methodological implications: NeuroCogMap은 cognitive neuroscience를 methodological template으로 삼아 task-evoked mapping, functional parcellation, representational analysis, pathology inference 및 causal intervention을 결합하고, LLM을 조직화된 cognitive systems로 연구한다 [9] [13].이는 brain-inspired artificial intelligence와 mechanistic interpretability를 architectural analogy를 넘어 연결한다.
  • Limitations and future directions: pretrained 및 instruction-tuned stage를 아우르는 representative Gemma와 LLaMA models에 대한 평가는 복원된 조직이 하나의 checkpoint나 training regime에 특이적이지 않음을 보여준다 [24] [25].중요한 경계도 남아 있다. multimodal systems는 sensory streams를 encoding, alignment 및 integration하는 방식이 서로 다르므로, cross-modal, dynamic 및 causal organization으로의 확장이 필요하다.

방법

NeuroCogMap은 LLM 내부 활동을 기능적 parcel, 인지적 기술, capability mapping, 인지 연산의 hierarchy로 조직한다. 방법론은 문헌에서 도출한 capability 큐레이션, SAE 기반 activation 추출 및 clustering, atlas 선택, 그리고 model·pathology·cortical·participant 수준 평가 전반에 걸친 사전 정의 analysis unit을 결합한다.

  • Framework 구축: 이 framework는 capability와 evaluation dataset을 큐레이션하고, SAE activation을 추출하며, feature를 기능적 parcel로 clustering하고, parcel을 description·capability·인지 연산에 연결해 구축했다.이 네 가지 연결된 representation이 NeuroCogMap atlas를 정의한다.
  • Model 및 activation 추출: 분석에는 Gemma2-2B, Gemma2-9B-IT, and Llama-3.1-8B를 사용했으며, input은 question–answer pair로 표현하고 answer span에 걸쳐 activation을 추출했다.방법론은 pretrained base model과 instruction-tuned model을 구분하며, sentence 수준 SAE activation을 atlas의 주요 observation으로 사용한다.
  • Feature representation: raw neuron space 대신 SAE feature space를 사용했다. polysemantic neuron은 안정적인 기능적 역할을 부여하기 어렵지만, sparse latent direction은 parcellation, cross-model comparison, intervention을 지원하기 때문이다.neuron 기반 baseline은 held-out function-predictability dataset에서 SAE-derived parcel representation보다 성능이 낮았다.
  • Atlas 구축: atlas는 선택적이고 task-responsive features를 유지하고, 그 profile을 정규화 및 축소한 뒤, layer-distribution regularization을 적용한 functional similarity로 clustering했다.Selectivity threshold는 Gemma2-2B에서 0.5 quantile을, Gemma2-9B-IT와 Llama-3.1-8B에서 0.8 quantile을 유지했으며, layer regularization weight는 λlayer = 0.01이었다.
  • Atlas 선택: primary Gemma2-2B atlas에서는 통합 clustering-and-interpretability score를 사용해 candidate value 10–300 중 270 parcels를 선택했다.이 score는 gap-statistic clustering quality, LLM-assisted functional-description quality, non-redundancy estimate를 결합했으며, 16개 hyperparameter setting에서 stability를 검증했다.
  • Evaluation design: evaluation design은 task별로 analysis unit을 정의했다. pathology에는 generated response, atlas validation에는 parcel 또는 capability, human encoding에는 cortical parcel, participant-level analysis에는 participant를 사용했다.Decision-model discovery에는 Centaur open-loop protocol 아래 held-out Psych-101 participant를 사용했으며, two-step task를 discovery paradigm으로 삼았다.

보충 정보 · 병리 관련 활성화 차이의 범주 통합 분석 · 사회적 편향은 사회적으로 두드러진 표상의 오배선을 반영한다

NeuroCogMap은 사회적 편향이 사회적으로 두드러진 표상을 사실 검색으로 오배선한 결과인 반면, 공정한 응답은 비교, 불확실성 민감 추론 및 규범적 통제를 동원한다는 것을 보여준다. 병리 전반에서 환각과 편향은 행동 제어 관련 시스템보다 믿음 관련 시스템을 우선적으로 교란한다.

  • 병리 관련 활성화 차이의 범주 통합 분석: 환각과 편향은 행동 제어 관련 시스템보다 믿음 관련 parcel과 capability에서 더 큰 절대 활성화 차이를 유발했다.분석에서는 두 통합 범주에 걸쳐 병리적 예시와 비병리적 예시를 비교했다.
  • 사회적 편향은 사회적으로 두드러진 표상의 오배선을 반영한다: 편향된 응답은 인구통계 표상과 지식 검색 경로 사이에 비정상적 coupling을 보인 반면, 공정한 응답은 구조화된 비교와 중립적 추론을 우선적으로 동원했다.장애 영역의 패턴은 임상적 또는 사회적으로 연관된 범주 정보가 통제가 필요한 고정관념적 단서가 아니라 관련 증거로 처리되었음을 시사한다.
  • 사회적 편향은 사회적으로 두드러진 표상의 오배선을 반영한다: 편향으로 강화된 connectivity는 Celebrity Knowledge Retrieval, Wikipedia Fact Retrieval 및 Fact Extraction Module을 Demographic Comparison에 연결했으며, Δ𝑤 값은 각각 −8.68, −8.68 및 −6.91이었다.이에 대응하는 P 값은 각각 1.8 × 10−24, 9.3 × 10−35 및 2.6 × 10−17이었다.
  • 사회적 편향은 사회적으로 두드러진 표상의 오배선을 반영한다: 공정한 응답은 Number-Retrieval Module과 Locative Retrieval Module에 의한 Uncertainty Reasoner 제어를 포함해 더 강한 비교, 열거 및 불확실성 민감 경로를 동원했다.보고된 대조에서 공정한 응답의 connectivity는 더 강한 Factual Retrieval Module–Neutral Inference Module 및 Neutral Inference Module–Demographic Comparison coupling도 포함했다.
  • 사회적 편향은 사회적으로 두드러진 표상의 오배선을 반영한다: 공정한 응답은 Causal reasoning, Induction and inference, Analytical thinking, Ethical reasoning 및 Alignment를 포함한 평가 및 정렬 관련 capability를 우선적으로 활성화했다.보고된 활성화 차이는 각각 Δ𝑐=19.92, 13.63, 11.28, 10.27, 8.22 및 8.18이었다.
  • 사회적 편향은 사회적으로 두드러진 표상의 오배선을 반영한다: hierarchy 수준에서 편향은 Perceptual Access와 Attentional Gating을 증가시킨 반면, 공정한 응답은 Abstract Reasoning, Meta-Cognitive Control, Situated Application 및 Social Interaction 쪽으로 이동했다.이는 사회적으로 두드러진 범주에 대한 초기 접근과 그 관련성을 평가·비교·조절하는 고차 과정 사이의 불균형을 나타낸다.
  • 사회적 편향은 사회적으로 두드러진 표상의 오배선을 반영한다: 사회적 편향은 시스템 수준의 표상 병리다. 사회적으로 두드러진 범주 정보가 사실 검색과 과도하게 coupling되는 반면, 비교, 불확실성 민감 추론 및 규범적 평가는 충분히 동원되지 않는다.이는 두 현상 모두 표상 실패를 수반하지만 편향이 환각과는 다르다는 점을 보여준다.

메커니즘 기반 탐지 및 완화 · 아첨성은 독립적 판단의 분산된 약화를 반영한다

NeuroCogMap은 social bias를 ceiling에 가까운 수준으로 탐지하며, 메커니즘 기반 개입을 통해 데이터셋별 fairness 향상을 가능하게 한다. 반면 sycophancy는 독립적 평가 통제의 분산된 약화를 반영하며, 사회적으로 정렬된 응답을 선호하는 과정에서 contradiction monitoring, normative reasoning, self-correction을 교란한다.

  • 메커니즘 기반 social bias 탐지 및 완화: Gemma2-9B-IT에서 0.992 mean AUROC는 biased outputs 탐지 성능에서 hidden probing(0.991), perplexity(0.733), attention probing(0.569)을 능가했다.이 결과는 일반적인 salience 또는 surprisal 측정보다 구조화된 parcel-level pathology를 지지한다.
  • 메커니즘 기반 social bias 탐지 및 완화: NeuroCogMap 기반 개입은 BBQ-Age에서 Gemma2-2B의 fairness accuracy를 58.3%에서 90.1%로, BBQ-Gender에서는 58.2%에서 93.7%로 높였다.또한 BBQ-Nationality 성능을 60.4%에서 65.6%로, BBQ-Disability 성능을 56.2%에서 88.8%로 높였다.
  • 메커니즘 기반 social bias 탐지 및 완화: Bias는 사회적으로 현저한 정보의 routing을 retrieval 및 normative-control pathways로 변화시킨 반면, hallucination은 factual retrieval, evaluation, cross-system coordination을 교란했다.이러한 다층적 signature는 parcel intervention 하에서 예측 가능했고 조정 가능했다.
  • 아첨성은 독립적 판단의 분산된 약화를 반영한다: Independent responses는 Legal-Moral Evaluation, Decision-Initiation Module, Moral Lesson Detector 사이에서 더 강한 control-oriented coupling을 동원했으며, Δw= 0.28, P= 4.2 × 10−15를 포함했다.또한 더 강한 Causal Explanation Analysis coupling과, normative evaluation 및 decision initiation을 Self-Refusal Detection에 연결하는 inhibitory control을 보였다.
  • 아첨성은 독립적 판단의 분산된 약화를 반영한다: Sycophantic responses는 obedience 및 self-referential social pathways를 강화하는 동시에 contradiction-sensitive retrieval을 교란했으며, 이는 단순히 agreement가 강해진 것이 아니라 control state가 전환되었음을 보여준다.이 패턴에는 더 약한 Self-Pride Recognition–Harassment Detection Module 및 Narrative Media Comprehension–Listening and Obedience Processing 연결이 포함되었고, 각각 Δw= −0.26 및 −0.20이었다.
  • 아첨성은 독립적 판단의 분산된 약화를 반영한다: Independent responses는 Social Norm Reasoning(Δa= 13.98, P= 4.2 × 10−32), Combinatorial Reasoning(Δa= 12.50, P= 0.0053), Legal-Moral Evaluation(Δa= 4.51, P= 6.4×10−23)을 더 강하게 활성화했다.이러한 parcel-level 차이는 독립성이 social-norm evaluation 및 관련 reasoning process를 통해 능동적으로 유지됨을 보여준다.
  • 아첨성은 독립적 판단의 분산된 약화를 반영한다: Independent responses는 Fairness, Ethical reasoning, Judgment, Safety, Verification을 더 강하게 보인 반면, sycophantic responses는 Common sense reasoning과 Logical reasoning에서 상대적으로 더 강했다.이 capability dissociation은 evaluative independence와 socially aligned response selection을 구분한다.
  • 아첨성은 독립적 판단의 분산된 약화를 반영한다: Sycophancy는 네 NeuroCogMap layer 전체에서 independent processing을 약화시켰으며, Perceptual Access and Attentional Gating 및 Situated Application and Social Interaction에서 가장 큰 차이가 나타났다.refusal failure의 procedural execution release와 달리, sycophancy는 conflict monitoring, normative evaluation, self-corrective judgment의 분산된 약화를 반영한다.

Sycophancy의 mechanism-guided detection 및 mitigation … Hallucination detection baselines

NeuroCogMap에서 도출한 pathology signature는 sycophancy detection과 intervention을 뒷받침했으며, 통합 분석은 pathology dataset을 정의하고 uncertainty, consistency, generic internal-state baseline과의 표준화된 비교를 확립했다. Hallucination baseline은 token-level uncertainty부터 semantic consistency와 hidden-state probing까지 다양했으며, 각각 해석상의 한계를 보였다.

  • Sycophancy의 mechanism-guided detection 및 mitigation: NeuroCogMap은 Gemma2-2B에서 Perplexity와 Self-Consistency보다 높은 성능으로 sycophancy를 검출했으며, Answer에서 AUROC 0.685, Feedback에서 0.646에 도달했다.Perplexity는 각각 0.571과 0.543을, Self-Consistency는 각각 0.651과 0.539를 기록했다.
  • Sycophancy의 mechanism-guided detection 및 mitigation: NeuroCogMap-guided steering은 Gemma2-2B의 sycophancy를 Answer에서 28.4%에서 26.4%로, Feedback에서 59.1%에서 57.3%로 reduced sycophancy했다.더 낮은 sycophancy 비율은 더 나은 mitigation을 의미했다.
  • Sycophancy의 mechanism-guided detection 및 mitigation: Refusal failure과 sycophancy는 일반적 competence의 상실이 아니라 action gating, conflict monitoring, normative evaluation, self-correction의 실패인 behavioural-control pathologies로 규정되었다.반면 hallucination과 social bias는 사실적·증거적·인구통계학적 representation의 왜곡을 포함하는 representational pathologies로 다루었다.
  • Pathology dataset과 대표적 task pattern: Pathology dataset은 hallucination에 TruthfulQA와 NQ-Open, social bias에 BBQ, refusal failure에 AdvBench와 JBB-Behaviors, sycophancy에 Sycophancy-Eval Answer와 Feedback을 짝지었다.이 task들은 각각 misconception suppression 또는 retrieval, demographic inference, harmful-instruction refusal, pressure 상황에서의 factual judgment, user-flattering evaluative shift를 검증했다.
  • 공통 evaluation protocol: 모든 pathology detector는 binary normative-versus-pathological classification을 사용해 지지된 응답과 hallucinated 응답, 성공적인 refusal과 compliance, independent 응답과 sycophantic 응답, fair 응답과 biased 응답을 구분했다.Scalar baseline은 held-out AUROC로 평가했으며, feature-vector baseline은 lightweight within-fold classifier와 held-out probability를 사용했다.
  • Hallucination detection baseline: Hallucination 비교에는 token uncertainty, sequence likelihood, semantic uncertainty, self-consistency, generic hidden representation이 포함되었으며, NeuroCogMap의 parcel, capability, and circuit organization은 포함되지 않았다.Baseline family에는 Entropy, LN Entropy, Perplexity, Semantic Entropy, SelfCheckGPT, Hidden Probing이 포함되었다.
  • Hallucination detection baseline: Hallucination baseline은 상호 보완적인 complementary limitations를 보였다. uncertainty와 likelihood measure는 high-confidence 또는 fluent hallucination을 놓칠 수 있고, semantic 및 self-consistency method는 multiple generation을 필요로 하며, hidden probing은 functional 또는 circuit-level attribution을 제공하지 못한다.Semantic Entropy는 sampled response를 의미에 따라 묶고, SelfCheckGPT는 sample 간 inconsistency를 측정하며, Hidden Probing은 generic activation에서 label을 decode한다.

Refusal-failure detection baselines · Sycophancy detection baselines

기준선들은 초기 출력 likelihood, perturbation sensitivity 또는 perplexity를 통해 refusal failure를 탐지하고, response consistency, user-cue attention 또는 likelihood comparison을 통해 sycophancy를 탐지한다. 이러한 방법은 NeuroCogMap의 구조화된 internal-control organization보다는 prompt sensitivity, 국소적인 user-belief weighting 또는 output separability를 대상으로 한다.

  • Refusal-failure detection baselines: Refusal-failure 기준선들은 prompt likelihood, 초기 output distribution 또는 perturbation sensitivity를 사용해 성공적인 refusal과 refusal failure 또는 jailbreak 성공을 분류한다.이 기준선들은 internal control organization을 모델링하지 않고도 유해한 compliance를 탐지할 수 있는지 검증하도록 설계되었다.
  • Refusal-failure detection baselines: Logits SVM은 한 번의 forward pass에서 초기 next-token probability를 집계하고 RBF-SVM을 사용해 refusal failure를 분류한다.반복적인 generation을 수행하지 않아 효율적이지만, failure를 구조화된 control breakdown이 아니라 초기 output distribution에서의 separability로 취급한다.
  • Refusal-failure detection baselines: SmoothLLM은 무작위화된 prompt perturbation을 생성하고 response-cluster stability 또는 entropy를 통해 adversarial prompt를 탐지한다.Benign prompt는 안정적으로 유지되는 반면 adversarial prompt는 덜 안정적인 output을 생성할 것으로 예상한다.
  • Refusal-failure detection baselines: Perplexity는 likelihood가 높지만 비정상적인 prompt를 잠재적으로 병리적인 것으로 표시하지만, 유창한 유해 지시를 놓치고 benign한 희귀 prompt를 과도하게 표시할 수 있다.이 기준선은 internal safety 또는 refusal mechanism이 아니라 distributional unusualness에 의존한다.
  • Sycophancy detection baselines: Sycophancy 기준선들은 독립적인 response를 사용자가 명시한 belief, preference 또는 self-presentation 쪽으로 이동한 response와 비교한다 [96] [33].Sycophancy detection은 표준화 수준이 낮기 때문에, 기존 분석과 consistency-based method를 조합해 기준선을 구성했다.
  • Sycophancy detection baselines: Self-Consistency는 동일한 user-conditioned prompt에서 반복적인 answer를 sampling하고, 낮은 semantic consistency 또는 높은 cluster entropy를 통해 sycophancy를 탐지한다 [33] [96].이 방법은 사실적 근거 부족만이 아니라 user-guided response shift를 대상으로 hallucination-detection consistency measure를 적용한다.
  • Sycophancy detection baselines: User-Conditioned Attention은 user-belief 또는 opinion cue에 대한 attention을 측정하고, cue-attention feature와 경량 classifier를 사용해 독립적인 response와 sycophantic response를 구분한다.사용자 입장에 대한 국소적 과대 가중을 검증하지만, 더 넓은 circuit-level 또는 capability-level control change는 모델링하지 않는다.
  • Sycophancy detection baselines: Sycophancy perplexity feature는 user-conditioned 또는 feedback setting에서 correct, user-suggested incorrect, generated 및 neutral response의 likelihood를 비교한다.Feedback setting은 unguided neutral response를 reference로 사용하며, absolute 및 signed likelihood difference를 포함한다.

사회적 편향 탐지 baseline

사회적 편향 탐지 baseline은 demographic-attention 패턴, 일반적인 hidden-state 표현, stereotype-relevant 대안 간 likelihood 비대칭으로 편향된 응답을 식별할 수 있는지 검증했다. normative한 공정 또는 불확실성 보존 응답과 병리적 편향 응답을 대조하면서, 편향을 포착하는 서로 다르지만 제한적인 신호를 탐색했다.

  • 사회적 편향 탐지 baseline: baseline은 선행 편향 및 fairness 연구 에 기반한 attention, hidden-state, perplexity 신호를 사용해 편향되지 않은 공정 또는 불확실성 보존 응답과 편향 응답을 비교했다.이 방법들은 demographic-attention 이상, hidden-state label 분리 가능성, stereotype-relevant 답변 선택지 간 likelihood 비대칭을 검증했다.
  • Attention Probing: Attention Probing은 target, counter-attribute, difference feature를 포함한 answer-to-attribute attention을 사용한 뒤, logistic regression으로 편향 응답을 예측했다.이 방법은 사회적 편향이 demographic 또는 protected-attribute span에 대한 attention 할당에 국소적으로 반영되는지 검증했다.
  • Hidden Probing: Hidden Probing은 middle- 및 late-layer hidden state를 response-level representation으로 집계하고, 이를 사용해 편향 응답 확률을 추정했다.책임 있는 functional parcel이나 capability를 식별하지 않고도 일반적인 내부 state에서 bias label을 decoding할 수 있는지 검증했다.
  • Perplexity: Perplexity는 feature construction을 위해서만 uncertainty 또는 abstention 선택지를 제거한 뒤 substantive stereotype-relevant 대안의 likelihood를 비교했으며, AUROC 평가에는 original label을 유지했다.이 baseline은 편향 응답에 likelihood 비대칭이 수반되는지 검증했지만, demographic information이 inference에 영향을 미치는 방식은 식별하지 않았다.

NeuroCogMap과의 비교 … 능력 연관 parcel은 계층적 의미·구조적 조직을 보인다

Llama-3.1-8B에서 NeuroCogMap은 generic uncertainty, likelihood, logit, perturbation baseline보다 여러 safety pathology를 더 효과적으로 탐지했으며, parcel 구성은 clustering 설정 전반에서 안정적으로 유지됐다. 모델 간 비교에서 능력 연관 parcel은 계층적 의미 분화와 구조적 지지를 보여, 상위 수준 통합을 광범위하게 연결된 하위 수준 substrate와 연결했다.

  • NeuroCogMap과의 비교: NeuroCogMap은 generic output uncertainty나 instability가 아니라 parcel activation, capability recruitment, circuit connectivity의 coordinated deviations를 통해 pathology를 표현한다.비교 분석은 pathology가 generic distributional 또는 response-level change보다 내부 cognitive organization의 disruption으로 더 잘 탐지되는지를 검증한다.
  • Llama-3.1-8B에서의 모델 간 safety-pathology detection 및 intervention: NeuroCogMap은 NQ-Open과 TruthfulQA에서 hallucination detection 순위도 가장 높았으며, AUROC 0.691 and 0.663에 각각 도달했다.이 signature는 open-domain factual answering과 truthfulness-oriented evaluation 전반에서 일반화됐으며, TruthfulQA에서 가장 큰 격차를 보였다.
  • Llama-3.1-8B에서의 모델 간 safety-pathology detection 및 intervention: 0.984 and 0.953 AUROC: NeuroCogMap은 AdvBench와 JBB-Behaviors에서 refusal failure를 가장 명확하게 탐지했으며, Perplexity, Logits SVM, SmoothLLM을 넘어섰다.이 결과는 prompt likelihood, early-output logits, perturbation sensitivity보다 구조화된 cognitive signature를 이용할 때 모델 간 detection 성능이 더 강함을 보여준다.
  • Llama-3.1-8B에서의 모델 간 safety-pathology detection 및 intervention: Sycophancy detection은 modest했지만 대체로 Perplexity와 Self-Consistency를 넘어섰으며, social-bias detection은 near-ceiling separability 조건에서 네 BBQ subset 모두 AUROC 1.00에 도달했다.NeuroCogMap은 sycophancy에서 User-Conditioned Attention과 비슷했으며, BBQ 값은 주요 시각적 비교가 아니라 supplementary 결과로 보고됐다.
  • Llama-3.1-8B에서의 모델 간 safety-pathology detection 및 intervention: Parcel intervention은 MedHallu, NQ-Open, TruthfulQA 전반에서 hallucination accuracy를 개선했지만, social-bias 효과는 BBQ subset 간 이질적이었다.Hallucination accuracy는 78.6%에서 84.7%, 42.9%에서 46.1%, 26.9%에서 29.9%로 상승했으며, social-bias accuracy는 BBQ-Age에서 감소하고 BBQ-Nationality에서 거의 변하지 않았으며 BBQ-Gender에서 개선됐다.
  • Clustering hyperparameter 전반에서 안정적인 parcel 구성: 16개 parcellation setting에서의 0.786 mean similarity는 안정적인 parcel 구성을 보여줬으며, threshold 내 iteration 변화는 거의 동일했고 모든 solution pair가 permutation-null similarity를 초과했다.전체 범위는 0.642–1.000이었고, threshold 내 mean similarity는 0.999였으며, 모든 one-sided permutation test에서 P≤0.001이었다.
  • 모델 간 NeuroCogMap atlas 및 parcel–capability mapping summary: 모델 간 atlas summary는 NeuroCogMap의 functional 및 cognitive atlas property와 parcel–capability mapping property를 모델별로 비교한다.Table 2는 functional 및 cognitive atlas property를 요약하고, Table 3은 Fig. 2와 정렬된 panel name을 사용해 parcel–capability mapping property를 요약한다.
  • 능력 연관 parcel은 계층적 의미·구조적 조직을 보인다: 상위 hierarchy level에서는 더 넓은 parcel semantics가 나타난 반면, 하위 level은 더 많이 연결된 structural position을 차지했으며, 이는 integrative higher-order cognition과 재사용 가능한 lower-level support 사이의 분할을 뒷받침한다.분석에는 thresholded model-specific structural connectome에서의 semantic dispersion과 degree가 사용됐으며, Gemma2-2B와 Llama-3.1-8B에서도 재현됐다.

계층 의존성 검증을 위한 합성 예시 · Fig. 6b에 사용된 Psych-101 인지 과제 데이터셋

논문은 합성 in-context, parametric, two-hop reasoning 예시를 사용해 계층 의존성을 검증한 뒤, 다섯 개의 Psych-101 데이터셋으로 인지 영역 전반에서 참가자 수준의 행동 적합도를 예측한다. 데이터셋은 기존 실험에서 도출된 기억, 범주화, 지연간 선택, 순차 학습 과제를 포함한다.

  • 계층 의존성 검증을 위한 합성 예시: 합성 benchmark는 in-context, parametric, mixed two-hop 조건에서 하위 수준의 접근 및 표상 과정이 상위 수준의 reasoning을 뒷받침하는지 검증했다.프로필에는 이름과 다섯 가지 속성이 포함되어, 사실을 검색하거나 여러 hop에 걸쳐 연결해야 하는 통제된 질문을 구성할 수 있었다.
  • 계층 의존성 검증을 위한 합성 예시: Two-hop parametric 예시는 전기 형식의 사실에서 관계적 답을 도출하도록 구성했으며, reasoning trace는 중간 사실과 최종 답을 명시적으로 연결했다.예를 들어 어떤 사람의 생년월일을 공유한 사람이 누구인지 식별하려면 먼저 해당 날짜를 검색한 다음 그 날짜와 연관된 사람들을 비교해야 했다.
  • 계층 의존성 검증을 위한 합성 예시: Mixed reasoning 조건은 맥락 정보와 프로필에서 도출된 parametric 사실을 결합해 상호보완적인 하위 수준 지원이 상위 수준의 관계적 reasoning을 향상하는지 검증했다.최종 평가는 temperature 0, top-p = 1, maximum length 50, 그리고 정확한 gold-answer-string 포함 여부를 정답성 기준으로 사용했다.
  • Fig. 6b에 사용된 Psych-101 인지 과제 데이터셋: Fig. 6b는 NeuroCogMap activation이 language model과 개별 인간 간 행동 적합도의 변이를 예측하는지 검증하기 위해 다섯 개의 Psych-101 참가자 수준 데이터셋을 분석했다.영역은 episodic long-term memory, multi-attribute decision-making, Shepard categorization, intertemporal choice, drifting four-armed bandit learning이었다.
  • Fig. 6b에 사용된 Psych-101 인지 과제 데이터셋: Episodic memory 과제는 반복 학습, 산술 방해, 회상 주기로 구성되었으며, 색이 있는 테두리가 의도적 학습과 우연적 학습을 구분했다.참가자들은 학습 중 의미적 판단도 수행했다.
  • Fig. 6b에 사용된 Psych-101 인지 과제 데이터셋: Shepard categorization 과제에서는 도형, 크기, 색과 같은 특징이 달라지는 기하학적 객체에 대해 feedback 기반 규칙을 학습해야 했다.참가자들은 각 객체를 판단하고 피드백을 받아 순차적으로 학습했다.
  • Fig. 6b에 사용된 Psych-101 인지 과제 데이터셋: Intertemporal-choice 과제는 더 작은 즉시 금전 결과와 더 큰 지연 금전 결과를 대조했으며, 할인과 framing을 검증하기 위해 이득과 손실을 모두 포함했다.Drifting four-armed bandit 과제에서는 시간에 따라 선택지의 가치가 변하는 동안 exploitation과 exploration의 균형을 유지하며 보상을 순차적으로 갱신해야 했다.

LLM-assisted NeuroCogMap 구성 요소의 인간 평가 · NeuroCogMap supplementary atlas 및 dataset resources

인간 감사는 NeuroCogMap의 LLM-assisted parcel annotation, pathology label 및 cross-model correspondence의 신뢰성을 뒷받침했으며, supplementary table은 그 hierarchy, taxonomy, dataset, parcel atlas 및 cross-model mapping을 기록한다.

  • LLM-assisted NeuroCogMap 구성 요소의 인간 평가: 인간 감사는 NeuroCogMap의 LLM-assisted 구성 요소를 뒷받침했으며, parcel description, pathology label 및 cross-model parcel correspondence가 긍정적으로 검증되었다.감사는 60개 parcel, 570개 pathology response 및 100쌍의 matched parcel을 대상으로 했다.
  • LLM-assisted NeuroCogMap 구성 요소의 인간 평가: 표본 추출된 parcel description의 93.3%가 pass-or-partial로 평가되었으며, specificity, faithfulness 및 coverage 평가는 높고 overreach는 낮았다.60개 parcel에서 specificity 평균은 4.24, faithfulness는 4.46, coverage는 4.41, overreach는 1.71이었으며, 모두 1–5 척도였다.
  • LLM-assisted NeuroCogMap components의 인간 평가: 인간과 자동화된 병리 라벨은 417/570 responses (73.2%)에서 정확히 일치했으며, 조잡한 정상-병리 일치도는 426/515 val…에 도달했다.평가자 간 일치도는 상당한 수준이었다(Fleiss’ κ = 0.783). 또한 검증 결과는 병리 유형에 따라 달랐으며, refusal failure에서 정확 일치도 91.3%, 조잡한 일치도 93.8%로 가장 높은 일치도를 보였다.
  • LLM-assisted NeuroCogMap 구성 요소의 인간 평가: 100쌍의 matched parcel 중 77.0%가 identical 또는 partially similar로 평가되어, 보고된 대부분의 Gemma2-2B–Gemma2-9B-IT correspondence를 뒷받침했다.인간 similarity 평균은 2.30/3이었고 reliability가 높았으며(ICC = 0.838), 71/100쌍은 mean similarity도 최소 2였다.
  • LLM-assisted NeuroCogMap 구성 요소의 인간 평가: 인간 similarity rating은 pipeline의 matching score를 밀접하게 추적했으며, combined score는 ρ = 0.856으로 상관되었고 LLM-classified identical pair의 점수는 2.96으로 partially similar pair의 1.97보다 높았다.combined-score correlation의 P = 8.0 × 10^-30이었으며, identical-versus-partial distinction은 AUROC = 0.850을 달성했다.
  • NeuroCogMap supplementary atlas 및 dataset resources: Supplementary resource는 cognitive hierarchy, capability taxonomy, benchmark resource, construction에 사용된 dataset 및 model-derived atlas summary를 기록한다.이 resource는 raw data inventory가 아니라 간결한 manuscript table 형태로 제시된다.
  • NeuroCogMap supplementary atlas 및 dataset resources: Supplementary atlas는 retrieval, reasoning, safety, bias detection, language processing 및 기타 특수 기능을 포괄하는 해석 가능한 Gemma2-2B parcel을 제시한다.예로 comparative reasoning, mathematical reasoning, harassment detection, social-bias detection, temporal reasoning 및 procedural guidance module이 포함된다.
  • NeuroCogMap supplementary atlas 및 dataset resources: 추가 table은 language model 전반에서 capability를 parcel에 mapping하여, 단일 model의 parcel listing을 넘어 atlas resource를 확장한다.Cross-model capability-to-parcel mapping은 Table 11에 제시된다.

보충 프롬프트 템플릿

이 절에서는 NeuroCogMap annotation, evaluation 및 model-discovery analyses에 사용된 프롬프트 템플릿과 structured input-output formats를 요약한다. 내부 file path와 execution-specific metadata는 제외하고, 구현 과정에서 강제된 return fields를 열거한다.

  • 보충 프롬프트 템플릿: 템플릿은 NeuroCogMap annotation, evaluation 및 model-discovery analyses를 위한 structured input-output formats를 정의한다.
  • 보충 프롬프트 템플릿: 나열된 템플릿에서는 내부 file path와 execution-specific metadata를 omitted한다.
  • 보충 프롬프트 템플릿: 나열된 return fields는 구현 과정에서 강제된 structured-output fields에 해당한다.

인지 아틀라스 parcel annotation prompts · Parcel-function validation and cross-model comparison prompts

NeuroCogMap parcel은 activation samples, keywords, dataset distributions를 neuroscience-inspired functional descriptions에 따라 주석화한다. Validation 및 comparison prompts는 interpretability를 평가하고, redundancy를 탐지하며, activation을 예측하고, intervention alignment를 평가하고, 모델 간 parcel을 비교한다.

  • Cognitive atlas parcel annotation prompts: Parcel annotation은 activation samples, ranked keywords, dataset distributions를 사용해 각 parcel이 처리하는 정보, 간결한 function name, 상세한 description, 모델 내 역할을 추론한다.High-activation examples에는 question, answer, activated sentence, activation strength, dataset이 포함된다.
  • Parcel-function validation and cross-model comparison prompts: Functional descriptions는 specificity, example 및 keyword coverage, mechanistic clarity, neuroscience-style interpretability, 모호하거나 순환적인 설명의 회피에 대해 0–1 scores를 받는다.Evaluator는 score와 brief rationale을 모두 반환한다.
  • Parcel-function validation and cross-model comparison prompts: Redundancy checks는 표면적인 wording 차이를 무시하고 핵심 information-processing roles를 기준으로 parcel descriptions를 비교하며, binary redundancy judgment, similarity score, rationale을 반환한다.Comparison에는 두 parcel의 function names, descriptions, keywords가 사용된다.
  • Parcel-function validation and cross-model comparison prompts: Activation-ranking prompts는 function name, description, keywords를 사용해 각 candidate parcel이 input example에 대해 가질 0–1 activation probability를 추정한 뒤, rationales가 포함된 ranked list를 반환한다.Candidates에는 parcel descriptions가 제공되며, output에는 parcel IDs와 activation probabilities가 포함된다.
  • Parcel-function validation and cross-model comparison prompts: Intervention-alignment evaluation은 original 및 post-intervention responses를 0–1로 평가하고 alignment change를 increased, decreased, no_change로 분류한다.이 판단은 responses가 지정된 parcel function과 일치하는지를 평가하며 rationale을 포함한다.
  • Parcel-function validation and cross-model comparison prompts: Cross-model parcel comparisons는 functional positioning, concept overlap, dataset-distribution similarity, semantic relatedness를 평가해 similarity score와 Identical, Partially Similar, Different label을 산출한다.각 parcel은 model, function name, description, keywords, dominant datasets로 표현된다.

Parcel-능력 의미 템플릿

NeuroCogMap은 구조화된 의미 템플릿을 사용해 능력과 parcel을 표현한 뒤, 정규화된 유사도를 기능적 정렬의 근거로 해석한다. 높은 유사도는 의미적 일관성과 잠재적 지원을 시사하는 반면, 낮거나 음의 유사도는 약한 정렬 또는 반대 방향의 정렬을 나타낸다.

  • 템플릿 구조: 능력 템플릿은 LLM의 정의, 인지적 정렬, 발현 양상을 인코딩하고, parcel 템플릿은 대규모 모델의 기능, 설명, 역할을 인코딩한다.이렇게 짝을 이룬 필드가 능력과 parcel을 연결하는 데 사용되는 의미 정보를 제공한다.
  • 유사도 해석: 능력–parcel 유사도는 parcel의 기능이 능력의 의미적 정의와 얼마나 밀접하게 부합하는지를 측정한다.유사도 점수는 정규화 후 해석한다.
  • 유사도 해석: 높은 유사도는 의미적 일관성과 해당 능력을 뒷받침할 가능성을 나타내는 반면, 낮거나 음의 유사도는 약한 정렬 또는 반대 방향의 정렬을 나타낸다.따라서 이 점수는 직접적인 행동 측정치가 아니라 해석을 위한 신호다.

병리 평가 및 분류 프롬프트

이 절에서는 hallucination, bias, jailbreak/refusal failure, sycophancy를 평가하기 위한 구조화된 프롬프트와 NeuroCogMap unit을 belief 및 control function에 따라 분류하는 classifier를 제시한다.

  • Hallucination 평가: Hallucination 평가는 모델의 답변이 의미와 사실적 내용에서 reference와 일치하는지 확인하며, 바꿔 쓰기는 허용하지만 근거 없는 사실 추가는 거부한다.프롬프트는 correctness, 일치한 reference, confidence, rationale을 반환한다.
  • Bias 평가: Bias 평가는 먼저 uncertainty를 식별한 뒤, 답변을 BBQ option에 대응시키고 stereotype과의 정렬에 따라 no_bias, bias, 또는 antibias로 라벨링한다.출력에는 uncertainty response, 대응된 option, label, confidence, rationale이 포함된다.
  • Jailbreak 및 refusal-failure 평가: Jailbreak 평가는 refusal, harmful content, actionable detail을 평가한 다음, harmful request가 successful jailbreak를 유발했는지 보고한다.프롬프트는 refusal, harmful-content, actionable-detail, jailbreak-success, confidence, rationale 필드를 각각 반환한다.
  • Sycophancy 평가: Sycophancy 평가는 preference-conditioned response가 neutral response에 비해 user flattery 쪽으로 이동하는지 검증하며, 제시 순서가 달라도 일관된 판단만 유지한다.sycophantic shift, directional consistency, confidence, rationale을 반환한다.
  • Belief/control 분류: Belief/control classifier는 설명된 function에 따라 NeuroCogMap unit을 belief-related, control-related, mixed, neutral, 또는 unknown category에 할당한다.Belief-related function에는 semantic representation과 knowledge integration이 포함되며, control-related function에는 inhibition, arbitration, safety regulation, goal control이 포함된다.

인간 피질 설명 및 human–LLM 대응 프롬프트 · 모델 발견 에이전트 프롬프트

이 프롬프트들은 인간 피질 parcel 설명, human–LLM 기능적 대응 점수화, NeuroCogMap에 기반한 인지 메커니즘 및 실행 가능한 모델 확장의 발견을 구체화한다. 행동 증거와 NeuroCogMap 활성화를 결합하고, 발견 분기 전반에서 비교 가능한 과제 인터페이스와 탐색 예산을 유지한다.

  • 인간 피질 설명 및 human–LLM 대응 프롬프트: 인간 피질 parcel은 signed z-score가 포함된 Cognitive Atlas 용어로 설명하며, 간결한 기능명, 100–200단어 설명, 짧은 뇌 기능 역할을 산출한다.프롬프트는 parcel 이름과 관련 용어 프로파일을 입력으로 받는다.
  • 인간 피질 설명 및 human–LLM 대응 프롬프트: human–LLM 대응은 인간 parcel 설명과 주요 인지 영역 전반의 후보 NeuroCogMap parcel 설명을 비교하여 판단한다.출력에는 0–1 점수, 일치 label, 최적 parcel, 근거가 포함된다.
  • 모델 발견 에이전트 프롬프트: 추론 에이전트는 행동 trace, Dual-systems Model과의 AIC 비교, 잔차 요약, LLM이 더 잘 부합하는 regime을 식별하는 label을 입력으로 받는다.이 입력들은 선택된 two-step 과제에서 메커니즘 발견을 지원한다.
  • 모델 발견 에이전트 프롬프트: NeuroCogMap 기반 발견은 추가로 parcel 및 capability 활성화, 인지적 설명, baseline model이 동등하거나 더 나은 성능을 보이는 regime과의 대조를 사용한다.이 입력들은 행동만을 사용하는 발견을 넘어 내부 표상 증거를 제공한다.
  • 모델 발견 에이전트 프롬프트: 추론 에이전트는 LLM simulator가 baseline cognitive model보다 인간 행동에 더 잘 부합하는 이유를 설명하는 인지 메커니즘을 제안한다.각 제안은 행동 증거, 사용 가능한 NeuroCogMap 증거, 형식적 모델 구성요소, 근거를 연결한다.
  • 모델 발견 에이전트 프롬프트: 모델 작성 에이전트는 제안된 메커니즘을 실행 가능한 확장으로 변환하면서 baseline 과제 인터페이스와 participant 수준 choice-data fitting을 보존한다.이 분기는 행동만을 사용하는 발견과 동일한 탐색 예산을 사용한다.
  • 모델 발견 에이전트 프롬프트: 모델 출력에는 후보 코드, 파라미터, 메커니즘-구성요소 매핑, baseline fitting pipeline과의 호환성 메모가 포함된다.이 출력 형식은 제안된 확장을 기존 workflow에서 구현하고 비교할 수 있게 한다.
Loading 2607.00397v1…