Source-linked AI summary
The Hitchhiker's Guide to Agentic AI: From Foundations to Systems
Haggai Roitman
TL;DR
실무자는 AI 시스템 스택 전반에 걸쳐 파편화된 지식에 직면한다. 이 가이드는 이론과 구현 지침을 통합해 자율 AI 시스템 구축을 위한 단일 참고 자료로 정리한다.
문제
지능형 AI 시스템 구축에 필요한 지식이 논문, repository, 연구실의 노하우에 흩어져 있기 때문에 실무자에게는 통합 참고 자료가 필요하다.
방법
이 가이드는 AI systems stack 전반의 지식을 종합하고, 자율 시스템을 위한 이론적 기반과 구현 세부 사항을 결합한다.
결과
이 가이드는 foundational model, reasoning, agent design, coordination, evaluation, production deployment를 아우르는 단일 참고 자료를 제공한다.
핵심 내용 및 한계
이 가이드는 지능형 AI 시스템을 구축할 때 이론과 구현 지침이 모두 필요한 실무자를 지원하는 것을 목적으로 한다.
핵심 내용 및 한계
이 콘텐츠는 어떠한 보증 없이 제공되며, 독자는 production use 전에 주장, 수식, 구현 세부 사항을 독립적으로 검증해야 한다.
Abstract
from arXiv · showhide
The Hitchhiker's Guide to Agentic AI is a comprehensive practitioner's reference for building autonomous AI systems. The book covers the full stack from first principles to production deployment, organized around a central thesis: building great agentic systems requires understanding every layer of the pipeline, not just one. The book opens with the LLM substrate -- transformer architecture, GPU systems, training and fine-tuning (SFT, LoRA, MoE), model compression, and inference optimization -- treated as essential foundations rather than the primary focus. It then develops the alignment and reasoning layer: reinforcement learning from human feedback (RLHF), PPO, DPO and its variants, GRPO, reward modeling, and RL for large reasoning models including chain-of-thought and test-time scaling. The second half is devoted to agentic AI proper. Topics include agentic training and trajectory-based RL, retrieval-augmented generation (RAG and Agentic RAG), memory systems (in-context, external, episodic, and semantic), agent harness design and context management, loop engineering (inference-time RL, generate-verify-retry optimization, and adaptive budget control), and a taxonomy of agent design patterns. Inter-agent coordination is covered in depth: the Model Context Protocol (MCP), agent skills and tool use, the Agent-to-Agent (A2A) communication protocol, and multi-agent architectures spanning centralized, decentralized, and hierarchical topologies. The book concludes with agent development frameworks, agentic UI design, evaluation methodology for agentic tasks, and production deployment. Each chapter pairs rigorous theoretical foundations with implementation guidance, code examples, and references to the primary literature.
28 퀴즈 질문 및 상세 답변 … 3. Feed-Forward Network + Residual + LayerNorm
이 가이드는 Transformer의 기초와 시스템 인프라부터 alignment, reasoning, evaluation, autonomous agent deployment까지 현대 AI를 아우르는 실무자 지향·구현 중심 참고 자료다. 전체 pipeline에 대한 이해를 강조하면서 text-in, text-out 범위를 유지하고 2026년 중반까지 등장하는 방법론을 추가한다.
- 면책 조항: 이 자료는 교육용으로 제공되며 “있는 그대로”의 상태이므로, 독자는 production system에 적용하기 전에 주장, 수식, 구현 세부 사항을 독립적으로 검증해야 한다.저자는 이 작업이 독립적인 자료이며 LLM이 연구와 초안 작성에 도움을 주었고, 저자가 편집과 검증을 수행했다고 밝힌다.
- 이 가이드가 필요한 이유: 현대의 intelligent system에는 Transformer, GPU system, optimization, reinforcement learning, multi-agent architecture를 아우르는 전문성이 필요하므로, 이 참고 자료는 흩어진 지식을 통합한다.실제로 작동하는 system을 만드는 데 필요한 이론적 기초와 구현 세부 사항을 결합한다.
- Agentic AI로 향한 개인적 여정: 이 가이드는 agentic AI를 LLM의 language capability, RL 기반 reasoning과 alignment, MCP tool access, A2A communication, persistent memory, orchestration framework가 수렴한 형태로 제시한다.이러한 흐름은 Transformer [357], RLHF [280], DeepSeek-R1 [72]과 같은 reasoning model을 포함한 초기의 주요 이정표를 따른다.
- 얻게 될 것: 이 가이드의 명시된 학습 성과는 LLM internals와 system, efficient fine-tuning, preference alignment, RL-trained reasoning, agent architecture, rigorous evaluation을 이해하는 것이다.명시된 방법과 system에는 LoRA/QLoRA, RLHF, DPO, GRPO, KTO, DeepSeek-R1, o1/o3, MCP, A2A, vLLM, LLM-as-Judge pattern이 포함된다.
- 이 가이드의 구성: 여섯 부분으로 구성된 체계는 foundations, LLM을 위한 RL method, reasoning, evaluation, agentic AI, assessment/reference material을 다루며, 108개의 상세한 퀴즈 질문도 포함한다.Agentic section에는 RAG, memory, orchestration, loop engineering, MCP, A2A, multi-agent system, development framework, agentic UI가 포함된다.
- 범위와 의도적인 제외 사항: 범위는 text-in, text-out language model과 이에 수반되는 RL, system, agentic infrastructure에 의도적으로 초점을 맞추며, multimodal, domain-specific, personalization system은 제외한다.이러한 경계는 architecture foundation부터 autonomous-agent deployment까지 일관된 흐름을 유지한다.
- 큰 그림: 이 가이드의 핵심 논지는 effective AI system을 구축하려면 model architecture와 hardware부터 training, alignment, reasoning, orchestration, deployment까지 전체 pipeline을 이해해야 한다는 것이다.이러한 계층 전반에서 구축, 평가, 기술적 의사결정을 수행하는 실무자를 대상으로 한다.
2. FP16에서 gradient 계산(S로 스케일링) … 5. N회 연속 overflow가 없으면 S 증가
Mixed-precision training은 정확한 누적을 위해 FP32 master weights를 사용하며, FP16에서는 underflow와 overflow를 방지하기 위해 dynamic loss scaling이 필요하다. BF16은 일반적으로 더 넓은 범위 덕분에 scaling이 필요 없다. 실무 workflow에는 gradient clipping 전 unscaling, overflow가 발생한 optimizer step 건너뛰기, scale factor의 동적 조정이 포함된다.
- 5. N회 연속 overflow가 없으면 S 증가: FP32 master weights는 BF16 정밀도에서 손실될 수 있는 작은 update를 보존해 여러 optimizer step에 걸쳐 정확한 누적을 보장한다.이는 긴 training run과 작은 learning rate에서 특히 중요하다. 반면 큰 learning rate를 사용하는 짧은 SFT run은 BF16-only training으로 처리할 수 있는 경우가 많지만, RL training에는 FP32 master weights가 필요하다.
- 2. FP16에서 gradient 계산(S로 스케일링): BF16 training은 FP32에 필적하는 범위를 가지므로 loss scaling이 필요 없으며, autocast workflow를 FP16보다 단순하고 수치적으로 안정적으로 만든다.BF16 경로에서는 gradient를 scaler 없이 직접 backpropagation하고 clipping한다.
- 2. FP16에서 gradient 계산(S로 스케일링): FP16 training은 backpropagation 전에 loss를 스케일링하고, clipping 전에 gradient를 unscaling하며, overflow가 발생하면 optimizer step을 건너뛰고 scale factor를 동적으로 줄이거나 늘린다.scaler는 NaN 또는 Inf가 감지되면 multiplier를 조정한다. N회 연속 overflow가 발생하지 않으면 scale을 늘릴 수 있다.
- 3. optimizer step 전에 gradient를 S로 나누기: FP16 gradient는 unscaling한 후에 gradient clipping을 수행해야 한다. 그렇지 않으면 clipping이 스케일링된 gradient에 잘못된 threshold를 적용한다.규정된 순서는 scaler.unscale_(optimizer), clip_grad_norm_, scaler.step(optimizer), 그 다음 scaler.update()다.
- 실전 Mixed Precision: HuggingFace: FP8 training은 fine-grained tile-wise scaling, stochastic rounding, 민감한 layer에 대한 higher precision을 함께 사용하면 BF16에 가까운 loss 품질을 유지할 수 있다.DeepSeek-V3 [70]는 약 $5.6M의 training cost로 671B-parameter model을 FP8에서 학습했으며, BF16 대비 relative loss degradation은 0.25% 미만이었다.
- 4. overflow(NaN/Inf) 확인; 발견되면 step을 건너뛰고 S 감소: Training diagnostics에서는 gradient norm, FP16 loss-scale stability, parameter-update norm을 모니터링해야 하며, overflow로 인한 scale 감소가 반복되면 BF16으로 전환할 필요가 있음을 의미한다.과도하게 큰 gradient norm이 반복되면 learning rate를 낮추거나 warmup을 늘려야 한다. 반면 norm이 0이면 vanishing gradient 또는 잘못된 loss를 의미한다.
1. 문서에서 핵심 사실 추출 … 강화학습 입문
제공된 자료는 prompt engineering과 model compression에서 inference optimization, hallucination detection, safety, GPU systems, reinforcement-learning foundations에 이르는 실무자 중심의 파이프라인을 제시한다. 구조화된 attention과 verification, 효율–품질 trade-off, 계층적 safety, 기본 policy-gradient methods의 한계를 강조한다.
- 3. 최종 답변 형식화: ARQ는 복잡한 질의를 분해하고, 초점이 맞춰진 context slice를 검색하며, 하위 답변을 집계해 긴 문서 QA, multi-hop reasoning, agentic tasks에서 lost-in-the-middle 효과를 완화한다.ARQ [403]는 모델이 어디에 attention을 둘지 명시적으로 관리하며, 구조화된 chain-of-thought로 기능한다.
- 1.13.8 모범 사례: 효과적인 Prompt 작성: Prompt quality는 specificity, examples, explicit output schemas, delimiters, role assignment, empirical iteration, modular software-engineering practices를 통해 향상된다.Prompt는 code처럼 versioning하고 평가해야 하며, 체계적인 실패는 SFT 또는 RLHF/DPO를 유도할 수 있다.
- 1.14 Model Compression Methods: Model compression은 quantization, pruning, distillation을 결합해 memory, latency, cost를 줄이는 동시에 compression ratio와 quality degradation 사이에서 trade-off를 만든다.제공된 비교에서는 4-bit AWQ가 35 GB, 2.5× speed, 97–98% quality를 보이는 반면, distilled 8B model은 16 GB를 사용하고 10× speed를 달성하며 80–85% quality를 유지한다.
- 1.14.3 Knowledge Distillation: Knowledge distillation은 더 풍부한 teacher output distributions를 작은 student로 전달하며, offline distillation은 reproducibility와 amortized teacher cost를 제공하고, online distillation은 freshness를 제공하며, black-box distillation은 API text outputs에서 작동한다.Soft-label distributions는 uncertainty와 near-miss alternatives를 드러내며, distillation을 4-bit quantization과 결합하면 20× compression에서 teacher에 가까운 quality를 달성할 수 있다.
- 1.16 Hallucination Detection: Model-level hallucination methods는 uncertainty 또는 self-consistency를 추정하는 반면, DoLA [58]는 mature layers와 premature layers를 대조해 retraining 없이 hallucinations를 줄인다. 이러한 methods는 보장된 incorrectness가 아니라 uncertainty를 탐지한다.따라서 신뢰할 수 있는 detection에는 retrieval-based verification 또는 external fact-checking tools가 필요하다.
RL Methods for LLMs … DPO — Direct Preference Optimization
이 절에서는 RL을 demonstration 품질을 넘어 LLM의 능력을 정렬하거나 향상하는 SFT 이후 메커니즘으로 제시한 뒤, 공통 RL 기법, PPO의 안정화 메커니즘, DPO의 closed-form preference optimization 대안을 전개한다. 또한 sparse reward, KL regularization, critic-free update, length normalization, reference-free objective를 비롯한 실용적 제약과 변형도 다룬다.
- 언어 모델을 위한 RL 기초: RL은 모델이 human demonstration을 넘어 더 높은 보상을 받는 행동을 발견하게 하므로, SFT 이후 alignment와 capability enhancement의 핵심이 된다 [280].RLHF는 human preference를 사용하는 반면, RLVR은 정답 여부나 code test 통과처럼 검증 가능한 결과를 사용하며, 둘 다 더 높은 보상을 향해 최적화한다.
- 언어 모델을 위한 RL 기초: LLM reinforcement learning은 token generation을 prompt와 prefix를 포함한 state, vocabulary token action, deterministic transition, 그리고 일반적으로 terminal reward를 갖는 MDP로 재구성한다.policy는 모델의 next-token distribution이다. RLHF score는 reward model에서 나오고, RLVR score는 최종 답의 정답 여부에서 나온다.
- 2. Reward Model Training:: RLHF는 KL constraint 아래에서 SFT policy, reward model, PPO 또는 GRPO optimizer를 학습하는 반면, RLVR은 preference modeling을 reasoning trace와 verifier로 대체한다.두 패러다임은 reward signal, reference-policy regularization, policy-gradient optimization을 공유한다. RLHF는 preference collection과 Bradley-Terry reward modeling을 따른다.
- PPO — Proximal Policy Optimization: PPO는 각 update를 ±20%로 제한하는 clipped surrogate objective를 사용해 policy-gradient learning을 안정화하며, catastrophic collapse와 과도하게 확신하는 specialization을 방지한다.min operator는 보수적인 bound를 선택한다. probability ratio가 trust region을 초과하면 좋은 action에 대한 증가는, 나쁜 action에 대한 감소는 clipping된다.
- PPO — Proximal Policy Optimization: PPO의 전체 update는 clipped policy loss, value loss, entropy regularization을 결합하는 반면, GRPO는 group-relative reward normalization을 통해 critic을 제거한다.LLM 특유의 제약에는 거대한 token action space, sparse feedback, KL anchoring, generation 중심의 on-policy rollout이 있다.
- DPO — Direct Preference Optimization: DPO는 KL regularization을 적용한 reward maximization의 closed-form optimum에서 supervised preference loss를 도출해 reward model과 명시적인 RL loop를 제거한다.reference policy는 deviation을 regularize한다. gradient는 chosen response의 확률을 높이고 rejected response의 확률을 낮추며, 혼동을 유발하는 preference pair에 가장 집중한다.
- 4. Preference optimization variants: Length-normalized DPO는 length gaming을 줄이지만 instruction-following 품질을 저하시킬 수 있으므로, 표준 unnormalized DPO가 production에서 여전히 더 흔하다.DPO training에는 충분한 global batch size도 필요하다. 32 미만에서는 implicit-reward gradient noise가 helpfulness와 safety objective 사이에서 파괴적인 진동을 일으킬 수 있다.
- 4. Preference optimization variants: SimPO는 reference-free이며 margin이 있는 length-normalized log-probability reward를 사용하므로, DPO보다 단순하고 ORPO보다 원칙에 충실하다.Reference model eviction은 70B model에서 약 140GB의 GPU memory를 절약해 더 큰 microbatch와 높은 throughput을 가능하게 한다.
GRPO — Group Relative Policy Optimization … Reward Model Training
이 절은 GRPO와 그 변형을 critic 없이 그룹 상대적 보상을 사용하는 강화학습 방법으로 제시한 뒤, 이를 preference optimization, best-of-N selection, reward-model training과 연결한다. 또한 memory, diversity, clipping, off-policy correction, compute, reward calibration 사이의 실용적 trade-off를 강조한다.
- GRPO — Group Relative Policy Optimization: GRPO [323]는 prompt마다 여러 completion을 sampling하고, 그룹 보상 통계를 empirical baseline으로 사용하며, PPO의 별도 value network를 제거한다.이를 통해 memory와 engineering complexity가 줄어들며, value-function estimate가 부정확할 때 PPO를 능가하는 경우가 많다.
- 4. 이러한 advantage를 사용해 PPO-style clipped update 적용: GRPO는 그룹 내부 보상을 advantage로 normalize하고 PPO-style clipped policy update를 적용해 평균보다 높은 response를 강화하고 평균보다 낮은 response를 억제한다.그룹 평균은 expected reward를 근사하며, standard deviation normalization은 prompt 간 advantage를 비교 가능하게 만든다.
- GRPO — Group Relative Policy Optimization: Verbalized Sampling [422]은 확률과 함께 여러 candidate를 유도해 alignment로 인한 mode collapse를 완화하며, fine-tuning 없이 semantic diversity가 높은 GRPO group을 구성할 수 있게 한다.creative writing에서 1.6–2.1×의 diversity gain을 제공하며, inference 중에도 적용해 training-free response collection을 수행할 수 있다.
- GRPO — Group Relative Policy Optimization: DAPO, GSPO, Dr. GRPO 및 관련 변형은 targeted objective 또는 sampling 변경을 통해 GRPO의 clipping, off-policy, pretraining-bias, truncation, reward-diversity failure mode를 해결한다.GSPO는 off-policy sequence-level importance sampling에 이론적으로 더 적합하며, Dr. GRPO는 task information에 거의 기여하지 않는 high-probability token의 가중치를 낮춘다.
- 2-GRPO in TRL: 2-GRPO는 대부분의 reasoning benchmark에서 G=16 GRPO와 비슷하거나 더 높은 성능을 내면서, GSM8K, MATH, code benchmark에서 accuracy loss 없이 약 4–6×의 end-to-end speedup을 제공한다.두 completion만으로 contrastive signal을 명시적으로 구성하지만, reward gap이나 partial credit이 중요할 때는 larger group이 여전히 유용할 수 있다.
- Preference Optimization Variants: Preference optimization 변형은 candidate response를 생성하거나 scoring한 뒤, GRPO의 per-sample advantage objective 대신 pairwise 또는 listwise preference를 optimize한다.Online DPO는 현재 policy와 reward model을 사용해 새로운 preference pair를 생성한 다음 DPO loss를 적용한다.
- Reward Model Training: Reward model은 모든 N response를 동시에 evaluate해 pairwise comparison보다 더 강한 rank separation을 학습하고 GRPO에 listwise signal을 제공할 수 있다.Listwise training은 rank-1이 rank-N보다 실질적으로 더 높은 reward를 받아야 한다는 점을 가르치며, 단순히 하나의 comparison response보다 선호된다는 것만 학습시키지 않는다.
SFT 모범 사례와 기법 · 대규모 시스템 아키텍처 및 인프라
이 절은 SFT를 RLHF의 행동적 기반으로 제시하며 packing, template correctness, completion-only masking, data mixing, forgetting control을 강조한다. 이어 메모리 효율적 병렬화, 분리된 synchronization, latency overlap, hardware-aware 인프라 선택을 통해 학습을 확장한다.
- SFT 모범 사례와 기법: SFT는 RLHF의 상한을 결정한다. reinforcement learning은 SFT 모델에 존재하는 행동을 개선할 수 있지만, 완전히 부재한 능력을 안정적으로 만들어낼 수는 없기 때문이다.이 절은 고품질·다양하고 과제를 포괄하는 데이터, 제한된 학습 기간, RL 전 pass@k 평가를 권장한다.
- Padding 문제: Sequence packing은 padding을 사용할 때의 20–50% 대비 활용률을 85–95%로 높이고, 분산이 큰 데이터셋에서 2–4× speedup을 제공하지만 block-diagonal masking과 non-padding loss가 필요하다.예제는 EOS separator로 연결하며, masking은 예제 간 attention과 cross-contamination을 방지한다.
- Chat Template과 Completion-Only Masking: 올바른 chat template과 completion-only masking은 학습을 assistant response에 집중시키는 반면, template 불일치나 prompt loss는 gradient signal을 낭비하고 instruction following을 저하시킬 수 있다.ChatML과 Llama 3는 서로 다른 special-token format을 사용한다. masking은 tokenization과 정확히 일치해야 하며 multi-turn conversation의 모든 assistant turn을 포함해야 한다.
- Multi-Task Data Mixing: Multi-task SFT에서는 conflicting gradient가 task interference를 일으키므로 data-mixing strategy가 필요하다. temperature mixing은 비례 sampling과 uniform sampling 사이를 보간하며, quality weighting은 더 나은 데이터셋을 우선한다.Temperature T = 1은 proportional mixing, T →∞은 uniform mixing, T < 1은 대규모 데이터셋, T > 1은 소규모 데이터셋을 선호한다.
- SFT가 해로울 때: Forgetting과 Alignment Tax: Catastrophic forgetting은 overwriting을 통해 기존 지식을 파괴하는 반면, alignment tax는 behavioral constraint를 통해 능력을 억제하므로 서로 다른 실패 양상을 만들며 각기 다른 완화책이 필요하다.Forgetting은 수학, multilingual ability, language diversity, rehearsal되지 않은 factual knowledge를 제거할 수 있다. Alignment는 over-refusal, stylistic stiffness, 낮은 raw-capability score, 감소한 high-entropy generation을 유발할 수 있다.
- 대규모 시스템 아키텍처 및 인프라: Sequence parallelism은 communication volume을 추가하지 않고, FSDP는 communication과 memory를 맞바꾸며, pipeline transfer는 compute에 비해 작게 유지될 수 있다. 따라서 topology와 overlap이 유리하면 대규모 모델 학습이 가능하다.Sequence parallelism은 tensor parallelism과 함께 활성화해야 한다. FSDP는 DDP로 수용할 수 없거나 communication이 compute와 70–90% overlap될 때 가장 유용하다.
- Decoupled DiLoCo: 데이터센터 간 학습: Decoupled DiLoCo는 주기적인 model-sized outer update만 통신하고 비동기적인 지역별 도착을 허용한다. 그 결과 bandwidth는 236× lower, wall-clock time은 fully asynchronous SGD보다 20× faster이며, 단일 데이터센터와 동일한 품질과 worker-failure tolerance를 달성한다.이 접근법은 매 step의 gradient synchronization을 지역 간 asynchronous coordinator-applied update로 대체한다.
- Latency, Memory, Cost, Hardware Scaling: Infrastructure optimization은 synchronization staleness, activation checkpointing, Flash Attention, overlap, hardware selection을 결합해 비용을 줄이고 long-context RLHF를 가능하게 한다.보고된 사례로는 50-step staleness에서 2% 미만의 quality loss, 약 60%의 activation-memory savings, 실행 가능한 8K–32K-token rollout, overlapped decoupled run의 35–50초와 monolithic run의 50–75초 비교, full 70B RLHF alignment에 약 $7,500가 있다.
LLM 에이전트 학습 · 추론 · 대규모 추론 모델을 위한 RL
에이전트 학습은 RL을 단일 턴 응답에서 구조화된 도구 행동, 실행 피드백, 희소 보상이 포함된 장기 궤적으로 확장한다. 추론 중심 방법은 자체 생성 trace, 언어적 성찰, search, trajectory preference, skill accumulation, verifiable reward를 통해 에이전트를 개선하며, reasoning model은 학습된 chain-of-thought와 증가한 test-time compute의 이점을 얻는다.
- 12.1 동기: Chatbot에서 Autonomous Agent로: 에이전트는 10–100+회의 tool call을 수행하고, 구조화된 action을 생성하며, 환경에서 도출된 feedback을 받고, 긴 horizon이 지난 뒤에야 성공 또는 실패를 확인할 수 있으므로, Agentic RL은 전체 trajectory를 최적화해야 한다.표준 single-turn RLHF와 달리 에이전트는 tool use와 internal reasoning 사이에서 선택하고, 오류에서 복구하며, exploration과 exploitation의 균형을 맞추고, partial observability를 처리해야 한다.
- 12.2 LLM Agent를 위한 Trajectory Buffer: Trajectory buffer는 replay를 평면적인 수치 tuple에서 textual context state, reasoning-plus-tool action, 실행에서 도출된 reward, 그리고 tool output이나 error log를 포함하는 갱신된 history로 변환한다.이러한 buffer는 self-correction, 필터링된 off-policy exploration, 그리고 학습 없이 성공 경험을 few-shot demonstration으로 retrieval하는 기능을 지원한다.
- 12.5.1 STaR: Self-Taught Reasoner (상세): STaR는 성공한 자체 생성 trace를 필터링하고, 정답을 조건으로 실패를 rationalize하며, 반복적으로 fine-tuning해 추론을 bootstrap한다. 일반적으로 3–5회 iteration에서 수렴하며 solve rate는 0.7–0.9다.이 방법은 external reward model 없이 간헐적인 정답 solution에서 학습하며, rationalization 단계는 모델이 solution에서 역방향으로 추론하도록 가르친다.
- 12.5.2 Reflexion: Verbal Reinforcement Learning (상세): Reflexion은 weight update 없이 episodic memory에 자연어 self-critique를 저장하고 이를 후속 prompt에 주입해 에이전트를 개선한다.gradient computation이 필요 없고 frozen API model에서도 작동할 수 있지만, context capacity와 task-specific memory에 의해 제한된다.
- 12.5.4 LATS: Language Agent Tree Search (상세): LATS는 WebShop에서 ReAct의 40%에 비해 75% success를 달성했고, HumanEval pass@1을 68%에서 94%로 향상했으며, inference FLOPs는 10–50× 더 높았다.LATS는 computation budget 내에서 Monte Carlo Tree Search를 사용해 후보 agent action을 확장하고, simulate하며, 평가하고, backpropagate한다.
- 12.5.5 AgentQ: Agent Trajectory에 대한 DPO (상세): AgentQ는 execution reward에서 trajectory preference를 구성해 세 번의 DPO iteration 동안 base policy 대비 WebShop success를 50%에서 82%로 향상했다.확장 기법으로는 MCTS-guided exploration, step-level DPO, self-play improvement가 있다.
- 12.5.8 OpenHands / SWE-Agent: Software Engineering을 위한 GRPO: GRPO 기반 RL 이후 SWE-bench Verified resolve rate는 SFT-only baseline과 비교해 30%에서 55%로 증가했다.OpenHands와 SWE-Agent는 tool과 test가 있는 repository에서 작동하며, binary regression-test success를 reward로 사용한다.
- 13.1.2 Chain-of-Thought: Emergent Behavior와 Trained Capability: RL로 학습된 chain-of-thought model은 self-correction, backtracking, verification을 포함하는 더 길고 탐색적인 reasoning을 생성하며, test-time compute는 inference token을 training 또는 model scale과 교환할 수 있다.추가 test-time computation에 따라 성능은 단조롭게 향상되며, N ≈40 이후 self-consistency의 수익은 감소한다. GSM8K에서 정확도는 PaLM-540B [55]를 사용한 CoT의 56.5%에서 N=40 self-consistency의 74.4%로 상승했다.
1. 현재 깊이의 각 노드에 대해 b개의 후보 사고 생성 … LLM 평가
이 절에서는 추가 추론 연산을 구조화된 탐색, 검증, 개선, 암묵적 탐색과 교환하는 test-time reasoning 방법을 제시한다. 또한 검증 가능한 보상, distillation, adaptive compute, intrinsic metric과 실제 효용 간 격차를 강조하며 reasoning model의 학습 및 평가 관행을 요약한다.
- Tree-of-Thoughts: Game of 24에서 CoT의 4% 대비 74% 성공률을 보인 결과는 동일한 GPT-4 base model로도 ToT의 구조화된 탐색이 추론을 크게 향상할 수 있음을 보여준다.b = 3, k = 2, d = 3일 때 ToT는 표준 CoT의 1회와 비교해 36회의 LLM 호출을 요구한다.
- Graph-of-Thoughts: Graph-of-Thoughts는 여러 추론 경로를 DAG로 병합해 ensemble reasoning과 divide-and-conquer 분해를 수행하면서, 트리 탐색을 aggregation과 refinement로 확장한다.sorting에서는 동등한 품질에서 GoT가 ToT보다 비용을 62% 줄이며, set intersection과 keyword counting에서는 LLM 호출을 30–40% 적게 사용하고도 ToT와 동일한 품질을 달성한다.
- Best-of-N과 MCTS: Best-of-N은 outcome reward 또는 process reward를 사용해 샘플링된 해 중에서 선택하며, MCTS는 value estimate, 방문 횟수, UCB 기반 exploration을 통해 탐색을 배분한다.불완전한 reward model은 N ≈64–256을 넘어서면 정확도가 정체되거나 감소하게 할 수 있지만, MCTS는 학습된 value와 구조화된 exploration을 결합한다.
- Beam Search, Refinement, and Selection Guide: 추론 시간 대안으로는 prefix에 대한 beam search, 반복적 self-correction, 그리고 compute budget, 병렬성, reward-model 가용성, 문제 분해 가능성에 기반한 adaptive method selection이 있다.반복적 refinement에는 self-verification, external check, critic model을 사용할 수 있으며, 권장 budget은 CoT 또는 Self-Consistency의 5× 미만부터 MCTS의 50–500×까지다.
- DeepSeek-R1 Training and Rewards: DeepSeek-R1은 cold-start SFT 이후 검증 가능한 수학 및 코드 보상을 사용하는 GRPO, rejection sampling, 추가 SFT, 최종 alignment-and-helpfulness RL 단계로 reasoning을 학습한다.R1은 process reward model 없이 accuracy reward와 format reward를 사용하며, outcome-only reward는 검증 가능한 task에 충분하고 step-level reward-hacking 실패 모드를 피할 수 있다.
- GRPO Formulation and Stability: R1의 GRPO는 response group을 샘플링하고 별도의 value network 없이 advantage를 정규화하며, G = 8로 variance와 compute의 균형을 맞추면서 frontier problem에 학습을 집중한다.모든 response가 정답이거나 오답인 group은 gradient를 0으로 만들어, mean reward가 상승하고 reward variance가 감소할수록 자연스러운 curriculum을 형성한다.
- Evaluation and LLM Evaluation: 평가 논의는 비용이 저렴한 intrinsic metric과 더 느린 extrinsic validation을 구분하며, agent benchmark는 task success 또는 issue resolution과 BERTScore, G-Eval, preference modeling 같은 human-aligned method를 사용한다.SWE-bench는 % Resolved를 측정하고 WebArena는 task success rate를 보고하며, perplexity 같은 intrinsic metric은 실제 유용성과 상관이 낮을 수 있다.
Agentic AI … 4. 커뮤니티 요약: LLM이 각 커뮤니티의 요약을 생성한다
Agentic AI 시스템은 LLM을 단일 턴 응답에서 반복적인 인지–추론–행동 루프로 확장하며, RAG는 검색, 청킹, 근거 기반 생성을 통해 동적인 외부 지식을 제공한다. 더 넓은 아키텍처는 메모리, 오케스트레이션, 도구, 조정, 평가, 인간 감독을 통합하지만, 제공된 자료는 엔터티 추출, 문서 평가, 커뮤니티 요약 생성을 상세히 다루지 않는다.
- Agentic AI: Agentic AI 시스템은 관찰을 수신하고, 추론하며, 도구나 API를 통해 행동을 수행하고, 목표를 달성하거나 인간의 입력을 요청할 때까지 반복하는 루프에서 작동한다.이는 단일 턴 챗봇과 대조되며, 지속성, grounding, 행동, 조정, 안전성에 대한 요구를 만든다.
- Agentic AI 입문: Agentic stack은 에이전트 코어를 중심으로 지식 검색, 메모리, 오케스트레이션, loop engineering, 설계 패턴, 평가, 도구 통합, 에이전트 간 통신, 프레임워크, 사용자 상호작용을 계층화한다.하네스는 컨텍스트, 상태, 도구 디스패치, 복구, guardrail, 관측 가능성을 관리하며, MCP와 A2A는 도구 및 에이전트 통신을 표준화한다.
- Retrieval-Augmented Generation (RAG): RAG는 정적인 모델 지식에 대한 의존을 동적인 외부 메모리로 대체하여, 독점적·최신·도메인 특화·지식 집약적 과제의 grounding을 향상한다.이는 parametric LLM 지식의 환각, 지식 노후화, 도메인 특이성 한계에 대응한다.
- 1. top-k 문서 검색: 표준 RAG 파이프라인은 오프라인에서 이질적인 문서를 인덱싱하고, 온라인에서 관련 청크를 검색하며, 제약된 출처 인용 생성을 위해 해당 청크를 프롬프트에 주입한다.문서 로딩은 메타데이터를 보존하고, 청킹은 의미적으로 응집된 세그먼트를 추구하며, 임베딩은 벡터 데이터베이스에 저장되고, 검색은 top-k 청크를 컨텍스트로 반환한다.
- 5. 정제된 컨텍스트에서 답변 생성: Grounded generation은 검색된 컨텍스트만을 바탕으로 답변하고, 정보가 부족함을 명시적으로 인정하며, 문서 식별자를 사용해 출처를 인용하도록 모델에 지시한다.제공된 구절은 정제된 검색 컨텍스트에서의 생성을 설명하지만, 별도의 Correct/Ambiguous/Incorrect 문서 평가 절차는 명시하지 않는다.
- 검색 및 문서 평가: RAG 검색은 lexical 및 semantic 방법을 결합할 수 있으며, SPLADE는 GPU 쿼리 시점 검색 없이 inverted-index 조회를 지원하는 sparse semantic expansion을 제공한다.SPLADEv2는 cross-encoder distillation, asymmetric sparsity, FLOPS-aware regularization, 더 작은 DistilBERT backbone을 추가한다. MS MARCO에서 MRR@10은 36.8로 34.0보다 높고, 문서당 0이 아닌 항은 약 120개로 200개보다 적다고 보고한다.
- 1. 정확한 검색을 위해 작은 child 청크(예: 128 tokens) 인덱싱: Parent-child chunking은 정확한 검색을 위해 작은 child 청크를 인덱싱하고, 더 풍부한 생성 컨텍스트를 위해 더 큰 parent 청크를 LLM에 반환한다.이는 검색 세분성과 생성 컨텍스트를 분리하며, 별도의 child 및 parent splitter로 구현된다.
- 4. 커뮤니티 요약: LLM이 각 커뮤니티의 요약을 생성한다: 제공된 구절은 엔터티 추출, 커뮤니티 구성, 또는 LLM이 생성하는 커뮤니티 요약을 위한 메커니즘이나 결과를 제공하지 않는다.따라서 해당 작업은 요청된 섹션 레이블에 나타난 내용을 넘어서는 수준으로 요약할 수 없다.
3. 최종 답변 정확도 채점 (ground truth 대비 exact match 또는 F1) … Agentic Memory Systems
이 절은 agentic reasoning을 개선하는 메커니즘으로 학습된 search와 memory를 제시한다. Search-R1은 언제 어떻게 retrieve할지 학습하고, memory systems는 장기 horizon task 전반에서 context, experience, knowledge, skills를 보존한다. 또한 retrieval, generation, end-to-end behavior를 함께 평가해야 하며, production에서는 latency, cost, reliability 간 trade-off를 고려해야 함을 강조한다.
- 4. Compute group-relative advantage: ˆAi = (Ri −µG)/σG: standard RAG보다 15–20% 높은 accuracy와 prompted agentic RAG보다 8–12% 높은 accuracy를 보이며, Search-R1의 7B model은 open-domain QA에서 훨씬 큰 model에 근접한다.이 방법은 불확실할 때 search하고, 효과적인 query를 formulate하며, 반복적으로 search하고, retrieved context를 통합하도록 학습한다.
- 16.8 Evaluation: RAG evaluation은 retrieval quality, generation quality, end-to-end task success를 측정해야 한다. 오류는 서로 다른 단계에서 발생하며 누적될 수 있기 때문이다.관련 metric으로는 Recall, Precision, MRR, NDCG, correctness, faithfulness, answer relevance, human preference, task success rate, latency-adjusted utility가 있다.
- 16.11 Comprehensive RAG Approach Comparison: Production RAG systems는 query type, corpus scale과 dynamism, latency, grounding requirements, vocabulary specialization, indexing consistency, retrieval cost 사이에서 균형을 맞춰야 한다.권장 mechanism으로는 incremental indexing, metadata versioning, pre-filtering, approximate nearest-neighbor search, caching, parallel retrieval, streaming generation이 있다.
- Agentic Memory Systems: Memory systems는 agent가 장기 horizon observation을 보존하고, experience를 재사용하며, personalization을 유지하지 못하게 하는 고정된 context-window limits를 해결한다.이 taxonomy는 access pattern, update frequency, retrieval mechanism에 따라 working, episodic, semantic, procedural memory를 구분한다.
- 17.3.1 RAG-Based Memory: External memory는 일반적으로 dense, sparse 또는 hybrid retrieval을 사용하며, re-ranking은 accuracy를 높이고 provenance metadata와 faithfulness check는 retrieval hallucination을 완화한다.Hybrid retrieval은 reciprocal rank fusion을 통해 dense와 sparse score를 결합하며, 어느 하나만 사용하는 경우보다 일관되게 우수한 것으로 보고된다 [44].
- Agentic Memory Systems: LOCOMO에서 Mem0는 OpenAI’s baseline memory 대비 26% relative improvement, 91% lower p95 latency, >90% lower token cost를 달성한 것으로 보고된다.이 절은 또한 A-MEM이 여섯 개 foundation model에 걸쳐 flat vector, summarization-based, graph-database memory보다 우수하다고 보고한다.
- 17.11.3 Sleep-Time Compute: Offline Memory Processing: 관련 query가 예측 가능한 context를 공유할 때 sleep-time compute를 사용하면 ∼5× lower test-time compute와 2.5× lower average query cost를 달성한다.그 효과는 user query가 예측 가능하고 processed context에 의해 강하게 제약되는지에 달려 있다.
- Proactive Memory: Empirical Results: Proactive memory는 지속적인 constraint adherence를 안정화하고 100 tool calls 이후에도 효과적이지만, API cost를 ∼40% 증가시킨다.Memory agent가 없으면 executor success rate는 ∼30 tool calls 이후 급격히 하락하며, architecture는 reactive retrieval에서 anticipatory intervention으로 전환된다.
에이전트 하네스 – 컨텍스트 관리와 오케스트레이션 · 루프 엔지니어링
에이전트 하네스는 상태, 도구, 메모리, 라우팅, 안전성, 관측 가능성으로 LLM을 감싸며, 컨텍스트 관리는 신뢰할 수 있는 동작을 유지하도록 유한한 토큰을 할당하고 압축한다. 루프 엔지니어링은 이 인프라를 추론 시간 최적화로 확장하며, 동결된 모델이 누적 상태, 검증, 성찰, 예산 인지형 반복을 통해 개선되도록 한다.
- 에이전트 하네스 – 컨텍스트 관리와 오케스트레이션: 에이전트 하네스는 도구 실행, 여러 메모리 유형, 통신, 관측 가능성을 관리해 무상태 LLM을 상태를 유지하며 목표 지향적인 에이전트로 변환한다.하네스는 추론, 실행, 메모리, 통신, 관측 가능성의 책임을 분리한다.
- 18.2 컨텍스트 윈도우 관리: 모든 토큰에는 비용과 지연 시간이 발생하고, 유한한 컨텍스트 윈도우 밖의 토큰은 모델에 보이지 않기 때문에 컨텍스트 관리가 중요하다.히스토리와 도구 출력이 늘어날수록 하네스는 컨텍스트 예산을 강제하고, 지시를 지우거나 불완전한 컨텍스트 환각을 일으킬 수 있는 무음 잘림을 방지해야 한다.
- 18.2.2 컨텍스트 할당 전략: 동적 할당은 토큰 제약 아래에서 효용이 높은 컨텍스트 구성 요소를 우선시하고, 압축은 요약, 관련성 기반 선택, 중요도 가중 잘림을 사용한다.이전 턴 요약은 일반적으로 5–10× 더 짧으며, 중요도 가중 잘림은 가중치가 낮은 턴부터 제거한다.
- Recursive Language Model (RLM): Recursive Language Models는 지나치게 큰 컨텍스트를 청크로 나누고 각 청크를 재귀적으로 질의한 뒤 결과를 집계하므로, 하나의 호출이 전체 컨텍스트를 처리하지 않는다.Zhang et al. [420]은 Recursive GPT-5-mini가 어려운 장문 컨텍스트 벤치마크에서 non-recursive GPT-5보다 우수하면서도 질의당 비용은 더 낮다고 보고한다.
- 18.3 프롬프트 아키텍처: Production 하네스는 모듈형 프롬프트와 명시적 도구 시그니처를 조합해 버전이 지정된 프롬프트 구성 요소, 더 명확한 도구 선택, 타입이 지정된 매개변수, 반환 형식, 운영 제약을 가능하게 한다.도구 설명에는 도구를 사용하거나 피해야 하는 경우, 권한, rate limit, 부작용, 관련 출력 구조를 지정할 수 있다.
- 19.2 추론 시간 강화학습으로서의 루프 엔지니어링: 루프 엔지니어링은 에이전트 루프를 추론 시간 강화학습으로 다룬다. 정책 가중치는 동결된 상태로 유지되지만, 환경이 이후 입력을 형성하는 동안 상태 누적이 조건화를 풍부하게 한다.이 대응 관계는 인간–에이전트 협업을 대화에 참여하는 일에서 자율적으로 대화를 수행하는 시스템을 설계하는 일로 전환한다.
- 검증 루프: 테스트가 통과할 때까지 수정: 피드백이 신뢰할 수 있을 때 검증 및 성찰 루프는 반복 성능을 향상한다. 테스트 러너는 위조할 수 없는 비평가를 제공하며, Reflexion은 HumanEval에서 기준선 67% 대비 91% pass@1에 도달한다 [326].지속적인 성찰 메모리는 에이전트가 동일한 실패를 반복하지 않도록 도와 반복적 환경에서 언어적 자기비평이 가중치 업데이트를 대신할 수 있게 한다.
- 루프 비용 모델: 루프 배포에서는 목표, 일정, 예산을 가치에 맞춰야 한다. 루프는 엔지니어링 역량을 증폭하지만 잘못된 목표를 효율적으로 추구하거나 비용 폭증을 초래할 수 있기 때문이다.$0.02씩 20회 반복하면 $0.40이 들지만, 제한 없는 overnight 루프는 수백 달러를 소모할 수 있다.
Agent Design Patterns … Model Context Protocol (MCP)
이 절에서는 단순한 workflow에서 adaptive agent pattern으로 나아가는 과정을 제시한 뒤, 표준화되고 안전한 환경이 신뢰할 수 있는 평가를 가능하게 하는 방식과 MCP가 tool integration의 복잡성을 줄이는 방식을 설명한다.
- Agent Design Patterns: Workflow는 미리 정의되고 예측 가능한 제어 흐름을 사용하는 반면, agent는 새로운 상황을 유연하게 처리하기 위해 동적으로 행동을 선택한다. Workflow에서 시작하고 필요한 경우에만 자율성을 추가해야 한다.Workflow는 비용이 낮고 테스트하기 쉬운 반면, agent는 적응적 의사결정이 필요한 작업에 적합하다.
- Agent Design Patterns: 핵심 workflow pattern에는 validation gate를 포함한 prompt chaining, specialist로의 routing, 병렬 sectioning 또는 voting, model-generated orchestrator-worker, evaluator-optimizer refinement가 포함된다.이 pattern들은 각각 순차적 작업, 서로 다른 task type, 동시적인 독립 작업, 개방형 decomposition, 명시적 기준에 따른 반복적 품질 개선을 지원한다 [246].
- Agent Design Patterns: 자율적 pattern은 ReAct loop, 수정 가능한 planning, reflection, 지속적인 failure memory, 특화된 tool-use pattern을 통해 제어 범위를 LLM으로 확장한다.ReAct는 reasoning, tool call, observation을 번갈아 수행하며 [408], Reflexion은 weight update 없이 episode 전반에 걸쳐 자연어 reflection을 저장한다 [326].
- Agent Design Patterns: 신뢰할 수 있는 agent 실행에는 inspectable step, structured output, 다양한 testing, retry와 fallback, 그리고 infrastructure failure를 model에 노출하지 않고 처리하는 harness가 필요하다.설계 지침은 단순성과 투명성을 중시하며, structured schema는 parsing failure를 줄이고 adversarial testing은 다양한 tool-call sequence를 포괄한다.
- Agentic Environments and Benchmarks: Agent 평가는 agent가 단일 점수화 응답을 생성하는 대신 일련의 step에 걸쳐 행동하고 결과를 관찰하며 적응해야 하므로 structured environment를 필요로 한다.이러한 environment는 안전한 exploration, 재현성, 그리고 task 난이도를 점진적으로 높이는 curriculum을 지원해야 한다.
- Agentic Environments and Benchmarks: Environment engineering은 observation, action, reward, episode structure를 정렬하는 동시에 observation leakage와 reward hacking을 방지해야 한다. Adaptive horizon과 difficulty curriculum은 learning efficiency를 높인다.Observation은 text, structured, multimodal 또는 hybrid일 수 있으며, reward는 정렬되어 있고 학습 가능하며 변조에 강해야 한다.
- Agentic Environments and Benchmarks: Benchmark 결과는 상당한 human–agent gap을 드러낸다. OSWorld에서는 human success가 대략 72%인 반면 가장 강력한 LLM agent는 ∼18%를 기록하며, GAIA에서는 human accuracy가 ∼92%인 반면 출시 당시 plugin을 사용한 GPT-4는 ∼15%, 이후 system은 ∼30%를 기록한다.이 격차는 computer use에서 가장 크며, action space와 training data의 상대적 성숙도를 반영한다.
- Model Context Protocol (MCP): MCP는 pairwise integration을 shared protocol implementation으로 대체하여 AI tool connectivity를 표준화한다. 20개의 agent와 50개의 provider에 대해 custom connector 1,000개를 70개의 implementation으로 줄여 14× reduction을 달성한다.이 protocol은 quadratic integration problem을 linear problem으로 변환하며, USB, HTTP, LSP를 통한 표준화와 맥을 같이한다.
2. 클라이언트에서 직접 API 호출을 session.call_tool()로 대체하기 … Agent-to-Agent Communication (A2A)
이 절은 tool-using agent를 위한 표준화된 기반으로서 MCP를 제시하며, RL 환경, trajectory 수집, 상호운용 가능한 배포를 지원하는 방식을 설명한다. 이어서 조합 가능한 capability unit으로서 skills를 발전시키고, 전문화된 agent 간 검색 가능하고 안전하며 비동기적인 협업을 위한 protocol로서 A2A를 다룬다.
- 22.10.1 RL 환경 인터페이스로서의 MCP Servers: MCP는 tools를 구조화된 action space로, resources를 observations로, tool results를 rewards로, reset tools를 RL 환경의 episode management로 노출한다.JSON Schema는 tool parameters를 안정적으로 parse할 수 있게 하며 training 중 체계적인 exploration을 지원한다.
- 22.10.1 RL 환경 인터페이스로서의 MCP Servers: MCP를 사용하는 모든 RL framework는 custom environment code 없이 coding tools, environment resources, test-passing rewards를 활용해 SWE-bench에서 training할 수 있다.이 예시는 read_file, write_file, run_tests, apply_patch, search_codebase를 environment의 tools에 매핑하고, 통과한 tests의 비율을 reward로 사용한다.
- 22.10.2 MCP를 통한 표준화된 Action Spaces: MCP는 서로 다른 tool environments를 표준화하므로 policies가 사용 가능한 actions를 조건으로 삼고 새로운 tool sets에 zero-shot으로 일반화할 가능성이 있다.MCP는 arguments, results, duration, errors, success, reward를 포함한 구조화된 tool-use trajectories도 기록하여 chat-format SFT examples로 변환할 수 있게 한다.
- Tool-Using Agents를 위한 Universal Gym으로서의 MCP: MCP는 tool-using agents를 위한 universal gymnasium으로 제안되지만, reward fields, reset semantics, structured observation schemas, compatible benchmark suites는 여전히 미해결 문제로 남아 있다.이 요약은 MCP를 action spaces 정의, trajectories 수집, 환경 전반에 RL-trained agents 배포를 위한 표준화되고 확장 가능한 interface로 규정한다.
- Agent Skills: Skills는 prompts, tool bindings, knowledge, workflow logic, guardrails를 재사용 가능한 capabilities로 묶어 retraining 없이 load, compose, swap할 수 있게 한다.Static loading은 단순하지만 context를 낭비하는 반면, dynamic discovery는 더 큰 libraries로 확장되지만 routing latency를 추가하고 관련 skills를 놓칠 수 있다.
- Anthropic의 핵심 통찰: Anthropic의 design은 augmented LLM—model과 retrieval, tools, persistent memory의 결합체—을 atomic unit으로 취급하며, 정교한 orchestration보다 단순한 loops와 높은 품질의 tool descriptions를 선호한다.Skills는 각 capability의 범위를 좁고 조합 가능하게 유지하면서 task framing과 tool quality를 위한 구조를 제공한다.
- 24.2.2 Agent Cards와 Task Lifecycle: A2A는 lifecycle states를 지닌 stateful Tasks로 작업을 모델링하며, 장시간 실행되는 tasks에 대해 SSE 또는 webhook push notifications를 통해 incremental output을 지원한다.Agent Cards는 /.well-known/agent.json에 machine-readable manifest를 사용하고, authentication 및 authorization schemes는 특정 operations를 요청할 수 있는 주체를 통제한다.
- 핵심 요점: Agent-to-Agent Communication: A2A는 agents 간 tasks를 routing하여 specialization at scale을 가능하게 하고, context limits, parallel work, delegation, fault isolation을 관리하면서 systems가 breadth와 depth를 결합하도록 돕는다.요구사항에는 discoverability, interoperability, asynchrony, security, observability가 포함되며, Agent Cards는 capability-based routing을 위해 capabilities, authentication, task endpoints를 알린다.
다중 에이전트 시스템 … 에이전트 개발 프레임워크
이 절은 다중 에이전트 시스템을 단일 에이전트의 확장 가능한 대안으로 제시하며, 전문화된 역할, 아키텍처 토폴로지, 조정 프로토콜, 상호작용 패턴을 중심으로 구성한다. 이어서 에이전트 개발 프레임워크로 넘어가 NOOA의 Python-native·model-agnostic 에이전트, live object reference, 내장 tracing 같은 추상화를 강조한다.
- 25.1 동기: 왜 여러 에이전트인가: 전문화된 에이전트 팀은 전문화, 병렬성, 견고성, 창발적 집단 능력을 통해 복잡한 작업에서 generalist LLM보다 뛰어난 성능을 낼 수 있다.전문화된 에이전트는 맞춤형 모델, 프롬프트, retrieval, verification, 동시 실행을 활용할 수 있으며, debate와 반복적 refinement를 통해 개별 에이전트에는 없는 능력을 만들어낼 수 있다.
- 25.2 다중 에이전트 아키텍처: 다중 에이전트 topology는 권한과 통신을 결정한다. centralized supervisor는 제어를 단순화하고, decentralized mesh는 복원력을 높이며, hierarchy는 context를 분배하고, swarm은 local rule과 handoff를 통해 조정한다.Centralized system은 명확한 책임성을 제공하지만 manager bottleneck과 단일 장애 지점에 직면한다. Decentralized system은 bottleneck을 피하지만 debugging이 더 어렵고 O(n2)의 메시지 오버헤드가 발생할 수 있다.
- 25.3 조정 메커니즘: 조정 메커니즘에는 shared blackboard, structured message passing, task-DAG planning, voting 또는 debate 기반 consensus, market bidding, shared environment를 통한 stigmergy가 포함된다.Market coordination은 task-auction 논리를 따른다. Manager가 요구사항을 공고하고, 에이전트가 능력과 비용을 바탕으로 bid를 제출하며, manager가 contract를 수여하고, 낙찰자가 실행한 뒤 결과를 보고한다. 이러한 메커니즘은 자원이 제한된 환경에 적합하다.
- 25.4 통신 프로토콜: 신뢰할 수 있는 에이전트 간 통신에는 structured format, 명시적 performative, 정보량·비용·context-window 한계 사이의 균형을 맞추는 context-sharing policy가 필요하다.Full history는 짧은 대화에 적합하고, summary는 중간 길이의 교환에 적합하며, retrieval-augmented excerpt는 가장 최근 k개 메시지를 원문 그대로 보존하면서 긴 세션에 적합하다.
- 25.5 역할 설계와 전문화: 역할과 persona 설계는 전문화를 좌우한다. Capability 기반 할당은 유연하고, dynamic reassignment는 workload와 failure에 대응하며, diverse persona는 groupthink를 줄이고, 명시적 conflict rule은 모순된 출력이나 loop를 방지한다.이 절은 예측 가능한 role-based assignment와 capability matching을 대조하며, 다양한 추론을 위해 skeptic, pragmatist, devil’s advocate 같은 persona를 권장한다.
- 25.6 LLM을 위한 다중 에이전트 패턴: 효과적인 LLM 다중 에이전트 패턴에는 debate, reflection, parallel division of labor, sequential pipeline, ensemble이 포함되며, CTDE는 inference-time communication 없이 centralized training과 decentralized execution을 결합한다.Debate는 factual accuracy를 높이고 hallucination을 줄이며, reflection은 generate-critique-revise loop를 구현하고, ensemble은 추가 계산량을 reliability 향상과 교환한다.
- 다중 에이전트 시스템: 핵심 요지: 이 절의 핵심 요지는 집중된 역할과 맞춤형 프롬프트가 품질을 향상시키는 한편, 팀이 조정 복잡성과 prototyping과 production 사이의 maturity gap에 대응해야 한다는 것이다.Maturity model 구절은 stage 2와 3 사이의 전환이 흔히 과소평가된다고 지적한다.
- 에이전트 개발 프레임워크: 에이전트 개발 프레임워크는 graph 및 protocol 지향 시스템부터 NOOA의 Python-native abstraction까지 다양하며, 여기서 field는 state, method는 capability, docstring은 prompt, annotation은 contract를 나타낸다.NOOA는 live Python object를 reference로 전달하고, 기본적으로 중첩 실행을 trace하며, UnifiedLLM layer를 통해 Anthropic, OpenAI, Ollama, vLLM 전반에서 model-agnostic으로 동작한다. Production system에는 observability와 cost control도 필요하며, 이를 통해 API cost를 50–90% 줄일 수 있다.
Agentic UI 프레임워크
Agentic UI는 단순히 답변을 반환하는 데 그치지 않고 과정, 추론, 도구 사용, 개입 지점, 복구를 드러내야 한다. 이 절에서는 투명한 협업을 중심으로 증강 채팅부터 캔버스, 워크플로 시각화, 대시보드, generative UI에 이르는 인터페이스를 제시한다.
- 설계 목표: Agentic UI 설계는 투명성, 제어, 신뢰 보정, 효율성, 복구 가능성을 우선시하여 사용자가 agent의 동작을 이해하고 개입하며 되돌릴 수 있도록 한다.이러한 목표는 내부 상태를 이해 가능하게 만들고, 의미 있는 개입 지점을 제공하며, 사용자의 mental model을 보정하고, 인지 부하를 줄이며, 실수를 저렴하게 탐지하고 되돌릴 수 있게 한다.
- 채팅 패러다임: 채팅 인터페이스에는 streaming, 도구 표시기, 상태 메시지, threaded 중간 단계를 추가할 수 있지만, 선형 stream은 복잡한 워크플로에서 병렬 실행 그래프를 잘못 나타낸다.agent가 여러 도구로 분기할 때는 실행 구조를 정확하게 표현하기 위해 더 풍부한 패러다임이 필요하다.
- Canvas 패러다임: Canvas UI는 대화와 실시간 편집 가능한 산출물을 결합하여 반복적 개선, 직접 편집, 수정 롤백, 그리고 writing, coding, analysis, design을 위한 복수 산출물을 지원한다.이 패러다임은 출력이 대화형 답변이 아니라 문서나 artifact인 공동 창작 작업에 특히 적합하다. 예로 Claude Artifacts1와 ChatGPT Canvas,2가 있다.
- 워크플로 시각화: 워크플로 시각화 UI는 agent 계획을 그래프, 체크리스트, 타임라인으로 렌더링하고 실시간 노드 상태를 표시하며, LangGraph Studio3는 검사, 재생, 수정된 상태 테스트를 지원한다.이러한 인터페이스는 데이터 또는 제어 흐름, 출력, 실패, 대안 경로를 포함한 구조화된 실행을 명시적이고 추적 가능하게 만든다.
- 투명한 협업과 generative UI: 지향점은 동작과 추론에 접근할 수 있고 실수를 복구할 수 있으며 역량이 명확한 투명한 협력자다. generative UI는 적응형 차트, 폼, 지도, 위젯을 통해 이를 확장한다.더 많은 정보를 제공하는 인터페이스는 실행 취소 옵션과 명시적 한계를 포함한 검증 및 복구 정보를 보여 줌으로써 신뢰를 구축할 수 있다.
평가 및 참고 · 퀴즈 질문 및 상세 답변
평가 장에서는 점진적으로 구조화된 질문과 상세한 답변을 통해 가이드의 기초, 알고리즘, 시스템, 고급 학습 개념을 강화한다. 설명은 핵심 메커니즘을 실용적 트레이드오프, 정량적 경험칙, 반복적으로 나타나는 실패 모드와 함께 제시한다.
- Q0b: Flash Attention을 설명하라. 어떤 문제를 어떻게 해결하는가?: Flash Attention은 HBM 메모리를 O(T^2)에서 O(T)로 줄이고, 2–4× wall-clock speedup을 달성하며, tiling, online softmax, recomputation을 통해 수치 출력을 정확히 보존한다.이 방법은 HBM에 전체 attention matrix를 materialize하지 않고, SRAM에서 tiled block을 계산한다.
- Q0c: SFT, RLHF, DPO: SFT는 demonstration에서 형식을 학습하고, RLHF는 PPO로 학습된 reward를 최적화하며, DPO는 preference pair를 직접 최적화한다. 일반적인 pipeline은 SFT first를 적용한 뒤, data와 compute 제약에 따라 RLHF 또는 DPO를 사용한다.SFT는 gold-standard output에, DPO는 compute가 제한된 preference pair에, RLHF는 인프라 비용을 감당할 수 있을 때 최대 품질 달성에 적합하다.
- Q0d: Reward model: Reward model은 Bradley-Terry preference pair에서 scalar quality score를 학습하지만, reward hacking, distribution shift, label noise, overconfidence로 인해 높은 score가 실제 품질과 어긋날 수 있다.Reward hacking에는 model bias를 악용하는 지나치게 길거나 반복적이거나 특정 phrase를 겨냥한 output이 포함된다.
- 28.2 핵심 알고리즘 질문: PPO는 probability ratio를 [0.8, 1.2]로 clip해 하나의 sample이 복구 불가능한 policy jump를 일으키는 것을 방지하고, exploration은 temperature, KL penalty, GRPO group sampling을 통해 균형을 맞춘다.Exploration이 너무 적으면 local optima에 빠지고, 너무 많으면 training이 불안정해지며 품질이 fluctuation한다.
- Q3: GRPO vs PPO: GRPO는 검증 가능한 binary reward를 선호하고 value-function training을 피하는 반면, PPO는 미묘한 continuous reward를 더 잘 처리한다. GRPO의 group sampling은 더 많은 generation을 통해 training complexity를 낮추는 대가를 치른다.경험칙은 right-or-wrong reward와 제한된 compute에는 GRPO를, 미묘한 reward-model score와 최대 품질에는 PPO를 사용하는 것이다.
- 28.3 시스템 설계 질문: 시스템 설계 답변은 throughput과 stability를 강조한다. Generation과 training을 overlap하면 1.3–1.5× throughput을 달성하고, 50-step weight staleness는 win-rate를 2% 미만 저하시킨다.이 장에서는 large-model RL이 step당 안정적이더라도 비용이 크다고 설명하며, 실패한 405B run 하나가 compute에서 $100K를 초과하는 비용을 낭비할 수 있다고 지적한다.
- 고급 최적화 및 평가 질문: 고급 질문은 training 선택을 측정 가능한 결과와 연결한다. MATH에서 PRM plus best-of-N은 ORM plus best-of-N보다 10–20% 우수하고, speculative decoding은 end-to-end RLHF speedup을 1.5–2× 제공하며, continuous batching은 utilization을 90% 이상으로 높인다.그 밖의 지침으로는 명확한 RL signal을 위해 successful prompt를 20–80% 사용하고, pass@1=5%, pass@64=60%을 이상적인 RL 사례로 인식하는 것이 있다.
Q: LLM에서 decoder-only 아키텍처가 encoder-decoder를 앞선 이유는? … Q: 소형 reasoning model 구축에서 distillation과 직접 RL 비교
이 절은 decoder-only model과 여러 시스템 최적화가 실용적인 LLM을 지배하는 이유를 설명한 뒤, trajectory-aware agent training과 reasoning model 구축 전략을 대조한다. 핵심 trade-off는 계산 효율성, reward 설계, 일반화, inference-time scaling에 있다.
- Q: LLM에서 decoder-only 아키텍처가 encoder-decoder를 앞선 이유는?: Decoder-only 아키텍처는 next-token prediction을 통해 pretraining, fine-tuning, inference를 통합하면서 모든 parameter를 generation에 사용하고 단일 KV cache를 활용한다.또한 scaling을 단순화하고 in-context few-shot learning을 자연스럽게 지원하지만, translation과 같은 고정 길이 seq2seq task에서는 encoder-decoder model이 여전히 더 적합하다.
- Q: Flash Attention이 FFN layer에는 도움이 되지 않는 이유는?: Flash Attention은 tiled computation과 exact online softmax를 SRAM에 유지해 attention을 가속하며, FLOPs가 아니라 HBM traffic을 줄인다. 반면 FFN은 여전히 compute-bound다.Online softmax는 block을 처리하는 동안 running statistics를 유지해 전체 n × n attention matrix를 materialize하지 않는다.
- Q: DoRA란 무엇이며 standard LoRA보다 성능이 뛰어난 이유는 무엇인가?; Q: LoRA는 왜 작동하는가? low-rank 업데이트를 정당화하는 이론적 통찰은 무엇인가?: LoRA는 저차원 fine-tuning 부분공간을 활용하는 반면, DoRA는 weight magnitude와 direction을 별도로 학습해 추가 inference compute 없이 reasoning 성능을 1–3% 향상시킨다.LoRA는 업데이트를 rank r로 제한하고, DoRA는 full fine-tuning에서 가능한 magnitude와 direction의 독립적인 자유도를 복원한다.
- Q: NVIDIA 2:4 structured sparsity를 설명하라. speedup과 제약은 무엇인가?: Structured 2:4 sparsity는 네 element마다 정확히 두 개의 zero를 요구하며, 전용 A100/H100 Tensor Core instruction을 통해 2× throughput을 달성한다.이 speedup은 임의의 sparsity를 사용하는 것이 아니라 hardware가 지원하는 50% pattern을 보존하는 데 달려 있다.
- Q: Speculative decoding은 “no quality loss”라고 주장한다. token을 다르게 생성하면서 어떻게 동일한 output distribution을 만들 수 있는가?; Q: Speculative decoding이 high batch size에서 도움이 되지 않는 이유는?: Speculative decoding은 acceptance-rejection을 통해 target distribution을 보존하지만, 이점은 workload에 따라 달라진다. batch=1에서는 step당 3–4 tokens를 얻는 반면, batch=128에서는 throughput이 감소할 수 있다.따라서 speculation은 작은 batch size에서 latency에 적합하고, 큰 batch size에서 throughput에는 batching이 선호된다.
- Q: Standard RLHF(single-turn PPO/DPO)가 multi-step agent에서 실패하는 이유는?: Single-turn RLHF는 credit assignment, sparse reward, structured tool action, changing state, exploration이 필요하기 때문에 multi-step agent에서 실패하며, per-step feedback을 사용하는 trajectory-level training이 필요하다.Agentic GRPO는 complete trajectory를 생성하고 environment output을 mask하며, terminal 또는 trajectory reward를 사용하고, per-step KL penalty를 적용하며, token이 아니라 agent action을 기준으로 normalize한다.
- Q: Research agent에서 PPO보다 GRPO가 선호되는 이유는?; Q: MCTS (Monte Carlo Tree Search)는 LLM reasoning에 어떻게 적용되는가?; Q: Plackett-Luce model을 설명하라. Bradley-Terry를 어떻게 일반화하는가?; Q: Long reasoning chain으로 학습했는데도 DeepSeek-R1이 Process Reward Model을 사용하지 않는 이유는?: GRPO는 long-context value estimation이 어렵고 terminal reward가 sparse하며, 소규모 complete trajectory group의 ranking을 통해 PPO의 value model을 피할 수 있기 때문에 research agent에 적합하다.Reasoning search에는 selection, expansion, simulation, backpropagation으로 구성된 MCTS를 사용할 수 있으며, 검증 가능한 domain에서는 outcome-only reward를 사용할 수 있다. DeepSeek-R1은 PRM 없이도 emergent self-correction을 보고한다.
Q: 코드 생성에서 pass@k metric이란 무엇이며 unbiased estimator가 중요한 이유는 무엇인가? … 결론 및 향후 방향
이 논문은 엄밀한 evaluation, memory와 orchestration, multi-agent coordination, retrieval, user interface, production trade-off를 아우르는 systems discipline으로 agentic AI를 제시한다. 결론에서는 evaluation과 standards가 발전을 가능하게 하며, 불필요한 architectural complexity에 앞서 simplicity를 우선해야 한다고 강조한다.
- Q: Benchmark contamination을 어떻게 detect하고 mitigate하는가?: Evaluation에서는 contamination, position bias, task success를 고려해야 한다. contamination은 score를 부풀릴 수 있고, GPT-4에서는 10–15% position bias가 나타나며, Task Success Rate는 human intervention 없이 올바르게 완료한 비율을 측정한다.Detection과 mitigation에는 overlap check, rephrased 또는 dynamic benchmark, position swapping 또는 multi-judge evaluation, layered production test가 포함된다.
- Q: RL을 사용해 memory operation을 어떻게 학습할 수 있는가?: Memory operation은 MDP actions로 학습할 수 있으며, task success에는 reward를 주고 비효율적인 read에는 penalty를 부과하지만, 지연된 benefit 때문에 long-horizon credit assignment가 필요하다.Policy는 counterfactual trajectory comparison을 통해 무엇을 저장할지, 언제 retrieve할지, 어떻게 compress할지, 언제 forget할지를 학습할 수 있다.
- Q: LLM orchestration pattern으로서 ReAct와 Plan-and-Execute를 비교하라: ReAct는 각 step을 observation에 맞춰 조정하는 반면, Plan-and-Execute는 more efficient and parallelizable하지만 초기 step이 실패하면 brittle해질 수 있다. Hybrid design은 high-level planning과 local ReAct를 결합한다.Infinite-loop safeguard는 maximum iteration, action-hash detection, graceful escalation을 결합해야 한다.
- LLM을 위한 centralized와 decentralized multi-agent architecture를 비교하라: MCP는 agent–tool integration을 N × M에서 N + M으로 줄이며, centralized, decentralized, hierarchical multi-agent architecture는 predictability, resilience, communication cost 사이에서 trade-off를 이룬다.A2A는 agent-to-agent delegation을 처리하고 MCP는 agent-to-tool access를 처리한다. Hierarchical communication은 O(n log n)으로 scale하며, decentralized communication은 구조가 없으면 O(n^2)으로 scale한다.
- Q: Multi-agent system 구축을 위한 LangGraph, AutoGen, CrewAI를 비교하라: LangGraph는 explicit state graph, checkpointing, conditional routing, first-class human-in-the-loop control을 제공하는 반면, AutoGen과 CrewAI는 더 단순한 conversation-based 또는 role-based prototyping을 선호한다.권장 선택은 production control과 persistence, rapid conversational experimentation, simple role-based team 중 무엇을 우선하는지에 따라 달라진다.
- SWE-bench가 특히 어려운 agent benchmark인 이유는 무엇인가?: SWE-bench는 coding ability와 software-engineering ability 사이의 격차를 드러낸다. 최고 수준의 agent도 SWE-bench Verified의 approximately 50%와 전체 SWE-bench의 approximately 30%만 해결한다.Repository-scale context, underspecified issue, multi-file edit, test verification 때문에 exploration, navigation, planning, implementation, validation이 모두 필요하다.
- 결론 및 향후 방향: 결론은 alignment가 systems problem이며, 어떤 단일 training method도 보편적으로 최선은 아니고, MCP와 A2A가 open ecosystem을 가능하게 하며, complexity를 추가하기 전에 rigorous evaluation이 필수라고 주장한다.PPO는 높은 engineering cost로 quality를 극대화하고, DPO는 infrastructure trade-off를 제공하며, GRPO는 verifiable reward에 적합하다. Autonomous loop나 multi-agent swarm에 앞서 simpler architecture를 우선해야 한다.