Source-linked AI summary
Task Specialization Fine-Tuning for Contextual Reinforcement Learning
Jianan Zhou, Jung-Hoon Cho, Tianyue Zhou, Han Zheng, Jie Zhang, Roy Dong, Yining Ma, Cathy Wu
TL;DR
CRL은 pretraining 이후 각 task region에 제한된 fine-tuning budget을 얼마나 배분해야 하는지에 대한 원칙적인 답을 제시하지 못한다. TSFT는 specialization performance를 예측하고 integer linear programming으로 budget을 배분하며, 다양한 domain에서 task coverage를 향상시키면서 oracle performance에 근접한다.
문제
기존 CRL 연구는 대체로 policy별 budget을 고정하므로, 제한된 budget에서 각 task region에 how much fine-tuning을 배분해야 하는지는 여전히 미해결이다.
방법
TSFT는 주기적 재추정을 수행하는 online parametric performance model을 사용하고, 각 model-based budget allocation을 integer linear programming으로 해결한다.
결과
combinatorial optimization, continuous control, LLM fine-tuning 전반에서 TSFT는 task coverage를 향상시키고, 단순한 전략보다 최대 2– 3× 높은 성능을 보이며, oracle과 비슷한 성능을 달성한다.
시사점 및 한계
Budget-aware specialization은 contextual reinforcement learning에서 task coverage를 향상시키는 통합적인 pretrain-finetune 방향을 제시한다.
시사점 및 한계
TSFT는 fixed task grouping을 가정하며, surrogate objective, exhaustive evaluation, exponential performance model이 alignment, scalability 또는 applicability를 제한할 수 있다.
Abstract
from arXiv · showhide
Contextual Reinforcement Learning (CRL) seeks to generalize classical RL by maximizing task coverage across a context space of related tasks. While prior works often train from scratch and rely on either multi-task learning for a single policy or strategically training multiple policies, we advocate for a unified alternative: pretraining a single policy with good initial performance, followed by fine-tuning multiple policies for task specialization. This new paradigm, however, introduces unique challenges, such as heterogeneous marginal returns and sample inefficiency. This raises a critical research question: given a pretrained policy and a constrained budget, how much fine-tuning should each task region receive to enable sample-efficient CRL? To this end, we propose Task Specialization Fine-Tuning (TSFT), an online framework that predicts fine-tuning performance with a simple parametric model and exactly solves the resulting discrete budget allocation problem via integer linear programming. Extensive experiments across diverse decision domains, including combinatorial optimization, continuous control, and LLM fine-tuning, demonstrate that TSFT significantly outperforms baselines in task coverage and approaches oracle performance. Our work charts a new direction for model-based CRL, aligning with the modern pretrain-finetune era.
1 서론
이 논문은 contextual reinforcement learning을 pretrained policy의 예산 제약형 specialization으로 재정식화하고, task region마다 이질적인 fine-tuning 수익을 다룬다. 또한 TSFT를 제안해 성능 향상을 예측하고 integer linear programming으로 fine-tuning 예산을 정확히 배분하며, 여러 decision domain에서 이를 검증한다.
- 배경: CRL은 통합된 context space에서 벡터로 표현되는 관련 task를 폭넓게 포괄하는 것을 목표로 하지만, independent, multi-task, multi-policy 패러다임은 각각 coverage, capacity, transfer 또는 계산 비용 측면의 한계에 직면한다.서론에서는 제안하는 통합 대안의 배경으로 이러한 기존 접근법을 대조한다.
- 문제 설정: pretrain-finetune 패러다임은 먼저 context space 전반에서 하나의 policy를 학습한 뒤, 제약된 예산 아래 여러 specialized variant를 생성한다.이 통합 대안은 공유된 pretrained initialization을 유지하면서 multi-task 및 multi-policy training의 요소를 결합한다.
- 동기: task region마다 fine-tuning 수익이 달라 일부는 빠르게 향상되는 반면 다른 영역은 포화되거나 성능이 저하되므로, uniform compute allocation은 sample-inefficient하다.이는 어디를 학습할지만 결정하는 것이 아니라 각 region에 얼마나 많은 fine-tuning을 할당할지도 결정해야 함을 시사한다.
- 방법: TSFT는 fine-tuning allocation을 online, model-based budget-allocation problem으로 정식화하고, 그 결과로 얻어지는 각 maximum-coverage variant를 integer linear programming으로 정확히 해결한다.parametric model은 추가 예산이 할당될 때 task performance와 그로부터 유도되는 coverage set이 어떻게 변화하는지 예측한다.
- 기여: 이 논문은 combinatorial optimization, continuous control, LLM fine-tuning 및 theoretical error analysis를 통해 TSFT를 검증한다.이 실험들은 다양한 decision domain에서 제안하는 budget-allocation framework를 평가한다.
2 관련 연구
기존 연구는 contextual reinforcement learning을 negative transfer, 다양한 dynamics, 희소한 feedback, 불안정한 최적화가 문제를 일으키는 구조화된 multi-task learning으로 다룬다. 대안으로 transfer, policy composition, multi-policy source selection, pretrained representation을 활용해 task specialization과 adaptation을 가능하게 한다.
- Multi-Task Learning과 Contextual RL: Multi-task learning은 관련 task 간 일반화를 향상시키지만, task 간 관련성이 충분하지 않으면 negative transfer가 발생할 수 있다.reinforcement learning에서는 다양한 task dynamics, 희소한 feedback, 불안정한 최적화가 이러한 문제를 악화시킨다.
- Multi-Task Learning과 Contextual RL: Single-policy contextual RL 접근법은 여전히 model capacity의 제약을 받으며, 더 크고 정규화가 잘된 value function을 통해 일반화가 향상되더라도 [28], task 다양성이 증가하면 더 큰 negative transfer를 겪을 수 있다.
- Multi-Task Learning과 Contextual RL: Transfer learning [14], policy composition [30], multi-policy CRL 방법은 component specialization을 가능하게 하거나 남은 context space를 zero-shot으로 포괄할 source task를 선택함으로써 task interference를 완화한다 [16] [19].MBTL은 source-task performance와 transfer gap을 모델링해 source-task selection을 유도한다.
- RL Fine-Tuning: RL fine-tuning 연구는 제한된 새로운 data로 adaptation 가능한 initialization 또는 task representation을 학습하는 방법, unsupervised skill discovery를 통한 재사용 가능한 behavior 학습, 그리고 보다 직접적인 pretraining followed by task-specific fine-tuning을 포함한다 [31] [32] [33].대표적인 접근법으로는 adaptation을 위한 MAML과 PEARL, 재사용 가능한 behavior를 위한 unsupervised skill discovery가 있다.
3 문제 정의
이 논문은 contextual reinforcement learning을 context vector로 색인되는 context-specific MDP family로 모델링하고, performance threshold를 통해 task coverage를 정의한다. 또한 task specialization을 source task set들에 제한된 fine-tuning budget을 배분해 specialized policy들의 coverage union을 최대화하는 문제로 정식화한다.
- Contextual MDP: Contextual MDP는 transition, reward, initial-state distribution을 변경할 수 있는 context vector로 색인되는 유한하고 bounded한 MDP family다 [6] [8] [9].
- Task Specialization Fine-Tuning: Pretrained policy와 source task set이 주어졌을 때, k budget unit으로 fine-tuning하면 specialized policy가 생성되며, 그 performance는 각 context task에서 평가된다.
- Task Specialization Fine-Tuning: Specialized policy가 사전 정의된 performance threshold를 충족하면 task가 covered되며, maximization objective에서는 inequality가 반대로 적용된다. Policy의 coverage set은 이러한 모든 task를 포함한다.
- Budget Allocation: N개의 source task set과 K개의 total budget unit이 주어질 때, objective는 specialized policy들에 budget을 배분해 global coverage를 maximize하며, global coverage는 서로 겹칠 수 있는 coverage set들의 union으로 정의된다.
- Budget Allocation: Budget unit은 training epoch 또는 gradient step 동안 소비된 data sample을 기준으로 계산되므로, allocation problem은 combinatorial하고 non-convex하다.
4 방법론
TSFT는 task-specialization budget allocation을 model-based multiple-choice coverage problem으로 정식화하고, ILP를 통해 정확히 해결하면서 parametric performance model로 미지의 coverage를 추정한다. 또한 이 allocation 절차를 warmup, 반복적 재추정, execution-budget control을 포함하는 online framework에 통합하고, optimality gap을 warmup, modeling, planning error로 분해한다.
- Online TSFT Framework: 이 framework는 각 decision step에서 model-based allocation을 online으로 해결하고, error accumulation을 완화하기 위해 performance model을 주기적으로 재추정하여 adaptive하고 sample-efficient한 task specialization을 가능하게 한다.이 절차는 전체 horizon에 대해 한 번만 planning하는 대신, exact ILP allocation을 contextual reinforcement learning에 통합한다.
- ILP Formulation: TSFT는 allocation을 multiple-choice budgeted maximum coverage problem으로 정식화하고, policy allocation level과 task coverage variable에 대한 ILP로 정확히 해결한다.이 정식화는 각 policy에 대해 정확히 하나의 allocation level을 선택하고, total budget을 준수하며, task가 covered된 경우에만 활성화되는 coverage variable을 사용한다.
- Surrogate Performance Model: training 전에 task coverage를 알 수 없으므로, TSFT는 각 policy-task pair에 대해 nonlinear least squares를 사용해 parametric performance model을 fitting하고 budget level 전반의 performance를 예측한다.이 fitting 과정은 수천 개 task에 대해 수 초 내 병렬로 수행할 수 있지만, modeling error로 인해 surrogate-optimal allocation이 true optimum과 달라질 수 있다.
- Online TSFT Framework: TSFT는 policy 전반에 uniform warmup을 적용하고, 저장된 checkpoint를 평가해 training data를 구축한 뒤, 반복적으로 model을 fitting하고 ILP를 해결하며 bounded execution budget을 할당하고 새로운 evaluation을 수집한다.execution budget은 완료될 때까지 실행하는 대신 ILP solution에 비례해 분배되므로, 불완전한 model에 대한 과도한 commitment를 제한하면서 균형 잡힌 exploration을 지원한다.
- Theoretical Analysis: Theorem 1은 TSFT의 Oracle 대비 optimality gap을 warmup error, surrogate-model error 2δm, algorithmic planning error ηalg로 분해한다.post-warmup state가 optimal trajectory 위에 놓이면 warmup error는 사라지며, one-shot exact full-horizon planner가 fixed surrogate를 정확히 최적화하고 실행하는 경우 ηalg = 0이다.
5 실험
조합 최적화, 연속 제어, LLM fine-tuning 전반에서 TSFT는 비-oracle baseline보다 task coverage를 일관되게 향상시키며 Oracle-Warmup에 근접한다. 추가 분석에서는 높은 sample efficiency, 효과적인 online modeling, 적은 computational overhead, 다양한 budget에 대한 강건성이 확인된다.
- 조합 최적화: 조합 최적화에서 TSFT가 가장 강력한 baseline보다 얻는 향상은 CVRP에서 budget 또는 policy 수가 증가할수록 커지는 반면, CVRPTW에서는 보다 제한적이다.비교 결과는 Table 2에 제시되며, coverage rate는 global coverage를 context-space task의 총수로 나눈 값으로 정의된다.
- 결과: TSFT는 조합 최적화, 연속 제어, LLM fine-tuning 전반에서 최상의 비-oracle coverage를 달성하며 Oracle-Warmup에 일관되게 근접한다.여섯 가지 CVRP 및 CVRPTW 설정 모두에서 가장 우수한 성능을 보이고, CartPole, Ant, Meta-World에서 coverage를 향상시키며, 비-oracle LLM baseline을 능가한다.
- 연속 제어: 연속 제어에서 TSFT는 coverage를 일관되게 향상시키고 budget이 증가할수록 Oracle-Warmup과의 격차를 줄이는 반면, MTL은 Ant에서 불안정할 수 있지만 Meta-World에서는 여전히 강력하다.Meta-World에서 MOORE는 평균 success rate 0.68을 달성하지만, TSFT는 여전히 더 나은 coverage를 달성한다.
- LLM Fine-Tuning: TSFT는 모든 비-oracle LLM baseline을 일관되게 능가하고 Oracle-Warmup에 근접하는 반면, heuristic allocation은 specialization benefit의 일부만 회복한다.결과는 model-based budget allocation이 수십억 개 parameter를 사용하는 LLM reinforcement-learning fine-tuning으로 확장될 수 있음을 보여준다.
- 분석: TSFT의 surrogate modeling과 ILP allocation은 적은 overhead만 추가한다. 수천 개의 model을 수 초 안에 병렬로 fitting할 수 있으며, N = 10, K = 150 ILP는 one second 미만에 최적으로 풀린다.추가 data가 유입되면 online model re-estimation이 효과적으로 작동하지만, distribution shift 때문에 pretraining 이후 coverage가 처음에는 감소할 수 있다.
6 결론 · 부록 · A 논의
이 논문은 parametric model과 exact integer linear programming을 사용해 제한된 fine-tuning budget을 task region별로 할당하는 online model-based framework로 TSFT를 제시한다. 또한 scalability, surrogate objective와 original objective의 정렬, pretrained policy의 품질, 비구조적 context 관계를 중요한 한계이자 확장 방향으로 지적한다.
- 6 결론: TSFT는 simple parametric model을 통해 제한된 fine-tuning budget을 task region에 할당하고, 그 결과로 얻은 allocation problem을 integer linear programming으로 정확히 해결한다.이 framework는 이 allocation 과정을 online procedure에 포함한다.
- 6 결론: 이 framework의 한계로는 surrogate와 original objective 사이의 misalignment 가능성이 있으며, 이로 인해 surrogate-optimal allocation이 original objective에서 낮은 성능을 보일 수 있다.이는 네 가지 한계 중 첫 번째로 식별된다.
- 6 결론: context space 또는 specialized policy의 수가 증가하면 exhaustive evaluation의 계산 비용이 감당하기 어려워질 수 있어 TSFT의 scalability가 제한된다.이는 네 가지 한계 중 두 번째로 식별된다.
- A 논의: 정식화 수준에서 Eqs. (3)-(7)은 multiple-choice budgeted MCP 를 정의하며, 각 policy는 대응하는 budget consumption과 coverage set을 갖는 K + 1개의 allocation level 중 하나를 선택한다.이 정식화는 각 policy의 candidate allocation level을 묶고 policy마다 정확히 하나의 level을 요구한다.
- A 논의: TSFT는 adaptation에 활용할 의미 있는 capability를 갖춘 pretrained policy를 가정한다. 관련 capability가 없으면 fine-tuning은 target task를 처음부터 학습하는 방식에 가까워지며 훨씬 더 많은 노력이 필요할 수 있다.이 가정은 foundation model처럼 이미 충분한 capability를 갖춘 pretrained model을 adaptation하는 의도된 설정을 반영한다.
- A 논의: context 관계가 덜 명시적이거나 smooth하게 변화하는 경우, source-task grouping method는 얼마만큼 학습할지에 초점을 맞추는 TSFT를 보완할 수 있다.task embedding과 gradient-based task-affinity grouping은 향후 연구의 orthogonal direction으로 제안된다.
B 방법론 상세 … B.3 대안 모델
방법론은 예산 할당을 model-based MDP로 정식화하고, policy-task 성능을 예측하며, dynamic programming 또는 ILP를 사용해 coverage를 고려한 할당을 최적화한다. 또한 대안적 정식화와 성능 모델을 비교해 표현력과 계산 가능성 사이의 균형을 분석한다.
- B.1.1 MDP 정식화: MDP는 policy 간에 이산 예산 단위를 할당하며, 추상적 할당 상태에서는 전이가 결정론적으로 이루어지고 추가 학습이 개선을 가져오지 않으면 조기 중단한다.추상적 할당 상태의 전이는 결정론적이지만, 실제 학습과 실현 성능은 여전히 확률적이다.
- B.1.1 MDP 정식화: 매개변수화된 policy-task 성능 모델은 소비된 예산으로부터 fine-tuning 결과를 예측하며, 비선형 최소제곱 fitting을 통해 수천 개 task에도 수 초 내에 확장된다.이 모델은 성능이 어느 방향으로든 변할 수 있도록 하여 fine-tuning 중 개선과 악화를 모두 포착한다.
- B.1.1 MDP 정식화: Coverage reward는 policy들의 task coverage 합집합에서 발생하는 한계 증가량이며, policy 간 결정을 결합하고 중복 specialization을 벌점화한다.따라서 전역 목적은 policy를 독립적으로 최적화하기보다 집단 coverage를 확장하도록 유도한다.
- B.1.2 MDP 풀이: Dynamic programming은 예측 성능으로 유도된 surrogate coverage 목적을 최적화하며 전체 예산에 대해 전역 최적해를 제공하지만, 복잡도는 policy 수 N에 대해 지수적으로 증가한다.Receding-horizon DP는 제한된 lookahead와 실행 horizon을 사용해 전역 최적성을 계산 가능성으로 절충한다.
- B.1.3 Dynamic Programming: DP 구현은 할당 상태를 재귀적으로 평가하고, 미래 가치가 최대인 action을 선택하며, 추가 학습으로 coverage를 개선할 수 없으면 action을 반환하지 않는다.Memoization은 반복되는 상태 평가를 지원하고, 종료 조건은 조기 중단을 구현한다.
- B.2 대안적 정식화: 대안적 ILP 인코딩은 monotone coverage에서 변수 수를 줄이는 반면, original ILP와 CP 정식화는 더 일반적이며, original ILP는 성숙한 mixed-integer 최적화 기법의 이점을 얻는다.CP 정식화는 임의의 non-monotone coverage를 지원하지만 context space가 크면 비용이 커질 수 있다.
- B.3 대안 모델: Gaussian process는 각 policy-task 쌍에 대해 non-parametric posterior-mean 성능 예측을 제공하며, 학습에 따라 coverage가 어떻게 변화하는지를 암묵적으로 추정한다.PFGP는 smooth parametric trend와 GP residual model을 결합해 국소적 편차와 확률적 변동을 포착한다.
- B.3 대안 모델: 추가 대안으로는 power-law, logarithmic, polynomial, piecewise-linear 모델이 있으며, smooth monotonic trends부터 유연한 non-monotonic trajectories까지 포괄한다.평가한 polynomial 차수는 2, 3, 4이며, piecewise-linear breakpoint는 BIC를 사용해 선택한다.
C 이론적 분석 · D 실험 세부사항 · D.1 Baseline
이론적 분석은 surrogate error와 planning accuracy를 통해 TSFT의 워밍업 이후 격차를 bound하고, full-Oracle 격차를 워밍업 및 워밍업 이후 손실로 분해한다. 실험 세부사항은 세 가지 domain의 hardware를 명시하며, baseline 구현은 Adaptive와 LinUCB의 allocation 및 reward 절차를 정의한다.
- C 이론적 분석: TSFT의 Oracle-Warmup 대비 워밍업 이후 optimality gap은 bounded surrogate error와 surrogate planning accuracy 하에서 2δm + ηalg로 bound된다.정확한 full-horizon planning에서는 ηalg = 0이므로 bound는 2δm로 줄어든다.
- C 이론적 분석: Coverage가 thresholded되므로 δm은 유도된 coverage-level surrogate error를 나타내며, online model 재추정으로 이를 줄일 수 있지만 monotonic improvement가 보장되지는 않는다.성능 예측 오차가 작더라도 threshold 근처의 coverage가 달라질 수 있다.
- C 이론적 분석: full-Oracle gap은 warmup error와 2δm + ηalg로 bound되는 워밍업 이후 항으로 분해된다.워밍업 이후 상태가 optimal trajectory 위에 놓이면 warmup error는 0이 될 수 있다.
- C 이론적 분석: 고품질 feasible allocation이 순위를 유지한다면 surrogate prediction error가 allocation error를 일으키지 않을 수 있지만, near-tie 또는 threshold 인접 task에서는 selection이 달라질 수 있다.따라서 allocation quality는 surrogate와 실제 coverage의 정확한 일치보다 ranking preservation에 좌우된다.
- D 실험 세부사항: 실험에서는 combinatorial optimization에 RTX 4090과 Threadripper PRO 7975WX hardware를, control에 V100과 Xeon E5-2670 hardware를, LLM fine-tuning에 16 H200 GPUs를 사용한다.Hardware configuration은 experimental domain에 따라 다르다.
- D.1 Baseline: Adaptive는 uniformly initialized policy weights를 유지하고, 이를 temperature-scaled softmax probabilities로 변환한 뒤, 그 결과인 multinomial distribution에서 execution-budget allocation을 sampling한다.업데이트된 checkpoint는 baseline implementation에 설명된 대로 training 후 평가된다.
- D.1 Baseline: LinUCB는 exploration에 α = 1.0을 사용하고, 가장 큰 upper-confidence score를 갖는 policy를 선택하며, 각 decision step에서 budget unit 하나를 allocation한다.Reward는 선택된 policy의 historical best 대비 normalized monotonic coverage improvement로 정의되어, 일시적인 fine-tuning 하락에 대한 penalty를 피한다.
D.2 정책 학습 · D.3 컨텍스트 공간 · E 추가 결과
이 논문은 조합 최적화, 연속 제어, LLM fine-tuning에 걸쳐 TSFT를 적용하며, 도메인별 정책 학습 프로토콜과 task parameter 또는 학습된 representation으로 정의된 컨텍스트 공간을 사용한다.
- D.2 정책 학습: POMO 정책은 epoch당 10,000개 instance를 사용해 전체 조합 최적화 컨텍스트 공간에서 5,000 epochs 동안 사전 학습된다.설정에는 learning rate 1 × 10−4, weight decay 1 × 10−6, batch size 64, problem size와 POMO size 각각 100인 Adam이 사용된다.
- D.2 정책 학습: 연속 제어 실험에서는 Stable Baselines3를 통해 PPO를 사용하며, 공유 MLP policy-value backbone의 크기는 CartPole에서, Ant에서 [256, 256]이다.실험에는 learning rate 3 × 10−4, n_steps=2048, batch size 64, discount factor 0.99, GAE parameter 0.95를 포함한 PPO 기본 hyperparameter가 사용된다.
- D.2 정책 학습: LLM specialization은 VeRL과 vLLM에서 GRPO를 사용해 Qwen3-4B-Base를 fine-tuning하며, 네 정책의 configuration은 고정하고 training corpus만 변경한다.각 GRPO update 이후 모든 checkpoint를 전체 컨텍스트 공간 benchmark에서 평가하며, 평가는 benchmark당 최대 100개 problem으로 제한된다.
- D.3 컨텍스트 공간: CVRP 컨텍스트는 vehicle capacity를 10부터 400까지 10 단위로 변화시키고, Gaussian mixture model의 covariance를 변경해 node distribution을 조절한다.Customer demand는 {1, 2, . . . , 9}에서 균등하게 sampling되며, network input 전에 vehicle capacity로 정규화된다.
- D.3 컨텍스트 공간: CVRPTW는 customer time window와 service time을 추가해 CVRP를 확장하며, capacity는 10부터 400까지, service time은 0.04부터 1.00까지 각각 0.04 단위로 변화시킨다.더 큰 service time은 더 좁은 time window에 해당하며, 다섯 source task set은 각각 reference task를 중심으로 49개 task를 포함한다.
- D.3 컨텍스트 공간: 연속 제어 컨텍스트 공간은 pole length, cart mass, pole mass를 기준으로 CartPole을 이산화하고, gravity와 friction을 기준으로 Ant를 이산화한다.Ant는 25×40 = 1,000-context grid를 사용하며, 다섯 개의 20-context source rectangle이 100개 grid point에 걸쳐 있다. CartPole은 다섯 개의 axis-aligned 27-context region을 사용한다.
- D.3 컨텍스트 공간: Meta-World는 one-hot encoding 대신 pretrained expert weights를 사용해 50개 manipulation task를 표현하고, PCA로 학습된 task representation을 2차원에 projection한다.LLM 컨텍스트 공간은 math reasoning, code generation, general reasoning을 아우르는 9개 benchmark로 구성되며, 각 benchmark에는 benchmark별 performance threshold가 있다.
E.1 전체 결과
CartPole, Ant, Meta-World의 전체 결과를 보고하며, 연속 제어의 coverage는 Figure 6에서 비교한다. CartPole과 Ant 실험에는 여러 seed를 사용하고, 다른 도메인에서는 안정성 또는 계산 비용 때문에 대체로 단일 seed 평가를 사용한다.
- E.1 전체 결과: CartPole에는 5개의 seed, Ant에는 3개의 seed를 사용하며, 조합 최적화와 LLM fine-tuning에는 하나의 seed를 사용한다. Meta-World에는 주 실험용 seed 하나와 더 작은 규모의 5-seed robustness 평가를 사용한다.Meta-World robustness 설정에서는 N = 5와 K = 25를 사용한다.
- E.1 전체 결과: 연속 제어의 coverage rate는 Figure 6에서 평균 막대와 표준편차 error bar를 사용해 비교한다.
- E.1 전체 결과: 전체 결과는 CartPole, Ant, Meta-World를 포함하며, CartPole은 Table 5에, Ant와 Meta-World는 Table 6에 보고한다.
E.2 성능 모델 종합 연구
TSFT는 효과적인 예산 할당에 고정밀 궤적 예측이 아니라 대략적인 학습 곡선 추세만 필요하므로 단순한 exponential performance model을 사용한다. 학습 곡선에 잡음이 있더라도 이러한 단조성 inductive bias가 유효하다는 근거가 있으며, 전역적으로 강한 비단조 거동에는 한계가 있음을 인정한다.
- 모델 동기: TSFT는 fine-tuning 궤적이 대체로 단조적이라고 가정하고, 예산 할당을 위해 대략적인 학습 곡선 추세를 포착하는 exponential model을 사용한다.효과적인 할당을 위해 확률적 학습 궤적 전체를 정확하게 예측할 필요는 없다.
- 잡음에 대한 강건성: 10개 지점을 샘플링하면 평가된 궤적의 거의 전부에서 국소적 비단조 거동이 나타나지만, 단조 모델은 잡음이 있는 학습 곡선에서도 여전히 효과적이다.이 연구는 각 곡선에서 5개 또는 10개의 지점을 균일하게 샘플링하여 궤적의 단조성을 정량화한다 (Table 7).
- 모델 비교: CVRP와 Ant에서 Monotonic Exponential, Power-Law, Logarithmic 모델을 Quadratic, Cubic, Quartic, Piecewise 모델과 비교하며, fitting, prediction, coverage metric을 사용한다.이 비교는 상대적으로 단조적인 도메인과 더 까다로운 비단조 도메인에서 제한된 관측이 주어질 때 단조성이 overfitting을 줄이는지 검증한다.
- 한계: exponential model은 모든 경우에 적용할 수 있는 것은 아니며, fine-tuning 궤적이 전역적으로 강한 비단조 거동을 보일 때 예산을 최적으로 할당하지 못할 수 있다.향후 연구 방향으로는 불확실성을 고려한 탐색과 neural network 같은 더 표현력 높은 surrogate model이 있다.
E.3 민감도 분석 · E.4 계산 비용
TSFT는 성능 임계값, 실행 예산, 워밍업 설정 전반에서 강건성을 유지하며, policy 수가 증가할수록 baseline보다 더 잘 확장된다. ILP 기반 할당은 계산적으로 효율적이고 정확한 반면, DP 방식은 policy 집합이 커지면 실행이 어려워진다.
- E.3 민감도 분석: 민감도 분석에서는 계산 가능성과 경험적 강건성을 고려해 선정한 사전 정의 범위에서 grid search로 ϵ, N, W, E를 조정한다.이 hyperparameter들은 각각 성능 임계값, policy 수, 워밍업 예산, 실행 예산을 제어한다.
- E.3 민감도 분석: TSFT는 1.15%에서 1.4%까지의 성능 임계값 ϵ에서 경쟁력과 안정성을 유지하며, 완화된 임계값에서 coverage가 증가할수록 standard baseline을 일관되게 능가한다.분석에는 3/100 CVRP 설정과 0.05% 단위 증가가 사용된다.
- E.3 민감도 분석: policy 수가 증가할 때 TSFT는 baseline보다 훨씬 더 잘 확장되는 반면, 대부분의 baseline은 고정된 예산 K = 150에서 성능이 저하된다.LinUCB는 예외로 언급되지만, 제공된 본문은 전체 비교가 제시되기 전에 잘려 있다.
- E.3 민감도 분석: TSFT는 대체로 비교적 작은 워밍업 예산에서 가장 우수한 성능을 보이며, 과도한 워밍업은 adaptive-specialization 예산을 줄여 전체 coverage를 저하시킬 수 있다.워밍업 예산은 3/100 및 3/150 CVRP 설정에서 policy당 3에서 15까지 변한다.
- E.3 민감도 분석: TSFT는 실행 예산 단위가 5에서 30까지 변해도 비교적 안정적인 성능을 유지하며, 합리적인 실행 예산을 사용하면 민감도가 제한적임을 보여준다.이 결과는 E를 광범위하게 조정하지 않아도 adaptive allocation이 강건하게 이점을 얻을 수 있음을 시사한다.
- E.4 계산 비용: ILP는 계산적으로 효율적인 상태를 유지하면서 할당 문제를 정확히 해결하는 반면, exact DP는 policy 수가 증가하면 확장성이 떨어지고 RH-DP는 대규모 policy 집합에서 여전히 실행이 불가능하다.ILP는 compact formulation, LP relaxation, branch-and-bound pruning의 이점을 얻는 반면, DP는 도달 가능한 할당 상태를 거의 완전히 열거하고 caching한다.
E.5 저비용 평가 … G 라이선스
TSFT는 task-space 하위 영역 간 상호보완적인 policy specialization을 가능하게 하면서, training보다 저렴한 evaluation을 유지하고 더욱 친환경적인 adaptation 방식을 지원한다. 또한 논문은 asset licensing을 문서화하고 code와 datasets를 MIT 라이선스로 공개할 계획을 제시한다.
- E.5 저비용 평가: TSFT는 주기적으로 policies를 평가하며, 전체 evaluation에는 policy training에 필요한 며칠이 아니라 몇 시간이 걸린다.evaluation 비용이 높을 때는 exhaustive evaluation이 여전히 비현실적일 수 있다.
- E.5 저비용 평가: validation samples를 더 적게 사용하거나 더 긴 execution interval로 evaluation 빈도를 낮추면 online evaluation cost를 줄일 수 있다.이러한 조정은 TSFT의 performance model fitting에 필요한 evaluation 부담을 줄인다.
- E.6 시각화: TSFT는 policies마다 서로 다른 fine-tuning budgets를 할당하여 일부는 초기 단계에 머물게 하고, 다른 policies는 이후 단계로 진행시킨다.시각화에는 5/150 CVRP setting의 final policies가 사용되며, 이 setting에서 TSFT가 specialization을 유도한다.
- E.6 시각화: TSFT policies는 source-task regions 근처에서 낮은 optimality gaps를 달성하고, 멀어질수록 성능이 저하되며, context space 전반에 상호보완적인 specialized coverage를 형성한다.Figure 10은 동일한 budget에서 TSFT가 선택한 policies를 pretrained 및 multi-task policies와 비교하고, TSFT의 final coverage set도 함께 제시한다.
- F 광범위한 영향: sample efficiency를 향상함으로써 task-specialization fine-tuning은 다양한 task conditions에서 RL agents를 adaptation하는 데 드는 computational 및 energy costs를 줄일 수 있다.논문은 더욱 친환경적인 AI practices와 자원이 제한된 researchers 및 practitioners의 접근성 향상을 긍정적인 societal impacts로 제시한다.
- G 라이선스: 기존 assets의 licenses와 usage는 Table 12에 정리되어 있으며, source code와 datasets는 publication 시 MIT License에 따라 공개될 예정이다.Table 12는 기존 assets의 licenses와 usage를 문서화한다.