Source-linked AI summary
SMART-LLM: Smart Multi-Agent Robot Task Planning using Large Language Models
Shyam Sundar Kannan, Vishnunandan L. N. Venkatesh, Byung-Cheol Min
TL;DR
다중 로봇 task planning은 고정 알고리즘을 넘어 다양하고 복잡하며 모호하게 기술된 task를 처리해야 한다. SMART-LLM은 LLM이 유도하는 task decomposition, coalition formation, skill-based allocation을 사용해 task category와 LLM backbone 전반에서 유리한 결과를 달성한다.
문제
고정 알고리즘은 다중 로봇 planning에서 다양하고 복잡하며 모호하게 기술된 자연어 task로 전환하는 데 어려움을 겪는다.
방법
SMART-LLM은 environment와 robot skill 정보를 few-shot programmatic LLM prompting과 함께 사용해 task decomposition, coalition formation, skill-based assignment를 수행한다.
결과
SMART-LLM은 task category와 LLM backbone 전반에서 유리한 결과를 내며, Claude-3는 simple task에서 TCR 1.0과 SR 0.87에 도달한다.
시사점 및 한계
이 접근법은 복잡성이 서로 다른 task instruction을 처리하고, simulation에서 생성된 plan을 실제 robot system으로 전환하는 것을 지원한다.
Abstract
from arXiv · showhide
In this work, we introduce SMART-LLM, an innovative framework designed for embodied multi-robot task planning. SMART-LLM: Smart Multi-Agent Robot Task Planning using Large Language Models (LLMs), harnesses the power of LLMs to convert high-level task instructions provided as input into a multi-robot task plan. It accomplishes this by executing a series of stages, including task decomposition, coalition formation, and task allocation, all guided by programmatic LLM prompts within the few-shot prompting paradigm. We create a benchmark dataset designed for validating the multi-robot task planning problem, encompassing four distinct categories of high-level instructions that vary in task complexity. Our evaluation experiments span both simulation and real-world scenarios, demonstrating that the proposed model can achieve promising results for generating multi-robot task plans. The experimental videos, code, and datasets from the work can be found at https://sites.google.com/view/smart-llm/.
I. 서론 · II. 관련 연구
SMART-LLM은 LLMs를 활용해 task decomposition, coalition formation, skill-based allocation을 수행함으로써 자연어로 표현된 이기종 multi-robot task planning의 어려움을 다룬다. 이 논문은 benchmark를 제시하고 simulation 및 real-world 환경에서 framework를 평가하며, task-specific하고 불완전한 기존 방법들과 비교해 그 위치를 설정한다.
- I. 서론: Multi-robot systems는 efficiency, scalability, and adaptability를 향상시키지만, 로봇의 유형과 skill level이 서로 다르면 더 복잡해진다.이 논문은 효율적인 planning을 위해 방대한 기존 지식을 활용해 자연어 instruction을 해석하는 방안을 제시한다.
- I. 서론: 기존의 고정 알고리즘 기반 planner는 다양한 task와 복잡한 환경에 맞게 적응하는 데 어려움을 겪으며, 특히 instruction이 imprecise or incomplete한 경우 더욱 그렇다.task 간 전환에는 상당한 code 수정이 필요할 수 있어, 자연어 task planning의 난도가 높아진다.
- I. 서론: SMART-LLM은 Python programming scripts와 함께 LLMs를 사용해 high-level instruction을 조정된 multi-robot task plan으로 변환한다.이 framework는 embodied agent를 대상으로 하며 task decomposition, coalition formation, skill-based task assignment를 지원한다.
- I. 서론: 이 논문은 AI2-THOR simulation platform에서 elemental task부터 complex multi-agent task까지 포괄하는 benchmark dataset을 제시한다.이 dataset은 다양한 task complexity에 걸쳐 multi-agent task-planning system을 평가하도록 설계되었다.
- I. 서론: SMART-LLM은 simulated and real-world settings 모두에서 광범위한 task를 대상으로 구현 및 검증되었다.이 평가는 planning framework와 benchmark dataset에 더해 주요 기여로 제시된다.
- II. 관련 연구: Multi-robot task planning은 일반적으로 task decomposition, coalition formation, task allocation, task execution으로 구성되며, 기존 allocation 방법에는 negotiation, auctioning, consensus, reinforcement learning이 포함된다.기존 접근법은 특정 goal이나 application에 맞춰 설계되고 최적화되는 경우가 많다.
- II. 관련 연구: 기존 방법은 planning의 일부만 자동화하거나 task-specific demonstration을 요구하며 특정 task에 한정되는 경우가 많다. 반면 SMART-LLM은 all four steps를 수행하고 task 간 일반화를 위해 few-shot prompting을 사용한다.관련 연구에서는 LLM 기반 multi-agent 접근법이 cooperation을 향상시키지만, 더 큰 team을 위한 task-plan creation을 구체적으로 다루지는 않는다는 점도 지적한다.
III. 문제 정식화
SMART-LLM은 다중 로봇 계획을 환경에서 high-level instruction을 실행 가능한 단계로 변환하는 문제로 정식화하며, 실현 가능한 병렬 실행을 통해 robot utilization을 극대화한다. 이 정식화는 제약된 skill set을 가진 heterogeneous robot을 모델링하고 decomposition, coalition formation, allocation을 지원한다.
- 계획 목표: 계획의 목표는 instruction I를 해석하고 완료 단계를 계산하여, 가능한 경우 task를 병렬화하는 실행 가능한 task plan을 생성하는 것이다.실행은 entity와 object를 포함하는 environment E에서 이루어진다.
- Robot 및 Skill 모델: 시스템은 N개의 heterogeneous embodied robot으로 구성되며, 각 robot은 task-specific constraint가 적용되는 skill set S_n ⊆ ∆를 가진다.Skill은 사전 구현되어 있거나 API를 통해 사용할 수 있으며, constraint에는 maximum pickup mass와 같은 한계가 포함될 수 있다.
- Planning Stage: Task-planning pipeline은 subtask를 식별하고, 이를 robot의 skill 및 property와 매칭하며, skill gap을 해소하기 위한 team을 구성하고, subtask를 robot 또는 team에 할당한다.이 정식화는 task decomposition과 coalition formation을 planning stage로 명시적으로 포함한다.
- 실행 구조: 생성된 plan은 독립적인 subtask를 동시에 실행할 수 있으며, prerequisite가 완료될 때까지 dependent subtask의 실행을 연기할 수 있다.예시에서는 두 subtask를 병렬화한 뒤 후속 task를 실행한다.
LLM LLM
SMART-LLM은 robot skills와 environment를 바탕으로 instruction을 시간 순서에 따라 정렬된 subtasks로 분해한 뒤, 개별 robot이 subtask의 skill requirements를 충족하지 못하면 robot coalition을 구성한다. 시스템 개요는 task decomposition과 coalition formation을 포함한 이 과정을 단계별 LLM-guided planning으로 제시한다.
- 시스템 개요: SMART-LLM은 robot skills, objects, examples, coalition policies를 포함한 prompts를 사용해 task decomposition과 coalition formation을 포함하는 단계별 planning을 구성한다.시스템 개요는 input instruction과 결합된 task decomposition prompts와, 분해된 tasks를 수행할 robot teams를 설명하는 coalition-formation prompts를 제시한다.
- Task Decomposition: instruction은 robot skills와 environment를 바탕으로 시간 순서가 정렬된 K subtasks 집합으로 분해된다.Subtasks는 동일한 temporal precedence를 공유할 수 있으므로 병렬로 실행된다.
- Task Allocation: 한 robot의 skills가 subtask에 필요한 all skills required를 포함하면 해당 subtask를 하나의 robot에 할당할 수 있다.Allocation condition은 required skill set이 robot의 available skills의 subset이라는 조건으로 표현된다.
- Coalition Formation: 어떤 단일 robot도 skill constraint를 충족하지 못하면 SMART-LLM은 subtask를 수행하기 위해 team of two or more robots를 구성한다.Coalition은 Q robots로 이루어진 team으로 표현되며, 각 robot은 자신의 skills를 기여한다.
IV. 방법론
이 접근법은 multi-robot planning에서 task decomposition, coalition formation, task allocation에 LLMs를 활용한다. Pythonic prompts는 구조화된 syntax, 주석이 포함된 예시, robot skills와 object properties의 간결한 dictionary 표현을 통해 실행 가능한 code 생성을 유도한다.
- LLM 기반 task planning: 이 방법은 multi-robot task planning을 위해 task decomposition, coalition formation, task allocation에 LLMs를 적용한다.
- Prompt 설계: Pythonic prompts는 실행 가능한 code를 직접 생성할 수 있고, LLM의 이해를 높이는 구조화된 syntax를 제공하므로 선호된다.
- Prompt 설계: Prompt samples는 작업을 요약하고 실행 및 allocation 요구사항을 명확히 하기 위해 line-by-line comments와 block comments를 사용한다.
- Prompt 설계: Robot skills와 object properties는 Python dictionaries로 인코딩되며, 토큰 크기를 줄이고 LLM의 이해를 돕는 간결한 표현을 제공한다 [39].
A. 1단계: 작업 분해
1단계에서는 환경 정보, 로봇 기술, few-shot 예시를 사용해 입력 지시를 실행 가능한 계획으로 생성하며, 이를 독립적인 하위 작업과 행동 시퀀스로 분해한다.
- 1단계: 작업 분해: LLM은 환경 세부 정보 E와 원시 로봇 기술 ∆을 사용해 입력 지시 I에 대한 독립적인 하위 작업 T와 행동 시퀀스를 생성한다.이러한 입력은 분해를 제약하여 결과 작업이 지정된 환경에서 수행될 수 있도록 한다.
- 1단계: 작업 분해: Few-shot prompting은 LLM이 입력 작업을 처리하기 전에 로봇 기술 및 환경 정보, 샘플 작업, Python 코드 기반의 분해된 계획을 제공한다.프롬프트가 적용된 LLM은 이러한 자료를 지시 I와 결합해 분해된 하위 작업 T를 생성한다.
B. 2단계: Coalition Formation
Coalition Formation은 필요한 skill과 개별 robot의 skill 및 capability를 매칭해 분해된 sub-task에 적합한 robot team을 할당한다. LLM은 few-shot coalition policy를 사용해 단일 robot 할당, 협업, capability 제약을 처리한다.
- B. 2단계: Coalition Formation: 이 단계는 필요한 skill과 개별 robot의 skill 및 capability를 분석해 각 분해된 sub-task에 대한 robot team을 구성한다.
- B. 2단계: Coalition Formation: LLM은 분해된 task 예시, coalition policy, 그리고 skill을 보유한 가용 robot을 입력받아 입력 task에 대한 assignment policy를 생성한다.
- B. 2단계: Coalition Formation: Coalition policy는 한 robot이 모든 필요한 skill을 보유한 경우의 일대일 할당과, skill이 여러 robot에 분산된 경우의 multi-robot collaboration을 다룬다.
- B. 2단계: Coalition Formation: 한 robot이 필요한 skill을 보유한 경우에도 pickup 중 maximum weight constraint와 같은 capability limitation을 해결하기 위해 추가 robot을 투입한다.
C. Stage 3: Task Allocation
Stage 3에서는 coalition formation policy에 따라 분해된 sub-task에 개별 robot 또는 robot team을 할당한다. 분해된 task 샘플, coalition policy, 사용 가능한 robot skill, 할당된 plan을 활용해 최종 실행 가능한 code를 생성한다.
- C. Stage 3: Task Allocation: Task allocation은 앞선 coalition formation policy에 따라 각 sub-task에 특정 robot 또는 robot team을 할당한다.Stage 3 prompt에는 입력 task의 분해된 sub-task와 coalition formation policy가 포함된다.
- C. Stage 3: Task Allocation: Stage 3 prompt에는 분해된 plan, 사용 가능한 robot과 skill, coalition policy, 할당된 plan이 포함되며, 이후 Stage 4에서 실행 가능한 code를 생성한다.
D. Stage 4: Task Execution · V. EXPERIMENTS · A. Benchmark Dataset
SMART-LLM은 virtual 또는 physical 팀을 활용해 robots’ low-level skills를 호출하는 interpreter를 통해 할당된 multi-robot plan을 실행한다. 벤치마크는 AI2-THOR household environment를 사용하며, coordination과 heterogeneity 요구 수준이 점차 높아지는 네 가지 task category로 구성된다.
- D. Stage 4: Task Execution: 할당된 task plan은 virtual 또는 physical multi-robot team을 위해 robots’ low-level skills를 호출하는 interpreter에 의해 실행된다.Stage 4에서는 조명과 television이 포함된 household instruction의 실행을 보여준다.
- D. Stage 4: Task Execution: 실행 단계에서는 진행 중인 단계를 식별하는 caption과 완료된 action을 녹색으로 표시한 robot-view sequence를 보여준다.
- V. EXPERIMENTS · A. Benchmark Dataset: 실험에서는 deterministic AI2-THOR household environment, action, instruction, floor plan으로 구축한 natural-language multi-robot task planning benchmark를 사용한다.데이터셋에는 36개의 high-level instruction이 포함된다.
- V. EXPERIMENTS · A. Benchmark Dataset: 각 benchmark task에는 최종 ground-truth object state와 symbolic goal conditions가 포함되며, 여기에는 position과 heated, cooked, sliced, washed 같은 condition이 포함된다.
- V. EXPERIMENTS · A. Benchmark Dataset: 데이터셋은 다양한 task complexity에 걸쳐 SMART-LLM을 평가하기 위해 task를 네 가지 category로 구성한다.
- V. EXPERIMENTS · A. Benchmark Dataset: Elemental task는 하나의 robot을 사용하지만, Simple task는 여러 object와 sequential-or-parallel decomposition을 포함하며 robot들이 필요한 모든 skill을 공유한다고 가정한다.
- V. EXPERIMENTS · A. Benchmark Dataset: Compound task는 heterogeneous specialized robot을 활용한 sequential, parallel 또는 hybrid execution을 허용하는 반면, Complex task는 어떤 robot도 모든 sub-task를 독립적으로 수행할 수 없으므로 strategic team assignment를 요구한다.Complex task는 decomposition, multi-robot engagement, multiple object, heterogeneous team을 결합한다.
B. 시뮬레이션 실험 · C. 실제 로봇 실험 · D. 평가 지표
실험에서는 여러 language-model backbone과 실제 공중-지상 로봇 환경에서 보지 못한 AI2-THOR benchmark task에 SMART-LLM을 적용해 평가한다. 성능은 달성된 실행 상태와 dataset ground truth를 비교하는 다섯 가지 지표로 측정한다.
- B. 시뮬레이션 실험: SMART-LLM은 AI2-THOR에서 병렬화 가능, 순차적 및 기타 task-planning 시나리오를 아우르는 benchmark task를 사용해 평가되며, decomposition, coalition formation, allocation 각각에 별도의 prompt를 사용한다.설정에서는 decomposition 예시 5개, coalition formation 예시 3개, task allocation 예시 4개를 사용한다.
- B. 시뮬레이션 실험: 모든 benchmark task는 테스트 중 보지 못한 것이며, SMART-LLM은 GPT-4, GPT-3.5, Llama-2-70B [7], Claude-3-Opus 로 평가된다.prompt에는 dataset에 포함된 것과 다른 task와 AI2-THOR floorplan을 사용한다.
- C. 실제 로봇 실험: 실제 로봇 실험에서는 서로 다른 skill과 가시성 능력을 지닌 heterogeneous aerial and ground robot을 사용해 visibility coverage와 object-image capture를 평가한다.SMART-LLM은 크기가 다양한 영역과 이미지 촬영이 필요한 객체에 대한 plan을 생성한다.
- B. 시뮬레이션 실험: Table I은 AI2-THOR simulator에서 benchmark task category 전반에 걸쳐 SMART-LLM과 baseline approach를 평가한다.제공된 문단은 표의 범위를 밝히지만, cell value를 제공하거나 비교 우위를 확정하지는 않는다.
- C. 실제 로봇 실험: 실제 로봇 task plan은 GoToLocation, ClickPicture, and Patrol skill을 사용하며, AI2-THOR simulation experiment에 기반한 prompt sample을 재사용한다.이 skill들은 능숙한 task execution에 필수적인 것으로 설명된다.
- D. 평가 지표: 평가에는 Success Rate, Task Completion Rate, Goal Condition Recall, Robot Utilization, Executability를 사용하며, 달성된 실행 후 상태를 dataset ground-truth final state 와 비교한다.이 지표들은 task success, completion, goal satisfaction, team efficiency, action executability를 평가한다.
- D. 평가 지표: GCR은 달성된 goal condition을 측정하고, TCR은 GCR이 1일 때 정확히 1이며, RU는 transition count를 ground truth와 비교하고, Exe는 executable action을 측정한다.SR은 GCR과 RU가 모두 1일 때만 1이고, 그렇지 않으면 0이다.
VI. 결과 및 논의 · A. 시뮬레이션 실험
시뮬레이션 실험에서 SMART-LLM은 LLM 백본과 과제 복잡도 전반에 걸쳐 대체로 우수한 multi-robot plan을 생성했지만, 성능은 decomposition, sequencing, allocation의 품질에 좌우됐다. 추가 실험에서는 이 방법이 실행 불가능한 시나리오를 인식할 수 있음이 나타났고, ablation 결과 comments와 coalition formation이 성공에 기여함을 확인했다.
- A. 시뮬레이션 실험: SMART-LLM은 elemental, simple, compound, complex 범주에 걸친 미학습 과제에서 LLM 백본 전반에 걸쳐 우수한 결과를 보였다.결과는 dataset 범주별 평균으로 요약했으며 baseline method와의 비교를 포함한다.
- A. 시뮬레이션 실험: GPT-3.5는 때때로 elemental 과제를 decomposition하는 데 어려움을 겪는 반면, 정확한 decomposition은 SMART-LLM이 robot을 적절히 할당하도록 한다.이는 백본의 reasoning 능력이 task-planning 신뢰성에 영향을 미침을 나타낸다.
- A. 시뮬레이션 실험: Claude-3는 단순 작업에서 가장 우수한 성능을 보이는 반면, GPT-4와 Claude-3는 TCR 점수 1.0에서 만점을 달성하지만 로봇이 병렬이 아닌 순차적으로 실행하므로 SR은 더 낮다.이러한 순차 실행은 로봇 활용도에도 영향을 미친다.
- A. 시뮬레이션 실험: Compound 및 complex task는 테스트한 모든 LLM 백본에서 70% success rate를 달성했지만, 간헐적인 sequencing 및 robot-team assignment 오류는 여전히 남았다.추가 prompt sample이 이러한 오류를 완화할 수 있지만, token 제한이 그러한 최적화를 방해할 수 있으며, GPT-3.5는 이러한 과제에서 다른 model보다 낮은 성능을 보였다.
- A. 시뮬레이션 실험: 실행 불가능한 시나리오에서 GPT-4 및 Claude-3 기반 SMART-LLM은 필요한 skill을 가진 robot이 없음을 정확히 감지하고 allocation plan 생성을 자제했다.metric 측정을 위한 실행 가능한 code를 생성할 수 없으므로 이러한 시나리오는 Table I에서 제외했다.
- A. 시뮬레이션 실험: comments를 제거하면 일반적으로 success rate가 낮아지며, 특히 compound 및 complex task에서 두드러졌다. 이는 code와 함께 제공되는 자연어 instruction이 reasoning 및 logical-structure 이해를 돕는다는 것을 보여준다.comments가 없으면 simple 및 elemental task에서는 decomposition과 allocation이 유사하게 유지되지만, 더 복잡한 task에서는 저하된다.
- A. 시뮬레이션 실험: coalition formation을 제거해도 success가 감소했으며, 이는 이 단계가 SMART-LLM의 task-planning 성능에 실질적으로 기여함을 나타낸다.제시된 ablation 결과는 coalition formation이 이 방법의 중요한 구성 요소임을 보여준다.
B. 실물 로봇 실험 · VII. 결론 및 향후 연구
실물 로봇 실험은 이 방법이 기존에 보지 못한 가시성 기반 작업에 대한 작업 계획을 생성하고 할당함을 보여주며, 결론에서는 복잡한 환경 전반에서 prompt 기반 계획, 적응성, simulation-to-real transfer를 강조한다.
- B. 실물 로봇 실험: 실물 로봇 평가는 Table III에 요약된 ablation studies를 포함했다.제공된 표의 본문은 ablation study의 범위는 제시하지만, 개별 ablation의 값이나 결과는 제공하지 않는다.
- B. 실물 로봇 실험: 실물 로봇 작업 전반에서 이 방법은 작업 계획을 정확히 생성하고 적절한 수의 로봇을 할당했으며, 완전히 보지 못한 가시성 기반 작업도 처리했다.실험에서는 면적이 서로 다른 영역과 가시 영역이 서로 다른 로봇을 사용했으며, 실물 로봇에서 작업을 원활하게 수행했다.
- B. 실물 로봇 실험: “patrol the regions”의 경우, 로봇은 가시 영역에 따라 영역에 할당된 후 자신에게 할당된 영역을 순찰했다.Figure 3은 로봇 팀, 영역, 계획 후 할당 결과, 그리고 그에 따른 순찰 행동을 묘사한다.
- VII. 결론 및 향후 연구: 이 연구는 네 가지 핵심 multi-robot task-planning 단계에 맞춰 설계한 prompt를 사용해 이기종 로봇 팀의 작업 계획 생성을 목표로 한다.각 prompt는 작업 계획을 생성할 때 환경 속성과 개별 로봇의 capability를 반영한다.
- VII. 결론 및 향후 연구: 실험을 통해 제안 방법이 복잡성이 서로 다른 작업 지시를 처리함을 검증했다.benchmark와 실물 로봇 평가는 연구 대상 작업 설정 전반에서 이 결론을 뒷받침한다.
- VII. 결론 및 향후 연구: 이 접근법은 새롭고 탐색되지 않은 환경, 로봇 유형, 작업 시나리오로 일반화되며, 표본으로 다룬 설정을 넘어 적응성을 보인다.결론에서는 이러한 일반화가 세 가지 차원 모두에서 원활하다고 규정한다.
- VII. 결론 및 향후 연구: 이 방법은 simulation-to-real deployment를 가능하게 해 simulation 작업 계획 sample로 실물 로봇 시스템의 계획을 생성함으로써 배포 과정을 간소화한다.이 transfer capability는 simulated planning에서 실제 로봇 응용으로 이어지는 가교로 제시된다.