Source-linked AI summary
Deep Imitation Learning for Complex Manipulation Tasks from Virtual Reality Teleoperation
Tianhao Zhang, Zoe McCarthy, Owen Jow, Dennis Lee, Xi Chen, Ken Goldberg, Pieter Abbeel
TL;DR
로봇 조작에서 pixel-to-action visuomotor policy에 사용할 고품질 demonstration을 수집하는 일은 여전히 어렵다. 이 논문은 consumer-grade VR teleoperation으로 demonstration을 수집하고 deep imitation-learning policy를 학습하며, task당 30분 미만의 demonstration만으로 높은 성공률을 달성하고 실제 환경의 다양한 조작 task에 일반화한다.
문제
로봇 조작을 위한 pixel-to-action visuomotor policy 학습용 고품질 demonstration은 여전히 수집하기 어렵다.
방법
consumer-grade VR teleoperation system은 사람이 PR2 robot을 자연스럽게 제어하면서 observation space와 action space를 공유하도록 하며, deep visuomotor imitation learning을 위한 demonstration을 생성한다.
결과
task당 30분 미만의 demonstration으로 학습한 policy는 높은 성공률을 달성하고 새로운 상황에 일반화했으며, 장시간 이어지는 조작 sequence를 완료했다.
시사점 및 한계
간단한 imitation learning만으로도 다양한 복잡한 실제 환경 조작 task를 위한 data-efficient pixel-to-action policy를 학습할 수 있다.
시사점 및 한계
policy는 자주 성공했지만, 느린 움직임, 멈춤, 최단 경로가 아닌 경로, 반복적인 grasp 시도 등 행동이 자주 최적이 아니었다.
Abstract
from arXiv · showhide
Imitation learning is a powerful paradigm for robot skill acquisition. However, obtaining demonstrations suitable for learning a policy that maps from raw pixels to actions can be challenging. In this paper we describe how consumer-grade Virtual Reality headsets and hand tracking hardware can be used to naturally teleoperate robots to perform complex tasks. We also describe how imitation learning can learn deep neural network policies (mapping from pixels to actions) that can acquire the demonstrated skills. Our experiments showcase the effectiveness of our approach for learning visuomotor skills.
I. 서론
이 논문은 PR2 로봇을 teleoperation하고 manipulation을 위한 고품질 demonstration을 수집하는 저비용 consumer-grade VR 시스템을 제시한다. 이러한 demonstration을 사용해 behavioral cloning은 실제 환경의 10개 task에서 visuomotor policy를 학습했으며, task당 데이터는 30분 미만이었다.
- I. 서론: 고품질 manipulation demonstration은 kinesthetic teaching이 어렵기 때문에 얻기 어렵고, trajectory optimization과 reinforcement learning은 세심하게 설계된 reward, dynamics model, 상당한 로봇 상호작용을 요구한다.기존의 특수 teleoperation 시스템은 수집을 단순화할 수 있지만 비용이 높고 특수 hardware에 맞게 설계되었을 수 있다.
- I. 서론: 이 연구는 실제 환경의 10개 PR2 manipulation task에 대한 demonstration을 수집하고 behavioral cloning으로 deep visuomotor policy를 학습했으며, 저자들은 고품질 demonstration이 주어졌을 때 그 효과가 놀라울 정도로 높다고 보았다.이 policy는 단순한 imitation-learning method를 사용해 pixel을 action으로 직접 변환한다.
- I. 서론: 이 시스템은 consumer-grade VR device를 사용해 실제 PR2 로봇을 teleoperation하며, operator가 로봇의 sensor space를 인지하고 motion-tracked VR controller로 로봇을 제어할 수 있게 한다.이 접근법은 특수 teleoperation hardware 없이 직관적인 manipulation과 고품질 demonstration 수집을 목표로 한다.
- I. 서론: 단일 neural-network architecture가 모든 task에서 raw color 및 depth pixel을 action으로 변환하며, learning을 가속하기 위해 auxiliary prediction connection을 추가했다.architecture는 Fig. 3에 제시되어 있다.
- I. 서론: task당 30분 미만의 demonstration만으로도 task 전반에 동일한 hyperparameter와 neural-network architecture를 사용해 성공적인 policy를 학습할 수 있었다.저자들은 이를 가장 놀라운 발견이라고 설명한다.
II . 관련 연구
관련 연구는 behavioral cloning과 inverse reinforcement learning을 구분하고, raw pixel에서 직접 policy를 학습하는 접근을 뒷받침한다. 이 논문은 실제 조작에서 시각적 demonstration을 수집하는 어려움을 해결하기 위해 Virtual Reality teleoperation을 활용한 behavioral cloning에 초점을 둔다.
- 관련 연구: Behavioral cloning은 supervised learning을 통해 observation에서 action으로의 대응을 학습하는 반면, inverse reinforcement learning은 demonstration을 거의 최적의 행동으로 설명하는 reward function을 추정한다.이 연구는 behavioral cloning에 초점을 둔다.
- 관련 연구: Behavioral cloning은 low-dimensional state representation을 사용하는 robotics에서 성공을 거두었으며, raw-pixel policy는 simulation, driving, drone 분야에서도 성공을 거두었다, [5],,, [35],.state information을 직접 추출하는 일은 흔히 어렵기 때문에 pixel에서 직접 학습하는 것이 바람직하다.
- 관련 연구: 실제 조작 demonstration을 수집하기는 어렵다. kinesthetic teaching은 직관적이지 않고 motion-capture teleoperation은 viewpoint correspondence problem을 일으킬 수 있다,, [37].Virtual Reality teleoperation은 직접적인 observation-action mapping을 제공하며 인간의 자연스러운 조작 본능을 활용한다.
- 관련 연구: Reinforcement learning은 pixel-to-action policy를 학습할 수 있지만, 실제 환경에서의 exploration은 흔히 비현실적이며 reward specification도 어렵다,,,.Guided Policy Search 는 sample complexity를 줄이지만, demonstration을 자율적으로 얻기 위해 trajectory 중심의 reinforcement learning에 의존한다.
III. 가상현실 원격조작 … C. 제어 인터페이스
이 시스템은 consumer-grade VR 원격조작을 사용해 사람이 pixel 기반 policy 학습에 필요한 demonstration을 자연스럽게 생성하도록 한다. 시각 및 제어 인터페이스는 motion sickness와 kinematic mismatch를 해결하면서 조작자의 움직임을 robot perception 및 gripper motion에 맞춘다.
- III. 가상현실 원격조작: 원격조작 시스템은 사람이 pixel을 action으로 매핑하는 policy 학습에 적합한 demonstration을 자연스럽게 생성하도록 설계되었다.
- A. 하드웨어: 원격조작 플랫폼은 $600 Vive VR system, PR2 robot, 그리고 visual sensing을 위한 저가형 3D camera를 결합한다.Vive는 서브밀리미터 정밀도와 90 Hz로 6 DoF hand-controller tracking을 제공하며, camera는 30 Hz로 일인칭 컬러 및 깊이 영상을 제공한다.
- B. 시각 인터페이스: 시각 환경은 3D 공간에 대한 조작자의 직관을 활용해 장시간 원격조작에 유익하고, 직관적이며, 편안하도록 설계되었다.
- B. 시각 인터페이스: stereo image를 직접 표시하면 motion sickness가 발생하고, PR2 head가 human head보다 degrees of freedom이 적고 precision이 낮아 lag가 생길 수 있다.6D human head pose를 맞추려면 PR2 base와 torso가 움직여야 할 수 있으며, 이로 인해 head movement와 표시된 scene 사이의 불일치가 커진다.
- B. 시각 인터페이스: RGB-D camera와 렌더링된 colored 3D point cloud가 virtual scene을 제공하고, virtual camera는 motion sickness를 피하기 위해 조작자의 head pose에 맞춰 즉시 갱신된다.
- C. 제어 인터페이스: 시스템은 Vive hand controller로 robot arm을 제어하며, trigger button으로 gripper를 완전히 열거나 닫는다.통합된 virtual coordinate frame에서 tracking된 조작자 손의 pose가 해당 robot gripper의 target pose가 된다.
- C. 제어 인터페이스: 손을 움직이면 robot gripper의 pose target도 그에 맞춰 움직이므로 제어 방식이 자연스럽고, 처음 사용하는 사람도 복잡한 manipulation task를 수행할 수 있다.kinesthetic teaching과 비교해 자연스러운 움직임에서 발생하는 kinematic difference를 최소화하고 조작자에게 즉각적인 feedback을 제공한다.
IV. 학습 · A. Neural Network Control Policies
이 논문은 observation–control demonstration에서 behavioral cloning을 통해 neural network control policy를 학습한다. Policy는 visual, depth, 최근 end-effector 정보를 사용해 오른팔 속도와 gripper command를 예측하며, depth input과 auxiliary task로 보강된 architecture를 사용한다.
- IV. 학습: Behavioral cloning은 각 task에 대해 여러 demonstration에서 수집한 observation–control pair로부터 control을 재구성하도록 policy를 학습한다.Dataset은 example observation–control pair를 포함하며, πθ(ut|ot)는 해당 mapping을 학습한다.
- A. Neural Network Control Policies: 각 policy input은 160×120×3 RGB image, current depth image, 그리고 가장 최근 다섯 step의 세 end-effector point를 결합한다.RGB와 depth는 onboard 3D camera로 수집하며, point history는 오른팔 end-effector state를 나타낸다.
- A. Neural Network Control Policies: 다섯 step의 end-effector history를 통해 robot은 kinematic state에서 velocity와 acceleration을 추론할 수 있다.Human operator가 일곱 arm joint가 아니라 end effector의 six degrees of freedom을 직접 제어하므로 joint angle은 제외한다.
- A. Neural Network Control Policies: Policy는 right-hand angular velocity, linear velocity, 그리고 grasping task에서는 binary desired gripper state를 출력한다.Platform은 양팔과 head를 모두 지원하지만 right arm만 제어하며, reset 중을 제외하면 다른 joint는 frozen 상태로 둔다.
- A. Neural Network Control Policies: Execution 중 policy는 current observation으로부터 ut = πθ(ot)와 같이 control을 생성한다.Control vector는 right-hand motion command와 해당되는 경우 gripper command를 포함한다.
- A. Neural Network Control Policies: Architecture는 을 따르면서 learning을 가속하기 위한 depth image와 auxiliary prediction task를 추가한다.Module은 vision, auxiliary prediction, control component로 분리되며, image feature는 convolutional network와 spatial soft-argmax layer 로 추출한다.
B. 손실 함수
실험에서는 표준 fitting objective에 방향 정렬과 task-specific auxiliary prediction을 결합한 수정 behavioral-cloning loss를 사용한다. Grasping task에서는 sigmoid cross entropy를 사용해 gripper state도 예측한다.
- B. 손실 함수: Behavioral cloning은 표준 l1 및 l2 loss를 사용해 demonstration pair를 fitting하며, 이 실험을 위해 약간 수정했다.
- B. 손실 함수: directional-alignment loss는 예측된 end-effector movement와 demonstration의 movement가 크기만 일치하는 대신 유사한 방향을 가리키도록 유도한다.이는 크기보다 movement direction을 중시한다는 점을 반영하며, arccos output의 범위는 0부터 π까지다.
- B. 손실 함수: Grasping task에서는 final layer가 scalar logit을 사용해 gripper open/close를 예측하고, sigmoid cross entropy로 학습한다.Target gripper state는 binary이며, gt ∈{0, 1}이다.
- B. 손실 함수: 전체 objective는 표준 loss와 auxiliary prediction loss의 weighted combination이다.Auxiliary prediction task는 Section IV-C에서 설명한다.
- B. 손실 함수: Neural network policy는 Dtask에서 무작위로 샘플링한 batch에 대해 stochastic gradient descent로 학습한다.
C. Auxiliary Loss Functions · V. 실험
이 방법은 task demonstration에서 추론한 label을 사용해 동시에 학습되는 auxiliary pose-prediction loss를 추가하며, 실험에서는 VR로 수집한 demonstration을 실제 PR2 manipulation task에서 평가한다. 각 task당 30분 미만의 demonstration으로 학습한 policy는 높은 성공률과 양호한 일반화 성능을 달성한다.
- C. Auxiliary Loss Functions: Auxiliary prediction task는 self-supervision의 추가 원천을 제공하며, self-supervisory signal이 data efficiency와 robustness를 향상시킬 수 있다는 근거를 바탕으로 한다 [51].각 task는 spatial soft-argmax layer 뒤에 작은 two-layer fully connected module을 추가한다.
- C. Auxiliary Loss Functions: 각 auxiliary module은 대응하는 label을 예측하도록 L2 loss로 학습된다.예측값은 ŝ^(a)로, target label은 s^(a)로 표기한다.
- C. Auxiliary Loss Functions: Auxiliary label은 current gripper pose p_t와 final gripper pose p_T를 포함해 task dataset에서 직접 추론할 수 있다.이 label은 별도의 annotation data가 아니라 demonstration에서 얻을 수 있다.
- C. Auxiliary Loss Functions: 별도의 labeled image dataset 을 사용하는 기존 pose-based pretraining과 달리, 이 방법은 additional data 없이 auxiliary objective를 동시에 학습한다.비교의 초점은 pose-related supervision의 data source와 training procedure에 있다.
- V. 실험: 실험에서는 도전적인 manipulation task에서의 policy 성공 여부, sample complexity, 그리고 auxiliary prediction loss가 real-world data efficiency를 향상시키는지를 검토한다.이 질문들은 제안한 VR teleoperation system을 통해 수집한 demonstration으로 평가한다.
- V. 실험: 각 task당 30분 미만의 demonstration으로 학습한 policy는 실제 PR2 manipulation task에서 높은 성공률과 양호한 일반화 성능을 달성한다.실험에서는 VR teleoperation이 적은 tuning으로 성공적인 deep visuomotor policy를 생성할 수 있는지를 조사한다.
A. 실험 설정
실험에서는 localization, precision, contact handling, deformable-object management, long-horizon generalization이 필요한 다양한 manipulation task를 대상으로 VR-teleoperated imitation learning을 평가한다. Demonstration은 단일 세션에서 수집했으며, human operator가 demonstration 수를 명시적으로 최소화하지 않고도 충분한 local variation을 제공했다.
- A. 실험 설정: 평가는 reaching, grasping, pushing, assembly, insertion, alignment, sequential placement, cloth manipulation을 포함한 ten challenging tasks를 다룬다.이 task들은 bottles, tools, toy blocks, planes, fruits, bowls, disheveled cloth에 걸쳐 있다.
- A. 실험 설정: 성공적인 policy는 object localization, high-precision control, contact handling, deformable-object manipulation, generalization을 결합해야 한다.여러 movement stage와 더 긴 duration이 필요한 task를 포함해 long-horizon imitation learning에서 compounding error에 대한 취약성을 검증했다.
- A. 실험 설정: 모든 task의 demonstration은 VR teleoperation system으로 수집했으며, 일반적으로 single robot-interaction session에서 진행했다.이 연구는 성공적인 policy에 필요한 최소 demonstration 수를 명시적으로 탐색하기보다 feasibility를 검증했다.
- A. 실험 설정: Human-operated demonstration은 자연스럽게 sufficient local training variation을 제공해 collected sample 수를 보완했다.이는 desired noise를 주입하기 위해 linear Gaussian controller를 사용하는 GPS 와 같은 기존 접근법과 대조된다.
B. 결과 및 분석
태스크당 30분 미만의 demonstration과 고정된 hyperparameter를 사용했음에도, 학습된 policy는 복잡한 manipulation 태스크 전반에서 높은 성공률을 달성했으며 보지 못한 test state에도 일반화됐다. 추가 분석에서는 skill quality, extrapolation, sample complexity, auxiliary loss를 검토하고, suboptimal behavior와 failure mode를 식별했다.
- 결과: 태스크당 30분 미만의 demonstration으로 학습한 모든 policy는 평가된 manipulation 태스크 전반에서 높은 성공률과 보지 못한 test situation에 대한 양호한 일반화 성능을 달성했다.Policy는 고정된 neural-network architecture와 hyperparameter로 학습한 뒤, training regime 내에서 object-position variation을 무작위화한 보지 못한 initial state에서 평가됐다.
- Skill Quality: Policy는 한 번의 contact으로 block을 balancing하는 동작, adaptive insertion behavior, 장시간 실행되는 태스크에서 maneuver 간 transition을 포함한 복잡한 skill execution을 학습했다.성공적인 evaluation trial에는 pushing과 반복적인 grasp-place-x2 sequence가 포함됐다.
- 한계: 성공 metric을 충족했음에도 policy는 비효율적인 경로를 택하거나, 느리게 움직이거나, 멈추거나, grasp를 재시도하는 등 대체로 suboptimal했으며, 태스크별 failure도 보였다.보고된 failure에는 object를 넘어뜨리는 동작, grasp 또는 alignment 실패, boundary trapping, target 근처에서 멈추는 현상이 포함됐다.
- Extrapolation: Policy는 보지 못한 competing bottle을 거부하고, block이 10 cm 더 낮은 경우에도 성공하며, hammer가 6 cm 더 멀리 있는 상황을 처리함으로써 training state를 넘어 extrapolate했다.이 테스트는 시연된 training regime 밖의 initial state를 사용해 generalization 한계를 검증했다.
- Sample Complexity: nail 태스크와 grasp-and-place 태스크의 demonstration subset을 줄여, 동일한 test initial state를 사용해 이 방법의 sample-complexity 한계를 직접 평가할 수 있었다.그 결과에 따른 performance 비교는 Table II에 보고됐다.
- Auxiliary Prediction Loss: Auxiliary prediction loss는 다양한 양의 demonstration으로 학습한 grasp-and-place policy의 data efficiency를 실험적으로 향상시켰다.비교에는 auxiliary loss를 사용한 policy와 사용하지 않은 policy가 포함됐으며, 그 동기는 simulated game에서 얻은 선행 근거 [51]였다.
VI . C O N C L U S I O N
이 논문은 VR teleoperation이 visuomotor learning을 위한 고품질 시연을 수집하는 실용적인 방법임을 제시하며, 제한된 데이터만으로도 imitation learning이 pixel-to-action policy를 학습할 수 있음을 보인다. 또한 더 풍부한 VR feedback, policy diagnosis, bimanual manipulation을 위한 향후 연구 방향을 제시한다.
- 기여: VR teleoperation은 visuomotor learning에 적합한 고품질 로봇 manipulation 시연을 쉽게 수집할 수 있게 한다.이 시스템은 자연스러운 시연 수집을 지원하기 위해 consumer-oriented VR interaction을 사용한다.
- 기여: Imitation learning은 소량의 learning data만으로 RGB-D image에서 action으로 직접 매핑되는 deep policy를 효과적으로 학습할 수 있다.결론은 이 결과를 논문의 핵심 발견으로 강조한다.
- 향후 연구: 향후 VR 확장에는 visual policy diagnosis, 사람이 제공하는 control-variance signal, haptics와 sound를 통한 더 풍부한 demonstrator feedback이 포함된다.이러한 추가 기능은 자연스러운 시연 수집을 넘어 VR을 더욱 활용하게 한다.
- 향후 연구: 이 시스템은 로봇의 head와 양팔을 제어하므로, 향후 연구에서는 bimanual manipulation을 위한 policy를 탐구할 수 있다.결론은 현재의 control setup이 가능하게 하는 미해결 연구 방향으로 bimanual learning을 제시한다.
부록 · A. 과제 명세
부록에서는 다양한 물체 배치, gripper 초기화, action sequence, 과제별 성공 기준을 포함하는 10개의 robot manipulation task를 정의한다. 과제는 단일 단계의 reaching과 insertion부터, 보지 못한 test configuration에서 장기적이고 시각적으로 다양한 manipulation을 수행하는 과제까지 범위가 넓다.
- A. 과제 명세: Reaching은 30 x 50 cm 영역에 무작위로 배치된 bottle을 knock하지 않고 grasp하는 능력을 평가하며, gripper를 수동으로 닫은 뒤 성공 여부를 판정한다.gripper는 고정된 pose에서 시작하며, trial 종료 시 bottle을 grasp할 수 있어야 한다.
- A. 과제 명세: Grasping은 15 x 15 cm 영역에 무작위로 배치되고 방향이 다양하게 설정된 toy hammer를 획득한 뒤 gripper를 움직일 때 떨어뜨리지 않는 능력을 요구한다.gripper는 중심을 향해 45° 위쪽, 45° 아래쪽 또는 수평으로 향한 상태에서 시작한다.
- A. 과제 명세: Pushing은 닫힌 gripper를 조작해 무작위로 배치된 LEGO block을 고정된 zone으로 이동시키면서 접촉과 pushing 방향을 유지하도록 한다.block은 40 x 20 cm 영역 안에서 위치와 방향이 달라지며, gripper는 세 위치에서 시작한다.
- A. 과제 명세: Plane assembly는 peg와 직사각형 wheel base를 모두 삽입하기 위해 정밀하게 정렬하는 과제로, plane과 wheel은 여러 영역과 방향으로 초기화된다.성공은 wheel이 완전히 삽입되어 움직일 수 없는 상태를 뜻한다.
- A. 과제 명세: Cube insertion과 nail alignment는 시연된 초기 상태에서 midpoint configurations로 일반화하는 능력을 평가하며, 일치하는 slot에 삽입하거나 nail head 아래에 hammer claw를 배치해야 한다.cube는 6개의 training state와 midpoint test state를 사용하고, nail은 시연된 3개의 gripper pose와 이에 대응하는 midpoint reset을 사용한다.
- A. 과제 명세: Grasp-and-place는 apple을 grasp하고 들어 올린 뒤 고정된 plate 위에 놓는 과제로, 잘못 들어 올리면 plate가 움직일 수 있다.성공하려면 종료 시 apple이 plate 안에 있고 gripper가 열려 있어야 한다.
- A. 과제 명세: Grasp-drop-push는 apple을 grasp하고 들어 올려 bowl에 떨어뜨린 다음, 무작위로 배치된 물체 사이에서 bowl을 고정된 cup 옆으로 미는 과정을 연쇄적으로 수행한다.이 장기 sequence에서는 apple을 bowl 안에 부드럽게 떨어뜨리기 위한 3차원 인식도 필요하다.
- A. 과제 명세: Grasp-Place-x2는 orange과 apple을 차례로 운반해 서로 다른 target에 놓아야 하며, Cloth는 학습한 영역과 보지 못한 중간 test 위치에서 시각적으로 다양한 cloth를 들어 올리는 과제다.과일 과제는 수행 시간이 길고 rolling에 취약하며, cloth의 형태와 pile 높이는 크게 달라진다.
B. 손실 함수 · C. 신경망 정책 · 감사의 글
실험에서는 고정된 loss weight와 auxiliary gripper-pose prediction objective를 사용했으며, policy는 지정된 초기화 및 ADAM 최적화 설정을 따랐다. 연구진은 기여자, funding program, fellowship 지원에 감사를 표했다.
- B. 손실 함수: Vision network는 auxiliary loss를 통해 현재 gripper pose와 최종 시점의 gripper pose를 예측했다.pose는 end effector 위의 세 점으로 표현했다.
- B. 손실 함수: plane 및 cube task에서는 vision network가 물체를 잡는 데 사용된 left gripper의 현재 pose도 추가로 예측했다.
- C. 신경망 정책: Policy는 Section IV-A에 설명된 architecture를 사용했으며, ImageNet으로 학습된 GoogLeNet 에서 초기화한 RGB first-layer filter를 제외한 모든 parameter를 [-0.01, 0.01]에서 균일하게 초기화했다.
- C. 신경망 정책: Policy optimization에는 기본 learning rate가 0.001이고 batch size가 64인 ADAM 을 사용했다.
- 감사의 글: 저자들은 집필 및 supplementary-video 지원에 감사를 표했으며, DARPA Simplex, ONR PECASE, Berkeley Deep Drive consortium으로부터 funding을 받았다고 보고했다.Tianhao Zhang, Zoe McCarthy 및 기타 기여자들도 fellowship 지원을 받았다.