Source-linked AI summary
ANYmal Parkour: Learning Agile Navigation for Quadrupedal Robots
David Hoeller, Nikita Rudin, Dhionis Sako, Marco Hutter
TL;DR
Agile quadrupedal navigation은 장애물에 따라 달라지는 동작, 부분적 인지, 최소한의 지연 시간을 처리해야 한다. 본 논문은 시뮬레이션에서 하드웨어로 transfer되는 fully learned hierarchical pipeline을 제시하며, 최대 2 m/s의 속도로 까다로운 장애물을 통과하는 navigation을 가능하게 한다.
문제
Agile quadrupedal navigation에는 장애물 의존적 동작, 부분적인 장면 인지, 최소한의 처리 지연 시간이 필요하다.
방법
fully learned hierarchical pipeline은 시뮬레이션에서 장애물별 locomotion skill, high-level selector, perception module을 학습하여 사전 매핑이나 offline planning 없이 onboard navigation을 수행한다.
결과
로봇은 무작위로 배치된 장애물 구성을 가로질러 목표에 도달하고, 적절한 skill을 선택하며, 넘어지거나 미끄러진 뒤 회복하고, 최대 2 m/s의 속도에 도달한다.
시사점 및 한계
이 접근법은 climbing, jumping, non-trivial path가 필요한 복잡한 장면에서 onboard 실시간 연산을 통해 real-world quadrupedal parkour를 입증한다.
시사점 및 한계
더 다양한 시나리오로의 확장성은 아직 검증되지 않았으며, 완전히 새로운 환경에 대한 generalization도 해결되지 않은 문제로 남아 있다.
Abstract
from arXiv · showhide
Performing agile navigation with four-legged robots is a challenging task due to the highly dynamic motions, contacts with various parts of the robot, and the limited field of view of the perception sensors. In this paper, we propose a fully-learned approach to train such robots and conquer scenarios that are reminiscent of parkour challenges. The method involves training advanced locomotion skills for several types of obstacles, such as walking, jumping, climbing, and crouching, and then using a high-level policy to select and control those skills across the terrain. Thanks to our hierarchical formulation, the navigation policy is aware of the capabilities of each skill, and it will adapt its behavior depending on the scenario at hand. Additionally, a perception module is trained to reconstruct obstacles from highly occluded and noisy sensory data and endows the pipeline with scene understanding. Compared to previous attempts, our method can plan a path for challenging scenarios without expert demonstration, offline computation, a priori knowledge of the environment, or taking contacts explicitly into account. While these modules are trained from simulated data only, our real-world experiments demonstrate successful transfer on hardware, where the robot navigates and crosses consecutive challenging obstacles with speeds of up to two meters per second. The supplementary video can be found on the project website: https://sites.google.com/leggedrobotics.com/agile-navigation
I. 서론 · A. 방법 개요
이 논문은 agile quadrupedal navigation을 부분 관측 환경에서 협응된 기술, 신속한 perception과 planning, dynamic control이 필요한 parkour 유사 traversal로 정식화한다. terrain perception, 특화된 locomotion skills, navigation을 simulation에서 학습한 뒤 ANYmal D에 실제 배치하는 three-module pipeline을 제안한다.
- I. 서론: Parkour 유사 navigation에서는 어려운 위치에 효율적으로 도달하기 위해 로봇이 정확하게 시간 조정된 sequence를 통해 걷기, 달리기, 오르기, 점프를 협응해야 한다.
- I. 서론: 로봇은 제한된 onboard computing과 부분적인 sensing에도 불구하고 빠르게 변하는 장면을 해석하고, 실행 가능한 skill sequence를 선택하며, dynamic maneuver를 real time으로 수행해야 한다.
- I. 서론: Agile traversal은 장애물이 안정적인 periodic gait가 아니라 서로 다른 motion과 limb contact를 요구하기 때문에 기존 locomotion에 도전이 된다.
- I. 서론: Self-occlusion과 제한된 sensor field of view로 인해 부분적인 장면만 제공되므로 perception과 planning이 어렵고, 실행 가능한 trajectory는 로봇의 kinematic, dynamic, controller limitation을 준수해야 한다.
- A. 방법 개요: 제안 시스템은 parkour 유사 환경에서 target location에 빠르게 도달하도록 agile navigation을 perception, locomotion, navigation module로 나눈다.
- A. 방법 개요: Perception은 onboard camera와 LiDAR point cloud로 주변 terrain과 compact scene-belief vector를 재구성하고, locomotion은 irregular ground와 gap 같은 terrain에 특화된 다섯 개의 policy를 제공한다.
- A. 방법 개요: Training에는 stairs, inclined surface, box, gap, table로 구성된 randomized field를 사용하며, locomotion policy는 single obstacle에서, perception과 navigation은 obstacle arrangement에서 학습한다.
- A. 방법 개요: Simulation training 후 complete pipeline을 ANYmal D quadruped에 배치하여 highly dynamic maneuver와 필요한 limb contact를 수행한다.
B. 기여 · C. 관련 연구
이 논문은 지형 재구성, 민첩한 보행 기술, 내비게이션을 결합한 학습 기반 계층형 시스템을 제시하며, 최대 2 m/s의 속도로 험난한 지형을 자율적으로 횡단한다. 또한 a priori 지도나 계획 없이 기술 선택과 경로 계획을 가능하게 함으로써 model-based, planned, manually designed 접근법의 한계를 해결한다.
- B. 기여: 이 시스템은 최대 2 m/s의 속도로 험난한 지형을 자율적으로 횡단하며, 내비게이션 결정을 선택하고 좁고 높은 장애물에서 정밀한 민첩 동작을 수행한다.보행 제어기는 로봇의 전체 가동 범위를 활용하며, 로봇의 footprint와 거의 같은 크기의 상자도 통과할 수 있다.
- B. 기여: 이 내비게이션 접근법은 지형 재구성 belief를 바탕으로 복잡한 장면을 계획하고, 보행 기술 중 하나를 선택하며, millisecond-scale inference를 수행한다.이 방법은 PPO [1]를 수정하여 Gaussian low-level command와 categorical skill output을 생성하는 hybrid actor를 사용한다.
- B. 기여: 보행 policy는 새로운 지형, heading command, symmetry augmentation을 사용하며, 지형 재구성은 정밀한 local map과 거친 larger-scale map을 결합한다.재구성 network는 reinforcement-learning 학습 중 효율적인 large-batch inference를 수행하도록 수정되었다.
- C. 관련 연구: Model-predictive-control 방법은 정밀한 발 배치 –를 지원하지만 underlying model에 의존하며 slippage or imperfect terrain perception 상황에서 실패할 수 있다.기존 접근법은 foot-contact schedule에 대해서도 강한 가정을 두므로 허용 가능한 동작을 제한한다.
- C. 관련 연구: 기존 민첩 사족보행 연구에는 running [11], jumping,, jumping and climbing, cat-like landing motion, 이 포함되며, 민첩한 이족보행 시연 [20], 도 함께 이루어졌다.이 사례들은 상용 사족보행 플랫폼과 deep reinforcement-learning framework를 통해 구현되는 민첩한 보행에 대한 관심이 커지고 있음을 보여준다.
- C. 관련 연구: 전통적인 다리형 로봇 내비게이션은 제어 전에 collision-free path를 계획하지만, 접촉이 많은 hybrid dynamics로 인해 계획이 어렵고 seconds, a priori environment knowledge, 또는 offline computation이 필요할 수 있다.기존 사족보행 접근법은 0.1 m 장애물을 0.33 m/s로 통과하는 데 제한되었으며, jumping-controller switching이 hard-coded되어 있었다.
- C. 관련 연구: Learning-based navigation은 demonstration,, reinforcement learning –, 또는 self-supervision [30]을 사용하며, hierarchical method는 steering과 switching,, 을 통해 재사용 가능한 기술을 결합한다.유사한 사족보행 장애물 코스 시스템 과 비교하면, 이 연구는 사람이 설계한 path와 skill selection, 사전 매핑된 environment, motion-capture 의존성을 제거한다. 또한 를 사용해 기술을 학습하고 와 같이 기술 사이를 steering한다.
- C. 관련 연구: 다리형 로봇 내비게이션과 보행은 일반적으로 elevation map,,,, 에 의존하지만, noise와 state-estimation error로 인해 unclean map이 생성되며 filtering 또는 teacher-student training으로 이를 완화할 수 있다.이 논문은 대신 multi-resolution scene representation과 효율적인 training-time inference를 포함하는, 까다로운 sensory condition을 위한 terrain reconstruction을 개발한다.
II. 결과
ANYmal D는 randomized obstacle arrangement 전반에서 demonstration, offline computation, prior environmental knowledge 없이 통합 learning-based pipeline을 통해 target에 안정적으로 도달한다. 또한 넘어짐과 미끄러짐에서 회복하고, 실행 중 obstacle이 이동하면 다시 적응한다.
- Hardware: ANYmal D의 중량은 약 55 kg이며, 각각 85 N m의 torque를 생성할 수 있는 12개의 series elastic actuator를 사용한다.이 platform은 deployment 실험에 사용된 hardware다.
- System implementation: Perception에는 6개의 Intel Realsense depth camera와 Velodyne Puck LiDAR가 사용되며, NVIDIA Jetson Orin에서 asynchronous processing을 수행한다.Locomotion과 navigation은 하나의 onboard node에서 synchronous하게 실행되는 반면, perception은 onboard system 전반에서 asynchronous하게 동작한다.
- Deployment results: 세 가지 learning-based module은 expert demonstration, offline computation, a priori environmental knowledge 없이 randomized obstacle arrangement 전반에서 ANYmal D가 target에 안정적으로 도달하도록 한다.Deployment에는 speed, selected skill, joint position 및 torque의 trajectory와 profile이 포함된다.
- Deployment results: System은 motor의 full torque capability와 large joint deflection을 활용해 높은 speed에 도달하고 challenging obstacle을 극복한다.Figure 3은 speed, selected-skill, joint-angle 및 torque profile과 함께 real-robot 및 simulation trajectory를 비교한다.
- Robustness: Robot은 box에서 떨어진 뒤 일어서고, 미끄러진 뒤 course를 완주하며, 실행 중 obstacle이 당겨져 이동하면 다시 적응함으로써 disturbance에서 회복한다.이러한 adaptation은 모든 component가 static environment만으로 학습되었음에도 발생한다.
A. Locomotion 모듈
Locomotion 모듈은 걷기, 점프, 오르기와 내려오기, 웅크리기에 대해 각각 별도의 policy를 학습하며, 각 policy는 서로 다른 obstacle 유형에 맞게 설계된다. Obstacle 난이도가 증가해도 모든 skill은 training difficulty의 90%까지 높은 성능을 보이지만, 그 이후에는 특히 웅크리기에서 성능이 저하된다.
- 점프와 오르기: 점프, 오르기, 내려오기 policy는 발 디딜 위치, 몸 자세, 다리 지지를 조정해 최대 높이 1 m의 box 또는 간격 1 m까지의 gap을 통과한다.오르기 policy는 다리가 미끄러지거나 edge를 놓치면 무릎으로 복구해 지면으로 다시 떨어지는 것을 막는다.
- 웅크리기: 웅크리기 policy는 robot의 base를 낮추고 gait를 조정해 폭이 0.4 m만큼 좁은 passage도 통과한다.base 높이가 낮을 때는 robot이 target을 향해 걷는 동안 양쪽 hip motor가 발을 들어 올리는 데 기여한다.
- 걷기: 걷기 policy는 40° 경사, 0.25 m 단차, 2 m/s의 평지 주행을 포함해 계단, 경사면, 흩어진 obstacle을 통과한다.하나의 공통 policy가 이러한 다양한 불규칙 지형을 처리하며, 이는 기존 perceptive legged-locomotion 연구, 의 환경과 유사하다.
- Skill 평가: 모든 skill은 각자의 training difficulty의 90%까지 높은 성공률을 달성하지만, 해당 임계값을 넘으면 웅크리기의 성능이 가장 빠르게 저하된다.점프, 오르기, 내려오기 skill도 더 높은 난이도에서 급격히 성능이 떨어진다.
B. 내비게이션 모듈
내비게이션 모듈은 3D perception과 각 skill의 capability에 대한 지식을 사용해 지형에 맞는 sub-goal을 선택하고 locomotion policy를 전환한다. 장애물 구성에 맞춰 trajectory를 조정하며, 고속 접근과 직접 climbing이 실패하는 경우도 처리한다.
- Planner는 perception의 latent space에서 3D 지형 정보를 추출해 sub-goal을 선택하고 장애물 크기에 맞게 경로를 조정한다.유사한 환경 구성에서도 장애물 크기에 따라 서로 다른 경로를 선택한다.
- High-level module은 지형에 적합한 locomotion policy를 선택하고 제어하며, 좁은 장애물에서의 급격한 감속과 회전도 수행한다.로봇이 고속으로 도착해 다음 장애물에 빠르게 도달해야 할 때 이러한 제어가 특히 중요하다.
- 내비게이션 모듈은 각 skill의 capability와 limitation을 사용해 trajectory를 수정하고, 실패할 climb-up 또는 climb-down 동작을 피하며 너무 낮은 테이블은 넘어간다.특히 climbing과 crouching skill에서 장애물 구성에 따라 동작이 달라진다.
- 이 방법은 1000 roll-outs씩 수행한 무작위 선정 3개의 거의 최대 난이도 시나리오에서 수작업으로 hard-code한 trajectory와 비교된다.수작업 baseline은 장애물 순서에 따라 command와 skill을 hard-code하며, 지형을 무작위화하면 확장할 수 없는 human expert demonstration을 필요로 한다.
C. 지각 모듈
지각 모듈은 noisy하고 occluded된 point cloud에서 의미 있는 scene geometry와 navigation latent를 재구성하며, 실제 운용 중 비동기적으로 동작한다. elevation-map baseline과 비교하면 희소한 측정값, overhang, state-estimation drift를 처리하지만, 재구성 정밀도는 로봇에서 멀어질수록 감소한다.
- C. 지각 모듈: 이 모듈은 noisy, occluded point cloud를 navigation을 위한 latent와 locomotion을 위한 정제된 재구성으로 변환하며, 실제 운용 중 비동기적으로 동작한다.반면 학습에서는 perceptive information, reconstruction, latent가 inference 시점에 정확히 이용 가능하다고 가정한다.
- C. 지각 모듈: elevation-map baseline 과 비교하면, 이 네트워크는 직접 측정값이 없는 elevated surface와 wall을 포함해 희소한 scene을 더 완전하게 재구성한다.edge measurement를 사용해 box top을 추론하고 wall을 정확히 식별하는 반면, baseline은 더 높은 box 위쪽 영역을 누락한다.
- C. 지각 모듈: voxel resolution이 낮고 obstacle edge가 noisy하기 때문에 로봇에서 멀어질수록 reconstruction precision이 감소하지만, refiner는 주변 geometry를 개선하고 더 정제된 stair를 생성한다.먼 상자 하나는 높이는 정확하지만 너비가 약 8 cm 지나치게 넓게 추정된다.
- C. 지각 모듈: Auto-regressive feedback은 overhang 아래의 occluded geometry를 보존하는 반면, baseline은 crouching 중 table-top과 ground surface를 잘못된 map에 섞는다.로봇이 접근하는 동안 네트워크는 이전 observation에서 얻은 table top surface를 기억한다.
- C. 지각 모듈: 이 네트워크는 갑작스러운 state-estimation drift를 감지하고 교정하는 반면, elevation map은 robot limb을 map 안에 박힌 상태로 남긴다.이러한 강건성은 로봇의 position estimate가 급변하는 상황과, 다른 시나리오에서 hind leg가 elevation map 내부에 나타나는 상황에서 입증된다.
III. 논의 … A. 개요
이 논문은 agile quadrupedal parkour를 위한 fully learned onboard pipeline을 제시하는 한편, scalability, training complexity, navigation convergence의 한계를 식별한다. 평가는 simulated 및 real-world 시나리오에서 agile navigation의 난제를 유지하는 structured pallet-box terrain을 사용한다.
- III. 논의: complete pipeline은 low-level locomotion skill, high-level navigation, perception을 결합해 로봇이 복잡한 장면에서 climb, jump하고 비자명한 경로를 선택할 수 있게 한다.이 시스템은 매우 도전적인 terrain을 위해 설계되었으며, 전례 없는 민첩성으로 이동할 수 있게 한다.
- III. 논의: 모든 module은 simulation에서 학습한 neural network를 hardware로 transfer하며, pre-mapping이나 offline planning 없이 real-time onboard operation을 가능하게 한다.Learning은 과업의 복잡성을 training 단계로 옮기면서 deployment computation은 비교적 작게 유지한다.
- A. 현재의 한계: 이 방법의 scalability는 제한된 시나리오 집합과 소수의 서로 다른 environmental module을 넘어서는 범위에서 아직 검증되지 않았다.이를 붕괴한 건물이나 실제 parkour course로 확장하려면 더 폭넓은 perception, navigation, traversal capability가 필요하다.
- A. 현재의 한계: 이 pipeline은 서로 의존하는 neural network 8개를 각각 조정하므로 training에 많은 시간이 걸리며, 한 module의 수정에 따라 다른 module을 다시 training해야 할 수 있다.예를 들어 navigation은 특정 perception latent tensor와 locomotion policy에 결부되어 있고, skill이 바뀌면 perception도 다시 training해야 한다.
- A. 현재의 한계: 목표에 도달하려면 여러 failure path를 포함하는 일련의 결정을 내려야 하므로 navigation이 수렴하려면 많은 iteration이 필요하다.올바른 behavior를 발견하려면 curriculum이 필요하며, curriculum이 없으면 로봇은 더 큰 obstacle에 도달하기 전에 stuck될 수 있다.
- A. 개요: 이 과업은 pallet 크기의 box로 이루어진 structured configuration을 navigation하고 locomotion하면서 target에 빠르게 도달하는 것으로 정의된다.이 설정은 agile navigation의 주요 난제를 유지하면서도 실행 가능하고 반복 가능하며 structured하다.
- A. 개요: benchmark에는 climb 또는 jump가 필요한 randomized box arrangement, randomized obstacle이 배치된 winding parkour line, 그리고 real-world deployment를 위한 straight-line version이 포함된다.시나리오는 object dimension, platform shape, obstacle sequence, parameter, initial position을 변화시키며, generalization을 시험하기 위해 wall과 distractor도 추가한다.
B. 파이프라인 · 1) Perception Module:
이 파이프라인은 세 가지 learning-based module로 구성되며, perception module은 noisy하고 occlusion이 심한 point cloud에서 로봇 주변 환경을 재구성해 이후 planning과 control에 사용한다. 이 multi-resolution encoder-decoder는 spatially adaptive mapping과 temporal evidence accumulation을 결합하며, simulated parkour trajectory에서 unsupervised 방식으로 학습된다.
- B. 파이프라인: 이 파이프라인은 perception, locomotion, navigation policy를 포함한 세 가지 learning-based module로 구성된다.
- 1) Perception Module:: Perception module은 path planning, policy selection, foothold placement, contact decision에 사용되는 scene understanding을 navigation과 locomotion에 제공한다.Sensor noise와 심한 occlusion에도 depth-camera와 LiDAR point cloud로 주변 terrain을 추정한다.
- 1) Perception Module:: Multi-resolution encoder-decoder는 로봇 근처의 terrain을 high resolution으로, 더 먼 영역을 lower resolution으로 재구성해 locomotion detail과 넓은 scene coverage 사이의 균형을 맞춘다.두 network는 서로 다른 spatial scale에서 작동하며, 원거리 영역은 planning과 policy selection에 필요한 approximate configuration만 있으면 된다.
- 1) Perception Module:: Encoder-decoder는 point cloud를 압축하고, 누락된 정보를 보완하며, noise를 filtering하고, coarse-network의 autoregressive feedback을 사용해 여러 frame에 걸쳐 evidence를 accumulate한다.이 temporal aggregation을 통해 로봇이 table 아래를 통과할 때 table의 top surface처럼 occluded structure를 재구성할 수 있다.
- 1) Perception Module:: Measurement는 centroid feature를 포함한 voxel grid가 되며, dense 3D convolution은 4000개 robot의 reinforcement-learning batch로 확장할 수 있지만 approximately 45 GB의 GPU memory가 필요하다.Sparse implementation은 이 설정에서 충분히 확장되지 않았기 때문에 이 아닌 dense formulation을 선택했다.
- 1) Perception Module:: Decoder는 voxel occupancy probability와 cell centroid를 예측하므로, low-probability cell을 pruning해 reconstruction할 수 있다. Randomized parkour world에서는 skip connection을 생략한 방식이 잘 작동했다.[3]과 달리 이 방법은 navigation에 skip-connected latent를 직접 노출하지 않지만, 이로 인해 generalization이 제한될 수 있다.
- 1) Perception Module:: High-resolution network는 temporal information이 이미 input에 encoding되어 있으므로 autoregressive feedback 없이 coarse-network feature와 measurement를 입력으로 받는다.Coarse map은 axis당 4 m 범위에서 12.5 cm voxel을 사용하고, high-resolution map은 2 m 범위에서 6.25 cm voxel을 사용한다.
- 1) Perception Module:: Network는 parkour scenario 전체에 균등하게 분할된 100 time-step 길이의 2000 trajectories에서 얻은 simulated data로 unsupervised 학습되며, occupancy와 centroid reconstruction loss를 사용한다.Occupancy에는 binary cross-entropy를, centroid에는 ground truth까지의 Euclidean distance를 사용하고, augmentation은 을 따른다.
2) Locomotion Module:
Locomotion Module은 50 Hz 인터페이스를 통해 별도로 학습된 걷기, climbing, crouching, jumping policy를 제공하며, proprioception, local elevation map, skill-specific command를 사용한다. Curriculum과 task-specific training condition은 다양한 지형과 장애물에서 강건하고 전이 가능한 행동을 생성한다.
- Locomotion Module: 50 Hz locomotion interface는 별도로 학습된 walking, climbing-up, climbing-down, crouching, jumping policy 중에서 선택하며 motor joint-position command를 출력한다.각 policy는 proprioceptive state, local terrain map, intermediate command를 입력으로 받는다. Policy들은 observation space와 action space를 공유하지만 서로 다른 reward와 termination condition을 사용한다.
- Skill Training: Walking은 불규칙한 계단, 경사면, 작은 장애물에서 학습하는 반면, specialized skill은 obstacle-focused curriculum과 20% random rough terrain을 사용해 자연스러운 보행과 더 나은 deployment performance를 생성한다.Walking은 60% 계단, 20% 경사면, 20% randomized obstacle을 사용한다. 다른 skill은 80% 해당 장애물과 20% random rough terrain을 사용한다. Walking scenario는 기존 legged-locomotion setting, 과 유사하다.
- Skill Training: Jumping은 최대 1 m의 gap을 넘으며, climbing-down과 climbing-up curriculum은 최대 1 m 높이의 box까지 도달한다.Climbing down은 안전하지 않은 simulated jumping을 방지하기 위해 높은 foot impact에서 종료된다. Climbing up은 base contact와 knee contact를 허용해 knee-assisted climbing에서 foot-based climbing으로의 진행을 유도한다.
- Skill Training: Crouching은 height curriculum을 사용해 최저 0.4 m 높이의 좁고 위가 돌출된 통로를 통과한다. 다만 top-view map은 table과 box를 구분하지 못한다.Policy가 이러한 overhanging-obstacle scenario를 대상으로 특별히 학습되므로 이 모호성은 허용 가능하다.
3) Navigation Module: · 보충 자료 · S1. Observations, actions, and rewards 정의
Navigation Module은 hierarchical reinforcement learning을 사용해 robot을 target으로 유도하며, frozen 50 Hz locomotion policies와 5 Hz navigation policy를 결합한다. 보충 자료에서는 locomotion 및 navigation module에서 사용하는 symbol, reward, observation, action을 정의한다.
- 3) Navigation Module:: Navigation Module은 할당된 시간 안에 target에 도달하도록 terrain 주변에서 robot을 유도한다.
- 3) Navigation Module:: Hierarchical reinforcement learning은 50 Hz로 작동하는 frozen locomotion policies 상위에서 5 Hz로 navigation을 수행한다.Navigation policy는 각 high-level step에서 goal, timing, robot-state 및 perceptual latent 정보를 입력받는다.
- 3) Navigation Module:: 수정된 PPO policy는 Gaussian command output과 categorical skill-selection probability를 사용하며, training 중에는 두 값을 모두 sampling하고 deployment 중에는 mean을 사용한다.
- 3) Navigation Module:: 실제 low-level policies를 rollout하면 navigation이 각 controller의 operating mode, capability 및 limitation을 고려할 수 있으며, 와 같은 단순화된 inner-loop model과는 다르다.이를 통해 더 높은 box를 climb할 수 없을 때 더 낮은 box에 접근하고, 좁은 passage에서 target을 신중하게 배치하는 등의 결정을 내릴 수 있다.
- S1. Observations, actions, and rewards 정의: 보충 자료에서는 method 전반에서 사용하는 symbol을 정의한다.
- S1. Observations, actions, and rewards 정의: 보충 자료에서는 전용 table을 통해 locomotion 및 navigation reward, observation, action을 명시한다.
S2. 구현 세부사항 · S4. 장거리 탐색
이 방법은 대규모 병렬 시뮬레이션과 대칭 인식 학습을 사용하며, planner는 제약된 지형에서 일시적으로 goal에서 멀어지는 방식으로 장거리 탐색을 해결할 수 있다.
- S2. 구현 세부 사항: 학습 및 perception 데이터 수집에는 Isaac Gym 을 사용하며, 4096개의 병렬 agent가 동작한다. 한편 custom Warp CUDA kernel은 timestep마다 약 140 million개의 sensor ray를 처리한다.kernel은 6개의 depth camera와 LiDAR에 raycast를 수행하고, memory copy 없이 측정값을 voxel-grid input으로 직접 변환한다.
- S2. 구현 세부사항: Position-tracking locomotion 학습에서는 trajectory를 제약하지 않으므로 복잡한 동작을 가능하게 하지만, 여러 obstacle을 통과할 때 방해가 될 수 있는 비대칭 동작을 만들어낸다.Climbing policy는 전방으로 올라가도록 학습하며, obstacle을 등지고 마주하면 방향을 전환할 수 있어 여러 obstacle이 있는 상황에서 불리한 상태를 만든다.
- S4. 장거리 탐색: Planner는 경로를 해결하려면 일시적으로 goal과의 거리를 늘려야 하는 경우에도 원거리 target에 도달할 수 있다.이 동작은 넓은 gap을 가로지르는 직접 jump가 불가능한 U자형 지형에서 나타난다.
- S2. 구현 세부사항: 이 방법은 의 duplication 방법에 따라 ANYmal D robot의 각 environment transition에 전후 및 좌우 대칭 variant를 추가한다.해당 representation은 robot의 X 및 Y symmetry를 사용해 원래 state를 4개의 대칭 state로 확장한다.
- S2. 구현 세부사항: 대칭 state는 off-policy일 수 있고 변환된 action에 낮은 probability를 할당할 수 있으므로, 이 방법은 모든 대칭 variant에 원래 action의 probability를 할당한다.이는 무작위로 초기화된 policy의 학습을 bootstrap하는 동시에 수렴 시 symmetry를 활용하기 위한 것이다.
- S4. 장거리 탐색: U자형 지형에서 planner는 넓은 gap을 jump로 건널 수 없기 때문에 먼저 goal에서 멀어지는 방식으로 원거리 goal에 도달한다.이는 겉보기에 직접적인 action을 배제하는 지형 제약하에서의 장거리 planning을 보여준다.
S5. navigation module 출력의 Ablation study · S6. measurement blind spots 설명 · S7. 잘못된 terrain reconstruction
보충 분석에서는 navigation policy action-space 구성요소를 평가하고, perception blind spots와 잘못된 terrain reconstruction을 기록한다. 이러한 reconstruction error는 occlusion 상황에서 발생하지만, 가시성이 향상되면 navigation이나 locomotion을 방해하지 않고 수정된다.
- S5. navigation module 출력의 Ablation study: Table S6는 동일한 비교 조건에서 time command, heading command 또는 둘 다 제거한 navigation-policy variant를 비교한다.Ablation을 통해 timer와 heading output이 low-level policy control에 기여하는 정도를 분리해 확인한다.
- S6. measurement blind spots 설명: box climbing 중에는 sensor가 처음에 상부 표면을 감지하지 못하며, climb 과정에서 limb이 큰 occluded region을 만든다.perception module은 front-surface edge를 따라 분포한 point로부터 box height를 추정해 보이지 않는 상부를 reconstruction한다.
- S6. measurement blind spots 설명: camera 배치로 인해 robot 바로 아래에도 blind spot이 생겨 locomotion 중 perception이 제한된다.이 blind spot은 robot 및 limb에 대한 sensor 배치의 상대적 위치에서 비롯된다.
- S7. 잘못된 terrain reconstruction: terrain network는 occluded region에서 첫 번째 box 뒤에 stair가 있다고 hallucinate하기도 하며, 이는 dataset imbalance 때문일 가능성이 높다.더 나은 시야를 확보하면 network가 reconstruction을 빠르게 수정하므로 navigation과 locomotion module은 방해받지 않는다.
- S7. 잘못된 terrain reconstruction: robot이 table 아래를 기어갈 때 network가 table의 shape를 부풀리기도 한다.이는 hallucinated stair와 함께 기록된 또 다른 잘못된 reconstruction이다.
- S7. 잘못된 terrain reconstruction: 잘못된 reconstruction은 measurement blind spot에서 발생하지만, scene이 더 잘 보이게 되면 network가 recover할 수 있다.보고된 recovery 덕분에 이러한 error가 navigation 및 locomotion 성능을 저해하지 않는다.