Source-linked AI summary

Context Aware AI Assistant and AR Interface for Lunar Extravehicular Activity (EVA) Procedural Guidance

Rodrigo Gallardo, Qilmeg Doudatcz, Ganit Goldstein, Ilkyaz Sarimehmetoglu, Sergio Mutis, Alexander Htet Kyaw, Anita Lin, Clara Emmerling, Berfin Ataman, Skylar Tibbits

arXiv:2608.13589v1cs.HCcs.AI

TL;DR

달 표면 EVA 중 우주비행사는 높은 인지 부담과 제한된 주의력에도 접근 가능한 절차 안내가 필요하다. GAIN-AI는 구조화된 EVA context로 LLM을 grounding하고 Goal-Task-Verification 안내를 제공하며, nominal 시나리오에서 10.0/10, single-fault 시나리오에서 8.15/10을 기록했지만 복잡성이 증가하면 성능이 저하된다.

  • 문제

    기존 EVA 절차는 실시간으로 사용하기 어렵고, grounding되지 않은 LLM은 multi-fault 및 boundary-threshold 조건에서 의도를 잘못 해석할 수 있다.

  • 방법

    GAIN-AI는 JSON으로 인코딩된 절차, telemetry, error-handling data로 LLM을 grounding한 뒤 출력을 간결한 Goal-Task-Verification AR unit으로 재구성한다.

  • 결과

    nominal 및 single-fault 시나리오에서는 성능이 강하지만 복잡성이 증가하면 저하되며, 각각 10.0/10과 8.15/10에 도달한다.

  • 시사점 및 한계

    이 시스템은 anomaly를 비교적 일관되게 탐지하지만, 특히 복잡한 시나리오에서 정밀한 corrective action을 처방하는 데는 신뢰성이 낮다.

  • 시사점 및 한계

    합성 평가는 실제 사용자 성과나 인지 부하에 미치는 영향을 측정하지 않으며, 통합 시스템 결과는 아직 제공되지 않는다.

Abstract

from arXiv · show

As human space exploration returns to the Moon, astronauts need rapid access to procedural information during extravehicular activities (EVAs), where attention is divided across navigation, repair tasks, tool handling, and environmental risk. The challenge is not the absence of information, but surfacing the right information at the right moment. We present GAIN-AI (Guided Assistant for Intelligent Navigation), a context-aware AI assistant and minimal heads-up interface for procedural guidance in simulated lunar EVA. The system operates in two layers. The first grounds a large language model with structured context: EVA procedure documents, live telemetry data, and error-handling protocols encoded as JSON. The second restructures that output into three compact units for AR display: Goal, Task, and Verification. Evaluated on 111 synthetic EVA scenarios, the system scores 10.0/10 on nominal conditions and 8.15/10 on single-fault scenarios, with performance degrading on multi-fault and boundary-threshold cases.

1 서론

달 탐사 EVA에서는 목표, 위험 요소, 다단계 절차 전반에 걸쳐 지속적인 주의가 필요하지만, 포괄적인 절차 문서는 실시간 인터페이스로 사용하기 어렵다. GAIN-AI는 구조화된 JSON context로 LLM을 grounding하고, Goal-Task-Verification AR cards를 통해 실행 가능한 guidance를 제시함으로써 이 간극을 해소한다.

  • 동기: EVA는 우주비행사가 신체적 제약 속에서 임무 목표, 환경 위험 요소, 다단계 절차를 관리해야 하므로 인지적으로 demanding하다.높은 인지 workload는 문서화된 안전 위험이다.
  • 선행 연구: AR-assisted EVA systems는 생체정보, navigation, communication을 지원하며, LLM-AR integration은 시간 민감적 작업 중 인지 load를 줄일 수 있다 [Thomas et al. 2020; Zhuang et al. 2025; Xu et al. 2025].이러한 기능은 EVA 중 heads-up procedural support의 필요성을 뒷받침한다.
  • 문제: standard LLM은 특히 multi-fault 또는 near-boundary-threshold 상황에서 사용자 의도를 잘못 해석할 수 있으므로 domain-specific grounding이 필요하다 [Gallardo et al. 2025; Kyaw et al. 2025].제시된 본문은 이러한 조건을 ungrounded models의 구체적인 우려 사항으로 규정한다.
  • 기여: GAIN-AI는 structured JSON context로 grounding된 general-purpose LLM과, 출력을 이산적이고 실행 가능한 카드로 재구성하는 Goal-Task-Verification AR display를 결합한다.이 시스템은 공식 절차를 대체하기보다 제약 상황에서의 행동을 지원하도록 절차를 재구성한다.

2 시스템 개요

GAIN-AI는 시뮬레이션된 달 EVA 중 절차 안내를 위해 context-grounded LLM과 구조화된 AR 전달 계층을 결합한다. procedure, telemetry, error-handling JSON을 사용해 HoloLens 2 디스플레이에 순차적인 Goal–Task–Verification 단위를 생성한다.

  • 시스템 아키텍처: GAIN-AI는 procedure 문서를 Goal–Task–Verification 단위로 파싱하고 AR heads-up display에 이를 점진적으로 렌더링한다.시스템 아키텍처는 AI 계층의 파싱과 AR 계층의 렌더링을 분리한다.
  • 계층 1: Context-grounded LLM: context-grounded LLM은 procedure 데이터, 실시간 우주복 및 환경 telemetry, 그리고 fault conditions, severity thresholds, corrective actions를 지정하는 error-handling 데이터를 입력으로 받는다.구조화된 context는 nominal 및 fault-related conditions를 아우르는 111개 synthetic EVA scenario에서 inference 시점에 제공된다.
  • 계층 2: 구조화된 AR 전달: Grounded output은 Microsoft HoloLens 2에서 순차적인 Goal, Task, Verification cards로 제공되며, 사용자 제어 navigation을 통해 한 번에 하나의 card가 표시된다 [Zhao et al. 2025].각 단위는 현재 objective, 필요한 action, 관찰 가능한 completion evidence를 정의하면서 operator agency를 유지한다.

3 인터페이스 설계

GAIN-AI는 읽기, 상호작용, 주의가 제한되는 EVA 환경을 고려해 설계한 최소한의 3필드 카드 인터페이스를 사용한다. 각 카드는 현재 행동을 우선시하면서 완료 검증에 즉시 접근할 수 있도록 한다.

  • 카드 구조: 각 카드는 Goal, Task, Verification이라는 정확히 3개의 레이블 필드로 구성되며, 현재 행동을 우선시하고 Verification에 즉시 접근할 수 있도록 한다(Fig. 3).Goal은 상위 수준의 목표를 제시하고, Task는 하나의 명령형 신체 동작을 제시하며, Verification은 관찰 가능한 완료 조건을 제시한다.
  • 설계 동기: 이 인터페이스는 상황 인식을 저하시키고 인지 부하를 증가시킬 수 있는 조밀한 디스플레이를 피함으로써 제한된 시야, 장갑을 착용한 상호작용, 분산된 주의 문제에 대응한다 [Gupta and Kyaw 2025].이 설계의 동기는 가압 헬멧, 제한된 시야각, 미세 운동 상호작용을 어렵게 하는 장갑, 신체적 부담에 근거한다.
  • Verification 설계: 완료 여부는 센서 판독값, 물리적 상태, 시스템 표시기와 같은 관찰 가능한 조건을 통해 확인해야 하므로 Verification을 주요 필드로 격상한다.이 문단은 Verification 누락을 절차 오류의 흔한 원인으로 지적한다.

4 평가

GAIN-AI는 111개의 synthetic EVA scenarios를 대상으로 detection, action, urgency, triage를 포괄하는 10점 척도를 사용해 full structured context injection 조건에서 평가됐다. nominal case에서는 완벽한 성능을 보였지만 fault, vehicle error, threshold-sensitive procedure가 늘어 복잡도가 높아지면서 성능이 저하됐으며, anomaly detection이 action execution보다 강했다.

  • 4 평가: 평가는 error detection, correct action, urgency calibration, triage ordering을 사용해 최대 10점으로 측정한 다섯 범주의 111개 synthetic scenario를 포괄했다 [Chang et al. 2023].테스트한 모델은 multimodal capability와 latency profile을 고려해 선정한 gemini-2.5-flash-lite였으며, full structured context injection을 적용했다.
  • 4 평가: nominal scenario에서는 10.0/10, single-fault scenario에서는 8.15/10을 기록했으며, multi-fault에서는 7.73/10, LTV error에서는 3.96/10, boundary case에서는 5.24/10으로 하락했다.Table 1은 EVA scenario category 전반의 10점 평가를 보고하며, multi-fault 성능은 action-sequencing failure 때문에 낮아졌다.
  • 4 평가: Error detection은 범주 전반에서 평균 2.52/3이었던 반면 correct action은 평균 1.74/3으로, downstream procedural execution보다 anomaly identification이 강했음을 보여준다.이 구절은 scenario category 전반에서 detection에 비해 correct action이 급격히 저하된다고 보고한다.
  • 4 평가: 13-step NAV restart sequence는 정확한 switch state, indicator color, reset timing을 요구했으며, boundary case는 모델이 반올림하거나 순서를 잘못 정렬한 정밀한 pressure threshold에 좌우됐다.예로는 3000 psi 초과 또는 10 psi 미만의 tank pressure가 포함됐다.

5 한계와 향후 연구

이 연구는 초기 설계 프로토타입으로, 평가가 LLM 로직과 UI 설계를 분리하므로 통합 시스템 성능은 아직 검증되지 않았다. 향후 연구에서는 no-injection baseline, 실시간 telemetry, 비교 사용자 연구를 추가하고, 궁극적으로 multimodal hands-free input을 도입할 예정이다.

  • 한계: 현재 평가가 LLM 로직과 UI 설계를 분리하고 완전한 human-factors 연구 결과도 아직 나오지 않았기 때문에, 통합 시스템 성능은 해결되지 않은 과제로 남아 있다.이 프로토타입은 camera-free gesture-recognition glove를 포함하는 더 큰 EVA 시스템의 한 하위 시스템이다.
  • 향후 연구: 비교를 완성하기 위해 no-injection baseline을 추가하고, 실시간 업데이트를 위해 live telemetry를 통합할 예정이다.
  • 향후 연구: 사용자 연구에서는 GTV display를 conventional checklists와 비교하며, 장기적으로 multimodal hands-free input을 목표로 한다.
Loading 2608.13589v1…