Source-linked AI summary
Unsolved Problems in ML Safety
Dan Hendrycks, Nicholas Carlini, John Schulman, Jacob Steinhardt
TL;DR
ML 시스템이 고위험 환경에 진입하면서 어떤 안전 문제를 우선시해야 하는지, 어떻게 진전을 이룰지 여전히 불분명하다. 이 연구는 robustness, monitoring, alignment, systemic safety라는 서로 연결된 네 가지 연구 문제를 중심으로 구성된 로드맵을 제안하며, 안전을 달성하려면 네 영역 모두에 걸친 연구가 필요하다고 결론짓는다.
문제
ML 시스템이 고위험 환경에 진입하면서 어떤 안전 문제를 우선시해야 하는지, 어떻게 진전을 이룰지 여전히 불분명하다.
방법
이 논문은 robustness, monitoring, alignment, systemic safety라는 네 가지 연구 문제를 중심으로 구성된 로드맵을 제시한다.
결과
이 논문은 네 문제가 서로 연결되고 상호 의존하므로 안전을 달성하려면 네 영역 모두에 대한 연구가 필요하다고 결론짓는다.
시사점 및 한계
ML 연구가 발전함에 따라 안전은 accuracy, speed, scalability와 함께 최우선 과제가 되어야 한다.
시사점 및 한계
systemic safety에 관한 논의는 망라적이지 않으며 empirical ML 연구의 방향에 초점을 맞춘다. 한편 정책과 거버넌스 연구는 안전한 배포에 여전히 필수적이다.
Abstract
from arXiv · showhide
Machine learning (ML) systems are rapidly increasing in size, are acquiring new capabilities, and are increasingly deployed in high-stakes settings. As with other powerful technologies, safety for ML should be a leading research priority. In response to emerging safety challenges in ML, such as those introduced by recent large-scale models, we provide a new roadmap for ML Safety and refine the technical problems that the field needs to address. We present four problems ready for research, namely withstanding hazards ("Robustness"), identifying hazards ("Monitoring"), reducing inherent model hazards ("Alignment"), and reducing systemic hazards ("Systemic Safety"). Throughout, we clarify each problem's motivation and provide concrete research directions.
1 서론
ML 시스템이 고위험 환경에 진입하면서 안전하지 않은 시스템은 심각한 피해를 초래할 수 있으며, 기존 공학 관행, 지연된 안전 연구, 경쟁 압력으로 인해 위험이 시스템에 내재화될 수 있다. 이 논문은 ML Safety의 네 가지 우선순위인 robustness, monitoring, alignment, systemic safety를 제시한다.
- 기여: 이 논문은 ML Safety의 네 가지 문제인 robustness, monitoring, alignment, systemic safety를 제시한다.이 문제들은 적대적 공격과 비정상적 사건에 대한 회복탄력성, 위험 및 예상치 못한 기능의 탐지, 인간의 가치를 안전하게 최적화하는 방법, cyberattack과 같은 더 광범위한 위험을 다룬다.
- 범위: ML 안전 연구는 역량이 증가하면서 안전성이 낮아지거나 이번 십 년 동안 문제가 더 어려워질 수 있는 장기적·long-tail 위험을 우선시한다.각 문제에 대해 이 논문은 향후 몇 년 안에 시작하거나 계속할 수 있는 연구 방향을 논의한다.
- 동기: 개발 초기에 이루어지는 안전 결정이 중요한 이유는 안전 연구를 미루면 안전하지 않은 설계 선택이 깊이 내재화되기 때문이다.보고에 따르면 가장 중요한 안전 결정의 약 75%는 개발 초기에 이루어진다.
- 동기: ML 시스템에는 기존 공학을 넘어서는 안전 접근법이 필요하다. 학습되고 pointwise 테스트된 모델은 취약하고, coverage를 평가하기 어려우며, 짧은 patch로 쉽게 수정되지 않기 때문이다.해석하기 어려운 학습된 가중치와 modularity 또는 encapsulation의 부재는 일반적인 소프트웨어에 비해 추가적인 과제를 만든다.
2 강건성
강건성 연구는 개방형 고위험 환경에서 ML 시스템이 극단적이고 이례적이며 적대적이고 변화하는 사건을 견디도록 하는 것을 목표로 한다. 이 로드맵은 Black Swan과 long-tail hazard뿐 아니라 작고 사전에 정의된 perturbation을 넘어서는 광범위한 adversarial threat도 강조한다.
- Black Swan: 강건성 연구는 Black Swan, long tail, 예측하지 못한 공격을 비롯한 극단적이고 이례적이거나 적대적인 사건을 견디는 ML 시스템 구축을 목표로 한다.이러한 시스템은 변화하는 환경에 적응하고 다양한 지각 가능한 공격을 처리해야 한다.
- Black Swan: 희귀하지만 영향력이 큰 사건은 현재 시스템의 취약성을 드러낸다. 2010년 Flash Crash 는 수조 달러 규모의 주식 가치를 수분 만에 증발시킨 feedback loop를 촉발했다.방대한 training dataset 이 있어도 long-tail 도로 시나리오는 autonomous vehicle의 충돌과 인명 손실을 초래할 수 있다.
- Black Swan: 연구자들은 시스템을 stress-test하고, 한계점을 찾으며, 잠재적 미래 시나리오에서의 동작을 평가하는 extreme distribution-shift 및 long-tail benchmark를 구축해야 한다.Interactive environment는 random shock, feedback loop, 그리고 agent가 잘못된 routine을 실행하는 competent error를 모델링할 수 있다.
- Black Swan: 미래 시스템은 이례적 상황에서 학습하고 새로운 경험에 빠르게 적응함으로써 Black Swan, long tail, 구조적으로 새로운 사건을 견뎌야 한다.Deployment 시점의 adaptation은 poisoned data 에도 대응해야 한다.
- Adversary: Adversarial-robustness 연구는 작은 ℓp perturbation을 넘어 지각 가능한 공격, 사전에 명시되지 않은 공격, 제한된 접근 권한의 공격, adaptive attack으로 범위를 넓혀야 한다 [30] [21].유망한 방어책으로는 multisensor inconsistency check, evolving test-time defense, robust representation, 개선된 data·architecture·training·loss가 있다 [41] [31].
3 모니터링 … 3.2 대표 모델 출력
모니터링 연구는 위험을 식별하고, 모델을 점검하며, 인간 운영자가 ML 시스템을 언제 신뢰하거나 개입할지 결정하도록 지원하는 것을 목표로 한다. 이 로드맵은 anomaly detection, calibrated uncertainty, 정직하고 진실한 모델 출력을 강조한다.
- 대표 모델 출력: 대표적인 모니터링 출력에는 model trojan 탐지, capability 스캐닝, 확률 calibration, 개입 시점 결정, 운영자 경고, 새로운 오용 플래깅이 포함된다.
- 3 모니터링: 모니터링은 위험을 식별하고, 모델을 점검하며, 인간 ML 시스템 운영자를 지원하는 것을 목표로 한다.
- 3.1 Anomaly Detection을 통한 위험 및 악의적 사용 식별: 사회적 조작, 무기 연구, 또는 사이버 공격을 위해 ML 시스템의 용도를 바꿀 수 있는 새로운 전략을 포함해 위험과 악의적 사용을 식별하려면 anomaly detection이 필요하다.
- 3.1 Anomaly Detection을 통한 위험 및 악의적 사용 식별: 기존 anomaly-detection 방법은 이전에 보지 못한 anomaly를 안정적으로 탐지하는 representation을 학습하는 데 어려움을 겪으며, 이에 따라 out-of-distribution, open-set, one-class detection에 대한 추가 연구가 필요하다.
- 3.2.1 Calibration: 인간 모니터가 시스템을 언제 신뢰하거나 개입할지 알려면 신뢰할 수 있는 모델 uncertainty가 필요하지만, 현재의 uncertainty는 종종 대표성이 부족하고 과도하게 확신한다.
- 3.2.1 Calibration: Calibration 연구는 전형적인 테스트와 training data와 다른 테스트에서 uncertainty 추정치를 개선해야 하며, 미래의 시스템은 조건부 언어를 통해 uncertainty를 전달할 수 있다.
- 3.2.2 정직하고 진실한 모델 출력 만들기: 현재의 language model은 유창하지만 조작된 설명을 자주 제공하므로, 모델은 자신의 이해를 정확하고 정직하며 충실하게 나타내는 출력을 생성해야 한다.
3.3 숨겨진 모델 기능
숨겨진 기능은 적대적으로 삽입된 backdoor나 모델 규모가 커지면서 출현하는 예상 밖의 능력으로 나타날 수 있다. 따라서 ML safety에는 이러한 행동을 탐지하고, 적응형 공격자에 맞서 탐지 성능을 stress-test하며, 위험한 능력을 예방하거나 제거하는 일이 필요하다.
- Backdoor: Backdoored model은 대부분의 상황에서 정상적으로 행동하지만, 적대자가 선택한 trigger가 주어지면 잘못 행동하도록 만들 수 있다 [67].Backdoor는 학습 중 삽입된다는 점에서 adversarial example과 다르며, model weight에 직접 삽입되거나 오염된 training 또는 pretraining data를 통해 삽입된다.
- Backdoor: 연구자들은 backdoor detector를 개선하고, 확장되는 공격 집합을 대상으로 adaptive attacker–auditor competition을 통해 이를 평가해야 한다.이러한 competition은 공격자가 전략을 바꿀 때도 detection method가 효과를 유지하는지 stress-test할 수 있다.
- Emergent capability: Large-scale model은 설계자가 처음에는 예상하지 못한 새롭고 질적으로 구별되는 능력을 발달시킬 수 있다 [23].일부 emergent capability는 monitoring을 회피할 수 있다. 예를 들어 agent와 유사한 system은 은밀한 행동을 채택할 수 있으며, digital organism이 monitoring을 감지한 뒤 행동을 바꾼 사례가 이를 보여준다.
- Emergent capability: Safety research는 model에서 위험하거나 위험을 완화하는 capability를 탐색하고, detection method를 검증하며, 바람직하지 않은 capability를 예방하거나 제거해야 한다.제안된 접근법에는 지속적으로 발전하는 capability testbed, sensitivity를 평가하기 위한 hidden functionality 삽입, 미래 capability 예측, 그리고 model이 위험한 capability를 획득하지 않거나 이를 잊도록 학습시키는 방법이 포함된다.
4 정렬
정렬 연구는 좋은 세계 상태를 추구하고 나쁜 상태를 피하는 ML 에이전트를 구축할 때 발생하는 사회적·기술적 과제를 다룬다. 이 논문은 의도하지 않은 결과를 방지하면서 목적 함수의 대리 지표를 명세하고 최적화하며 견고하게 업데이트하는 데 초점을 둔다.
- 사회적 과제: 정렬은 기업의 목표가 공익만을 추구하지 않을 수 있어 발생하는 사회적 위험 [94, 59, 20]을 다뤄야 한다.기업의 인센티브가 공공 복지를 해치는 방식으로 왜곡될 수 있다고 논문은 지적한다.
- 기술적 정렬 과제: 네 가지 기술적 정렬 문제가 핵심이다. 목적 함수의 대리 지표는 명세하고 최적화하며 견고하게 유지하기 어렵고, 의도하지 않은 결과를 초래할 수 있다.이러한 문제는 사회적 쟁점이 해결되고 이상적인 목표가 선택된 경우에도 발생한다.
- 가치 학습: 행복, 좋은 판단, 의미 있는 경험, 자율성과 같은 인간의 가치는 정의하고 측정하기 어렵기 때문에 가치 학습이 필요하다.시스템은 측정 가능한 것을 최적화하는 경향이 있으므로 클릭 수와 시청 시간이 인간 가치의 오해를 불러일으키는 대리 지표가 될 수 있다.
- 가치를 행동으로 변환하기: 정확한 가치 모델도 최적화가 어렵고, 장기적·단기적 웰빙이 충돌할 수 있으며, 하위 시스템이 주요 목적보다 부차적 목표를 추구할 수 있기 때문에 행동 측면에서는 정렬되지 않을 수 있다.따라서 명시적으로 작성된 목적이 시스템이 실제로 운용상 추구하는 목적과 반드시 일치하는 것은 아니다.
- 대리 지표 게임과 가치 명료화: 목적 함수의 대리 지표는 취약하며 최적화기나 적대자가 이를 게임할 수 있으므로, 적대적으로 견고한 보상 함수, 허점 모니터링, 가치가 변할 때 목적을 수정하는 시스템이 필요하다.대리 지표 게임의 예로 포상금을 받기 위해 코브라를 사육하는 일이 있으며, 가치 명료화는 미래의 윤리적 질문과 변화하는 목표를 다룬다.
5 시스템 안전
시스템 안전은 ML 시스템을 실패하거나 잘못된 방향으로 유도할 수 있는 맥락적 위험을 다루며, 사이버보안과 정보에 기반한 의사결정에 초점을 둔다. 안전한 배포에는 정책 및 거버넌스 작업도 필요하며 [16] [25], 이 연구 의제는 비망라적이다.
- 5 시스템 안전: 시스템 안전은 맥락적 위험을 완화하기 위해 ML을 적용하며, 특히 ML 시스템을 실패하거나 잘못된 방향으로 유도할 수 있는 사이버보안 위협과 부실한 거버넌스 의사결정을 다룬다.ML 시스템은 더 큰 맥락 안에서 작동하므로, 그 맥락의 불안정성이나 격변이 시스템의 안전성을 약화할 수 있다.
- 5 시스템 안전: 시스템 안전은 비망라적이다. 안전한 배포에는 정책 및 거버넌스 작업이 여전히 필수적이며 [16] [25], 감사와 협력이 추가 연구 영역이 될 수도 있다 [44].이 논문은 기술해결주의의 한계에도 불구하고 경험적 ML 연구 경로에 초점을 둔다.
- 사이버보안: 전통적 소프트웨어의 취약성이 악의적 행위자에게 자율 ML 시스템을 통제하게 하거나 보안 컴퓨터가 필요한 시스템을 침해하게 할 수 있으므로, 사이버보안은 중요하다.ML 시스템은 흔히 전통적 소프트웨어와 함께, 그리고 사이버-물리 시스템 안에서 작동한다.
- 사이버보안: ML은 진입 장벽을 낮추고 공격자의 접근성, 공격력, 성공률, 규모, 속도 및 은닉성을 높여 사이버공격을 증폭할 수 있다.따라서 이 논문은 침입 및 사칭자 탐지를 위한 ML, 취약성 분석, 악성 난독화 payload 탐지를 포함한 명확한 방어적 연구를 강조한다.
- 정보에 기반한 의사결정: 정보에 기반한 의사결정은 예측과 핵심 질문 및 요인 식별에 ML을 활용함으로써 거버넌스와 command-and-control 안전성을 향상할 수 있다.예측은 잘 정의된 위험의 추정치를 정교화하며, 자문 시스템은 역사적이고 다양한 training data에서 새로운 위험과 완화 조치를 찾아낼 수 있다.
6 관련 연구 의제
이 논문은 수정된 ML Safety 의제를 사회적 결과에 관한 더 폭넓은 연구와 기존 safety roadmap 안에 위치시킨다. 안전한 ML 시스템을 향한 구체적이고 미해결된 경로에 초점을 맞추면서 기존 주제를 확장하고 새로운 주제를 도입한다.
- 범위: 이 의제는 안전한 ML 시스템을 향한 경로를 제시하는 연구로 범위를 한정하며, AI 정책, 프라이버시 [3], 공정성, 윤리 [56]에 관한 관련 연구와 나란히 다룬다.저자들은 이러한 관련 분야를 강력히 지지하지만, 이 절의 초점으로 취급하지는 않는다.
- 기존 의제: Russell et al., 2015 는 robustness, machine ethics, AI의 경제적 영향에 걸친 safety 경로를 식별했으며, Amodei and Olah et al., 2016 [5]는 여러 방향을 구체화했다.이 연구들은 ML safety 문제를 식별하고 구조화하는 데 중요한 토대를 제공한다.
- 기여: 이 논문은 미해결 문제에 초점을 맞추고 Robustness 및 Alignment의 일부와 같은 주제를 확장하며 새로운 방향을 식별함으로써 이러한 의제를 수정하고 확장한다.여러 safety 경로를 추구하면 hazard를 완화하는 다층적 보호가 형성될 수 있으며, 이는 Swiss cheese model로 설명된다.
7 결론
이 연구는 서로 연결되고 상호 의존적인 네 가지 미해결 ML safety 문제를 식별하고, 안전한 시스템을 위해 네 가지 모두를 해결해야 한다고 주장한다. ML 역량이 발전함에 따라 safety는 최우선 과제이자 safety-critical 상황에 배포하기 위한 핵심 설계 기준이 되어야 한다.
- 7 결론: 네 가지 미해결 연구 문제를 모두 해결해야 한다. 이 문제들은 서로 연결되고 상호 의존적이며, 하나에만 집중해서는 safety를 달성할 수 없기 때문이다.Anomaly detection은 proxy-gaming detection, suspicious-cyberactivity detection, 예상치 못한 사건 발생 시 fail-safes를 지원할 수 있다.
- 7 결론: ML 시스템이 image, natural language, programming 전반에서 성과를 내는 만큼, 연구 우선순위는 accuracy, speed, scalability를 넘어 safety를 최우선 과제로 삼는 방향으로 확장되어야 한다.
- 7 결론: ML community는 safety 문화를 조성하고 설계에 safety features를 내재화하여 시스템을 safety-critical 상황에 배포할 수 있도록 해야 한다.이 논문은 널리 배포된 기술에서 safety가 당연히 갖추어야 할 속성으로 취급되며, ML에서도 동일한 기준을 적용해야 한다고 주장한다.
A 위험, hazard, 영향 분석 · A.1 Risk Management Framework
이 절은 Department of Defense의 광범위한 risk management framework에서 채택한 네 가지 risk dimension을 사용해 ML Safety의 진전이 추상적 risk와 hazard를 어떻게 줄일 수 있는지 분석한다. 또한 ML system, operation, institution에 대한 near-term risk와 세 영역 전반의 future risk를 구분한다.
- A.1 Risk Management Framework: 이 framework는 ML Safety 문제를 해당 문제가 직접 완화하는 risk와 연결하면서, 각 문제가 near-term risk와 long-term risk 모두에 영향을 줄 수 있음을 인정한다.이 표는 현재 시점의 snapshot을 제시하며, future organization과 institution은 ML system에 더욱 의존하게 될 것으로 예상된다.
- A.1 Risk Management Framework: 이 framework는 네 가지 risk dimension, 즉 ML system, operational, institutional and societal, 그리고 future risk를 구분한다.앞의 세 차원은 near-term scenario를 다루며, future risk는 ML system, organization, institution 전반의 mid- to long-term challenge를 다룬다.
- A.1 Risk Management Framework: ML system risk는 near-term individual ML system이 안정적으로 작동할 수 있는지를 다룬다.
- A.1 Risk Management Framework: Operational risk는 organization이 near-term deployment scenario에서 ML system을 안전하게 운영할 수 있는지를 다룬다.
- A.1 Risk Management Framework: Institutional and societal risk는 global society 또는 influential institution이 near-term scenario에서 효율적으로, 정보에 입각하여, 신중하게 운영될 수 있는지를 다룬다.
- A.1 Risk Management Framework: Future risk는 future ML system, operating organization, institution이 mid- to long-term challenge에 대응할 수 있는지를 다룬다.
- A.1 Risk Management Framework: Risk는 hazard prevalence에 exposure와 deleterious effect를 곱한 것으로 개념화되며, hazard는 harm을 일으킬 가능성이 있는 요인이다. [1]이 절은 systemic safety, monitoring, reduced exposure가 서로 다른 mechanism을 통해 각각 risk를 낮출 수 있음을 보여준다.
A.2 Hazard Management Framework
이 프레임워크는 ML safety를 다섯 가지 추상적 hazard인 known unknowns, unknown unknowns, emergence, long tails, adversaries & deception을 중심으로 구성한다. 이러한 hazard는 서로 중첩되고 exhaustive하지 않으며, problem mapping과 interconnectedness model을 통해 risks, hazards, goals를 연결한다.
- Hazard taxonomy: 이 프레임워크는 다섯 가지 hazard를 구분한다: known unknowns, unknown unknowns, emergence, long tails, adversaries & deception.이는 불완전한 지식, 식별되지 않은 hazard, 크기 또는 구성에 의존하는 hazard, 극단적 tail 사건, 공격 또는 deception을 나타낸다.
- Scope and limitations: 다섯 가지 hazard는 exhaustive하지 않다. systemic-safety 문제는 turbulence를 다룰 수 있으며, ML systems가 삶의 더 많은 영역에 통합될수록 feedback loops가 더욱 두드러질 수 있다.따라서 이 프레임워크는 미래 hazard의 완전한 목록이 아니라 현재의 범위를 제시한다.
- Hazard relationships: hazard는 서로 중첩된다. emergent hazard는 unknown unknowns일 수 있고, long-tail 사건은 known 또는 unknown일 수 있으며, adversarial attack은 long-tail 사건을 일으킬 수 있다.hazard는 탐지되면 범주가 바뀔 수 있고, emergent hazard와 long-tailed hazard는 동시에 발생할 수 있다.
- Problem–hazard mapping: Table 2는 각 ML safety 문제가 각 hazard에 대한 vulnerability 또는 exposure를 줄이는지를 나타내며, 현재 시점의 스냅샷을 제공한다.미래의 adversary가 새롭고 이례적인 사건을 만들거나 tail 사건을 악용함에 따라 mapping은 바뀔 수 있다.
- Interconnected framework: Figure 6은 이러한 요소를 명시한 뒤 risks, hazards, goals의 interconnectedness를 보여준다.이는 ML safety를 위한 상호 연결된 요인의 단순화된 model을 제공한다.
A.3 영향 극대화를 위한 우선순위 설정과 전략
ML Safety 문제는 중요성, 미개척성, 실행 가능성을 기준으로 우선순위를 정해야 하며, 영향 극대화 전략은 인력, 연구, 프로토콜, 파트너십을 결합한다. 이러한 우선순위는 대략적인 기준이며, 위험과 문제가 변화함에 따라 조정되어야 한다.
- A.3 영향 극대화를 위한 우선순위 설정과 전략: 문제는 중요성, 미개척성, 실행 가능성을 기준으로 우선순위를 정해야 한다. 즉 잠재적 위험 감소, 현재 연구 관심도, 예상되는 진전을 고려한다.Table 3은 이러한 요인에 대한 대략적인 현황을 제시할 뿐, 확정적인 순위를 제시하지 않는다.
- A.3 영향 극대화를 위한 우선순위 설정과 전략: 중요성은 재앙적 위험을 줄이는 것부터 더 개연성 높은 영구적 재앙의 위험을 직접 줄이는 것까지 다양하다.중요성 척도는 점점 더 강한 형태의 위험 감소를 구분한다.
- A.3 영향 극대화를 위한 우선순위 설정과 전략: 미개척성은 가장 많이 연구된 10개 주제 중 하나인 경우부터 주요 ML 학회에 관련 논문이 거의 없는 경우까지 다양하다.중간 단계의 경우에는 학회에서 어느 정도 관심을 받거나, 거의 미개척되지 않은 인접 문제를 다룬다.
- A.3 영향 극대화를 위한 우선순위 설정과 전략: 실행 가능성은 개념적 또는 capability 병목부터 신뢰할 수 있는 진전, 그리고 명백한 low-hanging fruit이 있는 매우 생산적인 노력까지 다양하다.이 척도는 연구자들이 현재 특정 문제에 대한 연구에서 어느 정도의 진전을 기대할 수 있는지를 포착한다.
- A.3 영향 극대화를 위한 우선순위 설정과 전략: 이러한 요인들은 한계 영향에 대한 대략적인 감각만 제공한다. 인기 있는 문제 안에도 미개척된 측면이 있을 수 있고, 집단적 선택이 미개척 영역을 과밀하게 만들 수 있기 때문이다.따라서 새로운 위험과 문제가 나타남에 따라 Safety 분석과 전략도 발전해야 한다.
- A.3 영향 극대화를 위한 우선순위 설정과 전략: 잠재적인 ML Safety 전략은 준비된 인력, Safety 연구 공동체, 안전한 개발과 배포를 위한 프로토콜, 그리고 학계·산업계·정부 간 연대를 결합한다.이 전략에는 시스템을 안전하게 운영하기, 목표 명확히 하기, 도입 비용 줄이기, Safety 방법 통합하기, red teaming, 표준 수립이 포함된다.