Source-linked AI summary

Inferring biological networks by sparse identification of nonlinear dynamics

Niall M. Mangan, Steven L. Brunton, Joshua L. Proctor, J. Nathan Kutz

arXiv:1605.08368v1math.DS

TL;DR

상호작용과 비선형성을 알 수 없는 경우 생물학적 네트워크 추론에는 확장 가능한 접근법이 부족하다. 이 논문은 sparse null-space identification을 사용하는 implicit-SINDy를 제안해 rational nonlinear dynamics를 추론하고, 세 가지 대표적 생물학적 모델을 정확히 재구성한다.

  • 문제

    네트워크 상호작용과 비선형성을 알 수 없으면 후보 상호작용 수가 조합적으로 증가하므로 information-theoretic model selection이 계산적으로 까다롭다.

  • 방법

    Implicit-SINDy는 rational nonlinear dynamics를 implicit equations로 표현하고, state-derivative library의 null space에서 가장 희소한 벡터를 선택한다.

  • 결과

    Implicit-SINDy는 효소 kinetics, 세균 조절, 효모 대사를 정확히 재구성하며, 원래 값에서 2% 이내의 계수를 복원한다.

  • 시사점 및 한계

    이 방법은 대규모 후보 함수 library에서 비선형 생물학적 네트워크 dynamics를 선택하기 위한 parsimonious alternative를 제공한다.

  • 시사점 및 한계

    실제 구현에는 noise sensitivity와 시계열 측정 횟수를 줄여야 한다는 과제가 남아 있다.

Abstract

from arXiv · show

Inferring the structure and dynamics of network models is critical to understanding the functionality and control of complex systems, such as metabolic and regulatory biological networks. The increasing quality and quantity of experimental data enable statistical approaches based on information theory for model selection and goodness-of-fit metrics. We propose an alternative method to infer networked nonlinear dynamical systems by using sparsity-promoting $\ell_1$ optimization to select a subset of nonlinear interactions representing dynamics on a fully connected network. Our method generalizes the sparse identification of nonlinear dynamics (SINDy) algorithm to dynamical systems with rational function nonlinearities, such as biological networks. We show that dynamical systems with rational nonlinearities may be cast in an implicit form, where the equations may be identified in the null-space of a library of mixed nonlinearities including the state and derivative terms; this approach applies more generally to implicit dynamical systems beyond those containing rational nonlinearities. This method, implicit-SINDy, succeeds in inferring three canonical biological models: Michaelis-Menten enzyme kinetics, the regulatory network for competence in bacteria, and the metabolic network for yeast glycolysis.

I. 서론 · A. 생물학적 네트워크 · B. 모델 선택과 정보이론

이 논문은 정보이론적 모델 선택이 계산적으로 다루기 어려워지는 상황에서 생물학적 네트워크의 동역학과 연결성을 추론하기 위한 데이터 기반 대안으로 implicit-SINDy를 제시한다. overcomplete library와 sparse regression을 사용해 SINDy를 rational nonlinearity로 일반화하고, 세 가지 생물학적 모델에 이 방법을 적용해 보인다.

  • I. 서론: Implicit-SINDy는 overcomplete library 와 sparse regression, 에 기반해 SINDy 를 rational-function dynamics를 허용하는 implicit formulation으로 일반화한다.이 방법은 생물학적 네트워크의 동역학과 연결성을 모두 추론하기 위해 제안되었으며, 세 가지 대표 모델에서 정확도와 강건성이 입증된다.
  • A. 생물학적 네트워크: 조절 네트워크와 대사 네트워크는 세포 기능에 중요하며, 이들의 제어 회로 이상은 암과 그 밖의 치명적 질환에 기여할 수 있다.이러한 네트워크는 흔히 mass-action kinetics로 모델링할 수 있으며, 이는 비교적 제한된 네트워크 모티프 집합을 만든다.
  • A. 생물학적 네트워크: 현대의 고품질 실험 데이터는 조절 네트워크와 대사 네트워크 모델을 빠르고 강건하며 정확하게 데이터 기반으로 식별할 기회를 제공한다.이러한 식별은 질병 치료와 대사공학을 포함해 생물학적 기능의 이해와 제어를 앞당길 수 있다.
  • B. 모델 선택과 정보이론: 전통적인 생물학적 네트워크 모델은 변수 간 관계를 추정하고 실험 결과에 맞춰 반복적으로 수정하는 방식으로 개발되며, 이 과정이 정량적으로 예측 가능해지는 데 수년이 걸릴 수 있다.반면 정보 기준은 후보 모델에 수치 점수를 부여하지만, 실무자가 합리적인 후보 집합을 지정해야 한다는 제약이 있다.
  • B. 모델 선택과 정보이론: 비선형 동역학 네트워크에서는 알려지지 않은 연결과 함수형이 조합적으로 매우 큰 모델 공간을 만들기 때문에 정보이론적 모델 선택이 어렵다.후보 모델은 시뮬레이션, 데이터와의 비교, 정보 기준 점수 계산을 요구할 수 있어 전체 평가가 계산적으로 다루기 어려워진다.
  • B. 모델 선택과 정보이론: 다섯 변수에서 차수 4 이하인 다항식의 경우, 대사 네트워크 예제에는 126개의 단항식과 약 10^38개의 가능한 다항식 구조가 존재한다.일반적인 분자식과 분모식 다항식은 rational function의 공간을 더욱 크게 만든다.
  • B. 모델 선택과 정보이론: 후보 비선형성의 대규모 library와 sparsity-promoting regression을 결합하면 SINDy 와 같이 함수적 상호작용의 sparse subset을 선택할 수 있다.library는 다양한 가능한 함수형을 제공하고, LASSO 또는 elastic-net regularization 은 sparse selection을 촉진한다.

C. 본 연구의 기여 · II. 동역학계의 희소 회귀 · A. LASSO와 희소 근사

이 절에서는 생물학적 네트워크 동역학에서 동기를 얻은 rational nonlinearity에 SINDy를 확장하고, sparse regression, overcomplete library, LASSO 기반 feature selection을 통해 접근법을 정식화한다. 이 방법은 세 가지 생물학적 모델에서 검증되며 실제 시스템에서의 실용적 추론을 위한 방법으로 제시된다.

  • C. 본 연구의 기여: 이 연구는 대사 및 조절 네트워크 동역학에 rational-function nonlinearity 항이 흔히 포함되므로 SINDy를 rational-function nonlinearity로 확장한다.일반적인 rational function을 위한 sparse-regression library를 구성하기는 어렵다. rational function은 소수의 basis function을 단순히 희소 결합한 형태가 아니기 때문이다.
  • C. 본 연구의 기여: 업데이트된 알고리즘은 실제 생물학적 응용을 논의하기 전에 모의 enzyme kinetics, 세포 분화 조절, seven-node glycolysis 모델에서 검증된다.실용적 논의에는 implicit-SINDy를 실제 생물학적 시스템에 적용할 때 발생하는 문제와 같은 과제가 포함된다.
  • II. 동역학계의 희소 회귀: 이 네트워크 추론 방법은 sparse regression, overcomplete library, dynamical-systems theory를 결합하여 폭넓게 적용 가능한 수학적 architecture를 구축한다.이러한 구성 요소는 방법을 가능하게 하는 핵심 혁신으로 제시된다.
  • A. LASSO와 희소 근사: LASSO 는 over-determined library Θ에서 희소 해 벡터 a를 찾아 feature selection을 수행하며, 이를 통해 변수 선택 기준을 정의한다.이 방법은 초기의 sparsity-promoting regression 기법 중 하나로 설명된다.
  • A. LASSO와 희소 근사: Sparse approximation은 ℓ1 norm을 사용해 측정값을 library atom의 선형 결합으로 표현하며, elastic-net regularization 과 같은 관련 방법도 함께 사용된다.다른 ℓ1 기반 sparsity 혁신으로는,, 에 인용된 방법들이 있으며, atom은 training data 또는 알려진 basis에서 올 수 있다.

B. 비선형 동역학의 희소 식별 (SINDy)

SINDy는 측정된 도함수를 후보 함수 라이브러리에 회귀시키고 희소성을 강제해 활성 상호작용을 선택함으로써 비선형 동역학계를 발견한다. 다항식 및 삼각함수 라이브러리는 많은 시스템을 포괄하지만, 시간 척도가 분리된 생물학적 동역학에서 발생하는 유리함수 비선형성은 표준 라이브러리의 계산을 감당하기 어려울 정도로 만들 수 있다.

  • B. 비선형 동역학의 희소 식별 (SINDy): SINDy는 희소 회귀를 통해 자동화된 시스템 식별을 확장하며, 이전 압축 센싱 접근법 과 비교해 잡음이 있는 과결정 문제에서 수치적 강건성을 향상한다.
  • B. 비선형 동역학의 희소 식별 (SINDy): SINDy는 동역학계가 함수 공간에서 희소하다고 가정하고 ℓ1-정규화 회귀를 사용해 활성 항을 식별한다.이 볼록 최적화는 조합적으로 매우 큰 후보 비선형성 집합에서 희소 모델을 선택한다.
  • B. 비선형 동역학의 희소 식별 (SINDy): 워크플로는 상태 시계열과 도함수를 수집하고, 다항식 및 삼각함수 후보 라이브러리를 구성한 뒤, 도함수를 이러한 비선형성에 회귀시킨다.상태 변수는 측정된 생물학적 구성요소를 나타내며, total-variation 정규화는 잡음이 있는 데이터에서 수치적으로 강건한 도함수 추정치를 제공한다.
  • B. 비선형 동역학의 희소 식별 (SINDy): n차까지의 다항식 라이브러리는 단량체부터 n-mer까지의 복합체가 관여하는 생물학적 mass-action kinetics에 해당한다.다항식 및 삼각함수 라이브러리는 광범위한 동역학계에 충분하다.
  • B. 비선형 동역학의 희소 식별 (SINDy): 시간 척도가 분리된 mass-action kinetics는 유리함수로 환원될 수 있으며, 이 경우 표준 다항식 라이브러리는 감당하기 어려울 정도로 커져 계산 가능한 유리함수 라이브러리를 사용하게 된다.

III. 유리 함수로 비선형 동적 시스템 추론

이 방법은 dynamics를 implicit equations로 다시 쓰고 library의 null space에서 가장 sparse한 nonzero coefficient vector를 찾음으로써 SINDy를 rational nonlinearities로 일반화한다. 확장된 library는 numerator monomials와 derivative-weighted denominator polynomials를 결합하며, alternating directions methods가 sparse model을 식별한다.

  • III. 유리 함수로 비선형 동적 시스템 추론: Rational nonlinearities는 일반적으로 소수의 rational-function library에 대한 sparse linear combination으로 표현되지 않으므로 sparse regression을 수정해야 한다.따라서 이 절차는 원래 SINDy formulation을 직접 적용하는 대신 가장 희소한 implicit ordinary differential equation을 찾는다.
  • III. 유리 함수로 비선형 동적 시스템 추론: 각 rational equation에 denominator를 곱하면 동역학은 numerator polynomial과 derivative-weighted denominator polynomial을 포함하는 implicit form으로 변환된다.그 결과로 얻는 augmented library는 state monomial과 denominator-library column에 해당 derivative를 element-wise로 곱한 항으로 구성된다.
  • III. 유리 함수로 비선형 동적 시스템 추론: Numerator와 denominator polynomial의 차수를 일치시키면 augmented library는 일반적으로 원래 polynomial library의 twice the size가 된다.이 일반적인 경우 ΘN(X) = ΘD(X)이다.
  • III. 유리 함수로 비선형 동적 시스템 추론: 0 vector는 implicit equation을 자명하게 만족하므로, algorithm은 alternating directions methods를 사용해 library의 null space에서 가장 희소한 sparsest nonzero vector를 식별한다.추론된 sparse coefficients는 각 동적 방정식에서 활성화된 nonlinear terms에 대응한다.

A. 유리함수 희소 선택 알고리즘

이 알고리즘은 상태 및 도함수 시계열로 구축한 library의 null space에서 희소 벡터를 찾은 뒤, 희소성 threshold 전반에서 간결한 모델을 선택해 희소 유리함수 동역학을 식별한다.

  • 알고리즘: 이 방법은 상태변수와 도함수 시계열 데이터로 functional library를 구축하고, null-space basis를 계산한 뒤, threshold λ를 사용하는 alternating-directions 방법으로 희소 선형 결합을 탐색한다.threshold는 추론된 계수 벡터 ξ에 부과되는 희소성의 정도를 조절한다.
  • 모델 선택: λ를 변화시키면 정확도와 희소성이 서로 다른 모델이 생성되며, 이후 알고리즘은 이들의 Pareto front에서 가장 간결한 모델을 선택한다.λ를 증가시키면 항의 수가 줄어들고, 선택된 모델은 Pareto plot의 급격한 감소 지점에서 식별된다.

B. 암시적 ODE의 일반 정식화

이 정식화는 상태와 미분항의 혼합 비선형성을 포함하는 library를 사용해 rational nonlinearity를 넘어 일반 암시적 ordinary differential equation으로 implicit-SINDy를 확장한다. 또한 고계 미분항을 지원해 식별 가능한 시스템의 범위를 넓힌다.

  • 일반 정식화: 이 방법은 rational function nonlinearity를 포함하는 시스템을 넘어 일반 암시적 ordinary differential equation을 식별한다.이러한 일반성은 뒤에서 살펴보는 rational-function 사례를 넘어 추가적인 시스템을 식별할 수 있게 한다.
  • 일반 정식화: 상태와 미분항의 비선형 함수 library는 서로 다른 거듭제곱과 조합을 갖는 혼합항을 표현한다.이 정식화는 다양한 상태항과 미분항의 조합을 포함하는 비선형 방정식을 허용한다.
  • 일반 정식화: 그 결과 얻어지는 암시적 동역학은 library의 영공간에서 sparse vector로 부호화할 수 있다.
  • 일반 정식화: 피처 라이브러리를 확장하면 고차 미분을 포함할 수 있으며, 이차 암시적 동역학 시스템을 위한 정식화도 포함된다.

IV. 결과

implicit-SINDy architecture를 canonical biological network model에 적용한 결과, 세 시스템의 추론에서 빠르고 정확하며 견고한 성능을 보였다.

  • Implicit-SINDy는 Michaelis-Menten enzyme kinetics, bacterial competence regulation, yeast glycolysis를 빠르고 정확하며 견고하게 추론한다.이러한 canonical model은 biological networked dynamical system에 대한 방법의 더 폭넓은 적용 가능성을 뒷받침한다.
  • 이 방법은 biological networked dynamical system의 canonical model에서 검증되었다.이러한 model에서의 검증은 더 폭넓은 적용 가능성을 보여준다.
  • 검증한 system은 enzyme kinetics, bacterial regulatory dynamics, yeast metabolic dynamics를 아우른다.예시에는 Michaelis-Menten enzyme kinetics, bacteria의 competence를 위한 regulatory network, yeast glycolysis의 metabolic network가 포함된다.

A. 간단한 예: Michaelis-Menten kinetics

Michaelis-Menten kinetics에서 implicit-SINDy는 단 두 개의 초기 농도에서 얻은 시계열 데이터만으로 올바른 rational functional form을 복원하고 계수를 정확히 적합한다. 추론된 모델은 새로운 초기 조건에서 생성된 테스트 궤적에서도 원래 모델과 일치한다.

  • A. 간단한 예: Michaelis-Menten kinetics: 빠른 결합/해리 또는 정상상태 가정하에서 Michaelis-Menten dynamics는 rational function을 갖는 단일 상태변수 방정식으로 환원된다.이 모델은 기질의 결합과 해리에 이어 비가역적인 생성물 형성을 기술한다.
  • A. 간단한 예: Michaelis-Menten kinetics: 단 두 개의 초기 농도에서 얻은 시계열 데이터를 사용해 implicit-SINDy는 올바른 functional form을 추출하고 그 계수를 정확히 적합하며, 새로운 초기 조건에서 원래 모델과 일치하는 결과를 보인다.새로운 초기 조건은 학습에 사용되지 않았다.
  • A. 간단한 예: Michaelis-Menten kinetics: 이 알고리즘은 측정 가능한 농도 궤적 x(t)를 사용하고, 이로부터 미분 궤적을 계산하며, flux source j_x와 Michaelis-Menten 소비 항을 포함한다.V_max는 최대 반응 속도이고, K_m은 반최대 반응 속도에서의 농도다.
  • A. 간단한 예: Michaelis-Menten kinetics: Implicit-SINDy는 4차 이하 다항함수로 구성된 10열 library에서 네 개의 활성 항을 희소하게 선택하며, Pareto front의 오차는 0.01에서 10^-5 부근으로 급격히 감소한다.이 급격한 감소는 네 개의 항에서 나타나며, 가장 간결한 모델의 λ를 나타낸다.

B. 조절 네트워크: B. subtilis competence

이 방법은 시간 척도 분리에서 비롯된 rational 및 Hill-function 비선형성을 갖는 2상태 B. subtilis competence 조절 모델에 적용된다. rational 구조를 정확히 복원하고 계수를 실제값의 2% 이내로 식별한다.

  • B. 조절 네트워크: B. subtilis competence: 2상태 축약 모델은 ComK 양성 자기조절과 ComS 억제를 Hill-function 양성 및 음성 피드백 루프로 나타낸다.Hill-function의 지수는 조절 복합체에 x1 단백질이 협동적으로 관여함을 나타내며, 결합된 피드백은 competence와 영양세포 성장 사이의 전환을 가능하게 한다.
  • B. 조절 네트워크: B. subtilis competence: 두 방정식은 6-state 조절 동역학 시스템을 축약한 것이며, 각 rational function은 정상상태 또는 시간 척도 분리 가정으로부터 도출된다.이 축약은 테스트 모델에 사용된 rational 비선형성의 기계론적 근거를 제공한다.
  • B. 조절 네트워크: B. subtilis competence: 벤치마크는 40개 시계열을 사용하며, 분자 다항식의 차수가 다섯 차수에 이르더라도 두 상태 변수에 대한 의존성을 식별해야 한다.따라서 library에는 차수가 여섯까지인 다항식을 포함해야 하지만, 최고 거듭제곱을 사전에 알 필요는 없다.
  • B. 조절 네트워크: B. subtilis competence: 추론된 rational function은 원래 형태로 인수분해되며, 식별된 계수는 실제 계수와 2% 이내의 오차를 보인다.이 결과는 원래 모델에서 생성한 테스트 데이터로 검증되며 Table I에 요약된다.

C. 대사 네트워크: 효모 해당과정

효모 해당과정에서 implicit-SINDy를 유리 함수와 다항식 방정식으로 구성된 더 크고 진동하는 네트워크에 적용해 검증했다. 충분한 데이터가 주어지면 네트워크 구조와 계수를 복원하는 동시에 방정식별 데이터 및 library 요구사항을 드러낸다.

  • C. 대사 네트워크: 효모 해당과정: 해당과정 네트워크를 추론하면 중심 대사에 대한 이해를 가속하고 대사 질환 중재를 뒷받침할 수 있다.해당과정은 포도당을 분해해 ATP와 NADPH 형태로 에너지를 추출하며, 그 네트워크를 규명하는 데 100년 이상이 걸렸다.
  • C. 대사 네트워크: 효모 해당과정: 분석한 효모 해당과정 네트워크는 더 크고 진동하며, 3개의 유리 함수 방정식과 4개의 다항식 방정식으로 구성된다.이 네트워크는 이전에도 모델 추론 시험 사례로 사용되었다.
  • C. 대사 네트워크: 효모 해당과정: Eq. (21c)의 3432개 library 함수에서 7개 항을 선택했으며, 5개의 분자 항과 2개의 분모 항으로 구성된다. Table II에서는 실제 계수와 추출된 계수를 비교한다.선택된 항과 Pareto front는 Fig. 6에 제시되어 있다.
  • C. 대사 네트워크: 효모 해당과정: 계수의 함수적 의존성 오차는 0.1% 미만으로 매우 작았지만, 일부 매개변수는 다항식 인수분해 후 잘못된 x6 의존성을 보였다.Eq. (21g)는 더 많은 데이터를 필요로 했고, 이를 통해 더 높은 정밀도로 계수를 추출할 수 있었다. 별표가 붙은 값에는 x6 의존성 오차가 있다.
  • C. 대사 네트워크: 효모 해당과정: 방정식 x3, x4, x5, x7은 6차 polynomial library가 필요하지 않아 더 빠르게 추론된 반면, Eq. (21g)는 두 배가 넘는 측정값이 필요했다.비교 대상은 다른 rational-function 방정식인 Eqs. (21c) 및 (21b)다.

V. 결론

이 논문은 대규모 library에서 rational nonlinear dynamics를 식별하기 위한 계산적으로 다루기 쉬운 sparse 방법인 implicit-SINDy를 개발한다. 또한 효율적인 data-driven model selection을 강조하며, 통계적 연계와 실제적 robustness 문제는 향후 과제로 남긴다.

  • V. 결론: Implicit-SINDy는 alternating-directions 방법을 사용해 library null space에서 간결한 sparse vector를 선택하며, 이를 통해 합리적인 규모의 biological network에서 rational nonlinear dynamics를 다룰 수 있게 한다.library에는 nonlinear derivative term을 포함할 수 있으면서도 계산적으로 다루기 쉬운 형태를 유지한다.
  • V. 결론: data-driven method는 sparsity threshold를 Pareto front로 결정하는 것 외에는 별도의 parameter tuning 없이, 데이터 자체의 정보만으로 connectivity와 dynamics를 선택한다.이는 많은 후보 가능성 중에서 dynamics를 sparse하게 선택하는 효율적인 unsupervised learning algorithm처럼 작동한다.
  • V. 결론: implicit-SINDy selection과 AIC and BIC 같은 information criteria 사이의 엄밀한 통계적 연계는 여전히 미해결 이론 문제다.저자들은 information-theoretic metric과 sparse selection을 연결하기 위한 향후 연구 방향으로 이 연계를 제시한다.
  • V. 결론: 실제 구현에서는 noise에 대한 robustness를 높이고 computational demand를 줄이는 데 여전히 어려움이 있다.제시된 문단은 이를 남아 있는 두 가지 실용적 과제로 규정한다.
Loading 1605.08368v1…