Source-linked AI summary

LaGSplat: Inferring Physics-Governed Interactive Simulation from Monocular Video Using Latent Lagrangian Gaussian Splatting

Louen Pottier

arXiv:2608.16324v1cs.CVcs.LG

TL;DR

既存のvideo-based scene reconstructionはインタラクションなしに動きを再生する一方、learned physical simulatorはセンサーまたはsimulationからのgeneralized-coordinate dataを必要とする。LaGSplatはlatent dissipative Lagrangianと移動するGaussian primitiveを組み合わせ、monocular videoからインタラクティブなダイナミクスを推定する。実在する7システムで観測周波数を再現し、soft robotではbaselineを上回る。

  • 問題

    Video-based scene reconstructionは記録された動きをインタラクションなしに再生する一方、learned physical simulatorはセンサーまたはsimulationからのgeneralized-coordinate dataを必要とする。

  • 手法

    LaGSplatは、教師なしの低次元latent stateを、dissipative Lagrangianのgeneralized coordinateと、移動するGaussian primitiveのconditioning variableの双方として用いる。

  • 結果

    実在する7システムでは、励起時のnatural frequencyが観測値と数パーセント以内で一致し、two-segment soft robotではLaGSplatが5モデル中で最も高精度である。

  • 要点と限界

    再構成された物体にはimage-spaceまたはvolume-spaceのforceを加えられ、decoder Jacobianを介してlearned dynamicsへ伝達される。再学習は不要である。

  • 要点と限界

    本手法は、少数のgeneralized coordinate、滑らかなkinematics、dissipative dynamicsを持つシステムに適用され、contact、impact、topology change、plasticity、hysteresisは対象外である。

Abstract

from arXiv · show

We present LaGSplat (Latent Lagrangian Gaussian Splatting), a framework that infers interactive, physics-governed dynamics from one or a few monocular videos. At inference it lets a user push on the filmed object, rigid or deformable, with an external force that was never measured, annotated, or seen during training. This is possible because a low-dimensional latent state $\mathbf{q} \in \mathbb{R}^d$ plays two roles at once: it is the generalised coordinate of a learned dissipative Lagrangian and the conditioning variable of a Gaussian Splatting decoder. The inductive bias of this decoder, whose primitives are explicit points $μ_i(\mathbf{q})$ that move with the object, is what lets a force $f$ applied in the image pull back into a latent generalised force $J(\mathbf{q})^\top f$ and enter the equations of motion, which pixel-space (CNN) or neural-field (NeRF) decoders cannot do. We validate LaGSplat on test cases of increasing difficulty, from rigid to deformable and from autonomous to forced real systems, combining monocular video and sensor measurements. We further demonstrate interactive use: forces of arbitrary magnitude and direction can be applied to the reconstructed object at any time, its response rendered in real time, in 2D or 3D. Assuming a dissipative Euler-Lagrange equation over a few generalised coordinates trades generality for a bounded, plausible response to unseen forces, where an unconstrained predictor diverges.

1 Introduction

LaGSplatは、明示的なGaussian primitivesと学習されたlatent Lagrangianを組み合わせ、撮影された物体をリアルタイムで物理法則に支配されたインタラクティブなシミュレーションとして再構成する。移動するprimitiveにより、再学習なしで画像空間の力をlatentな一般化力へ変換するために必要なJacobianが得られる。

  • 動機: 記録済みクリップを再生する時間パラメータ化された動的シーン再構成とは異なり、LaGSplatは再構成物体とのインタラクションを可能にする。動的シーン再構成はリアルタイムで写実的な表現を提供するが、時間ベースのパラメータ化では物体とのインタラクションは可能にならない。
  • 貢献: LaGSplatは、真の力学法則と、物体とともに移動してその物体を描画する明示的なprimitiveを組み合わせることで、この空白を埋める。従来手法は、持続的に移動する明示的primitiveを伴わない構造化されたダイナミクスか、真の力学法則を伴わない明示的再構成のいずれかを提供していた。
  • 手法: 低次元のlatent state qは、学習された散逸Lagrangianの一般化座標であると同時に、Gaussian Splatting decoderのconditioning variableでもある。encoderがフレームをqへ写像し、latent Lagrangianが運動方程式を積分し、decoderがqを2Dまたは3D画像へ描画する。
  • インタラクティブな力入力: 明示的なdecoder point μ_i(q)はlatentな変化のもとで移動し、仮想仕事を介して画像空間の力fを一般化力J(q)^T fへ変換できるようにする。学習動画中で力が一切加えられていなくても、この力は再学習なしに同じ運動方程式へ入る。
  • 貢献: このパイプラインは、monocular videoを同定された物理モデルと、2Dまたは3Dで描画されるリアルタイムのインタラクティブなシミュレーションへ変換する。明示的なGaussian primitivesと微分可能なrasterizationを、latent Lagrangianおよび一般化力に基づくダイナミクスと組み合わせる。

2 関連研究

関連研究は、動的レンダリング、学習された力学、動画教師付きのダイナミクス、力インタラクティブモデルにまたがる。LaGSplatは、潜在座標上の学習された散逸Lagrangianと、力を輸送するJacobianを備えた明示的なmaterial-point Gaussian decoderを組み合わせる。

  • 分野の概観: 研究分野は、動的なnovel-view synthesis、解析力学、動画生成による物理レンダリング、シミュレーション対象系の映像からの直接的なダイナミクス学習に分かれる。重要な相違点は、動画が出力か教師信号か、またモデルが撮影された系を再現するのか、それとも同種のもっともらしいシーンを生成するのかである。
  • レンダリング表現: NeRF-based decoderはEulerianであり、力を付着させるmaterial pointを提供しない。一方、明示的に移動するprimitivesは位置とJacobiansを提供する。canonical primitivesを変形させるneural networksは付着条件を満たすが、動きの豊かなコンテンツには直接的なprimitivesが好ましい。
  • 物理と力制御: PhysGaussian [37] [45] [74]やVR-GS [29]のような物理を指定する手法は外部ダイナミクスを用いる一方、Force Prompting [18]は機械構造なしに力への応答を学習する。Force Prompting [18]は力と動画の例を必要とし、生成される各clipに固定された力ベクトルを用いるため、real-timeでもframeごとの制御可能でもない。
  • 潜在力学: NeuROK [17]および関連するlatent-mechanics手法は、latent integrationとJacobian pullbacksを共有するが、それらのdecoderはaffine Gaussian primitivesではなくmeshをレンダリングする。reduced-order graphics手法もmaterial-point decoderとpullback構造を用いる一方、LaGSplatは学習されたstate上で支配法則を学習する。
  • LaGSplatの相違点: LaGSplatは高次元Gaussiansにおいて時間をlatent coordinatesに置き換え、散逸Lagrangianを学習し、任意の未知の力をJ^T fを通じて輸送する。Wang et al. [69]のような剛体専用の力インタラクティブシステムとは異なり、変形可能な物体を扱い、力を任意の時点で再定義できる。

3 手法

LaGSplatは、散逸Euler–Lagrangeダイナミクスと状態条件付きGaussian Splattingデコーダを同時にパラメータ化する連続潜在状態を学習する。学習された運動学により、画像空間の力を潜在一般化力へ引き戻し、観測幾何と力スケールの曖昧性を考慮しながら、未知の荷重に対して有界なインタラクティブ応答を可能にする。

  • アーキテクチャと学習: LaGSplatは、エンコーダ、散逸を含むlatent Lagrangian、Gaussian Splattingデコーダを共同学習し、その後オートエンコーダを固定して、符号化された軌跡に対するダイナミクスを適合させる。Stage 1では外観を適合させて潜在チャートを固定し、Stage 2ではクリップを一度符号化した後にLagrangianを適合させる。
  • アーキテクチャと学習: Lipschitz制約付きエンコーダは、ダイナミクス目的関数が符号化軌跡を微分してq̇とq̈を得るため、時間的連続性を正則化する。この手法は、エンコーダの深さや表現力を高めるのではなく、Zhu et al. [81]の連続性正則化項を用いる。
  • Gaussian Splattingデコーダ: デコーダは空間–状態ボリューム (x, y, q)をタイル状に分割するため、各シーン状態を一度だけ保存し、Euler–Lagrange軌跡、未知の初期条件、または印加力からレンダリングできる。Gaussianプリミティブをqで条件付けることで状態依存の中心を生成し、問い合わせた潜在状態から遠いプリミティブを抑制する。レンダリングはn=2の動画出力、またはn=3のインタラクティブ3Dシーンに対応する。
  • 潜在ダイナミクス: 学習された潜在チャートは白色化され、誤差は、復号された画素運動に応じて潜在方向を重み付けする異方的なpull-back image metric Ḡで測定される。この計量は、評価時のラスタライズを必要とせず、復号画像誤差を一次近似する。
  • 潜在ダイナミクス: 散逸と一意な最小値を持つポテンシャルにより、有界な自由ダイナミクスが保証され、系は静止状態へ落ち着き、維持された力の下では荷重平衡へ収束する。pendulum、rocking chair、hanging bagには単一の凸盆地をモデル化するICNNを用いる。一方、soft continuum robotには、凸な等位集合を緩和しつつ一意な平衡を維持するため、i-ResNetと合成したICNNを用いる。
  • インタラクティブな力入力: Gaussian運動学のJacobianはプリミティブに作用する力を潜在一般化力へ引き戻し、近傍接触の集約とO(nd)の推論コストにより、ネットワークの微分なしで未知の荷重を可能にする。応答の方向と形状は学習された運動学によって決まるが、物理的な力の大きさは単一の大域的エネルギー係数κまで曖昧である。これは、(L, D)と(αL, αD)が同一の観測軌跡を生成するためである。

4 実験

LaGSplatを、自律的な剛体・変形可能システムの単眼実物体動画に加え、圧力計測を伴う連続駆動ソフトロボットで評価する。これらの実験を通じて妥当なダイナミクスを復元し、decoderから導かれるJacobianにより、推論時に画像空間または世界空間の外力を一意に扱えることを示す。

  • 全体的なダイナミクス評価: ほぼすべてのシステムで、教師なしの固有振動数誤差 εfreq は1–6%である一方、1セグメントロボットでは記録中に固有モードが励起されないため31.4%に達する。二重振り子では εq = 0.947 であり、クリップ全体では1.544まで増加する。一方、吊り下げバッグの誤差は2周期での0.150から7周期での0.396へ増加する。
  • ソフト連続体ロボット: LaGSplatはより難しい2セグメントロボットでも高精度を維持し、d=4の座標で0.769 × 10−3を達成し、そこで比較モデルを×0.98上回る。この結果は5つのseedの中央値であり、4つのbaselineはすべてd=10を用いる。1セグメントの記録は主に、慣性や固有振動数ではなく、準静的な圧力から形状への写像を捉える。
  • インタラクティブな力の適用: 画像上の外力は、再学習なしに、Gaussian map q 7→μ_i が誘導するJacobianを用いて、推論時に f_lat = J^T f としてLaGSplatの学習済みダイナミクスに入力される。decoderは画像プリミティブに作用する力を潜在一般化座標へ引き戻し、学習では自律ダイナミクスと駆動写像を同定する。この能力は比較対象の手法にはない。
  • インタラクティブな力の適用: 1次元のrainbow rockerでは、等しい力がレバーアームに依存し、符号反転する潜在シフトを生じさせ、適用点によって Δq = −0.50, −0.76, −0.84 および +1.22 となる。Jacobianが零である背景Gaussianは力を伝達しないため、この応答が任意の画像内容ではなく物体の運動に従うことが示される。
  • 三次元インタラクション: マルチビューの合成教師信号を用いると、同じtransport機構が3Dでも機能する。すなわち、rayで選択されたGaussianが世界空間の力を受け、物体を q = +1.52 の新たな平衡へ移動させられる。実演には、学習時の運動に存在しない方向への押し込みも含まれており、観測軌道を超えたインタラクティブな応答を示す。

5 考察

LaGSplatの物理事前分布は構造を改善する一方、適用範囲を観測可能で滑らかな低次元散逸系に限定し、力の機構も計測力に対して未検証である。今後は、力ラベル付きデータ、隠れた構成変数、シミュレータ連成、潜在表現と幾何モデリングの改善に取り組む。

  • 限界: Lagrangian事前分布は接触、衝突、トポロジー変化、塑性、ヒステリシスを除外するため、手法は少数の座標で表される滑らかな散逸ダイナミクスに限定される。この境界は表現そのものではなく、実装されたダイナミクスに由来する。
  • 限界: 単眼学習には画像から観測可能な状態が必要であるため、面外運動には複数視点の教師信号が必要となり、塑性には隠れた荷重履歴の情報が必要となる。視覚的に一致するフレームでも異なる塑性履歴を符号化し得るため、このような変数は単一フレームの教師信号からは不可視である。
  • 限界: 中心的な力の機構は、固定視点動画、少数自由度、印加点力、結果として生じる変形を組み合わせたデータセットが存在しないため、計測力に対して未検証である。Section 4.5ではその代わりに、エネルギー係数κに対して不変なJacobian由来の比、符号、総和、pullback-kernelの性質を検証する。
  • 限界: 外観を優先したフィッティングは依然として議論のある設計選択であり、潜在次元dを手動で選ぶと最小状態サイズを過大評価する可能性がある。Friedl et al. [14]は逐次学習を上回る共同学習モデルを報告している一方、Zhu et al. [81]は共同学習ベースラインを上回る凍結encoder方式を報告している。Chen et al. [8]は、最小潜在幅を超えると再構成が劣化すると報告している。
  • 今後の研究: 今後の研究では、計測力データセット、塑性とヒステリシスの内部変数、外部シミュレータとの連成、primitiveごとのdensityの扱いの改善を提案する。内部変数モデルにはより大きなdとmulti-frame encoderが必要となる一方、シミュレータ連成では力の機構の分離テストを維持しなければならない。

6 結論

LaGSplatは動画のみから共有された低次元の物理状態を学習し、それを一般化座標とGaussian decoderの条件変数の両方として用いる。実システム全体で観測されたダイナミクスを高精度に再現し、再学習なしに、未知の力に対して有界で妥当な応答を可能にする。

  • LaGSplatは、散逸Lagrangianをパラメータ化すると同時に、明示的に移動する点状Gaussian primitiveを条件付ける教師なし物理状態qを学習する。学習信号は動画そのものであり、qに直接的な教師信号は与えない。
  • 7つの実システムにおいて、学習された固有振動数は、それらを励起するすべての記録で動画の観測値と数パーセント以内で一致する。対象システムは、自由度1から4までにわたる。
  • Krauss et al.’s [35]の2セグメント軟連続体ロボットデータにおいて、LaGSplatは5つのモデル中で最も高精度であり、10個ではなく4個の座標を用いる。評価には著者ら自身のデータ、分割、プロトコルを用いる。
  • 推論時には、画像または再構成体積から得た力が、再学習なしにdecoder Jacobianを介して学習済み方程式に入力される。ただし、学習時に力の計測は行っていない。力の方向と形状は学習された運動学に従い、振幅は単一のグローバルなエネルギー係数までしか定まらない。
  • Lagrangian priorは到達可能なシステムのクラスを制限する一方、未知の力に対する応答を有界かつ物理的に妥当に保つ。

A 導出

本付録では、学習された運動学が力と慣性をどのように伝達するかを導出し、bounded-response claimの基盤となるエネルギー収支を説明する。

  • A.1: 学習された運動学は、力と慣性を同様に伝達する。この導出はSection A.1で扱う。
  • A.2: 本付録では、bounded-response remarkの背景にあるエネルギー収支を導出する。この分析はSection A.2で扱う。

A.1 学習された運動学による力と慣性

学習された運動学は潜在構成をプリミティブ位置へ写像し、追加のモデリング上の選択なしに一般化力と運動エネルギーを決定する。力の輸送は滑らかな潜在座標変換に対して不変であり、正規化されたプリミティブの不透明度により、構成依存の質量行列は軌道に沿って変化する。

  • A.1 学習された運動学による力と慣性: 学習された構成からプリミティブへの写像は、解析力学の標準的な規則により、一般化力と運動エネルギーの双方を決定する。これは各粒子の位置の役割を果たすため、写像を固定すれば、それ以上のモデリング上の選択は必要ない。
  • A.1 学習された運動学による力と慣性: プリミティブに加えられた力は、プリミティブのヤコビアンを介して標準的な潜在一般化力へ輸送され、仮想仕事を保存する。この構成により、運動方程式への力の注入はエネルギー収支と整合する。
  • A.1 学習された運動学による力と慣性: 輸送された力とそれによる応答は、潜在座標の任意の滑らかな再パラメータ化に対して不変である。ヤコビアン変換と仮想変位変換が相殺されるため、潜在チャートが変わっても仕事は不変に保たれる。
  • A.1 学習された運動学による力と慣性: 正規化された潜在不透明度は、等質量のプリミティブに重み付けし、構成依存の質量行列を生成する。プリミティブ速度が dot(μ_i) = J_i dot(q) を満たすため、状態依存性はゲーティング重みを介して導入され、各 J_i が一定であっても質量行列は軌道に沿って変化し、コリオリ項を持つ。

A.2 有界な外力応答

正定値慣性、強圧的ポテンシャル、一様に正の減衰のもとで、LaGSplatの連続時間ダイナミクスは有界かつ散逸的に保たれる。自由ロールアウトは一意なポテンシャル最小点に収束し、一定外力を維持すると荷重平衡点へ有界収束する。シンプレクティック積分は離散ドリフトを抑えるが、分布外領域における定量的誤差を抑えるものではない。

  • 仮定: 有界応答の保証は、正定値慣性、強圧的なポテンシャル下限、および等方的下限 c0 > 0 をもつ減衰に依存する。これらの仮定により、位置の非有界なドリフトを防ぎつつ、運動および散逸を制御できる。
  • 自由ロールアウト: 強圧的ポテンシャル、正定値慣性、一様に正の減衰のもとで、自由ロールアウトは有界であり、LaSalleの不変性原理 により一意な大域的ポテンシャル最小点へ収束する。エネルギーは Ė ≤ −c0∥q̇∥2 に従って減少し、エネルギーの下位レベル集合が q̇ と q の両方を有界にする。
  • 維持外力: 一定外力を維持すると、∂V/∂q = f を満たす荷重平衡点へ収束する有界応答が生じる。荷重エネルギー E_f = T + V − f^Tq は注入パワーを相殺し、二次ポテンシャル下限がこれを強圧的に保つ。
  • 離散ロールアウト: シンプレクティック法は長時間の離散ロールアウトをドリフトから保つが、有界性は訓練データから遠く離れた領域での定量的精度を意味しない。したがって、連続時間について述べた保証は応答の増大を制約するが、厳密な外挿を保証するものではない。

B 同一予算下での変形場デコーダ

同一の学習予算では、LaGSplatのアフィンlatent-to-primitiveデコーダは再構成性能で同等以上を達成しつつ、学習変形場よりも実質的に滑らかで意味のあるprimitive Jacobianを生成する。変形場に追加された容量は画像品質を向上させない一方、力の適用と慣性推定に必要な微分を損なう可能性がある。

  • デコーダのパラメータ化: LaGSplatはqで条件付けられた(n+d)D体積内にprimitiveを配置し、各μ_iをqに関してアフィンかつconstant Jacobianにする。一方、別手法はq依存の非線形warpを学習する。変形モデルは任意の曲線をたどり、運動中もprimitiveを物体各部上に保てる可能性があるのに対し、latent-volume内の軌跡は直線である。
  • 再構成: 同一の再構成予算では、変形場はL1 (0.0157 vs 0.0142)およびSSIM loss (0.076 vs 0.063)でLaGSplatに及ばない。パラメータ数は9.8M versus 195kである。両デコーダは15,000個のprimitive、同一のloss、regularizer、optimizer、scheduleを用い、異なるのはパラメータ化だけである。
  • Jacobian field: Figure 11はLaGSplatのprimitive velocityがより滑らかであることを示しており、近傍差の中央値は1.4 px/s versus 6.9 px/sである。変形場は静的背景やrocker領域上のprimitiveも動かしており、見た目のrenderingが類似していても、より意味の乏しいJacobianであることを示している。
  • Jacobianが重要な理由: フレーム再構成はmaterial trackingやprimitive velocityを教師信号として与えないため、デコーダは動画を適合させながら、力のpullbackや慣性推定に必要な意味のない∂μ_i/∂qを出力する可能性がある。LaGSplatでは、同一のprimitiveがすべてのフレームを説明しなければならず、近接状態間の小さな移動によって覆っている物質を保つため、material trackingが創発する。

C 実装詳細

LaGSplatは、システム間で共有するencoder、decoder、LNN architectureを用いながら、latent dimension、resolution、primitive count、run lengthをシステムごとに調整する。学習には、Gaussianのライフサイクル管理とlatent whitening手順を組み込んだ、Adamで最適化する2段階を用いる。

  • 実装設定: すべてのシステムで同じarchitectureを用いる一方、latent dimension、image resolution、primitive count、run lengthはシステムごとに設定する。
  • Architecture: continuity-preserving convolutional autoencoderは、3つの12×12 convolution、2 channels、stride 2、ELU activation、4×4 average pooling、およびqへのlinear mapで構成される。パラメータ数は約2 000であり、decoderは104 to 2 × 10^5 parametersを持つ1 000–15 000個のGaussiansを含み、LNNのパラメータ数は15 000未満である。
  • 学習: 両方の学習段階でAdamを用い、Stage 1ではencoderとdecoderを約5 × 10^4 optimizer stepsにわたって同時学習する。epoch数はclip sizeに依存する。
  • 学習: Stage 1では、0.08 L1 + 0.02 (1 − SSIM) + 0.01 anisotropyを最適化し、peak opacityが0.02未満に低下したGaussiansを定期的にrecycleする。recyclingでは、full (n+d)-dimensional covarianceのprincipal eigenvectorに沿って過密なGaussiansを分割するか、高誤差領域へteleportする。latent whiteningには、encoded covarianceのeigendecompositionを用いる。
Loading 2608.16324v1…