Source-linked AI summary
LaGSplat: Inferring Physics-Governed Interactive Simulation from Monocular Video Using Latent Lagrangian Gaussian Splatting
Louen Pottier
TL;DR
现有基于视频的场景重建只能回放运动,无法进行交互;而学习型物理模拟器需要来自传感器或仿真的广义坐标数据。LaGSplat 将潜在耗散 Lagrangian 与运动 Gaussian primitives 结合,从单目视频推断可交互动力学;在七个真实系统上匹配观测频率,并在软体机器人上优于基线方法。
问题
基于视频的场景重建只能回放记录的运动,无法进行交互;而学习型物理模拟器需要来自传感器或仿真的广义坐标数据。
方法
LaGSplat 使用一个无监督的低维潜在状态,同时作为耗散 Lagrangian 的广义坐标,以及运动 Gaussian primitives 的条件变量。
结果
在七个真实系统上受激后,其固有频率与观测值的匹配误差在百分之几以内;在双节软体机器人上,LaGSplat 在五个模型中精度最高。
要点与局限
重建对象可以接收图像空间或体积空间中的力,并通过 decoder Jacobians 传递至学习到的动力学中,无需重新训练。
要点与局限
该方法适用于具有少量广义坐标、平滑运动学和耗散动力学的系统,但不适用于接触、碰撞、拓扑变化、塑性和滞回。
Abstract
from arXiv · showhide
We present LaGSplat (Latent Lagrangian Gaussian Splatting), a framework that infers interactive, physics-governed dynamics from one or a few monocular videos. At inference it lets a user push on the filmed object, rigid or deformable, with an external force that was never measured, annotated, or seen during training. This is possible because a low-dimensional latent state $\mathbf{q} \in \mathbb{R}^d$ plays two roles at once: it is the generalised coordinate of a learned dissipative Lagrangian and the conditioning variable of a Gaussian Splatting decoder. The inductive bias of this decoder, whose primitives are explicit points $μ_i(\mathbf{q})$ that move with the object, is what lets a force $f$ applied in the image pull back into a latent generalised force $J(\mathbf{q})^\top f$ and enter the equations of motion, which pixel-space (CNN) or neural-field (NeRF) decoders cannot do. We validate LaGSplat on test cases of increasing difficulty, from rigid to deformable and from autonomous to forced real systems, combining monocular video and sensor measurements. We further demonstrate interactive use: forces of arbitrary magnitude and direction can be applied to the reconstructed object at any time, its response rendered in real time, in 2D or 3D. Assuming a dissipative Euler-Lagrange equation over a few generalised coordinates trades generality for a bounded, plausible response to unseen forces, where an unconstrained predictor diverges.
1 引言
LaGSplat 将显式 Gaussian primitives 与学习到的 latent Lagrangian 相结合,把视频中的物体重建为实时、受物理规律支配的交互式 simulation。其运动 primitives 提供了所需的 Jacobian,可将图像空间力传递为 latent generalized forces,而无需重新训练。
- 动机: 不同于回放已记录片段的时间参数化动态场景重建,LaGSplat 支持与重建物体交互。动态场景重建能够提供实时的 photorealistic 表示,但基于时间的参数化不允许与物体交互。
- 贡献: LaGSplat 通过结合真正的机械定律与随物体运动并对其进行渲染的显式 primitives,填补了这一空白。已有方法要么提供具有结构化 dynamics 但没有持续运动的显式 primitives,要么提供显式重建但缺乏真正的机械定律。
- 方法: 低维 latent state q 既是学习到的耗散 Lagrangian 的 generalized coordinate,也是 Gaussian Splatting decoder 的 conditioning variable。Encoder 将帧映射为 q,latent Lagrangian 对运动方程进行积分,decoder 将 q 渲染为 2D 或 3D 图像。
- 交互式施力: 显式 decoder 点 μ_i(q) 随 latent 变化而运动,使图像空间力 f 能够通过虚功转化为 generalized force J(q)^T f。该力会进入同一组运动方程而无需重新训练,尽管训练视频中从未施加过力。
- 贡献: 该 pipeline 将单目视频转换为辨识得到的物理模型,以及一个以 2D 或 3D 形式渲染的实时交互式 simulation。它将显式 Gaussian primitives 和可微 rasterization 与 latent Lagrangian 及 generalized-force dynamics 相结合。
2 相关工作
相关工作涵盖动态渲染、学习型力学、视频监督的动力学,以及力交互模型。LaGSplat 将潜在坐标上的学习型耗散 Lagrangian 与显式材料点 Gaussian 解码器结合起来,并通过其 Jacobian 传递力。
- 领域概览: 相关研究分别关注动态新视角合成、解析力学、视频生成的物理渲染,以及直接从模拟系统的视频片段中学习动力学。关键区别在于视频是输出还是监督信号,以及模型复现的是被拍摄系统,还是同类系统中一个合理的场景。
- 渲染表示: 基于 NeRF 的解码器属于 Eulerian 表示,无法提供用于施力附着的材料点;而显式运动基元能够提供位置和 Jacobian。对 canonical 基元进行形变的神经网络满足附着条件,但对于运动丰富的内容,研究更倾向于使用直接基元。
- 物理与力控制: PhysGaussian [37] [45] [74] 和 VR-GS [29] 等预设物理方法使用外部动力学,而 Force Prompting [18] 在没有力学结构的情况下学习力响应。Force Prompting [18] 需要力—视频示例,为每个生成片段使用固定力向量,并且既不是实时的,也无法逐帧控制。
- 潜在力学: NeuROK [17] 及相关潜在力学方法同样采用潜在积分和 Jacobian pullback,但其解码器渲染的是网格,而不是仿射 Gaussian 基元。降阶图形方法也使用材料点解码器和 pullback 结构,而 LaGSplat 则在学习到的状态上学习控制定律。
- LaGSplat 的区别: LaGSplat 在高维 Gaussians 中以潜在坐标取代时间,学习耗散 Lagrangian,并通过 J^T f 传递任意未见过的力。不同于 Wang et al. [69] 等仅面向刚体的力交互系统,它处理可变形物体,并允许在任意时刻重新定义力。
3 方法
LaGSplat 学习一个连续潜状态,同时参数化带耗散的 Euler–Lagrange 动力学和状态条件化的 Gaussian Splatting 解码器。其学习到的运动学将图像空间中的力拉回潜空间广义力,从而在考虑观测几何与力尺度歧义的同时,使系统能够对未见过的载荷产生有界的交互响应。
- 架构与训练: LaGSplat 联合学习编码器、带耗散的潜在 Lagrangian 和 Gaussian Splatting 解码器,然后冻结自编码器,再对编码后的轨迹拟合动力学。阶段 1 拟合外观并固定潜在坐标图;阶段 2 在对视频片段编码一次后拟合 Lagrangian。
- 架构与训练: 受 Lipschitz 约束的编码器通过正则化时间连续性来稳定训练,因为动力学目标需要对编码后的轨迹求导以获得 q̇ 和 q̈。该方法采用 Zhu et al. [81] 的连续性正则项,而不是依赖更深或表达能力更强的编码器。
- Gaussian Splatting 解码器: 解码器对空间–状态体 (x, y, q) 进行平铺,因此每个场景状态只需存储一次,并可从 Euler–Lagrange 轨迹、未见过的初始条件或施加的力进行渲染。以 q 为条件化变量约束 Gaussian primitives,可生成依赖状态的中心,并抑制远离查询潜状态的 primitives;渲染支持 n=2 视频输出或 n=3 交互式 3D 场景。
- 潜在动力学: 学习到的潜在坐标图经过白化,而误差在各向异性的 pull-back 图像度量 Ḡ 中测量,该度量根据解码后的像素运动为潜在方向加权。该度量在一阶近似下逼近解码图像误差,评估时无需进行光栅化。
- 潜在动力学: 耗散项与具有唯一极小值的势能保证有界的自由动力学,使系统最终静止,并在持续施力下收敛到受载平衡态。对于摆、摇椅和悬挂袋,ICNN 建模单一凸盆;软连续体机器人则将 ICNN 与 i-ResNet 复合,在保持唯一平衡态的同时放宽凸水平集。
- 交互式施力: Gaussian 运动学 Jacobians 将 primitive forces 拉回潜在广义力,并结合邻域接触聚合和 O(nd) 推理开销,使系统无需对网络求导即可处理未见过的载荷。响应的方向与形状由学习到的运动学决定,但物理力的大小仍存在一个全局能量因子 κ 意义下的歧义,因为 (L, D) 和 (αL, αD) 会产生相同的观测轨迹。
4 实验
LaGSplat 在涵盖自主刚体与可变形系统的单目真实物体视频上进行评估,并加入一个带压力测量的连续驱动软体机器人。在这些测试中,它恢复出合理的动力学,并通过由 decoder 导出的 Jacobian,独特地支持在推理时施加图像空间或世界空间外力。
- 总体动力学评估: 在几乎所有系统上,无监督固有频率误差 εfreq 均为 1–6%;单段机器人达到 31.4%,因为其记录未激发固有模态。双摆的 εq = 0.947,在完整片段上升至 1.544;悬挂袋的误差则从两个周期内的 0.150 增至七个周期内的 0.396。
- 软连续体机器人: LaGSplat 在更具挑战性的双段机器人上仍保持准确性,使用 d=4 个坐标达到 0.769 × 10−3,并在该任务上以 ×0.98 超过对比模型。该结果取五个 seeds 的中位数,而四个 baseline 均使用 d=10;单段机器人的记录主要揭示准静态的压力到形状映射,而非惯性或固有频率。
- 交互式施力: 在推理时,无需重新训练,外部图像力即可通过 Gaussian map q 7→μ_i 诱导的 Jacobian,以 f_lat = J^T f 的形式进入 LaGSplat 学到的动力学。decoder 将图像 primitives 上的力回传至 latent 广义坐标,而训练过程识别自主动力学与驱动映射;对比方法不具备这一能力。
- 交互式施力: 在一维 rainbow rocker 上,相同大小的力会产生依赖力臂且发生符号反转的 latent 位移,在不同施力点包括 Δq = −0.50, −0.76, −0.84 和 +1.22。Jacobian 为零的背景 Gaussians 不会传递力,表明响应遵循物体运动,而非任意图像内容。
- 三维交互: 在多视角合成监督下,同一传输机制可在 3D 中运行:一个由射线选中的 Gaussian 接收世界空间力,并可将物体移向 q = +1.52 的新平衡状态。这些演示包含沿训练运动中未出现方向施加的推力,展示了超出观测轨迹的交互响应。
5 讨论
LaGSplat 的物理先验改善了结构建模,但将适用范围限制在可观测、平滑、低维耗散系统内;其力机制也尚未通过实测力验证。未来工作将聚焦于带力标注的数据、隐藏本构变量、模拟器耦合,以及更完善的潜变量与几何建模。
- 局限性: Lagrangian 先验排除了接触、碰撞、拓扑变化、塑性和滞回,将方法限制在少量坐标描述的平滑耗散动力学中。这一边界源于具体实例化的动力学,而非表示本身。
- 局限性: 单目学习要求状态能够从图像中观测,因此面外运动需要多视角监督,而塑性则需要隐藏的加载历史信息。视觉上重合的帧可能编码不同的塑性历史,使这些变量无法通过单帧监督得到观测。
- 局限性: 由于没有同时包含固定视角视频、少量自由度、施加的点力及其引起的变形的数据集,核心力机制尚未通过实测力验证。Section 4.5 转而检验由 Jacobian 得出的比值、符号、求和结果,以及不随能量因子 κ 变化的 pullback-kernel 性质。
- 局限性: 以外观为先的拟合仍是一个存在争议的设计选择,而手动选择潜变量维度 d 可能高估最小状态规模。Friedl et al. [14] 报告称,联合训练模型优于序列训练;而 Zhu et al. [81] 报告称,冻结编码器的方法优于联合训练基线;Chen et al. [8] 报告称,超过最小潜变量宽度后,重建质量会下降。
- 未来工作: 未来工作计划构建实测力数据集,引入描述塑性和滞回的内部变量,与外部模拟器耦合,并改进对每个 primitive 密度的处理。内部变量模型需要更大的 d 和多帧编码器,而模拟器耦合必须保留力机制的隔离测试。
6 结论
LaGSplat 仅凭视频学习共享的低维物理状态,并将其同时用作广义坐标和 Gaussian 解码器条件变量。在多个真实系统上,它准确恢复观测到的动力学,并且无需重新训练即可对此前未见的外力产生有界且合理的响应。
- LaGSplat 学习无监督物理状态 q,同时参数化耗散 Lagrangian,并作为显式运动点 Gaussian primitives 的条件变量。训练信号完全来自视频本身;q 不接受直接监督。
- 在七个真实系统中,对于每段激发出相应模态的记录,学习到的固有频率均与视频观测相差仅几个百分点。这些系统涵盖一至四个自由度。
- 在 Krauss 等人的 [35] 双段软体连续体机器人数据上,LaGSplat 使用四个坐标而非十个坐标,却是五个模型中准确度最高的。评估采用作者自己的数据、划分和协议。
- 推理时,图像或重建体积中的外力可通过解码器 Jacobian 进入学习到的方程,无需重新训练,尽管训练过程中没有外力测量。力的方向和形状遵循学习到的运动学,而幅值只能确定到一个全局能量因子。
- Lagrangian 先验限制了可达系统的类别,但使模型对未见外力的响应保持有界且符合物理规律。
A 推导
本附录推导学习得到的运动学如何传递力与惯性,并解释有界响应结论所依据的能量平衡。
- A.1: 学习得到的运动学同时传递力与惯性。该推导见 Section A.1。
- A.2: 本附录推导有界响应说明背后的能量平衡。该分析见 Section A.2。
A.1 从学习到的运动学中获得力与惯性
学习到的运动学将潜在构型映射为基元位置,从而无需额外建模选择即可确定广义力与动能。力传递对潜在坐标的光滑变化保持不变,而归一化的基元不透明度使依赖构型的质量矩阵沿轨迹变化。
- A.1 从学习到的运动学中获得力与惯性: 学习到的构型—基元映射依据标准分析力学规则,同时确定广义力与动能。它充当每个粒子的位置,因此映射一旦确定,便无需进一步选择建模方式。
- A.1 从学习到的运动学中获得力与惯性: 施加于基元的力通过基元 Jacobian 传递为规范潜在广义力,并保持虚功不变。这种构造使力注入运动方程的过程与能量平衡保持一致。
- A.1 从学习到的运动学中获得力与惯性: 传递后的力及其产生的响应对潜在坐标的任意光滑重参数化保持不变。Jacobian 变换与虚位移变换相互抵消,使不同潜在坐标图中的功保持不变。
- A.1 从学习到的运动学中获得力与惯性: 归一化的潜在不透明度为等质量基元赋予权重,从而生成依赖构型的质量矩阵。由于基元速度满足 dot(μ_i) = J_i dot(q),状态依赖性通过门控权重引入,因此质量矩阵沿轨迹变化;即使每个 J_i 都是常数,也会包含 Coriolis 项。
A.2 有界受力响应
在正定惯性、强制势能和一致正阻尼条件下,LaGSplat 的连续时间动力学保持有界并具有耗散性。自由 rollout 收敛到唯一势能极小值,而持续恒力使系统有界收敛到受载平衡点;辛积分可限制离散漂移,但不能保证远离分布外区域时的定量精度。
- 假设: 有界响应保证依赖于正定惯性、具有强制下界的势能,以及带有各向同性下界 c0 > 0 的阻尼。这些假设可防止位置无限漂移,同时确保对动能和耗散进行控制。
- 自由 rollout: 在强制势能、正定惯性和一致正阻尼条件下,根据 LaSalle 不变性原理 ,自由 rollout 有界并收敛到唯一的全局势能极小值。能量按 Ė ≤ −c0∥q̇∥2 递减,而能量次水平集同时约束 q̇ 和 q。
- 持续受力: 持续恒力产生有界响应,并收敛到满足 ∂V/∂q = f 的受载平衡点。受载能量 E_f = T + V − f^Tq 抵消注入功,而二次势能下界使其保持强制性。
- 离散 rollout: 辛积分方案可使长时间离散 rollout 保持不发生漂移,但有界性并不意味着远离训练数据时具有定量精度。因此,连续时间下的这些保证能够约束响应增长,但不能确保精确外推。
B 等预算下的形变场解码器
在训练预算相同的情况下,LaGSplat 的 affine latent-to-primitive decoder 在重建质量相当或更优的同时,产生的 primitive Jacobian 明显更平滑、更具意义。形变场增加的容量并未提升图像质量,反而可能破坏力施加与惯性估计所需的导数。
- 解码器参数化: LaGSplat 将 primitives 放置在由 q 条件化的 (n+d)D 体积中,使每个 μ_i 关于 q 都是 affine 的,并具有 constant Jacobian;相比之下,另一种方法学习的是依赖 q 的非线性形变。形变族可以描绘任意曲线,并有可能在运动过程中使 primitives 始终位于物体部件上;而沿 latent-volume 的轨迹是直线。
- 重建: 在重建预算相同的情况下,形变场在 L1 (0.0157 vs 0.0142) 和 SSIM loss (0.076 vs 0.063) 上均落后于 LaGSplat,尽管参数量为 9.8M versus 195k。两个解码器均使用 15,000 个 primitives、相同的损失、正则项、优化器和调度;只有参数化方式不同。
- Jacobian 场: Figure 11 显示,LaGSplat 的 primitive 速度更加平滑,其邻域差异中位数为 1.4 px/s versus 6.9 px/s(形变场)。形变场还会移动静态背景和 rocker 区域中的 primitives,表明其 Jacobian 的意义较弱,尽管渲染结果在视觉上相近。
- Jacobian 为何重要: 由于帧重建不会监督材质跟踪或 primitive 速度,解码器可能拟合视频片段,却产生无意义的 ∂μ_i/∂q,进而无法用于力回拉和惯性估计。LaGSplat 中的材质跟踪是自发形成的,因为同一组 primitives 必须解释每一帧;相邻状态之间的小幅位移能够保持其覆盖的物质不变。
C 实现细节
LaGSplat 在各系统间共享 encoder、decoder 和 LNN 架构,同时针对每个系统调节 latent dimension、分辨率、primitive 数量和运行长度。训练分为两个采用 Adam 优化的阶段,并结合 Gaussian 生命周期管理和 latent whitening 程序。
- 实现设置: 所有系统均采用相同架构,同时针对每个系统设定 latent dimension、图像分辨率、primitive 数量和运行长度。
- 架构: 保持连续性的卷积 autoencoder 使用三个 12×12 卷积层、两个通道、stride 2、ELU 激活、4×4 average pooling,以及映射到 q 的线性映射。其参数量约为 2 000;decoder 包含 1 000–15 000 个 Gaussian,参数量为 104 到 2 × 10^5,而 LNN 的参数量少于 15 000。
- 训练: 两个训练阶段均使用 Adam,其中阶段 1 联合训练 encoder 和 decoder,约执行 5 × 10^4 optimizer steps。epoch 数量取决于 clip 大小。
- 训练: 阶段 1 优化 0.08 L1 + 0.02 (1 − SSIM) + 0.01 anisotropy,同时定期回收峰值 opacity 低于 0.02 的 Gaussian。回收过程沿其完整 (n+d)-dimensional covariance 的主特征向量拆分负载过高的 Gaussian,或将其传送至高误差区域;latent whitening 使用 encoded covariance 的特征分解。