Source-linked AI summary

LaGSplat: Inferring Physics-Governed Interactive Simulation from Monocular Video Using Latent Lagrangian Gaussian Splatting

Louen Pottier

arXiv:2608.16324v1cs.CVcs.LG

TL;DR

Las reconstrucciones de escenas basadas en video reproducen el movimiento sin interacción, mientras que los simuladores físicos aprendidos requieren datos de coordenadas generalizadas procedentes de sensores o simulación. LaGSplat combina un Lagrangiano disipativo latente con primitivas Gaussianas móviles para inferir dinámicas interactivas a partir de video monocular, igualando las frecuencias observadas en siete sistemas reales y superando a las líneas base en un robot blando.

  • Problema

    Las reconstrucciones de escenas basadas en video reproducen el movimiento grabado sin interacción, mientras que los simuladores físicos aprendidos requieren datos de coordenadas generalizadas procedentes de sensores o simulación.

  • Método

    LaGSplat utiliza un único estado latente no supervisado de baja dimensión tanto como coordenada generalizada de un Lagrangiano disipativo como variable de condicionamiento de primitivas Gaussianas móviles.

  • Resultados

    En siete sistemas reales, las frecuencias naturales coinciden con los valores observados dentro de unos pocos porcentajes cuando son excitados, mientras que LaGSplat es el más preciso de cinco modelos en un robot blando de dos segmentos.

  • Conclusiones y limitaciones

    El objeto reconstruido puede recibir fuerzas en el espacio de imagen o de volumen que se transfieren mediante los jacobianos del decodificador a la dinámica aprendida sin reentrenamiento.

  • Conclusiones y limitaciones

    El método se aplica a sistemas con pocas coordenadas generalizadas, cinemática suave y dinámica disipativa, excluyendo el contacto, los impactos, los cambios de topología, la plasticidad y la histéresis.

Abstract

from arXiv · show

We present LaGSplat (Latent Lagrangian Gaussian Splatting), a framework that infers interactive, physics-governed dynamics from one or a few monocular videos. At inference it lets a user push on the filmed object, rigid or deformable, with an external force that was never measured, annotated, or seen during training. This is possible because a low-dimensional latent state $\mathbf{q} \in \mathbb{R}^d$ plays two roles at once: it is the generalised coordinate of a learned dissipative Lagrangian and the conditioning variable of a Gaussian Splatting decoder. The inductive bias of this decoder, whose primitives are explicit points $μ_i(\mathbf{q})$ that move with the object, is what lets a force $f$ applied in the image pull back into a latent generalised force $J(\mathbf{q})^\top f$ and enter the equations of motion, which pixel-space (CNN) or neural-field (NeRF) decoders cannot do. We validate LaGSplat on test cases of increasing difficulty, from rigid to deformable and from autonomous to forced real systems, combining monocular video and sensor measurements. We further demonstrate interactive use: forces of arbitrary magnitude and direction can be applied to the reconstructed object at any time, its response rendered in real time, in 2D or 3D. Assuming a dissipative Euler-Lagrange equation over a few generalised coordinates trades generality for a bounded, plausible response to unseen forces, where an unconstrained predictor diverges.

1 Introducción

LaGSplat combina primitivas Gaussian explícitas con un Lagrangiano latente aprendido para reconstruir objetos filmados como simulaciones interactivas en tiempo real gobernadas por la física. Sus primitivas móviles proporcionan el Jacobiano necesario para trasladar fuerzas del espacio de imagen a fuerzas generalizadas latentes sin reentrenamiento.

  • Motivación: A diferencia de las reconstrucciones dinámicas de escenas parametrizadas en función del tiempo, que reproducen clips grabados, LaGSplat permite interactuar con los objetos reconstruidos.La reconstrucción dinámica de escenas proporciona representaciones fotorrealistas en tiempo real, pero la parametrización temporal no permite interactuar con los objetos.
  • Contribución: LaGSplat cubre esta carencia al combinar una ley mecánica genuina con primitivas explícitas que se mueven con el objeto y lo renderizan.Los enfoques anteriores proporcionan dinámicas estructuradas sin primitivas móviles explícitas persistentes, o reconstrucciones explícitas sin una ley mecánica genuina.
  • Método: Un estado latente q de baja dimensionalidad es a la vez la coordenada generalizada de un Lagrangiano disipativo aprendido y la variable de condicionamiento de un decoder de Gaussian Splatting.Un encoder asigna los fotogramas a q, el Lagrangiano latente integra las ecuaciones de movimiento y el decoder transforma q en imágenes 2D o 3D.
  • Aplicación interactiva de fuerzas: Los puntos explícitos μ_i(q) del decoder se mueven ante variaciones latentes, lo que permite que una fuerza del espacio de imagen f se convierta en la fuerza generalizada J(q)^T f mediante trabajo virtual.Esta fuerza entra en las mismas ecuaciones de movimiento sin reentrenamiento, aunque no se aplicó ninguna fuerza en los vídeos de entrenamiento.
  • Contribución: El pipeline convierte vídeo monocular en un modelo físico identificado y una simulación interactiva en tiempo real renderizada en 2D o 3D.Combina primitivas Gaussian explícitas y rasterización diferenciable con un Lagrangiano latente y dinámicas de fuerzas generalizadas.

2 Trabajo relacionado

El trabajo relacionado abarca el rendering dinámico, la mecánica aprendida, la dinámica supervisada por video y los modelos interactivos con fuerzas. LaGSplat combina un Lagrangiano disipativo aprendido sobre coordenadas latentes con un decoder explícito de Gaussianas de puntos materiales cuyo Jacobiano transporta las fuerzas.

  • Panorama del campo: La literatura separa la síntesis dinámica de nuevas vistas, la mecánica analítica, el rendering físico generado por video y el aprendizaje de la dinámica directamente a partir de metraje del sistema simulado.La distinción clave es si el video constituye una salida o una supervisión, y si el modelo reproduce el sistema filmado o una escena plausible de su tipo.
  • Representaciones para rendering: Los decoders basados en NeRF son eulerianos y no proporcionan ningún punto material para fijar fuerzas, mientras que las primitivas explícitas móviles proporcionan posiciones y Jacobianos.Las redes neuronales que deforman primitivas canónicas cumplen el criterio de fijación, pero se prefieren las primitivas directas para contenido con mucho movimiento.
  • Física y control de fuerzas: Los métodos con física prescrita, como PhysGaussian [37] [45] [74] y VR-GS [29], utilizan dinámica externa, mientras que Force Prompting [18] aprende respuestas a fuerzas sin estructura mecánica.Force Prompting [18] requiere ejemplos de fuerza-video, utiliza un vector de fuerza fijo por clip generado y no permite control en tiempo real ni por frame.
  • Mecánica latente: NeuROK [17] y otros métodos relacionados de mecánica latente comparten la integración latente y los pullbacks del Jacobiano, pero sus decoders renderizan mallas en lugar de primitivas gaussianas afines.Los métodos gráficos de orden reducido también utilizan decoders de puntos materiales y una estructura de pullback, mientras que LaGSplat aprende la ley gobernante sobre el estado aprendido.
  • Distinción de LaGSplat: LaGSplat sustituye el tiempo por coordenadas latentes en Gaussianas de mayor dimensión, aprende un Lagrangiano disipativo y transporta fuerzas arbitrarias no observadas mediante J^T f.A diferencia de los sistemas interactivos con fuerzas restringidos a objetos rígidos, como Wang et al. [69], aborda objetos deformables y permite redefinir las fuerzas en cualquier instante.

3 Método

LaGSplat aprende un estado latente continuo que parametriza simultáneamente una dinámica disipativa de Euler–Lagrange y un decodificador de Gaussian Splatting condicionado por el estado. Su cinemática aprendida retropropaga las fuerzas en el espacio de imagen hacia fuerzas generalizadas latentes, lo que permite respuestas interactivas acotadas ante cargas no observadas, teniendo en cuenta la geometría de observación y la ambigüedad en la escala de la fuerza.

  • Arquitectura y entrenamiento: LaGSplat aprende conjuntamente un codificador, un Lagrangiano latente con disipación y un decodificador de Gaussian Splatting; después congela el autoencoder antes de ajustar la dinámica a la trayectoria codificada.La Etapa 1 ajusta la apariencia y fija la carta latente; la Etapa 2 ajusta el Lagrangiano después de codificar el clip una vez.
  • Arquitectura y entrenamiento: Un codificador restringido por Lipschitz regulariza la continuidad temporal porque el objetivo dinámico deriva la trayectoria codificada para obtener q̇ y q̈.El método utiliza el regularizador de continuidad de Zhu et al. [81] en lugar de depender de una mayor profundidad o expresividad del codificador.
  • Decodificador de Gaussian Splatting: El decodificador tesela el volumen espacio–estado (x, y, q), de modo que cada estado de la escena se almacena una sola vez y puede renderizarse a partir de trayectorias de Euler–Lagrange, condiciones iniciales no observadas o fuerzas aplicadas.Condicionar las primitivas Gaussian a q produce centros dependientes del estado y suprime las primitivas alejadas del estado latente consultado; el renderizado admite una salida de vídeo con n=2 o escenas 3D interactivas con n=3.
  • Dinámica latente: La carta latente aprendida se blanquea, mientras que los errores se miden en la métrica de imagen pull-back anisotrópica Ḡ, que pondera las direcciones latentes según su movimiento de píxeles decodificado.Esta métrica aproxima el error de imagen decodificado a primer orden sin requerir rasterización durante la evaluación.
  • Dinámica latente: La disipación y un potencial con un mínimo único garantizan una dinámica libre acotada que se asienta en reposo y converge a un equilibrio cargado bajo una fuerza mantenida.Una ICNN modela una única cuenca convexa para el péndulo, la mecedora y la bolsa suspendida; el robot de continuo blando utiliza, en cambio, una ICNN compuesta con una i-ResNet para relajar los conjuntos de nivel convexos preservando un equilibrio único.
  • Aplicación interactiva de fuerzas: Los Jacobianos de la cinemática Gaussian retropropagan las fuerzas primitivas hacia fuerzas generalizadas latentes, con agregación de contactos vecinales y un coste de inferencia O(nd), lo que permite aplicar cargas no observadas sin diferenciar la red.La dirección y la forma de la respuesta están determinadas por la cinemática aprendida, pero la magnitud de la fuerza física sigue siendo ambigua salvo por un único factor energético global κ, porque (L, D) y (αL, αD) producen trayectorias observadas idénticas.

4 Experimentos

LaGSplat se evalúa en videos monoculares de objetos reales que abarcan sistemas rígidos y deformables autónomos, además de un robot blando de accionamiento continuo con mediciones de presión. En estas pruebas, recupera dinámicas plausibles y admite de forma única fuerzas externas en el espacio de la imagen o del mundo durante la inferencia mediante Jacobianos derivados del decodificador.

  • Evaluación global de la dinámica: En casi todos los sistemas, el error de frecuencia natural no supervisado εfreq es de 1–6%, mientras que el robot de un segmento alcanza 31.4% porque sus registros no excitan el modo natural.El péndulo doble tiene εq = 0.947, que aumenta a 1.544 a lo largo del clip completo, mientras que el error de la bolsa suspendida aumenta de 0.150 en dos periodos a 0.396 en siete.
  • Robot blando continuo: LaGSplat mantiene la precisión en el robot más difícil de dos segmentos, alcanzando 0.769 × 10−3 con d=4 coordenadas y superando allí a los modelos de comparación por ×0.98.El resultado es la mediana de cinco semillas, mientras que las cuatro líneas base usan d=10; los registros del robot de un segmento revelan principalmente un mapa cuasiestático de presión a forma, más que inercia o frecuencias naturales.
  • Aplicación interactiva de fuerzas: Durante la inferencia, las fuerzas externas aplicadas en la imagen entran en la dinámica aprendida de LaGSplat como f_lat = J^T f sin reentrenamiento, mediante Jacobianos inducidos por el mapa gaussiano q 7→μ_i.El decodificador transporta las fuerzas desde los elementos primitivos de la imagen hacia coordenadas generalizadas latentes, mientras que el entrenamiento identifica la dinámica autónoma y el mapa de accionamiento; esta capacidad está ausente en los modelos comparados.
  • Aplicación interactiva de fuerzas: En el balancín arcoíris unidimensional, fuerzas iguales producen desplazamientos latentes dependientes del brazo de palanca y con inversión de signo, incluidos Δq = −0.50, −0.76, −0.84 y +1.22 según los puntos de aplicación.Los gaussianos del fondo con Jacobianos nulos no transmiten fuerza, lo que demuestra que la respuesta sigue el movimiento del objeto y no contenido arbitrario de la imagen.
  • Interacción tridimensional: Con supervisión sintética multivista, el mismo mecanismo de transporte opera en 3D: un gaussiano seleccionado por un rayo recibe una fuerza en el espacio del mundo y puede desplazar el objeto hacia un nuevo equilibrio en q = +1.52.Las demostraciones incluyen empujes en direcciones ausentes del movimiento de entrenamiento, lo que muestra respuestas interactivas más allá de la trayectoria observada.

5 Discusión

El prior físico de LaGSplat mejora la estructura, pero limita la aplicabilidad a sistemas disipativos observables, suaves y de baja dimensionalidad, mientras que su mecanismo de fuerza aún no ha sido validado frente a fuerzas medidas. El trabajo futuro se centra en datos con fuerzas etiquetadas, variables constitutivas ocultas, acoplamiento con simuladores y una mejora del modelado latente y geométrico.

  • Limitaciones: El prior lagrangiano excluye el contacto, los impactos, los cambios topológicos, la plasticidad y la histéresis, lo que restringe el método a dinámicas suaves, disipativas y descritas por pocas coordenadas.El límite indicado proviene de la dinámica instanciada, no de la representación en sí.
  • Limitaciones: El aprendizaje monocular requiere un estado observable en la imagen, por lo que el movimiento fuera del plano necesita supervisión multivista y la plasticidad requiere información oculta sobre el historial de carga.Fotogramas visualmente coincidentes pueden codificar historiales plásticos diferentes, lo que hace invisibles esas variables para la supervisión de un solo fotograma.
  • Limitaciones: El mecanismo central de fuerza no está validado frente a fuerzas medidas porque ningún conjunto de datos combina vídeo con vista fija, pocos grados de libertad, fuerzas puntuales aplicadas y la deformación resultante.La Section 4.5 comprueba, en cambio, razones y signos derivados del Jacobian, sumas y propiedades del pullback-kernel invariantes al factor de energía κ.
  • Limitaciones: El ajuste centrado primero en la apariencia sigue siendo una decisión de diseño controvertida, mientras que seleccionar manualmente la dimensión latente d puede sobreestimar el tamaño mínimo del estado.Friedl et al. [14] informan que los modelos entrenados conjuntamente superan al entrenamiento secuencial, mientras que Zhu et al. [81] informan que un enfoque con el codificador congelado supera a las líneas base entrenadas conjuntamente; Chen et al. [8] informan que la reconstrucción se degrada más allá de la anchura latente mínima.
  • Trabajo futuro: El trabajo futuro propone conjuntos de datos con fuerzas medidas, variables internas para la plasticidad y la histéresis, acoplamiento con simuladores externos y un tratamiento mejorado de la densidad por primitiva.Los modelos con variables internas requerirían un d mayor y un codificador multiframe, mientras que el acoplamiento con simuladores debe preservar la prueba de aislamiento del mecanismo de fuerza.

6 Conclusión

LaGSplat aprende a partir del video un estado físico compartido de baja dimensión y lo utiliza tanto como coordenada generalizada como condición del decoder gaussiano. En sistemas reales, recupera con precisión la dinámica observada y permite respuestas acotadas y plausibles a fuerzas no observadas previamente, sin reentrenamiento.

  • LaGSplat aprende un estado físico q sin supervisión que parametriza simultáneamente un Lagrangiano disipativo y condiciona primitivas gaussianas explícitas de puntos móviles.El propio video proporciona la señal de entrenamiento; q no recibe supervisión directa.
  • En siete sistemas reales, las frecuencias naturales aprendidas coinciden con las observaciones del video con una diferencia de pocos puntos porcentuales en todas las grabaciones que las excitan.Los sistemas abarcan de uno a cuatro grados de libertad.
  • En los datos del robot continuo blando de dos segmentos de Krauss et al. [35], LaGSplat es el más preciso de cinco modelos y utiliza cuatro coordenadas en lugar de diez.La evaluación utiliza los datos, la partición y el protocolo de los propios autores.
  • En inferencia, las fuerzas de la imagen o del volumen reconstruido entran en las ecuaciones aprendidas mediante los Jacobianos del decoder sin reentrenamiento, pese a la ausencia de mediciones de fuerzas durante el entrenamiento.La dirección y la forma de la fuerza siguen la cinemática aprendida, mientras que la amplitud solo queda determinada hasta un factor de energía global.
  • El prior lagrangiano limita la clase de sistemas alcanzables, pero mantiene acotadas y físicamente plausibles las respuestas a fuerzas no observadas.

A Derivaciones

Este apéndice deriva cómo la cinemática aprendida transporta fuerzas e inercia, y explica el balance energético subyacente a la afirmación sobre la respuesta acotada.

  • A.1: La cinemática aprendida transporta por igual fuerzas e inercia.Esta derivación se aborda en la Sección A.1.
  • A.2: El apéndice deriva el balance energético en el que se basa la observación sobre la respuesta acotada.Este análisis se aborda en la Sección A.2.

A.1 Fuerzas e inercia a partir de la cinemática aprendida

La cinemática aprendida asigna configuraciones latentes a posiciones de las primitivas, determinando así las fuerzas generalizadas y la energía cinética sin decisiones adicionales de modelado. El transporte de fuerzas es invariante frente a cambios suaves de las coordenadas latentes, mientras que las opacidades normalizadas de las primitivas hacen que la matriz de masas dependiente de la configuración varíe a lo largo de las trayectorias.

  • A.1 Fuerzas e inercia a partir de la cinemática aprendida: El mapa aprendido de configuración a primitivas determina tanto las fuerzas generalizadas como la energía cinética mediante las reglas estándar de la mecánica analítica.Cumple el papel de la posición de cada partícula, por lo que no se requiere ninguna decisión adicional de modelado una vez fijado el mapa.
  • A.1 Fuerzas e inercia a partir de la cinemática aprendida: Una fuerza aplicada a una primitiva se transporta a la fuerza generalizada latente canónica mediante el Jacobiano de la primitiva y preserva el trabajo virtual.Esta construcción hace que la inyección de fuerzas en las ecuaciones de movimiento sea coherente con el balance de energía.
  • A.1 Fuerzas e inercia a partir de la cinemática aprendida: La fuerza transportada y la respuesta resultante son invariantes frente a cualquier reparametrización suave de las coordenadas latentes.La transformación del Jacobiano y la transformación del desplazamiento virtual se cancelan, dejando el trabajo sin cambios entre distintas cartas latentes.
  • A.1 Fuerzas e inercia a partir de la cinemática aprendida: Las opacidades latentes normalizadas ponderan primitivas de igual masa para producir una matriz de masas dependiente de la configuración.Dado que las velocidades de las primitivas satisfacen dot(μ_i) = J_i dot(q), la dependencia del estado entra mediante los pesos de compuerta, por lo que la matriz de masas varía a lo largo de las trayectorias y contiene términos de Coriolis incluso cuando cada J_i es constante.

A.2 Respuesta forzada acotada

Bajo una inercia definida positiva, un potencial coercivo y un amortiguamiento uniformemente positivo, la dinámica continua de LaGSplat permanece acotada y disipativa. Las trayectorias libres convergen al único mínimo del potencial, mientras que las fuerzas constantes mantenidas producen una convergencia acotada hacia equilibrios cargados; la integración simpléctica limita la deriva discreta, pero no el error cuantitativo fuera de distribución.

  • Hipótesis: La garantía de respuesta acotada depende de una inercia definida positiva, un suelo de potencial coercivo y un amortiguamiento con suelo isotrópico c0 > 0.Estas hipótesis evitan la deriva no acotada de la posición y garantizan simultáneamente el control cinético y disipativo.
  • Trayectoria libre: Las trayectorias libres están acotadas y convergen al único mínimo global del potencial bajo un potencial coercivo, una inercia definida positiva y un amortiguamiento uniformemente positivo, según el principio de invariancia de LaSalle.La energía disminuye según Ė ≤ −c0∥q̇∥2, mientras que el subconjunto de nivel de energía acota tanto q̇ como q.
  • Fuerza mantenida: Las fuerzas constantes mantenidas producen respuestas acotadas que convergen a equilibrios cargados que satisfacen ∂V/∂q = f.La energía cargada E_f = T + V − f^Tq cancela la potencia inyectada, y el suelo de potencial cuadrático mantiene su coercividad.
  • Trayectoria discreta: El esquema simpléctico preserva las trayectorias discretas largas frente a la deriva, pero estar acotado no implica precisión cuantitativa lejos de los datos de entrenamiento.Por tanto, las garantías formuladas en tiempo continuo limitan el crecimiento de la respuesta sin asegurar una extrapolación exacta.

B Decodificador de campo de deformación con presupuesto igual

Con el mismo presupuesto de entrenamiento, el decodificador affine de latente a primitivas de LaGSplat iguala o mejora la reconstrucción y produce Jacobianos de las primitivas considerablemente más suaves y significativos que un campo de deformación aprendido. La capacidad adicional del campo de deformación no mejora la calidad de imagen, pero puede corromper las derivadas necesarias para aplicar fuerzas y estimar la inercia.

  • Parametrización del decodificador: LaGSplat sitúa las primitivas en un volumen (n+d)D condicionado por q, de modo que cada μ_i es affine en q y tiene un Jacobiano constante, mientras que la alternativa aprende deformaciones no lineales dependientes de q.La familia de deformaciones puede trazar curvas arbitrarias y potencialmente mantener las primitivas sobre partes del objeto durante todo el movimiento, a diferencia de las trayectorias rectas en el volumen latente.
  • Reconstrucción: Con el mismo presupuesto de reconstrucción, el campo de deformación queda por detrás de LaGSplat en L1 (0.0157 vs 0.0142) y en la pérdida SSIM (0.076 vs 0.063), pese a tener 9.8M frente a 195k parámetros.Ambos decodificadores usan 15,000 primitivas, las mismas pérdidas, regularizadores, optimizador y programación; solo difiere la parametrización.
  • El campo jacobiano: La Figure 11 muestra velocidades de las primitivas más suaves para LaGSplat, con diferencias medianas entre vecinas de 1.4 px/s frente a 6.9 px/s para el campo de deformación.El campo de deformación también mueve primitivas sobre el fondo estático y las regiones del rocker, lo que indica un Jacobiano menos significativo pese a renderizados visualmente similares.
  • Por qué importa el Jacobiano: Dado que la reconstrucción de cada frame no supervisa el seguimiento del material ni las velocidades de las primitivas, un decodificador puede ajustar el clip y, aun así, producir un ∂μ_i/∂q sin significado para el pullback de fuerzas y la estimación de la inercia.El seguimiento del material emerge en LaGSplat porque las mismas primitivas deben explicar cada frame, y pequeños desplazamientos entre estados cercanos preservan la materia que cubren.

C Detalles de implementación

LaGSplat utiliza arquitecturas compartidas de encoder, decoder y LNN en todos los sistemas, y ajusta la dimensión latente, la resolución, el número de primitivas y la duración de la ejecución para cada sistema. El entrenamiento emplea dos etapas optimizadas con Adam, gestión del ciclo de vida de las Gaussianas y procedimientos de blanqueo latente.

  • Configuración de implementación: Se utilizan las mismas arquitecturas en todos los sistemas, mientras que la dimensión latente, la resolución de imagen, el número de primitivas y la duración de la ejecución se establecen para cada sistema.
  • Arquitecturas: El autoencoder convolucional que preserva la continuidad utiliza tres convoluciones de 12×12, dos canales, stride 2, activaciones ELU, average pooling de 4×4 y un mapa lineal a q.Tiene aproximadamente 2 000 parámetros; el decoder contiene entre 1 000 y 15 000 Gaussianas, con entre 104 y 2 × 10^5 parámetros, y la LNN tiene menos de 15 000 parámetros.
  • Entrenamiento: Ambas etapas de entrenamiento utilizan Adam; en la Etapa 1 se entrenan conjuntamente el encoder y el decoder durante aproximadamente 5 × 10^4 pasos de optimización.El número de épocas depende del tamaño del clip.
  • Entrenamiento: La Etapa 1 optimiza 0.08 L1 + 0.02 (1 − SSIM) + 0.01 anisotropy, mientras recicla periódicamente las Gaussianas cuya opacidad máxima cae por debajo de 0.02.El reciclaje divide las Gaussianas sobrecargadas a lo largo del autovector principal de su covarianza completa de dimensión (n+d) o las teletransporta a regiones con alto error; el blanqueo latente utiliza una descomposición espectral de la covarianza codificada.
Loading 2608.16324v1…