Kandinsky 6.0 Video: Foundation Models for Synchronized Video and Audio Generation Paper • 2610.05608 • Published 7 days ago • 162
PDE-JEPA: Predictive Representation Learning of Latent Dynamics Modeling for Parametric PDEs Paper • 2609.34715 • Published 13 days ago • 62
Video DeltaNet: A Video-Native Hybrid Attention for Livestream Video Generation Paper • 2609.20744 • Published 24 days ago • 53
GAE: Learning a Geometry-Native Latent Space for 3D-Consistent World Generation Paper • 2609.24981 • Published 20 days ago • 76
Marigold V2: Revisiting Diffusion Transformers for Monocular Depth Estimation Paper • 2609.08084 • Published Sep 8 • 72
Running 99 Marigold V2: Revisiting Diffusion Transformers for Monocular Depth Estimation 🌼 99 Depth, surface normals, and albedo from a single image