GST-Bench: Can VLMs Develop Global Spatial Awareness from Video? Paper • 2608.05747 • Published 6 days ago • 44
DreamTraj: Generating 6-DoF Object Trajectories by Reading Unrendered Video Diffusion Latents Paper • 2608.00486 • Published 11 days ago • 15
Scaling Properties of Text Conditioning in Visual Generation Paper • 2607.29679 • Published 12 days ago • 38