TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM Paper • 2607.27205 • Published 2 days ago • 120
AlayaWorld: Interactive Long-Horizon World Modeling -- Full Technical Report Paper • 2607.18367 • Published 10 days ago • 57
BadWAM: When World-Action Models Dream Right but Act Wrong Paper • 2607.15207 • Published 15 days ago • 53
RynnWorld-4D: 4D Embodied World Models for Robotic Manipulation Paper • 2607.06559 • Published 24 days ago • 95
ABot-N1: Toward a General Visual Language Navigation Foundation Model Paper • 2607.10383 • Published 17 days ago • 102
Scalable Visual Pretraining for Language Intelligence Paper • 2607.09657 • Published 21 days ago • 57
AlayaWorld: Long-Horizon and Playable Video World Generation Paper • 2607.06291 • Published 24 days ago • 91
EVA-Client: A Unified Data Collection, Inference, and Deployment Framework for Embodied Policies on Real Robots Paper • 2607.02646 • Published 29 days ago • 27
AgenticSTS: A Bounded-Memory Testbed for Long-Horizon LLM Agents Paper • 2607.02255 • Published 29 days ago • 67
Seed2.0 Model Card: Towards Intelligence Frontier for Real-World Complexity Paper • 2607.00248 • Published about 1 month ago • 32
ACE-Ego-0: Unifying Egocentric Human and Robotic Data for VLA Pretraining Paper • 2606.17200 • Published Jun 15 • 55
LoopCoder-v2: Only Loop Once for Efficient Test-Time Computation Scaling Paper • 2606.18023 • Published Jun 16 • 210
Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack Paper • 2606.14409 • Published Jun 12 • 15
WBench Collection WBench: A Comprehensive Multi-turn Benchmark for Interactive Video World Model Evaluation • 4 items • Updated Jun 1 • 5