SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science? Paper • 2608.19799 • Published 6 days ago • 62
SemComp-Bench: Benchmarking Semantic Task Completion in Video Generation Paper • 2608.17426 • Published 8 days ago • 157
From Inaudible Inputs to Model Failures: Low-Frequency Safety Risks in LALMs Paper • 2608.09158 • Published 16 days ago • 10