SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science? Paper • 2608.19799 • Published 7 days ago • 63
SemComp-Bench: Benchmarking Semantic Task Completion in Video Generation Paper • 2608.17426 • Published 9 days ago • 157
From Inaudible Inputs to Model Failures: Low-Frequency Safety Risks in LALMs Paper • 2608.09158 • Published 17 days ago • 10