arxiv:2608.02023
Yu Zhang
AaronZ345
AI & ML interests
Multi-Modal Generative AI (Spatial Audio/Music/Singing/Speech).
Recent Activity
authored a paper 1 day ago
SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks authored a paper 1 day ago
Spatial-Omni: Spatial Audio Understanding Integration in Multimodal LLMs via FOA Encoding