See2Think: Do Multimodal Models Really Use Intermediate Visual States? Paper • 2607.26769 • Published 4 days ago • 22
DataEvolver: Self-Evolving Multi-Agent Data Construction for Text-Rich Image Generation Paper • 2606.31537 • Published Jun 30 • 29