UrbanGround: From Local Perception to Spatial Agency in a Real-Scale City Paper • 2608.27456 • Published 6 days ago • 109
Are Android GUI Agents Robust Against Runtime Anomalies? AnTrap: Evaluating Agents in Dynamic Adversarial Environments Paper • 2608.24099 • Published 8 days ago • 12
Intern-S2-Preview: Scientific Agentic Foundation Model Paper • 2608.13505 • Published 20 days ago • 71
Beyond Final Scores: A Systematic Evaluation of Agents for Long-Horizon AI Research and Development Paper • 2608.13417 • Published 20 days ago • 57
Sci-VBench: Evaluating Knowledge- and Reasoning-Intensive Video Generation in Science Domains Paper • 2608.09873 • Published 23 days ago • 29
OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models Paper • 2607.28609 • Published Jul 30 • 73
UEmbed: Unified Sparse and Dense Multimodal Embeddings Paper • 2608.02583 • Published 30 days ago • 52
Metacognition in LLMs: Foundations, Progress, and Opportunities Paper • 2607.11881 • Published Jul 13 • 30