MetroLLM-Bench: Evaluating Language Models as Transit Kiosk Runtimes Paper • 2609.10016 • Published 5 days ago • 32
Hierarchical Self-Improvement: A Framework for Task-Specific Evolvable Agent Harnesses Paper • 2608.08466 • Published Aug 9 • 13
SemComp-Bench: Benchmarking Semantic Task Completion in Video Generation Paper • 2608.17426 • Published 27 days ago • 159
Can We Defend Against AI-Generated Video Attacks on Real-World Crisis Events? A Systematic Evaluation of Detectors, Generators and Social Dissemination Paper • 2608.14391 • Published Aug 14 • 282
OpenART: Scaling Agent Red Teaming via Open-Ended Environment Evolution Paper • 2608.00677 • Published Aug 1 • 263
AdvFD: Boosting Visual Generation via Adversarial Fr'echet Distance Loss Paper • 2608.11205 • Published Aug 11 • 27
ChronoVision: Temporal Reasoning via Latent State Reconstruction Paper • 2608.05631 • Published Aug 6 • 40
AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning Paper • 2608.05987 • Published Aug 6 • 102