Rethinking On-Policy Distillation of Large Language Models II: One Training Example Paper • 2609.04172 • Published 2 days ago • 72
Random Attention: Rethinking KV Cache Eviction for Efficient Reasoning Paper • 2609.03430 • Published 2 days ago • 156
AI4AI at Test-Time: Strong-to-Weak Capability Transfer via Harnesses Paper • 2608.12307 • Published 24 days ago • 114
Co-Evolution in Agentic Systems: Toward Self-Directed Evolution Beyond Human Design Paper • 2608.10299 • Published 26 days ago • 136