about
Stories from July 1, 2026 (UTC)
Go back a day, month, or year. Go forward a day.
1. Reap: Automatic Curation of Coding Agent Benchmarks (arxiv.org)
2 points by dipankarsarkar 94 days ago | hide | past | pdf | discuss
2. Discretizing Reward Models (arxiv.org)
2 points by gmays 95 days ago | hide | past | pdf | discuss
3. Agents Are Aging Too: Agent Lifespan Engineering for Deployed Systems (arxiv.org)
1 point by yubblegum 94 days ago | hide | past | pdf | discuss
4. VeriCache: Turning Lossy KV Cache into Lossless LLM Inference (arxiv.org)
1 point by matt_d 94 days ago | hide | past | pdf | discuss
5. OpenAI Gym (2016) (arxiv.org)
1 point by gregsadetsky 94 days ago | hide | past | pdf | discuss
6. Explaining Attention with Program Synthesis (arxiv.org)
1 point by bilsbie 94 days ago | hide | past | pdf | discuss
7. Predictable GRPO (arxiv.org)
1 point by rghosh8 94 days ago | hide | past | pdf | discuss
8. Why averaging LLM benchmark scores is fundamentally broken (arxiv.org)
1 point by testofschool 94 days ago | hide | past | pdf | discuss
9. Reinforcement Learning with Metacognitive Feedback (arxiv.org)
1 point by guard0g 94 days ago | hide | past | pdf | 1 comment