about
Stories from August 4, 2026 (UTC)
Go back a day, month, or year. Go forward a day.
1. Why Large Language Models Fail at Tabular Prediction (arxiv.org)
115 points by sbulaev 60 days ago | hide | past | pdf | 33 comments
2. When AI Benchmarks Plateau: A Systematic Study of Benchmark Saturation (arxiv.org)
104 points by doppp 60 days ago | hide | past | pdf | 131 comments
3. Can AI agents conduct open-ended AI research? (arxiv.org)
4 points by galsapir 60 days ago | hide | past | pdf | discuss
4. Cross-Model LLM Code Review: Should you use Claude to review Codex or vice versa (arxiv.org)
3 points by mil22 60 days ago | hide | past | pdf | 2 comments
5. AAFlow: Scalable Patterns for Agentic AI Workflows (arxiv.org)
2 points by wslh 60 days ago | hide | past | pdf | discuss
6. Agentic Coding in the Wild: Characterizing GitHub Copilot Traces at Production (arxiv.org)
2 points by matt_d 60 days ago | hide | past | pdf | discuss
7. Walking to the Car Wash: The Salience Bias of LLMs in Commonsense Reasoning (arxiv.org)
2 points by theanonymousone 60 days ago | hide | past | pdf | 1 comment
8. Knowing When to Quit: Diagnosing and Training LLMs to Abort Futile Reasoning (arxiv.org)
2 points by sbulaev 60 days ago | hide | past | pdf | discuss
9. Beyond the Final Prompt: How Conversation Context Changes AI Answers (arxiv.org)
1 point by bentannenbaum 60 days ago | hide | past | pdf | discuss
10. Do Context Files Help Coding Agents? A Two-Agent Ablation Study on Real Repos (arxiv.org)
1 point by jamesblonde 60 days ago | hide | past | pdf | 1 comment
11. Context Compaction Theory (arxiv.org)
1 point by jadidbourbaki 60 days ago | hide | past | pdf | discuss
12. Hollow-LLM Attack: Ghost Weights That Fool Zero-Knowledge LLM Verification (arxiv.org)
1 point by sbulaev 61 days ago | hide | past | pdf | discuss