about
331. Towards Physics of Multimodal Pretraining (arxiv.org)
1 point by gmays 43 days ago | hide | past | pdf | discuss
332. FreeToken: Efficient Edge-Native Moe Serving with Bandwidth-Adaptive Execution (arxiv.org)
4 points by throwaway2027 43 days ago | hide | past | pdf | discuss
333. Every skill-evolution method authored unsafe skills across four agent harnesses (arxiv.org)
2 points by zwdommy 43 days ago | hide | past | pdf | discuss
334. AVO: Agentic Variation Operators for Autonomous Evolutionary Search (arxiv.org)
3 points by ijidak 43 days ago | hide | past | pdf | discuss
335. Mind Viruses: Self-Propagating Ideas in Multi-Agent LLM Systems (arxiv.org)
2 points by jdcaballerov 43 days ago | hide | past | pdf | discuss
336. Phantom Gains: Auditing Self-Improvement Against a Measured Null (arxiv.org)
4 points by sbulaev 43 days ago | hide | past | pdf | discuss
337. Bounded Agents: Delegation Security for Multi-Agent AI Systems (arxiv.org)
3 points by xmuruaga 44 days ago | hide | past | pdf | discuss
338. Inadvertent Context Leakage in Language Models (arxiv.org)
1 point by sbulaev 44 days ago | hide | past | pdf | discuss
339. Compress and Forget: Bitsandbytes Quantization Amplifies Proactive Interference (arxiv.org)
1 point by sbulaev 44 days ago | hide | past | pdf | discuss
340. Can LRMs Do Analogical Reasoning Under Perceptual Uncertainty? (2025) (arxiv.org)
2 points by wslh 44 days ago | hide | past | pdf | discuss
341. Spade: Self-Play in Adaptive Synthetic Executable Environments (arxiv.org)
2 points by ironyman 44 days ago | hide | past | pdf | discuss
342. The Spectral Neuron (arxiv.org)
4 points by E-Reverance 44 days ago | hide | past | pdf | discuss
343. VulnGym: Benchmarking Coding Agents for Repository-Level Vulnerability Detection (arxiv.org)
2 points by wslh 44 days ago | hide | past | pdf | discuss
344. DiffusionGemma Technical Report (arxiv.org)
165 points by gmays 44 days ago | hide | past | pdf | 40 comments
345. Do Chatbot LLMs Talk Too Much? (arxiv.org)
12 points by bretkoppel 44 days ago | hide | past | pdf | 4 comments
346. Test-Time Scaling in the Wild: Why Exploitation, Not Exploration (arxiv.org)
1 point by sbulaev 45 days ago | hide | past | pdf | discuss
347. Fool's Gold: Defensive Deception Against Safety-Removal Attacks on Open-Weight (arxiv.org)
2 points by sbulaev 45 days ago | hide | past | pdf | discuss
348. Cost-Aware Optimization for Agentic Query Execution (arxiv.org)
1 point by matt_d 45 days ago | hide | past | pdf | discuss
349. Stealing Reasoning Traces from Proprietary LLM APIs (arxiv.org)
3 points by doppp 45 days ago | hide | past | pdf | discuss
350. Universality of Gradient Descent Neural Network Training (arxiv.org)
39 points by E-Reverance 45 days ago | hide | past | pdf | 2 comments
351. Stealing Reasoning Traces from Proprietary LLM APIs (arxiv.org)
2 points by amai 45 days ago | hide | past | pdf | 1 comment
352. Chain-of-Thought Reasoning in the Wild Is Not Always Faithful (2025) (arxiv.org)
66 points by florianherrengt 45 days ago | hide | past | pdf | 38 comments
353. Improving the Matrix Multiplication Exponent (arxiv.org)
6 points by aaraujo002 45 days ago | hide | past | pdf | discuss
354. Adding Error Bars to Evals: A Statistical Approach to Language Model Evaluations (arxiv.org)
3 points by Anon84 45 days ago | hide | past | pdf | discuss
355. Sampling More, Getting Less: Calibration Is the Diversity Bottleneck in LLMs (arxiv.org)
2 points by clukic 45 days ago | hide | past | pdf | discuss
356. Stop Anthropomorphizing Intermediate Tokens as Reasoning/Thinking Traces (2025) (arxiv.org)
316 points by nunodonato 45 days ago | hide | past | pdf | 281 comments
357. AutoResearch: Insight In, Hallucination Out (arxiv.org)
2 points by johnbarron 45 days ago | hide | past | pdf | discuss
358. Benchmarking General-Purpose Agents on Market-Validated End-to-End Workflows (arxiv.org)
3 points by tcp_handshaker 45 days ago | hide | past | pdf | discuss
359. Fragility of Self-Improving Agents: Variance, Task Order, and Underspecification (arxiv.org)
3 points by tcp_handshaker 45 days ago | hide | past | pdf | discuss
360. Model Hypnosis: Strong control of AI via additive subliminal effects (arxiv.org)
3 points by sbulaev 46 days ago | hide | past | pdf | discuss