about
1711. Categorizing Variants of Goodhart's Law (arxiv.org)
1 point by foster_nyman 261 days ago | hide | past | pdf | discuss
1712. Future-as-Label: Scalable Supervision from Real-World Outcomes (arxiv.org)
17 points by bturtel 262 days ago | hide | past | pdf | discuss
1713. Control Flow Integrity for Computer Use Agents (arxiv.org)
1 point by iliaishacked 262 days ago | hide | past | pdf | 1 comment
1714. Learning Latent Action World Models in the Wild (arxiv.org)
1 point by saswatms 262 days ago | hide | past | pdf | discuss
1715. Towards a Science of Scaling Agent Systems (arxiv.org)
1 point by handfuloflight 262 days ago | hide | past | pdf | 1 comment
1716. A benchmark for LLM vericoding: formally verified program synthesis (arxiv.org)
2 points by cpeterso 263 days ago | hide | past | pdf | discuss
1717. Can LLMs Express Their Uncertainty? Not Really (arxiv.org)
2 points by apwheele 263 days ago | hide | past | pdf | discuss
1718. How Prompt Injections Gradually Evolved into a Multi-Step Malware (arxiv.org)
4 points by 50kIters 263 days ago | hide | past | pdf | discuss
1719. Prompt Repetition Improves Non-Reasoning LLMs (arxiv.org)
1 point by jsphweid 264 days ago | hide | past | pdf | discuss
1720. Ministral 3 – pruning via Cascade Distillation (arxiv.org)
5 points by everlier 264 days ago | hide | past | pdf | discuss
1721. WebGym: Scaling Training Environments for Visual Web Agents with Realistic Tasks (arxiv.org)
1 point by gmays 264 days ago | hide | past | pdf | discuss
1722. Prompt Repetition Improves Non-Reasoning LLMs (arxiv.org)
2 points by Anon84 264 days ago | hide | past | pdf | discuss
1723. HiGP: A high-performance Python package for Gaussian Process (arxiv.org)
5 points by 7777777phil 264 days ago | hide | past | pdf | discuss
1724. Conditional Memory via Scalable Lookup (arxiv.org)
2 points by jonbaer 265 days ago | hide | past | pdf | discuss
1725. MacPrompt: Maraconic-Guided Jailbreak Against Text-to-Image Models (arxiv.org)
3 points by 7777777phil 265 days ago | hide | past | pdf | discuss
1726. Sift or Get Off the PoC: Vulnerability Research via Information Retrieval (arxiv.org)
1 point by noperator 266 days ago | hide | past | pdf | discuss
1727. Quantization and distillation effects on code LLMs (arxiv.org)
1 point by nkko 266 days ago | hide | past | pdf | discuss
1728. Show HN: Two-line change, 30% RAG boost (arxiv.org)
1 point by snasan 266 days ago | hide | past | pdf | discuss
1729. iOS as Acceleration (arxiv.org)
3 points by PaulHoule 267 days ago | hide | past | pdf | discuss
1730. Confucius Code Agent: Scalable Agent Scaffolding for Real-World Codebases (arxiv.org)
1 point by erhuve 267 days ago | hide | past | pdf | discuss
1731. Extracting books from production language models (2026) (arxiv.org)
75 points by logicprog 268 days ago | hide | past | pdf | 22 comments
1732. Extracting books from production language models (arxiv.org)
4 points by cleandreams 268 days ago | hide | past | pdf | 2 comments
1733. Deep sequence models tend to memorize geometrically; it is unclear why (arxiv.org)
1 point by erhuve 268 days ago | hide | past | pdf | discuss
1734. One pixel attack for fooling deep neural networks (arxiv.org)
3 points by rafaepta 268 days ago | hide | past | pdf | discuss
1735. When AI Takes the Couch: Internal Conflict in Frontier Models (arxiv.org)
1 point by Folcon 269 days ago | hide | past | pdf | discuss
1736. Auto-Tuning Safety Guardrails for Black-Box Large Language Models (arxiv.org)
1 point by PaulHoule 269 days ago | hide | past | pdf | discuss
1737. Deep Delta Learning (arxiv.org)
1 point by mfiguiere 269 days ago | hide | past | pdf | discuss
1738. Mind Your Tone: Investigating How Prompt Politeness Affects LLM Accuracy (arxiv.org)
1 point by CGMthrowaway 269 days ago | hide | past | pdf | 1 comment
1739. Challenges and Research Directions for Large Language Model Inference Hardware (arxiv.org)
2 points by matt_d 269 days ago | hide | past | pdf | discuss
1740. Name That Part: 3D Part Segmentation and Naming (arxiv.org)
2 points by unisub_guy 269 days ago | hide | past | pdf | 1 comment