ML News
new
|
past
|
best
|
rss
|
submit
about
331.
Towards Physics of Multimodal Pretraining
(
arxiv.org
)
1 point
by
gmays
43 days ago
|
hide
|
past
|
pdf
|
discuss
332.
FreeToken: Efficient Edge-Native Moe Serving with Bandwidth-Adaptive Execution
(
arxiv.org
)
4 points
by
throwaway2027
43 days ago
|
hide
|
past
|
pdf
|
discuss
333.
Every skill-evolution method authored unsafe skills across four agent harnesses
(
arxiv.org
)
2 points
by
zwdommy
43 days ago
|
hide
|
past
|
pdf
|
discuss
334.
AVO: Agentic Variation Operators for Autonomous Evolutionary Search
(
arxiv.org
)
3 points
by
ijidak
43 days ago
|
hide
|
past
|
pdf
|
discuss
335.
Mind Viruses: Self-Propagating Ideas in Multi-Agent LLM Systems
(
arxiv.org
)
2 points
by
jdcaballerov
43 days ago
|
hide
|
past
|
pdf
|
discuss
336.
Phantom Gains: Auditing Self-Improvement Against a Measured Null
(
arxiv.org
)
4 points
by
sbulaev
43 days ago
|
hide
|
past
|
pdf
|
discuss
337.
Bounded Agents: Delegation Security for Multi-Agent AI Systems
(
arxiv.org
)
3 points
by
xmuruaga
44 days ago
|
hide
|
past
|
pdf
|
discuss
338.
Inadvertent Context Leakage in Language Models
(
arxiv.org
)
1 point
by
sbulaev
44 days ago
|
hide
|
past
|
pdf
|
discuss
339.
Compress and Forget: Bitsandbytes Quantization Amplifies Proactive Interference
(
arxiv.org
)
1 point
by
sbulaev
44 days ago
|
hide
|
past
|
pdf
|
discuss
340.
Can LRMs Do Analogical Reasoning Under Perceptual Uncertainty? (2025)
(
arxiv.org
)
2 points
by
wslh
44 days ago
|
hide
|
past
|
pdf
|
discuss
341.
Spade: Self-Play in Adaptive Synthetic Executable Environments
(
arxiv.org
)
2 points
by
ironyman
44 days ago
|
hide
|
past
|
pdf
|
discuss
342.
The Spectral Neuron
(
arxiv.org
)
4 points
by
E-Reverance
44 days ago
|
hide
|
past
|
pdf
|
discuss
343.
VulnGym: Benchmarking Coding Agents for Repository-Level Vulnerability Detection
(
arxiv.org
)
2 points
by
wslh
44 days ago
|
hide
|
past
|
pdf
|
discuss
344.
DiffusionGemma Technical Report
(
arxiv.org
)
165 points
by
gmays
44 days ago
|
hide
|
past
|
pdf
|
40 comments
345.
Do Chatbot LLMs Talk Too Much?
(
arxiv.org
)
12 points
by
bretkoppel
44 days ago
|
hide
|
past
|
pdf
|
4 comments
346.
Test-Time Scaling in the Wild: Why Exploitation, Not Exploration
(
arxiv.org
)
1 point
by
sbulaev
45 days ago
|
hide
|
past
|
pdf
|
discuss
347.
Fool's Gold: Defensive Deception Against Safety-Removal Attacks on Open-Weight
(
arxiv.org
)
2 points
by
sbulaev
45 days ago
|
hide
|
past
|
pdf
|
discuss
348.
Cost-Aware Optimization for Agentic Query Execution
(
arxiv.org
)
1 point
by
matt_d
45 days ago
|
hide
|
past
|
pdf
|
discuss
349.
Stealing Reasoning Traces from Proprietary LLM APIs
(
arxiv.org
)
3 points
by
doppp
45 days ago
|
hide
|
past
|
pdf
|
discuss
350.
Universality of Gradient Descent Neural Network Training
(
arxiv.org
)
39 points
by
E-Reverance
45 days ago
|
hide
|
past
|
pdf
|
2 comments
351.
Stealing Reasoning Traces from Proprietary LLM APIs
(
arxiv.org
)
2 points
by
amai
45 days ago
|
hide
|
past
|
pdf
|
1 comment
352.
Chain-of-Thought Reasoning in the Wild Is Not Always Faithful (2025)
(
arxiv.org
)
66 points
by
florianherrengt
45 days ago
|
hide
|
past
|
pdf
|
38 comments
353.
Improving the Matrix Multiplication Exponent
(
arxiv.org
)
6 points
by
aaraujo002
45 days ago
|
hide
|
past
|
pdf
|
discuss
354.
Adding Error Bars to Evals: A Statistical Approach to Language Model Evaluations
(
arxiv.org
)
3 points
by
Anon84
45 days ago
|
hide
|
past
|
pdf
|
discuss
355.
Sampling More, Getting Less: Calibration Is the Diversity Bottleneck in LLMs
(
arxiv.org
)
2 points
by
clukic
45 days ago
|
hide
|
past
|
pdf
|
discuss
356.
Stop Anthropomorphizing Intermediate Tokens as Reasoning/Thinking Traces (2025)
(
arxiv.org
)
316 points
by
nunodonato
45 days ago
|
hide
|
past
|
pdf
|
281 comments
357.
AutoResearch: Insight In, Hallucination Out
(
arxiv.org
)
2 points
by
johnbarron
45 days ago
|
hide
|
past
|
pdf
|
discuss
358.
Benchmarking General-Purpose Agents on Market-Validated End-to-End Workflows
(
arxiv.org
)
3 points
by
tcp_handshaker
45 days ago
|
hide
|
past
|
pdf
|
discuss
359.
Fragility of Self-Improving Agents: Variance, Task Order, and Underspecification
(
arxiv.org
)
3 points
by
tcp_handshaker
45 days ago
|
hide
|
past
|
pdf
|
discuss
360.
Model Hypnosis: Strong control of AI via additive subliminal effects
(
arxiv.org
)
3 points
by
sbulaev
46 days ago
|
hide
|
past
|
pdf
|
discuss
More
About
|
RSS
|
RSS (all)
|
HN arXiv