Representation-Space MMD for Diffusion Language Models Paper • 2610.06648 • Published 5 days ago • 31
LANTERN: Illuminating Hidden Mathematical Knowledge in Language Models Paper • 2609.32264 • Published 14 days ago • 50
Disaggregated Quantization: Specializing LLM Prefill and Decode Paper • 2609.26333 • Published 18 days ago • 93
One-Step Gradient Delay is Not a Barrier for Large-Scale Asynchronous Pipeline Parallel LLM Pretraining Paper • 2606.30634 • Published Jun 29 • 24
One-Step Gradient Delay is Not a Barrier for Large-Scale Asynchronous Pipeline Parallel LLM Pretraining Paper • 2606.30634 • Published Jun 29 • 24
Reasoning Shift: How Context Silently Shortens LLM Reasoning Paper • 2604.01161 • Published Apr 1 • 32