WhatWorkedBench: Benchmarking Experimental Understanding in AI Agents Paper • 2609.27490 • Published 6 days ago • 14
Yuhan123/vicuna-13b-self_consistency_neg_exp_var_4 Text Generation • 13B • Updated Mar 14, 2025 • 57 • 5
Realtime-Venus: A full-duplex interaction system with asynchronous delegation Paper • 2609.13814 • Published 17 days ago • 224
The Functionalizer: Lossless Functional Decomposition for Subword Tokenization Paper • 2609.15991 • Published 11 days ago • 17
1% of Tokens Can Be Enough: On Gradient Estimation in On-Policy Distillation Paper • 2609.24432 • Published 8 days ago • 16
RRSI: Regularized Recursive Self-Improvement of Agent Harnesses Paper • 2609.24972 • Published 8 days ago • 212
Measuring the Checker: Mutation Analysis for GPU-Kernel Benchmark Oracles Paper • 2609.22220 • Published 27 days ago • 7
Yuhan123/vicuna-13b-self_consistency_random_var_5 Text Generation • 13B • Updated Mar 14, 2025 • 14 • 5
Grounded Skill Synthesis from Code at Scale for Agentic Intelligence Paper • 2609.05571 • Published 25 days ago • 119
Yuhan123/vicuna-13b-self_consistency_neg_exp_var_1 Text Generation • 13B • Updated Mar 14, 2025 • 43 • 6
RetireOPD: Self-Retiring On-Policy Distillation for Agentic Reinforcement Learning Paper • 2609.20784 • Published 12 days ago • 57