arxiv:2609.32791
Peng Shangpin
AI & ML interests
Multimodal Large Language Models, Preference Optimization Algorithm, Reinforcement Learning
Recent Activity
authored a paper 2 days ago
$T^5$: Twin-Critic Training for Token-Level Thoughts in Reinforcement Mid-Training upvoted a paper 2 days ago
T^5: Twin-Critic Training for Token-Level Thoughts in Reinforcement Mid-Training updated a dataset 4 days ago
psp-dada/TableVerse-5K