Arjun Patel
apatel-1995
ยท
AI & ML interests
Reinforcement learning, reward modeling, RLHF, policy optimization, offline RL
Recent Activity
upvoted a paper about 3 hours ago
X-Tree: Tokenizing Reusable Experience for Efficient Agent Generalization upvoted a paper about 3 hours ago
Hierarchical Continuous Diffusion Language Models liked a dataset 2 days ago
andersonbcdefg/red_teaming_reward_modeling_pairwiseOrganizations
None yet