Reward Modeling and Preference Learning
Papers on training reward models and critics to learn human preferences through reinforcement learning, including approaches for visual reasoning, multi-objective alignment, and preference-based optimization.
rewardpreferencecriticreinforcement learningreinforcementreward modelsvisual reasoningpreferences
Papers
18
Last 4 weeks
18
New topic
—