The rewardbench CLI allows you to evaluate reward models on preference datasets. It automatically detects instruction datasets (those with messages instead of chosen/rejected) and logs model outputs instead of accuracy.
Basic usage:
rewardbench --model={yourmodel}
With specific dataset and batch size:
rewardbench --model={yourmodel} --dataset={yourdataset} --batch_size=8
Evaluating DPO models:
Pass the --ref_model argument to automatically route to the DPO evaluation logic.
rewardbench --model={your_dpo_model} --ref_model={your_ref_model}
Using local JSONL datasets:
rewardbench --model=Qwen/Qwen1.5-0.5B-Chat --ref_model=Qwen/Qwen1.5-0.5B --dataset=/path/to/data.jsonl --load_json
rewardbench --model=OpenAssistant/reward-model-deberta-v3-large-v2 --dataset=allenai/ultrafeedback_binarized_cleaned --split=test_gen --chat_template=raw