Overview of OpenR Framework
mainOpenR is an open-source framework designed for advanced reasoning with Large Language Models (LLMs). It provides tools for process-supervision data generation, online policy training, and various search strategies to enhance mathematical and logical reasoning capabilities.
Key Capabilities
- Process-supervision Data Generation: Uses OmegaPRM to improve mathematical reasoning through automated process supervision.
- Online Policy Training: Supports multiple reinforcement learning algorithms including APPO, GRPO, and TPPO (located in
train/mat/trainers). - PRM Training: Supports both supervised training for Process Reward Models (in
prm/code) and Generative Reward Model training (viagen_rm/). - Search Strategies: Implements multiple reasoning strategies such as Greedy Search, Best-of-N, Beam Search, MCTS, rStar, and Critic-MCTS.