Overview of MLGym-Bench → Harbor Adapter
mainThe MLGym-Bench adapter evaluates language model agents on machine learning tasks including computer vision, reinforcement learning, tabular ML, and game theory. It repackages exercises from the MLGym repository, requiring agents to write Python code to train and evaluate models.
Key Characteristics:
- Metrics: Uses continuous metrics (accuracy, RMSE, reward, etc.) by default. Use
--no-continuous-metricsfor binary pass/fail evaluation. - Tasks: Surfaces 11 tasks (e.g.,
titanic,imageClassificationCifar10,rlMountainCarContinuous). - Environment: Provides Dockerized environments with PyTorch and CUDA support. Use
--no-cudafor CPU-only mode. - Computation: Tasks are computationally intensive (training from scratch). Sequential execution (
n_concurrent_trials: 1) is strongly recommended.