Run a Load Test with token_benchmark_ray.py
mainThe load test evaluates LLM performance by spawning concurrent requests and measuring inter-token latency and generation throughput. It uses a prompt based on randomly sampled lines from Shakespeare sonnets and counts tokens using the LlamaTokenizer for consistency across APIs.
To run a load test, use the token_benchmark_ray.py script. You must specify the --llm-api and provide necessary credentials via environment variables.
Example: OpenAI Compatible API
export OPENAI_API_KEY=secret_abcdefg
export OPENAI_API_BASE="https://api.endpoints.anyscale.com/v1"
python token_benchmark_ray.py \
--model "meta-llama/Llama-2-7b-chat-hf" \
--mean-input-tokens 550 \
--stddev-input-tokens 150 \
--mean-output-tokens 150 \
--stddev-output-tokens 10 \
--max-num-completed-requests 2 \
--timeout 600 \
--num-concurrent-requests 1 \
--results-dir "result_outputs" \
--llm-api openai \
--additional-sampling-params '{}'