Local Deployment with vLLM
mainYou can use HippoRAG with a locally deployed vLLM server.
Start vLLM server: Set
VLLM_WORKER_MULTIPROC_METHOD=spawnto avoid CUDA initialization issues when using multiple GPUs.export CUDA_VISIBLE_DEVICES=0,1 export VLLM_WORKER_MULTIPROC_METHOD=spawn export HF_HOME=<path> vllm serve meta-llama/Llama-3.3-70B-Instruct --tensor-parallel-size 2 --max_model_len 4096 --gpu-memory-utilization 0.95Connect HippoRAG: Point
llm_base_urlto your vLLM server (e.g.,http://localhost:8000/v1).
vllm serve meta-llama/Llama-3.3-70B-Instruct --tensor-parallel-size 2 --max_model_len 4096 --gpu-memory-utilization 0.95