To launch a local web interface for Qwen3-ASR, install the qwen-asr package and use the qwen-asr-demo command. The demo supports two backends: transformers and vllm.
Key configuration options:
--asr-checkpoint: Path or ID of the ASR model.--aligner-checkpoint: Path or ID of the Forced Aligner (required for timestamps).--backend: Choose between transformers or vllm.--backend-kwargs: A JSON dictionary for backend-specific initialization (e.g., device_map, dtype, gpu_memory_utilization).--cuda-visible-devices: Select specific GPUs (e.g., 0 or 1).--ip and --port: Network binding settings.
Timestamps are automatically enabled in the UI if --aligner-checkpoint is provided.
# Transformers backend
qwen-asr-demo \
--asr-checkpoint Qwen/Qwen3-ASR-1.7B \
--backend transformers \
--cuda-visible-devices 0 \
--ip 0.0.0.0 --port 8000
# Transformers backend + Forced Aligner (enable timestamps)
qwen-asr-demo \
--asr-checkpoint Qwen/Qwen3-ASR-1.7B \
--aligner-checkpoint Qwen/Qwen3-ForcedAligner-0.6B \
--backend transformers \
--cuda-visible-devices 0 \
--backend-kwargs '{"device_map":"cuda:0","dtype":"bfloat16","max_inference_batch_size":8,"max_new_tokens":256}' \
--aligner-kwargs '{"device_map":"cuda:0","dtype":"bfloat16"}' \
--ip 0.0.0.0 --port 8000
# vLLM backend + Forced Aligner (enable timestamps)
qwen-asr-demo \
--asr-checkpoint Qwen/Qwen3-ASR-1.7B \
--aligner-checkpoint Qwen/Qwen3-ForcedAligner-0.6B \
--backend vllm \
--cuda-visible-devices 0 \
--backend-kwargs '{"gpu_memory_utilization":0.7,"max_inference_batch_size":8,"max_new_tokens":2048}' \
--aligner-kwargs '{"device_map":"cuda:0","dtype":"bfloat16"}' \
--ip 0.0.0.0 --port 8000