The prepare_dataset.py script generates Lhotse manifest files (.jsonl.gz) from TSV files for custom dataset training.
TSV File Formats
Each line in your TSV file must follow one of these two formats:
- Full audio:
{uniq_id}\t{text}\t{wav_path} - Partial audio:
{uniq_id}\t{text}\t{wav_path}\t{start_time}\t{end_time} (where times are in seconds).
Note: {uniq_id} must be unique for every line.
Usage Example
To prepare a training subset:
python3 -m zipvoice.bin.prepare_dataset \
--tsv-path data/raw/custom_train.tsv \
--prefix "custom" \
--subset "train" \
--num-jobs 20 \
--output-dir "data/manifests"
This will produce data/manifests/custom_cuts_train.jsonl.gz.
python3 -m zipvoice.bin.prepare_dataset \
--tsv-path data/raw/custom_train.tsv \
--prefix "custom" \
--subset "train" \
--num-jobs 20 \
--output-dir "data/manifests"