Preprocess InfographicVQA dataset
mainDownload InfographicVQA Task 1 (requires registration). Unzip the image files and JSON files into their respective split directories (train, val, test), upload to GCS, and run pix2struct.preprocessing.convert_docvqa (note: the command uses convert_docvqa for this task) using the DataflowRunner.
mkdir -p data/infographicvqa
cd data/infographicvqa
# (Download infographicVQA files from official source)
for split in train val test
do
unzip infographicVQA_${split}_v1.0_images.zip
mv infographicVQA_${split}_v1.0_images $split
mv infographicVQA_${split}_v1.0.json $split/${split}_v1.0.json
done
rm *.zip
cd ..
gsutil -m cp -r infographicvqa $PIX2STRUCT_DIR/data/infographicvqa
python -m pix2struct.preprocessing.convert_docvqa \
--data_dir=$PIX2STRUCT_DIR/data/infographicvqa \
-- \
--runner=DataflowRunner \
--save_main_session \
--project=$GCP_PROJECT \
--region=$GCP_REGION \
--temp_location=$PIX2STRUCT_DIR/data/temp \
--staging_location=$PIX2STRUCT_DIR/data/staging \
--setup_file=./setup.py