The pipeline_missense.DataPipeline class is used to create input features for inference. It requires a FASTA file containing target sequences and access to genetic databases (UniRef90, MGnify, and Small BFD).
Note: The position parameter in pipeline.process() is 1-based.
from alphamissense.data import pipeline_missense
protein_sequence_file = ...
pipeline = pipeline_missense.DataPipeline(
jackhmmer_binary_path=..., # Typically '/usr/bin/jackhmmer'.
protein_sequence_file=protein_sequence_file,
uniref90_database_path=DATABASES_DIR + '/uniref90/uniref90.fasta',
mgnify_database_path=DATABASES_DIR + '/mgnify/mgy_clusters_2022_05.fa',
small_bfd_database_path=DATABASES_DIR + '/small_bfd/bfd-first_non_consensus_sequences.fasta',
)
sample = pipeline.process(
protein_id=..., # Sequence identifier in the FASTA file.
reference_aa=..., # Single capital letter, e.g. 'A'.
alternate_aa=...,
position=..., # Integer, note that the position is 1-based!
msa_output_dir=msa_output_dir,
)