Overview of the Retriever SDG Plugin
mainThe data-designer-retrieval-sdg plugin is a first-party Data Designer extension designed to transform source documents into high-quality retriever training and BEIR evaluation data. It automates a four-stage pipeline: document bundling/chunking, artifact extraction and QA generation, deduplication and judging, and finally, exporting compatible artifacts for training and evaluation.
Key components include:
document-chunker(seed reader): Converts text files into sentence chunks with stablechunk_idvalues to ensure generated questions can always map back to their source evidence.embedding-dedup(column generator): Uses embeddings to remove near-duplicate questions, ensuring training data variety.
This plugin is compatible with [AutoModel] and is used to power NeMo embedding and reranking fine-tune recipes.