Overview of Crawl4AI features
mainCrawl4AI provides a comprehensive suite of features for LLM-friendly web scraping:
Markdown Generation
- Clean Markdown: Structured formatting.
- Fit Markdown: Heuristic filtering to remove noise.
- Citations: Converts links into numbered reference lists.
- BM25 Algorithm: Filtering for core information extraction.
Structured Data Extraction
- LLM-Driven: Supports all major LLMs.
- Chunking: Topic-based, regex, or sentence-level strategies.
- Semantic Extraction: Uses Cosine Similarity to find relevant content.
- CSS/XPath: Fast schema-based extraction.
Browser & Crawling
- Managed Browsers: Full control over Chromium, Firefox, and WebKit.
- Stealth Mode: Mimics real users to avoid detection.
- Dynamic Content: Executes JS, handles lazy loading, and simulates scrolling for infinite pages.
- Media & IFrame: Extracts images, audio, video, and content from embedded iframes.