Overview of Transformer applications
mainTransformers are used across several major modalities:
- Text and Language: Large Language Models (LLMs) like ChatGPT for processing and generating human-like language.
- Audio: Speech-to-text (e.g., OpenAI Whisper) and music generation.
- Vision (Analysis): Using Vision Transformers (ViT) to analyze images and videos (e.g., object detection).
- Vision (Generation): Generating images (e.g., Stable Diffusion, Dall-E, Midjourney) and videos (e.g., Sora, Pika).