Overview of Hunyuan-DiT
mainHunyuan-DiT is a multi-resolution Diffusion Transformer (DiT) designed for high-quality text-to-image generation with fine-grained understanding of both English and Chinese. It supports multi-turn text-to-image generation through multi-modal dialogue and features a bilingual DiT architecture.
Key capabilities include:
- Bilingual Support: Fine-grained understanding of Chinese and English prompts.
- Multi-turn Generation: Ability to refine images through conversational context.
- Extensibility: Support for ControlNet (Canny, Pose, Depth), IP-Adapter, and LoRA training.
- Optimization: Available versions for acceleration via Distillation and TensorRT, as well as a lite version for 6GB GPU VRAM inference.