Overview of LLM Vision features
mainLLM Vision is a Home Assistant integration that enables visual intelligence by using multimodal large language models (LLMs) to analyze:
- Images
- Video files
- Live camera feeds
- Frigate events
Key Capabilities:
- Multi-provider support: Works with OpenRouter, OpenAI, Anthropic, Google Gemini, AWS Bedrock, Azure, Groq, Ollama, Open WebUI, LocalAI, and any OpenAI-compatible endpoint.
- Visual Analysis: Answers questions and provides descriptions of visual media based on your prompts.
- Memory: Can remember people, pets, and objects.
- Timeline: Maintains a timeline of analyzed camera events, which can be displayed on a dashboard or queried via Home Assistant Assist.
- Sensor Automation: Seamlessly updates Home Assistant sensors based on data extracted from camera streams, images, or videos.