Multimodal Vision LLMs · Established · Intermediate
Llama 3.2 11B Vision
Also known as: Llama Vision 11B, Llama 3.2 V
Meta's open multimodal model integrating visual encoder weights with a 11B text transformer for visual reasoning.
What Llama 3.2 11B Vision is
Llama 3.2 11B Vision supports image understanding, document parsing, chart reading, and visual question answering.
How it works
Uses a pre-trained image encoder adapter fused into Llama 3.2 text layers using cross-attention mechanisms.
Why it matters
Deployable on single GPU instances for edge multimodal visual inspection.
Common uses
- →Document OCR and table parsing
- →Visual inspection automation
- →Image QA and description APIs
More in this collection
Browse all AI Models