Moyan AI Training Institution LogoMoyan AI

Multimodal Vision LLMs · Established · Intermediate

Llama 3.2 11B Vision

Also known as: Llama Vision 11B, Llama 3.2 V

Meta's open multimodal model integrating visual encoder weights with a 11B text transformer for visual reasoning.

What Llama 3.2 11B Vision is

Llama 3.2 11B Vision supports image understanding, document parsing, chart reading, and visual question answering.

How it works

Uses a pre-trained image encoder adapter fused into Llama 3.2 text layers using cross-attention mechanisms.

Why it matters

Deployable on single GPU instances for edge multimodal visual inspection.

Common uses

  • Document OCR and table parsing
  • Visual inspection automation
  • Image QA and description APIs

More in this collection

Browse all AI Models