blip-2

Model type

blip-2

Class

Blip2Model

Task

vision-language

Source

models/blip2.py

Description

BLIP-2 vision-language model (3-model split).

Builds three separate ONNX models:

  • decoder: text decoder taking inputs_embeds

  • vision_encoder: ViT + Q-Former + language projection

  • embedding: token embedding + image feature fusion

HuggingFace reference: Blip2ForConditionalGeneration.

Usage

mobius build --model <MODEL_ID> output_dir/
from mobius import build

model = build("<MODEL_ID>")