qwen3_asr

Model type

qwen3_asr

Class

Qwen3ASRForConditionalGeneration

Task

speech-language

Source

models/qwen3_asr.py

Description

Qwen3-ASR composite model for speech recognition.

Contains:

  • audio_tower: Audio encoder (mel → audio features)

  • embedding: Text+audio embedding fusion

  • decoder: Text decoder with KV cache

Also supports Qwen3-ForcedAligner when classify_num is set in the audio config (uses classification head instead of LM head).

HuggingFace class: Qwen3ASRForConditionalGeneration

Usage

mobius build --model <MODEL_ID> output_dir/
from mobius import build

model = build("<MODEL_ID>")