qwen3_forced_aligner¶
Model type |
|
Class |
|
Task |
|
Source |
|
Description¶
Qwen3-ASR composite model for speech recognition.
Contains:
audio_tower: Audio encoder (mel → audio features)embedding: Text+audio embedding fusiondecoder: Text decoder with KV cache
Also supports Qwen3-ForcedAligner when classify_num is set
in the audio config (uses classification head instead of LM head).
HuggingFace class: Qwen3ASRForConditionalGeneration
Usage¶
mobius build --model <MODEL_ID> output_dir/
from mobius import build
model = build("<MODEL_ID>")