sensevoice_small

Model type

sensevoice_small

Class

SenseVoiceSmallModel

Task

audio-ctc

Source

models/sensevoice_small.py

Description

SenseVoiceSmall: CTC encoder-only ASR with language control.

The model prepends 4 query tokens (language, event, emo, textnorm) to the input features before encoding. The encoder is the same SenseVoiceEncoderSmall used in Fun-ASR-Nano: 3 stacks of SANM layers with no temporal pooling.

Inputs: input_features: (batch, time, input_dim) LFR fbank features language_id: (batch, 1) integer language ID (0=auto, 3=zh, …)

Output: logits: (batch, time + 4, vocab_size) CTC log-probabilities

Weight prefixes (HuggingFace → ONNX)::

encoder.encoders0.N.*  → encoder.encoders0.N.*
encoder.encoders.N.*   → encoder.encoders.N.*
encoder.tp_encoders.N.* → encoder.tp_encoders.N.*
encoder.after_norm.*   → encoder.after_norm.*
encoder.tp_norm.*      → encoder.tp_norm.*
ctc.ctc_lo.*           → ctc_head.*
embed.weight           → query_embed.weight

Usage

mobius build --model <MODEL_ID> output_dir/
from mobius import build

model = build("<MODEL_ID>")