sensevoice_small¶
Model type |
|
Class |
|
Task |
|
Source |
|
Description¶
SenseVoiceSmall: CTC encoder-only ASR with language control.
The model prepends 4 query tokens (language, event, emo, textnorm) to the input features before encoding. The encoder is the same SenseVoiceEncoderSmall used in Fun-ASR-Nano: 3 stacks of SANM layers with no temporal pooling.
Inputs:
input_features: (batch, time, input_dim) LFR fbank features
language_id: (batch, 1) integer language ID (0=auto, 3=zh, …)
Output:
logits: (batch, time + 4, vocab_size) CTC log-probabilities
Weight prefixes (HuggingFace → ONNX)::
encoder.encoders0.N.* → encoder.encoders0.N.*
encoder.encoders.N.* → encoder.encoders.N.*
encoder.tp_encoders.N.* → encoder.tp_encoders.N.*
encoder.after_norm.* → encoder.after_norm.*
encoder.tp_norm.* → encoder.tp_norm.*
ctc.ctc_lo.* → ctc_head.*
embed.weight → query_embed.weight
Usage¶
mobius build --model <MODEL_ID> output_dir/
from mobius import build
model = build("<MODEL_ID>")