qwen3_next¶
Model type |
|
Class |
|
Task |
|
Source |
|
Description¶
Qwen3-Coder-Next causal language model.
Hybrid DeltaNet + Gated Attention architecture with MoE FFN on all layers. Uses 3B activated parameters (80B total) with 512 experts, top-10 routing, and a shared expert with sigmoid gating.
HuggingFace class: Qwen3NextForCausalLM
Usage¶
mobius build --model <MODEL_ID> output_dir/
from mobius import build
model = build("<MODEL_ID>")