mpt¶
Model type |
|
Class |
|
Task |
|
Source |
|
Description¶
MPT (MosaicML Pretrain Transformer) causal language model.
MPT uses a sequential pre-norm architecture with ALiBi positional encoding:
norm_1 → attention → residual → norm_2 → MLP → residual
This is the standard pre-norm transformer (not parallel attention), with two separate LayerNorms per block.
Weight naming differences from Falcon:
transformer.blocks.N.*instead oftransformer.h.N.*norm_1/norm_2instead ofln_attn/ln_mlpattn.Wqkv(fused QKV) instead ofself_attention.query_key_valueattn.out_projinstead ofself_attention.denseffn.up_proj/ffn.down_proj(already matches our naming!)transformer.wteinstead oftransformer.word_embeddingstransformer.norm_finstead oftransformer.ln_fUses ALiBi positional encoding (no RoPE)
MPT only supports MHA (no GQA), so num_key_value_heads is forced to
match num_attention_heads.
Replicates HuggingFace’s MptForCausalLM.
Usage¶
mobius build --model <MODEL_ID> output_dir/
from mobius import build
model = build("<MODEL_ID>")