inference/config.json
1.1 KB · 41 lines · json Raw
1 {
2 "vocab_size": 129280,
3 "dim": 4096,
4 "moe_inter_dim": 2048,
5 "n_layers": 43,
6 "n_hash_layers": 3,
7 "n_mtp_layers": 3,
8 "dspark_block_size": 5,
9 "dspark_noise_token_id": 128799,
10 "dspark_target_layer_ids": [40, 41, 42],
11 "dspark_markov_rank": 256,
12 "n_heads": 64,
13 "n_routed_experts": 256,
14 "n_shared_experts": 1,
15 "n_activated_experts": 6,
16 "score_func": "sqrtsoftplus",
17 "route_scale": 1.5,
18 "swiglu_limit": 10.0,
19 "q_lora_rank": 1024,
20 "head_dim": 512,
21 "rope_head_dim": 64,
22 "o_groups": 8,
23 "o_lora_rank": 1024,
24 "window_size": 128,
25 "original_seq_len": 65536,
26 "rope_theta": 10000,
27 "rope_factor": 16,
28 "beta_fast": 32,
29 "beta_slow": 1,
30 "index_n_heads": 64,
31 "index_head_dim": 128,
32 "index_topk": 512,
33 "hc_mult": 4,
34 "hc_sinkhorn_iters": 20,
35 "dtype": "fp8",
36 "scale_fmt": "ue8m0",
37 "expert_dtype": "fp4",
38 "compress_rope_theta": 160000,
39 "compress_ratios": [0, 0, 4, 128, 4, 128, 4, 128, 4, 128, 4, 128, 4, 128, 4, 128, 4, 128, 4, 128, 4, 128, 4, 128, 4, 128, 4, 128, 4, 128, 4, 128, 4, 128, 4, 128, 4, 128, 4, 128, 4, 128, 4, 0, 0, 0]
40 }
41