config.json
1.5 KB · 48 lines · json Raw
1 {
2 "_local_rope_theta_note": "local_rope_theta is DEPRECATED/unused: acoustic decoder now uses a learned slot-position embedding, not RoPE.",
3 "_reserved_tokens_note": "ids 13..42 are reserved/preserve slots (random-init), inserted right after emotion_4 (12); unk and phoneme vocab shifted +30.",
4 "architectures": [
5 "VieNeuV3TurboForTTS"
6 ],
7 "attention_dropout": 0.0,
8 "audio_pad_token_id": 1024,
9 "audio_ref_slot_token_id": 7,
10 "audio_sample_rate": 48000,
11 "audio_tokenizer_pretrained_name_or_path": "OpenMOSS-Team/MOSS-Audio-Tokenizer-Nano",
12 "audio_vocab_size": 1024,
13 "bos_token_id": 1,
14 "dtype": "float32",
15 "emotion_0_token_id": 8,
16 "emotion_1_token_id": 9,
17 "emotion_2_token_id": 10,
18 "emotion_3_token_id": 11,
19 "emotion_4_token_id": 12,
20 "eos_token_id": 2,
21 "head_dim": 64,
22 "hidden_size": 768,
23 "intermediate_size": 3072,
24 "local_intermediate_size": 2048,
25 "local_num_attention_heads": 8,
26 "local_num_hidden_layers": 2,
27 "local_rope_theta": 10000.0,
28 "max_position_embeddings": 1024,
29 "model_type": "vieneu_v3_turbo",
30 "n_vq": 16,
31 "num_attention_heads": 12,
32 "num_hidden_layers": 12,
33 "num_key_value_heads": 4,
34 "num_reserved_tokens": 30,
35 "pad_token_id": 0,
36 "reserved_token_start": 13,
37 "rms_norm_eps": 1e-06,
38 "rope_theta": 10000.0,
39 "speech_generation_end_token_id": 6,
40 "speech_generation_start_token_id": 5,
41 "text_prompt_end_token_id": 4,
42 "text_prompt_start_token_id": 3,
43 "text_vocab_size": 419,
44 "tie_word_embeddings": false,
45 "transformers_version": "4.56.0",
46 "unk_token_id": 43
47 }
48