tokenizer_config.json
1.1 KB · 34 lines · json Raw
1 {
2 "add_prefix_space": false,
3 "audio_bos_token": "<|audio_start|>",
4 "audio_eos_token": "<|audio_end|>",
5 "audio_token": "<|audio_pad|>",
6 "backend": "tokenizers",
7 "bos_token": null,
8 "clean_up_tokenization_spaces": false,
9 "eos_token": "<|im_end|>",
10 "errors": "replace",
11 "image_token": "<|image_pad|>",
12 "is_local": true,
13 "local_files_only": false,
14 "model_max_length": 262144,
15 "model_specific_special_tokens": {
16 "audio_bos_token": "<|audio_start|>",
17 "audio_eos_token": "<|audio_end|>",
18 "audio_token": "<|audio_pad|>",
19 "image_token": "<|image_pad|>",
20 "video_token": "<|video_pad|>",
21 "vision_bos_token": "<|vision_start|>",
22 "vision_eos_token": "<|vision_end|>"
23 },
24 "pad_token": "<|endoftext|>",
25 "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
26 "processor_class": "Qwen3VLProcessor",
27 "split_special_tokens": false,
28 "tokenizer_class": "Qwen2Tokenizer",
29 "unk_token": null,
30 "video_token": "<|video_pad|>",
31 "vision_bos_token": "<|vision_start|>",
32 "vision_eos_token": "<|vision_end|>"
33 }
34