JiRack_README_ru.md
6.6 KB · 243 lines · markdown Raw
1 # JiRack Qwen 3.8-27B with System Prompt
2
3 Это GGUF модель **Qwen 3.8-27B** с:
4 - ✅ **Встроенным системным промптом** (не нужно передавать вручную)
5 - ✅ **Ternary quantization** (тернарная квантизация для скорости)
6 - ✅ **Multi-Token Prediction** (предсказание нескольких токенов одновременно)
7 - ✅ **Q4_K_M квантизация** (16.8 GB, работает на современных CPU/GPU)
8
9 ---
10
11 ## Быстрый старт
12
13 ### 1. Установить llama.cpp
14
15 ```bash
16 git clone https://github.com/ggerganov/llama.cpp
17 cd llama.cpp
18 make
19 # Или с GPU поддержкой:
20 # make LLAMA_CUDA=1
21 ```
22
23 ### 2. Запустить модель
24
25 **Интерактивный чат:**
26
27 ```bash
28 ./llama-cli -m JiRackDeltaNet_27b_with_prompt.Q4_K_M.gguf -c 4096 -n 512
29 ```
30
31 Параметры:
32 - `-c 4096` — контекстное окно (4K токенов)
33 - `-n 512` — максимум новых токенов для генерации
34 - `-ngl 99` — если есть NVIDIA GPU
35
36 **Через API сервер:**
37
38 ```bash
39 ./llama-server -m JiRackDeltaNet_27b_with_prompt.Q4_K_M.gguf --port 8000
40 ```
41
42 Затем (в отдельном терминале):
43
44 ```bash
45 curl http://localhost:8000/v1/chat/completions \
46 -H "Content-Type: application/json" \
47 -d '{
48 "messages": [
49 {"role": "user", "content": "What is quantum computing?"}
50 ],
51 "temperature": 0.7,
52 "max_tokens": 256
53 }'
54 ```
55
56 ---
57
58 ## Встроенный системный промпт
59
60 Модель автоматически использует:
61
62 > You are JiRack, an advanced AI assistant based on Qwen 3.8-27B...
63
64 Если хочешь **переопределить промпт**, используй флаг `-p`:
65
66 ```bash
67 ./llama-cli -m model.gguf -p "You are a helpful coding expert..."
68 ```
69
70 ---
71
72 ## Требования к оборудованию
73
74 ### Минимум:
75 - **CPU**: Intel i5/AMD Ryzen 5+ (4+ ядра)
76 - **RAM**: 32 GB (для комфорта; можно на 16 GB, но будет медленно)
77 - **Хранилище**: 20 GB свободного места (сам файл 16.8 GB)
78
79 ### Рекомендуемо:
80 - **GPU**: NVIDIA RTX 3060+ / RTX 4060 (8 GB VRAM) — даст 30-50x ускорение
81 - **RAM**: 64 GB
82 - **NVMe SSD**: для быстрой загрузки модели
83
84 ### Примерная скорость:
85
86 | Железо | Скорость |
87 |--------|----------|
88 | CPU (i5-12400) | 1-2 токена/сек |
89 | GPU (RTX 4060, 8GB) | 15-20 токенов/сек |
90 | GPU (RTX 4090) | 60+ токенов/сек |
91
92 ---
93
94 ## Примеры использования
95
96 ### Задача 1: Ответить на вопрос
97
98 ```bash
99 ./llama-cli -m model.gguf -p "Explain machine learning in simple terms" -n 256
100 ```
101
102 ### Задача 2: Написать код
103
104 ```bash
105 ./llama-cli -m model.gguf -p "Write a Python function to sort a list" -n 512
106 ```
107
108 ### Задача 3: Переведи текст
109
110 ```bash
111 ./llama-cli -m model.gguf -p "Translate to Russian: Hello, how are you?" -n 128
112 ```
113
114 ### Задача 4: Анализ
115
116 ```bash
117 ./llama-cli -m model.gguf -p "Analyze the pros and cons of remote work" -n 512
118 ```
119
120 ---
121
122 ## Параметры генерации
123
124 ```bash
125 ./llama-cli -m model.gguf \
126 -c 4096 # Контекстное окно
127 -n 512 # Макс новых токенов
128 -t 8 # Потоков (используй количество ядер CPU)
129 -ngl 99 # Слоев на GPU (если есть)
130 --temp 0.7 # Температура (0.0 = детерминировано, 1.0 = случайно)
131 --top_p 0.9 # Nucleus sampling
132 -i # Интерактивный режим (по умолчанию)
133 -p "Prompt" # Начальный системный промпт
134 ```
135
136 ---
137
138 ## API через llama-server
139
140 Запусти сервер:
141
142 ```bash
143 ./llama-server -m model.gguf --port 8000
144 ```
145
146 ### Chat Completions (совместимо с OpenAI):
147
148 ```bash
149 curl http://localhost:8000/v1/chat/completions \
150 -H "Content-Type: application/json" \
151 -d '{
152 "model": "jirack",
153 "messages": [
154 {
155 "role": "system",
156 "content": "You are a helpful assistant."
157 },
158 {
159 "role": "user",
160 "content": "What is 2+2?"
161 }
162 ],
163 "temperature": 0.7,
164 "max_tokens": 100,
165 "stream": false
166 }'
167 ```
168
169 ### Completions:
170
171 ```bash
172 curl http://localhost:8000/v1/completions \
173 -H "Content-Type: application/json" \
174 -d '{
175 "prompt": "Once upon a time",
176 "max_tokens": 256,
177 "temperature": 0.9
178 }'
179 ```
180
181 ---
182
183 ## Решение проблем
184
185 ### Модель медленная
186
187 1. Уменьши контекст: `-c 2048` вместо `-c 4096`
188 2. Уменьши генерацию: `-n 128` вместо `-n 512`
189 3. Возьми GPU (даст 10-50x ускорение)
190
191 ### Недостаточно памяти
192
193 1. Установи `mlock=false`: `--no-mlock`
194 2. Уменьши контекст
195 3. Используй меньшую квантизацию (если доступна Q3_K_M)
196
197 ### CUDA ошибки
198
199 Убедись, что llama.cpp скомпилирован с GPU:
200
201 ```bash
202 make clean
203 make LLAMA_CUDA=1
204 ```
205
206 ### Неверные ответы
207
208 Попробуй поменять температуру:
209
210 ```bash
211 ./llama-cli -m model.gguf --temp 0.5 -p "Prompt" # Более консервативно
212 ./llama-cli -m model.gguf --temp 1.5 -p "Prompt" # Более креативно
213 ```
214
215 ---
216
217 ## Дополнительная информация
218
219 - **Модель**: Qwen 3.8-27B (127 млрд параметров, сжато до 27B с ternary quantization)
220 - **Квантизация**: Q4_K_M (средний компромисс качества/размера)
221 - **Контекст**: до 4096 токенов (основное окно)
222 - **Язык**: Многоязычная (English, 中文, Русский и другие)
223 - **MTP**: Multi-Token Prediction для ускорения спекулятивного декода
224
225 ---
226
227 ## Лицензия
228
229 Модель основана на Qwen 3.8-27B (Qwen License Agreement).
230 Квантизация и оптимизация: JiRack Project.
231
232 ---
233
234 ## Вопросы и поддержка
235
236 Если есть проблемы:
237 1. Проверь требования к оборудованию
238 2. Убедись, что llama.cpp собран правильно
239 3. Попробуй параметры по умолчанию
240 4. Обновись до последней версии llama.cpp
241
242 Enjoy! 🚀
243