Оптимизация инференса Qwen 3.6 35B A3B на Radeon RX 7600: 21 токен/с с llama.cpp и ROCm 7
Первый шаг: перенесите все слои модели на GPU через флаг -ngl 999 — MoE-архитектура умещается в 8 ГБ именно так.
Второй шаг: оффлоад экспертов на CPU с -ot 12 и -owi 4, чтобы распределить нагрузку без потери скорости.
Третий шаг: отключите mmap флагом --no-mmap для стабильной работы с квантованной версией Q8_0.
Четвёртый шаг: включите квантование K/V-кэша (--cache-type-k q8_0 --cache-type-v q8_0), чтобы разгрузить память.
Пятый шаг: используйте ROCm 7 и соберите llama.cpp с поддержкой Radeon RX 7600 — получите стабильные 18-21 токен/с.
Читать статью →
Подписаться на канал
AiManual - База знаний по ИИ
13 авг 2026 06:20
Комментариев пока нет.