AiManual - База знаний по ИИ
AiManual - База знаний по ИИ

Стриминг-инференс для MoE-моделей: запуск полной точности на машине с недостаточной памятью

Стриминг-инференс для MoE-моделей: запуск полной точности на машине с недостаточной памятью
TensorRT-LLM и DeepSpeed позволяют запускать полновесные MoE на конфигурациях с недостатком VRAM.
Механизм — псевдо-унифицированная память: эксперты подгружаются из CPU RAM через PCIe.
Итоговая скорость — 1-5 токенов/с вместо сотен из-за разреженной активации и оверхеда PCIe.
Решение подходит для тестов и экспериментов без квантизации, но не для продакшна.
Читать статью →

Подписаться на канал

Комментариев пока нет.