⚡️ Полную 125B-модель Qwen запустили на RTX 4090 с всего 6 ГБ VRAM.
Обычно такой checkpoint весит 360 ГБ и требует серверов. Но инженеры сделали это на домашней 4090 без квантизации — пик 5,95 ГБ. Модель полная, с vision и 262K контекстом.
VRAM больше не главная проблема для игровых моделей. Но я скажу свое мнение - мы наигрались в локальные модели, хватит... Карты продали.
tg / max

Комментарии (35)
А там где надо будет грузить корп документацию и свои внутрекорпоративные раги и пр. ебалу строить, корпораты найдут денежку на железки, чтобы поднять локальные модели
На RTX 3060 12 GB запустили + 64Гб ОЗУ DDR4, 24 токена, на 5070TI дает 40+ токенов/с.
Проводили тесты сравнивая с Opus 4.8, медленнее, но не хуже.
Тут уж будет зависеть от задач.