AiManual - База знаний по ИИ
AiManual - База знаний по ИИ

Сжатие LLM на 233 ГБ без потери точности: как удаление мультиязычности оптимизировало Kimi K3

Сжатие LLM на 233 ГБ без потери точности: как удаление мультиязычности оптимизировало Kimi K3
Проанализируйте словарь и веса модели: определите компоненты, отвечающие за все языки кроме английского.
Удалите неанглийские части эмбеддингов и выходного слоя, сохранив основные веса трансформера нетронутыми.
Проверьте точность на английском: в эксперименте hellohazine она не снизилась, а размер упал с 711 до 478 ГБ.
Примените тот же подход к другим моделям — например, DeepSeek V4 Flash — чтобы сократить требования к GPU без потери производительности.
Читать статью →

Подписаться на канал

Комментариев пока нет.