Qwen3.8-2.4T-A95B на SageMaker HyperPod: запуск через vLLM с NVFP4, MTP и OpenAI-совместимым эндпоинтом
Пошаговый разбор запуска Qwen3.8-2.4T-A95B на одном узле ml.p6-b300: NVFP4-квантизация, бюджет памяти под KV-cache, манифест InferenceEndpointConfig в SageMaker
Читать статью →
Подписаться на канал
AiManual - База знаний по ИИ
11 сен 2026 14:30
Комментариев пока нет.