AiManual - База знаний по ИИ
AiManual - База знаний по ИИ

DeepSeek-V4-Flash-0731: почему режим Low генерирует больше токенов, чем High, и как это использовать

DeepSeek-V4-Flash-0731: почему режим Low генерирует больше токенов, чем High, и как это использовать

Тестирование DeepSeek-V4-Flash-0731 показало: режим Low выдаёт на 25–100% больше выходных токенов, чем High. Паттерн воспроизводится и на локальном кванте, и через API. High даёт сжатый структурированный ответ, Low — многословные рассуждения с дублированием шагов.

Названия режимов вводят в заблуждение: «низкий» уровень усилий увеличивает расход токенов и, соответственно, стоимость инференса. На сложных аналитических задачах разрыв достигает двукратного, что напрямую бьёт по бюджету при выборе неверного режима.

Рабочая стратегия — не доверять интуиции, а измерять фактическое потребление на своих типах задач. Разница между none, low, high и max непредсказуема, а в OpenRouter фиксируется дополнительный баг, искажающий подсчёт. Только замеры на реальных промптах дают корректную картину.

Читать статью →

Подписаться на канал

Комментариев пока нет.