DeepSeek-V4-Flash-0731: почему режим Low генерирует больше токенов, чем High, и как это использовать
Тестирование DeepSeek-V4-Flash-0731 показало: режим Low выдаёт на 25–100% больше выходных токенов, чем High. Паттерн воспроизводится и на локальном кванте, и через API. High даёт сжатый структурированный ответ, Low — многословные рассуждения с дублированием шагов.
Названия режимов вводят в заблуждение: «низкий» уровень усилий увеличивает расход токенов и, соответственно, стоимость инференса. На сложных аналитических задачах разрыв достигает двукратного, что напрямую бьёт по бюджету при выборе неверного режима.
Рабочая стратегия — не доверять интуиции, а измерять фактическое потребление на своих типах задач. Разница между none, low, high и max непредсказуема, а в OpenRouter фиксируется дополнительный баг, искажающий подсчёт. Только замеры на реальных промптах дают корректную картину.
Читать статью →
Подписаться на канал
AiManual - База знаний по ИИ
3 авг 2026 09:20
Комментариев пока нет.