DeepSeek также заявляет, что KV-cache требует в 4 раза меньше HBM и в 8 раз меньше SSD по сравнению с предыдущим поколением. Модель доступна в API как
deepseek-flash, а запросы к deepseek-v4-pro с 04:00 UTC 14 сентября будут направляться на V4.1 Flash до выхода V4.1 Pro.По письму DeepSeek: в непиковые часы цена за 1 млн токенов — $0,003 за cache hit, $0,15 за cache miss и $0,60 за output; в пиковые часы цены удваиваются. Пиковые окна: 01:00–04:00 и 06:00–10:00 UTC по будням.
Где деньги: дешёвые агентные циклы, мультимодальные документы и self-hosting. Сжатый KV-cache особенно важен для длинного контекста и массовой инференс-нагрузки.
Вердикт: Это не просто новый endpoint, а смена базовой модели для пользователей Pro. Командам нужно проверить совместимость промптов, vision-пайплайнов и качество на своих задачах до даты маршрутизации.
Источник: DeepSeek API
Карта для оплаты AI: открыть бота
🎁 Подарок: неделя Claude Pro — забрать
Комментариев пока нет.