Qwen3.8-27B теперь работает со скоростью 70 токенов/с прямо на ноутбуке.
Вышел DFlash 2 — новое поколение спекулятивного декодирования на основе блочной диффузии.
DFlash 2 разгоняет Qwen3.8-27B до 70 токенов/с на MacBook Pro с M5 Max. Ускорение авторегрессионного декодирования достигает 4,6 раза, а итоговый вывод остаётся полностью идентичным исходной модели — буквально ни одного отличающегося токена. Уже доступны новые черновые модели для Qwen3.8-27B с нативной поддержкой SGLang, vLLM, llama.cpp и oMLX.
Суть подхода: https://inco.ai/blog/dflash2/
А я напомню, что уже есть модель без цензуры :)
tg / max

Комментарии (32)
Но в общем, у меня вопрос, чем вызвано такая реакция?
Ну вот вы правы, в какой-то степени, но по факту ускорение то есть,
И оно применимо на практике.
Ваше же высказывание по форме - уничижительно.
Зачем?
Почему?
Как именно вы пострадали от этих исследователей?
Оно не так полезно как маркетинговые тексты, но это постоянное свойство маркетинговых тестов начиная со шруповерта.
Меня тригерит другое -
Непрерывная токсичность.
Зайдите на хабр, почти в любую статью про ИИ - там в комментариях праздник токсичности.
Зачем?
Просто зачем?
я вижу что токсичность коментаторов хабра последние 2 года увеличилось очень значительно очень.
Вы понимаете что в практическом плане это ахуенно?
Вопрос только в масштабе.
Вот я придумал штуку,
Которая ускорит ИИ вывод на 5 процентов.
Ваша токсичность говорит - что нахуй это нужно.
Ну и не будет .
Но весь прогрес это миллионы ступенек по по 1 - 5 процентов прогресс
это часть прогресса.
незначительно ускорит, и люди будут на 5 процентов счаливие - кроме вас.
вы провели исследование и получили для вас отрицательный результат - и хорошо.
растроились.
не ставет тулзы по маркетинговым материалам,
никогда,
представите что каждый элемент современных системе ИИ это сотни идей каждая из которых ускоряли и улучшали процесс чуток.
ну вот представьте что каждый был обосран и это повлияло на развитие -
и их нет. нет прогресса.
Говнище редкое
А тут 27
чисто потестить, если есть потенциально интерес потом делать для кого-то какие-то штуки где обязательно требуется свой изолированный контур и нельзя отдавать данные на сторону. Ну, например, заказчик планирует скормить LLM корпоративную документацию или какие-то перс данные. Тогда API не подходят и опыт разворачивания локальных LLM понадобился бы.
А так мне кажется пустое
турник то продал?