Русский ИТ бизнес
Русский ИТ бизнес

Qwen3.8-27B теперь работает со скоростью 70 токенов/с прямо на ноутбуке

Qwen3.8-27B теперь работает со скоростью 70 токенов/с прямо на ноутбуке
Qwen3.8-27B теперь работает со скоростью 70 токенов/с прямо на ноутбуке.

Вышел DFlash 2 — новое поколение спекулятивного декодирования на основе блочной диффузии.

DFlash 2 разгоняет Qwen3.8-27B до 70 токенов/с на MacBook Pro с M5 Max. Ускорение авторегрессионного декодирования достигает 4,6 раза, а итоговый вывод остаётся полностью идентичным исходной модели — буквально ни одного отличающегося токена. Уже доступны новые черновые модели для Qwen3.8-27B с нативной поддержкой SGLang, vLLM, llama.cpp и oMLX.

Суть подхода: https://inco.ai/blog/dflash2/

А я напомню, что уже есть модель без цензуры :)

tg / max

Комментарии (32)

  • Комичный Врач
    Комичный Врач
    бесплезная хрень. Самое тяжёлое в слабом железе - обработка промпта. Даже самый простой промпт вместе с System Promp может обрабатываться 10 минут. Генерация же в любом случае делается довольно быстро. И вот эта приблуда как раз ускоряет только саму генерацию. А на обработку промпта не влияет. Т.е. по цифрам в табличкам всё красиво - ускорение в 5 раз. Но по факту - 10 минут всё равно ждать надо, чтобы получить ускорение потом в 30 секунд максимум... Ответить
    раскрыть ветку (10)
    • Ясный Единорог
      Ясный Единорог
      Для этого есть кеширование.


      Но в общем, у меня вопрос, чем вызвано такая реакция?
      Ну вот вы правы, в какой-то степени, но по факту ускорение то есть,
      И оно применимо на практике.
      Ваше же высказывание по форме - уничижительно.
      Зачем?
      Почему?
      Как именно вы пострадали от этих исследователей? Ответить
      раскрыть ветку (9)
      • Комичный Врач
        Комичный Врач
        я эту штуку щупал ещё неделю назад. Повёлся на красивые цифры. Что типо ускорение и все дела. Но по факту, когда подключаешь к задаче конкретной - ускорения нет. Да, пострадал - потерянное время. Зачем - ясное дело, предостеречь других, кто будет его терять. И если вы внимательно почитали, я сказал - ускорение есть, но не в 4 раза. А процентов на 10-20. Это не стоит того, чтобы эту обёртку ставить в принципе. Ничего уничижительного я не вижу. Я сказал свой опыт и сделал упор на то, что самое тяжёлое в обработке запросов. Если запускаете задачу с контекстом, оно не помогает нихера. А только ускоряет сам процесс печатания. Где здесь уничижение? и что они скрывают в своих маркетинговых цифрах - факт. Просто если общаться с ним, без контекста - поможет. Но стоит завести на реальную задачу - пользы мало. Точнее так - польза не стоит того, чтобы оборачивать в отдельную тулзу. На все вопросы ответил? Ответить
        раскрыть ветку (8)
        • Ясный Единорог
          Ясный Единорог
          Уничижительно это "бесполезная хрень".
          Оно не так полезно как маркетинговые тексты, но это постоянное свойство маркетинговых тестов начиная со шруповерта.
          Меня тригерит другое -
          Непрерывная токсичность.
          Зайдите на хабр, почти в любую статью про ИИ - там в комментариях праздник токсичности.
          Зачем?
          Просто зачем? Ответить
          раскрыть ветку (2)
          • Добрый Павлин
            Добрый Павлин
            Что угодно. Интернет и соцсети в частности вызывают злость даже у добрых. Там все несут хуйню. Да я понимаю что и сам порой, но доколе!🤣 Ответить
            раскрыть ветку (1)
            • Ясный Единорог
              Ясный Единорог
              вы правы и не правы.
              я вижу что токсичность коментаторов хабра последние 2 года увеличилось очень значительно очень. Ответить
        • Ясный Единорог
          Ясный Единорог
          На 20 процентов?
          Вы понимаете что в практическом плане это ахуенно?
          Вопрос только в масштабе.
          Вот я придумал штуку,
          Которая ускорит ИИ вывод на 5 процентов.
          Ваша токсичность говорит - что нахуй это нужно.
          Ну и не будет .
          Но весь прогрес это миллионы ступенек по по 1 - 5 процентов прогресс Ответить
          раскрыть ветку (4)
          • Комичный Врач
            Комичный Врач
            Меня тоже тригерят эти маркетинговые штуки. И я повелся, применил эту хрень на трёх проектах. Потратил дофига времени. Если я каждую тулзу по маркетинговым материалам буду ставить, то я только на тестирование и буду работать. По моим практическим результатам - да, на данный момент эта тулза бесполезная хрень. Ее применить нельзя. Ожидания просто с реальностью не совпадают. Разработчики просто не с той стороны ускорение начали. Ни в ии диалоге, ни в open webui, ни в маркетинговых отчетах оно ускорение не дало. Ставить на сервак каждую тулзу, которая что то обещает - это самоубийство архитектуры. А вопрос зачем - уже отвечал на него, видимо не поняли - предлстеречь других, сегодня время самое ценное и пощупать надо другие вещи Ответить
            раскрыть ветку (3)
            • Ясный Единорог
              Ясный Единорог
              через некоторое время эта штука (идея) станет частью общих фремовков, и будет работать везде.
              это часть прогресса.
              незначительно ускорит, и люди будут на 5 процентов счаливие - кроме вас.

              вы провели исследование и получили для вас отрицательный результат - и хорошо.
              растроились.
              не ставет тулзы по маркетинговым материалам,
              никогда, Ответить
              раскрыть ветку (2)
              • Комичный Врач
                Комичный Врач
                Да, не ставят, тут вы правы. А ставят, когла почитают язвительные комментарии на хабре, что оьычно и является нормальным показателем. Я не удосужился их сначала почитать, решил поэксперементировать. И да, позже будет может фреимворк с этой тулзой. Но тогда мы будем писать о фреимворке в целом, а не инструменте, который ускоряет весь процесс - от оьдумывания, поиска по дереву, анализа, а не просто печатанья. И все забудут об этой тулзе, как о небольшой части процесса Ответить
                раскрыть ветку (1)
                • Ясный Единорог
                  Ясный Единорог
                  Сергей, меня триггерит не ваш вывод, а экспрессия и токсичность.
                  представите что каждый элемент современных системе ИИ это сотни идей каждая из которых ускоряли и улучшали процесс чуток.
                  ну вот представьте что каждый был обосран и это повлияло на развитие -
                  и их нет. нет прогресса. Ответить
  • Невесомый Лимонад
    Невесомый Лимонад
    Comment media
    раскрыть ветку (5)
    • Комичный Врач
      Комичный Врач
      qwen3.6-35B-A3b будет норм работать. И даже тормозить не будет. Но на длинном контексте будет висеть. Поэтому тяжёлые задачи в крон и на ночь... Ответить
      раскрыть ветку (1)
      • Полуночный Архитектор
        Полуночный Архитектор
        проще продать, а на вырученные деньги купить токенов или подписки на пару лет. В итоге за неделю сделаешь то, что такие мелкие модели будут круглосуточно пыхтеть и год делать Ответить
    • Комичный Врач
      Комичный Врач
      поэтому если нужны агентская работа с обработкой контекста, то Laguna-XS-2.1 с FP8 KV-кэшем, будет лучше qwen в этом случае. Но основную для чата бы я лагуну не использовал, qwen без цензуры лучше. Короче от задач зависит... Ответить
    • Скользкий Ящер
      Скользкий Ящер
      скок деняг? Ответить
      раскрыть ветку (1)
      • Невесомый Лимонад
        Невесомый Лимонад
        Пока даже к рынку не приценивался, в коробке был инвойс на 16k AED Ответить
  • Речной Шаман
    Речной Шаман
    работал с квен3-37В
    Говнище редкое

    А тут 27 Ответить
  • Зевающий Ленивец
    Зевающий Ленивец
    на м5про, Qwen3.8-27B-4bit выдает всего 15токенов в сек. ( Ответить
  • Полуночный Архитектор
    Полуночный Архитектор
    36 гб - это чуть лучше видюхи, которая на пару ступеней быстрее. Ладно бы хотя бы 64 или 128 лучше, медленно, но крупные... а тут и медленно, и слабые Ответить
  • Раздражительный Жираф
    Раздражительный Жираф
    чё-то мне кажется локально модели смысла разворачивать именно для себя нет, проще и дешевле пользоваться токенами по API.

    чисто потестить, если есть потенциально интерес потом делать для кого-то какие-то штуки где обязательно требуется свой изолированный контур и нельзя отдавать данные на сторону. Ну, например, заказчик планирует скормить LLM корпоративную документацию или какие-то перс данные. Тогда API не подходят и опыт разворачивания локальных LLM понадобился бы.

    А так мне кажется пустое Ответить
    раскрыть ветку (1)
    • Скользкий Ящер
      Скользкий Ящер
      только под видосы навер есть смысл. там быстро кончатся лимиты. Ответить
  • Чёрный Блогер
    Чёрный Блогер
    продать на авито Ответить
  • Автор канала
    Автор канала
    Какая цена ? Может быть нужно нам . Спасибо Ответить
    раскрыть ветку (7)
    • Раздражительный Жираф
      Раздражительный Жираф
      хочешь подёшевке у себя в чате выкупить и потом на Avito выставить х2

      турник то продал? Ответить
      раскрыть ветку (3)
      • Автор канала
        Автор канала
        Турник в деле . Я себе думал Ответить
        раскрыть ветку (2)
        • Раздражительный Жираф
          Раздражительный Жираф
          а ты прошлый mac обратно в ozon чтоли сдал? Ответить
          раскрыть ветку (1)
          • Автор канала
            Автор канала
            Работаю за ним. Я домой думал Ответить
    • Невесомый Лимонад
      Невесомый Лимонад
      В личку за него уже 180к₽ предложили))). Глянул - авито аналогичный от 200к продают. Ответить
      раскрыть ветку (2)
      • Автор канала
        Автор канала
        ну 180к достойно. мы не потянем :( Ответить
      • Раздражительный Жираф
        Раздражительный Жираф
        устраивай голландский аукцион Ответить
  • Полуночный Архитектор
    Полуночный Архитектор
    а это точно того стоит? Выбор каждого, конечно Ответить