Детали:
По официальному анонсу Z.ai, GLM-5.3-Flash — первый нативно-мультимодальный представитель серии GLM-5. Архитектура MoE заявлена как 320 млрд общих параметров и 18 млрд активных на токен; контекст — до 1 млн токенов. Z.ai отдельно подчёркивает работу на китайских AI-ускорителях.
Это означает, что при каждом шаге вычисляется не вся сеть, а выбранные экспертные блоки. Такой подход может снизить стоимость инференса по сравнению с плотной моделью сопоставимого общего размера. Сравнения с Claude и другими frontier-моделями в посте не выдаём за независимый результат: это требует отдельной воспроизводимой проверки.
Где деньги:
MoE и длинный контекст — это ставка на агентные сценарии, большие кодовые базы и мультимодальные документы. Для бизнеса ценность появится там, где модель можно развернуть дешевле и ближе к локальному железу, не отдавая данные во внешний API. Отдельный рынок — оптимизация inference под китайские ускорители и локальные стеки.
Вердикт:
Главная новость не в рекордном числе параметров, а в сочетании мультимодальности, огромного контекста и ограниченного числа активных экспертов. Если заявленные характеристики подтвердятся на независимых тестах, GLM-5.3-Flash усилит гонку open-weight и hardware-agnostic AI.
Источник: Официальный анонс Z.ai
AI От веб-кодинга к вайб-кодингу 🔥
27 авг 2026 08:13
Комментариев пока нет.