AI-дайджест · 16 сентября
Gemini Live: голосовые модели без библиотек
Google выпустила Gemini 3.8 Live и 3.8 Live Extended Thinking — две speech-to-speech модели, по форме похожие на семейство GPT-Live от OpenAI. Саймон Уиллисон собрал веб-интерфейс для теста: выбор модели и голоса, системный промпт, разговор через браузер с возможностью перебивать модель на полуслове.
Почему важно: Реализация — чистый WebSocket к BidiGenerateContent и Web Audio API, без единой библиотеки. Это готовый референс, как подключить голосовой канал к своему агенту без SDK-обвязки.
Читать →
NeoMME: эффективный мультимодальный и мультиязычный энкодер
Hcompany представила NeoMME — семейство энкодеров на 260M и 800M параметров. Один bidirectional Transformer обрабатывает и текстовые токены, и сырые патчи изображения; обучение с нуля через masked discrete-diffusion. Модель файнтюнилась для визуального поиска документов с использованием page-image подхода ColPali.
Почему важно: 260M модель кодирует около 51 страницы в секунду на NVIDIA L40S. Иерархический пулинг токенов и асимметричная квантизация сжимают индекс с ~1.5 MB до 6 kB на страницу (в 255 раз), сохраняя более 95% nDCG@10. Все чекпоинты под Apache 2.0.
Читать →
TabPFN-3.5 от Prior Labs: табличный foundation model, который с дефолтными настройками обходит победное решение Kaggle-соревнования Otto. Для тех, кто строит пайплайны на табличных данных — повод пересмотреть «классика vs foundation model» в пользу последнего.
AI От веб-кодинга к вайб-кодингу 🔥
16 сен 2026 12:52
Комментариев пока нет.