Русский ИТ бизнес
Русский ИТ бизнес

Этот тир-лист ИИ-моделей, возможно, точнее большинства официальных бенчмарков

Этот тир-лист ИИ-моделей, возможно, точнее большинства официальных бенчмарков
Этот тир-лист ИИ-моделей, возможно, точнее большинства официальных бенчмарков. Потому что он составлен не по результатам тестовых задач, а на основе реального использования за деньги.

С чем согласны, а с чем нет? Я работаю с openAI и вполне для моих задач подходит, хотя рука тянет попробовать Клод.

tg / max

Комментарии (21)

  • Колючий Маг
    Колючий Маг
    А где Gemini Ответить
  • Заляпанный Сухарь
    Заляпанный Сухарь
    А кем составлен то? Ответить
    раскрыть ветку (1)
    • Аристократичный Шаман
      Аристократичный Шаман
      Тем у кого подписка на клод) Ответить
  • Аристократичный Шаман
    Аристократичный Шаман
    Comment media
    Потому что 6 Terra нет в природе) Ответить
    раскрыть ветку (1)
    • Колючий Маг
      Колючий Маг
      Это галлюцинации нейросети, которая это генерировала )) Ответить
  • Чесночный Режиссер
    Чесночный Режиссер
    А сеть была клод, в смысле opus Ответить
  • Речной Шаман
    Речной Шаман
    по моему личному сравнению - на одних и тех же задачах опус на 2 головы выше чем GPT-6 luna. Убедился на двух разных реальных задачах, которые поручил тому и другому Ответить
    раскрыть ветку (1)
    • Заляпанный Сухарь
      Заляпанный Сухарь
      удивительно, модель в 20 раз дороже лучше? :D Ответить
  • Чесночный Режиссер
    Чесночный Режиссер
    ну, так не удивительно. луна самая тухлая у openai сейчас Ответить
  • Пряный Единорог
    Пряный Единорог
    Как GLM-5.3 можно поставить выше GPT-6-Sol? Ответить
  • Сумеречный Наемник
    Сумеречный Наемник
    На openrouter смотрите. Там люди деньгами голосуют. Ответить
    раскрыть ветку (2)
    • Чесночный Режиссер
      Чесночный Режиссер
      может голосуют просто за дешевое. а не качественное? Ответить
      раскрыть ветку (1)
      • Сумеречный Наемник
        Сумеречный Наемник
        Баланс. Ответить
  • Чесночный Режиссер
    Чесночный Режиссер
    под балансом вы имеете ввиду стоимость сделанной работы? тогда ок. Ответить
  • Чесночный Режиссер
    Чесночный Режиссер
    но я чето сомневаюсь что люди тестят одинаковые задачи разными моделями.
    Скорее просто кто хочет юзать GPT юзает напрямую через openai, а не через openrouter.
    Вот у меня например корпоративная подписка на gpt. А через Openrouter юзаю модели для петпроектов. и выбираю в основном бесплатные по акциям :)
    а дома еще qwen3.8 27b локальный крутится Ответить
  • Чесночный Режиссер
    Чесночный Режиссер
    И могу сказать что если бы не ограничения контекста у локальной модели - то вполне себе. А так для больших проектов контекста не хватает. очень часто в compaction уходит Ответить
    раскрыть ветку (5)
    • Пряный Единорог
      Пряный Единорог
      А на чем локальная модель крутится? Ответить
      раскрыть ветку (4)
      • Чесночный Режиссер
        Чесночный Режиссер
        Rtx 3090 Ответить
        раскрыть ветку (3)
        • Пряный Единорог
          Пряный Единорог
          С какой квантизацией, как скорость? У меня Strix Halo 128 gb, с Q5 занимает 90 Гб памяти, выдает 20 т/сек. Прямо скажем, не очень комфортно. Ответить
          раскрыть ветку (2)
          • Чесночный Режиссер
            Чесночный Режиссер
            Q4_k_m 160к контекста. 30 т/сек. Если понизить потребление энергии с 350вт до 250 то где-то 20 т/сек Ответить
          • Чесночный Режиссер
            Чесночный Режиссер
            Откуда у вас 90гб берётся. Не понимаю. Сама модель в q5 порядка 20 Гб же занимает. Ну кэш там еще пусть 10. Ответить