Рубрики
Технологии

Пост @apdorodin — Машинное обучение (+4) — 11.08.2026 21:39

Мой топ бэнчмарков

Какую модель запустить на 2xV100, 2×32 GB VRAM: Gemma-4-26B или Qwen-3.6-35B. Обе современные. Обе от топовых компаний, обе мультимодальные, у обеих качественный маркетинг. Количество параметров и требования к железу — аналогичные. Но Gemma абсолютно неконкурентна и в любом типе задач измеримо хуже. В таких грубых случаях бенчмарки отлично описывают модели. Они и в менее грубых помогают, но там уже есть некоторое отклонение от реальности.

https://artificialanalysis.ai/ — Топ-1 по популярности и взвешенности решения. Состоит из 9 бенчмарков и составляет 3 индекса на их основе: интеллект, кодинг и агентные способности. Содержит все модели и добавляет их в течение 2 дней после выхода. Модели OpenAI добавляет день в день. Поменял свой индекс, чтобы показать, что GPT-5.6 Sol лучше Opus 4.8, но если вы пользуетесь только одним бенчмарком — пусть это будет он.

https://deepswe.datacurve.ai/ — бенчмарк SOTA-моделей на реальных задачах программирования. Основной формат представления — процент решённых задач против цены на одну задачу. То есть даже лучше, чем цена за токен, ведь одни модели используют больше токенов, чем другие. Задачи максимально продуманы и глубоки. На данный момент не переполнен и реально показывает полезность моделей для программирования.

https://arena.ai/leaderboard — так же, как и Artificial Analysis, не один бенчмарк, а целая коллекция. Начинал со сравнения пользовательских предпочтений, но сейчас имеет куда больше разделов. Упал в популярности, но всё ещё полезен для нишевых вопросов вроде сравнения качества поиска или генерации картинок

Читать дальше →