Открытый бенчмарк · русский язык

Какие модели реально работают на русском

40 конфигураций моделей на 484 прикладных задачах российского бизнеса — бухгалтерия, право, финансы, BI, логистика, стройка, нефтегаз, промышленность, банки. Вендорские параметры инференса, единое судейство, полный разбор каждой задачи.

484
задач
22 / 18
моделей текст / VL
38
категорий
~15k
оценок судьи

Отчёты

Полные интерактивные отчёты: лидерборд, расход токенов, скорость, тепловые карты по сегментам и разбор каждой задачи с комментариями судьи.

181 задача · 22 модели

Текстовый бенчмарк

Рассуждение, код, RAG, агентские сценарии, отраслевые задачи РФ: налоги, юр. комплаенс, корпфинансы, данные и логистика.

1 место GPT-5.6 Sol (medium)9.03
303 задачи · 18 моделей

Компьютерное зрение

OCR, таблицы, графики и дашборды, схемы и чертежи, подсчёт объектов, дефектоскопия, охрана труда, карты, интерфейсы.

1 место Kimi K2.69.01

Текст · топ-8

Взвешенный балл 0–10, нормированный по категориям

#МодельБалл
1GPT-5.6 Sol (medium)9.04
2GPT-5.6 Sol (low)8.87
3GPT-5.5 (medium)8.85
4GPT-5.6 Luna (high)8.84
5GPT-5.6 Terra (high)8.77
6GPT-5.5 (low)8.76
7GPT-5.6 Terra (medium)8.74
8GPT-5.6 Terra (low)8.62

Зрение · топ-8

Взвешенный балл 0–10, нормированный по способностям

#МодельБалл
1Kimi K2.69.01
2GPT-5.6 Sol (medium)8.99
3GPT-5.5 (medium)8.95
4GPT-5.6 Sol (low)8.94
5GPT-5.5 (low)8.89
6GPT-5.6 Terra (medium)8.86
7Qwen3.6-35B-A3B-FP88.84
8Qwen3.6-27B-FP88.77

Только открытые веса

Модели, которые можно развернуть у себя, без топовых проприетарных GPT-5.5 / GPT-5.6. Полные списки; балл и метод те же.

Текст

12 моделей с открытыми весами

#МодельРазмерБалл
1DeepSeek v4-flash-0731284B / 13B8.56
2DeepSeek v4-pro1.6T / 49B8.49
3MiniMax-M3428B / 23B8.39
4Kimi K2.61T / 32B8.33
5DeepSeek v4-flash (до 0731)284B / 13B8.19
6Qwen3.6-27B-FP827B8.16
7Gemma-4-31B31B8.00
8Qwen3.6-35B-A3B-FP835B / 3B7.85
9gpt-oss-120b120B / 5B7.34
10DiffusionGemma26B / 4B6.08
11Nemotron-3-Nano-Omni-30B30B / 3B4.57
12Nemotron-3-Super-120B120B / 12B4.36

Зрение

8 моделей с открытыми весами

#МодельРазмерБалл
1Kimi K2.61T / 32B9.01
2Qwen3.6-35B-A3B-FP835B / 3B8.84
3Qwen3.6-27B-FP827B8.77
4Gemma-4-31B31B8.46
5DiffusionGemma26B / 4B8.20
6MiniMax-M3428B / 23B8.10
7Llama-4-Scout-17B109B / 17B7.53
8Nemotron-3-Nano-Omni-30B30B / 3B6.80

Размер — всего параметров; для MoE-моделей «всего / активных на токен».

Как читать. Судья — Claude Opus, единым методом для всех моделей: один агент на задачу видит эталон и ответы всех участников сразу. Разница меньше 0.15 балла — шум, а не превосходство. Задачи и эталоны открыты, поэтому со временем они попадут в обучающие выборки — датируйте выводы. Подробности методологии и оговорки — в README.