
Чемпионат мира по футболу — событие всегда особенное. Помимо просмотра хочется спрогнозировать расклады, пообсуждать возможного победителя. Благо обсудить есть с кем. Смотреть ЧМ начинают все подряд, даже те, кто в другое время матча-то ни одного не видел полностью. Они и состав участников не то чтобы знают хорошо, но пару-тройку команд со знакомыми фамилиями найдут, а среди них — и главного фаворита. А я футбола всегда смотрю много. И, в общем, тоже чрезвычайно люблю потеоретизировать и чего-нибудь иногда угадать.
Почти перед открытием турнира, дня за три, обнаружилась любопытная идея. Устроить ставочный конкурс, в котором, кроме меня, поучаствует еще и ИИ в лице нескольких моделей. Везде они сейчас сверкают — почему бы и сюда не притянуть. Тем более дело-то занимательное — эдакий бенчмарк в реальном времени. Данные из тренировочной выборки не сильно помогут. Что-то в духе эксперимента, где модели криптой торговали.
Времени на какую-то особенную подготовку почти не оставалось. Недалеко оттягивая, я выбрал из доступных на тот момент LLM несколько на свой вкус и попросил агента накодить мне удобный инструментарий. Пара итераций — и все было готово. Я составил набор правил, по которому будет проводиться эксперимент. Процесс пошел!
Правила
Итак, вот небольшой список условий и ограничений, для порядка:
- Ставим на фантики, естественно. Денег никому не даем.
- 104 матча. На каждый обязательно должна быть сделана ставка.
- Размер ставки фиксированный: 100 условных единиц на каждое событие. Никакого управления банком.
- Модели не знают, что они участвуют в соревновании. Нет турнирного соблазна рисковать или осторожничать.
- Запрос, он же промпт, у всех моделей и всех событий одинаковый. Он определен еще до старта эксперимента и не меняется.
- Модели не видят ставки друг друга. Историю своих ставок — тоже.
- У всех есть доступ к поиску самой свежей и актуальной информации. Никакой изоляции на обучающей выборке.
- Коэффициенты для каждой ставки фиксировались в одно время и брались у одного заранее определенного букмекера.
- Нельзя искать более выгодные варианты у других букмекеров.
- Ставки на конкретное событие делаются всеми в одно время, чтобы избежать различий в потенциально доступной информации для анализа.
- Ставка должна извлекать максимальный +EV(ожидаемую прибыль). Задача не в том, чтобы угадать победителя, а в том, чтобы определить событие, вероятность которого, по мнению модели, выше той, что заложена в букмекерском коэффициенте. Математически именно это должно давать прибыль на дистанции.
Оговорюсь, что я как организатор и человек, конечно, выбивался за рамки. Знал о своем участии в турнире, раскладах по ходу, всех сделанных ставках и т.д. Играл, короче, не совсем по правилам.
Наблюдения
Уже после первых дней в глаза бросился главный недостаток человеческих, то бишь моих, действий при принятии решений. Это, конечно, азарт.
Выигрыш заставляет поверить в собственную удачу, в ее неисчерпаемость. Хочется действовать рискованнее — все равно ж везет. Да и вообще, это я просто лучше всех все знаю и анализирую. К тому же результату приводит и проигрыш. Только мотивация уже другая. Хочется отыграться, а для этого придется выбрать коэффициент покрупнее. Серия одинаковых исходов эффект только усиливает.
Не то чтобы это все было откровением, но статистика его подтвердила.
Модели же действовали куда хладнокровнее. Часто они прямо сообщали, что во всей букмекерской линии нет даже одной потенциально прибыльной ставки и матч лучше пропустить. Это противоречило правилам, так что выбор делался в пользу события с самым щадящим -EV, т.е. уйти надо было с минимальными потерями.
Еще одной неожиданной проблемой для меня стало желание сделать эффектный выбор. Это я уже ближе к концу понял. Казалось бы, соревнуюсь с набором железок — кого тут впечатлять-то? Ан нет. В голове даже иногда проскакивало - "Вот сделала ты, модель, ставку на этот исход. Там коэффициент около 1.5. Да, скорее всего, это верняк. Ну выиграет эта ставка. И чего?".
Результаты
А вот чего.
| # | Модель | Выиграл | Проиграл | Возврат | Процент побед | Средний коэффициент | Прибыль | ROI |
|---|---|---|---|---|---|---|---|---|
| 🥇 | Gemini Flash 3.5 | 60 | 41 | 3 | 57.7% | 1.93 | +1381 | +13.3% |
| 🥈 | MiniMax M3 | 65 | 39 | 0 | 62.5% | 1.84 | +1155 | +11.1% |
| 🥉 | Grok 4.3 | 58 | 46 | 0 | 55.8% | 2.05 | +693 | +6.7% |
| 4 | GPT 5.5 | 60 | 44 | 0 | 57.7% | 1.89 | +662 | +6.4% |
| 5 | GLM 5.1 | 57 | 47 | 0 | 54.8% | 1.80 | −435 | −4.2% |
| 6 | Claude Opus 4.8 | 48 | 56 | 0 | 46.2% | 2.05 | −1038 | −10.0% |
| 7 | Qwen 3.7 Plus | 46 | 58 | 0 | 44.2% | 1.92 | −2284 | −22.0% |
| 8 | Human body | 37 | 67 | 0 | 35.6% | 2.45 | −2334 | −22.4% |
Модели меня вынесли в одну калитку. Уверенное последнее место. Зато чемпион по среднему коэффициенту. Эффектно, ничего не скажешь.
Тройка медалистов получилась совсем неожиданной. Хотя это как посмотреть.
Первое место уверенно заняла Gemini Flash 3.5. Она вышла в лидеры после 47-го матча (из 104) и с тех пор никто так и не смог ее сместить. По итогам турнира прибыль составила чуть больше 13 процентов. А ведь считается, что на дистанции все, что выше пяти процентов, — это уже высший пилотаж. Абсолютное большинство игроков всегда улетает в глубокий минус.
На втором очутилась MiniMax M3. Открытие турнира, не иначе. У этой модели на финише даже появился шанс побороться за чемпионство, но не вышло. Тем интереснее, что после группового этапа ЧМ (а это 72 матча) у MiniMax был нулевой ROI. Всю свою прибыль она собрала только на этапе плей-офф — за последние 32 матча.
Третью медаль забрал Grok 4.3. По ходу турнира модель побывала на первых двух местах, но удержаться не смогла, хотя долго цеплялась.
Четвертое место досталось последней модели с положительной прибылью - GPT 5.5.
Все остальные в минусе. Причем состав верхней и нижней четверки сформировался после 59-го матча и остался неизменным до самого конца турнира. Разница в классе.
Разочарованием для меня снова стал Claude Opus 4.8. Не должна настолько дорогая модель показывать откровенно слабые результаты. Особенно на фоне остальных.
Про GLM 5.1 и Qwen 3.7 Plus сказать особо нечего. Их результаты можно назвать ожидаемыми.
Можно сделать поверхностный вывод, что лучший результат показали модели, выпущенные компаниями, у которых уже есть сильные поисковые системы и доступ к большому объему свежих данных. Из этого ряда выбивается только MiniMax. У них какой-то свой секрет.
Анализируем
После турнира я скормил все данные ИИ-агенту и попросил поискать закономерности, которые не видны в обычной итоговой таблице. Некоторые находки показались мне действительно любопытными.
GPT одновременно лучший и худший
Удивил GPT 5.5. Если разбить результаты по рынкам, выясняется почти абсурдная вещь.
| Рынок | Результат GPT 5.5 |
|---|---|
| TOTAL | +1349 |
| AH (азиатские форы) | −1044 |
На тоталах модель была лучшей во всем турнире. На азиатских форах — худшей. Она очень уверенно умела делать одно и настолько же уверенно ошибалась в другом.
Claude за тоталитаризм
| Модель | Ставки на TOTAL | Рынков | Уникальных выборов |
|---|---|---|---|
| Claude Opus 4.8 | 77.9% | 5 | 12 |
| Gemini Flash 3.5 | 54.8% | 6 | 41 |
| MiniMax M3 | 57.7% | 7 | 29 |
| Human | 48.1% | 8 | 45 |
Claude делал почти четыре ставки из пяти на рынке тоталов и за весь чемпионат использовал всего 12 различных выборов — меньше всех. Для сравнения, у меня их было 45. Забавно, что ни тот, ни другой подход в итоге не сработал.
Gemini стабильнее MiniMax
| Модель | Группы | Плей-офф | Итог |
|---|---|---|---|
| Gemini Flash 3.5 | +759 | +622 | +1381 |
| MiniMax M3 | −1 | +1156 | +1155 |
Это, пожалуй, самая красивая таблица всей аналитики.
Gemini практически выиграла турнир еще на групповом этапе. После первых 72 матчей она заработала +759 у.е., тогда как MiniMax стоял практически на нуле. Да, MiniMax очень много собрал в плей-офф, но этого не хватило для победы. Gemini просто продолжала держать свой уровень до самого финала.
И еще
Я думал, что модели будут отличаться буквально на пару процентов точности. В реальности же они оказались совсем разными.
Одна почти всегда искала тоталы. Другая охотилась за ничьими. Третья блестяще понимала тоталы, но проваливалась на форах. Четвертая почти весь плюс заработала в плей-офф.
У каждой постепенно появляется собственный стиль принятия решений. И иногда этот стиль оказывается важнее, чем разница в качестве самой модели.
Если хотите покопаться в деталях, вся статистика и цифры доступны здесь.
А дальше
Проект мне очень понравился. Еще до его завершения успел собраться целый список идей: что можно доработать, каких проблем избежать, что попробовать изменить.
Надеюсь, что не заброшу эту штуку. Хочется допилить сбор информации, поиграться с правилами, попробовать другие модели, турниры и, возможно, виды спорта.
Следите за развитием на сайте.