Как считается

От секунд к шансам

Что стоит за числами и насколько им можно верить

Зачем вероятности

Обычный прогноз говорит: этот пилот быстрее того на 0.14 секунды на круге. Для чтения удобно, но с таким ответом нечего делать: из отставания в секундах не следует, как часто он действительно финиширует впереди.

Здесь эта разница закрыта. Модель отвечает числом: победа 34%, подиум 68%, очки 91%.

Как устроено

Сначала разыгрывается, доедет ли пилот. Вероятность схода берётся из частоты последних сорока гонок. Сходы не независимы: в гонке с завалом их сразу несколько, и это учтено отдельной величиной.

Потом доехавшие расставляются. Каждому считается оценка силы из отставания в темпе и стартовой позиции, к ней добавляется случайная величина, и пилоты сортируются. Всё это повторяется десятки тысяч раз, а доля прогонов и есть вероятность.

Если решётки ещё нет, она тоже разыгрывается. Сначала квалификация, из её исхода берётся решётка, и уже по ней идёт гонка. Неопределённость субботы попадает в воскресенье сама.

Насколько числам можно верить

Главная проверка называется калибровкой: когда модель говорит 30%, событие должно случаться в 30% случаев. Проверка идёт по правилу «только прошлое»: коэффициенты для каждой гонки подобраны на тех, что прошли раньше, и никогда на ней самой.

На 39 гонках, которых модель не видела:

обещано 15%, случилось 15% · обещано 27%, случилось 30% · обещано 41%, случилось 50% · обещано 60%, случилось 76%

Ни одна корзина по победе и подиуму не выходит за доверительный интервал.

Против простых схем

Само по себе совпадение мало значит, если то же самое даёт простое правило. Поэтому модель сравнивается со схемами «ставить на того, кто с поула» и «ставить на самого быстрого». Она выигрывает у обеих: оценка Брайера по победе 0.024 против 0.032 и 0.037.

Важная оговорка: по имени фаворита модель почти всегда совпадает с правилом «поулмен». Её ценность не в том, кого она называет, а в том, насколько уверена: в Монако она даёт 76%, в Сильверстоуне 15%.

Четыре ступени

Прогноз пересчитывается по ходу уик-энда, и на каждой ступени модель знает разное:

Разница между первой и последней ступенью измерена и составляет 0.0155 в логарифмической ошибке. Закрыть её нельзя: до квалификации решётка действительно неизвестна. Но проверка показала, что ранняя ступень честна: она грубее, но не самоувереннее, а значит, ею можно пользоваться.

Чего модель не знает

Дождя, столкновения на первом круге, машины безопасности в неудачный момент, ошибки на пит-стопе. Всё это входит в её числа только как общий шум. Поэтому уверенных значений вроде 95% здесь не бывает даже у явного фаворита. И это не слабость расчёта, а честное отражение того, что гонка решается не только скоростью.

Про ставки

Откалиброванные вероятности: условие необходимое, но не достаточное. Букмекер тоже знает, кто быстр, и его линия учитывает то же самое. Преимущество появляется только там, где расхождение с линией устойчиво и превышает маржу.

Чтобы доказать преимущество в 5% на коэффициенте 3.0, нужно около шести тысяч ставок. В сезоне их набирается несколько десятков.

То есть на одном сезоне отличить умение от везения нельзя в принципе. Это свойство задачи, а не модели.