Предсказателни модели за футболни залози: xG, Поасон и какво печели на дистанция

Аналитична работна станция за футболни модели

Защо моделирането е по-малко вълнуващо, отколкото изглежда

Когато преди девет години прочетох първата си статия за Поасон-разпределение в футбола, си помислих „това променя всичко“. Не променяше. Поасон беше използваем инструмент, но недостатъчен. След това опитах bivariate Poisson, който отчита корелация между двата отбора. По-добре. След това xG-базирани модели, които отчитат качеството на ударите, не само броя голове. Още по-добре. След това машинно обучение с десетки променливи. Малко по-добре, но не драстично. Всяко стъпало в моделирането даде маргинална подобрение, не революция. Това е истината за предсказателните модели във футбола — има реална стойност, но е по-скучна и по-малка, отколкото маркетингът на анализаторски услуги внушава.

Реалистичен поглед към предсказателните модели

Тази статия е за играчи, които искат да разберат основните типове модели, силни и слаби страни на всеки, и какво реално може да очаквам от тях.

xG като основа

Expected Goals (xG) е базата на почти всички съвременни предсказателни модели във футбола. Концепцията е елементарна: всеки удар се оценява според вероятността да стане гол, и тази вероятност (между 0 и 1) се натрупва за целия мач. xG на отбор за мача е сборът от xG на всичките им удари.

xG като основа на предсказателни модели

Защо xG е по-добро от голевете? Защото голевете имат огромна вариация. Един мач с три гола може да е резултат на изключително слаб удар (0,02 xG, късмет) или мощен удар на празна врата (0,90 xG, очаквано). xG разграничава тези две ситуации, докато броят голове ги тълкува еднакво.

За предсказателни цели, xG на скорошните мачове е по-добър предиктор за бъдещи голове от самия брой голове. Изследвания показват, че в извадки от 10+ мача xG значително над-надъхва на голевете-като-предиктор. Конкретно — около 10% от ударите се превръщат в гол на средно ниво. Това е базова статистика, но прецизните xG модели разделят ударите на класове (опит за глава, удар от близо, далечен удар, с асистенция) и присвояват различни вероятности на всеки клас.

Изследванията показват, че 8 от 10 топ-предиктивни модела в спорт-беттинг индустрията използват xG като централна променлива. Това е стандартът. Модел, който не включва xG, е технически назад с минимум 5-10 години.

Подробно за xG като статистическа концепция и как се чете, разглеждам в xG (Expected Goals) обяснено.

Поасон и bivariate Poisson

Поасон-разпределение е класическият статистически инструмент за моделиране на брой голове. Идеята: ако знам средната скорост на голове за единица време (или за мач), Поасон-разпределение ми дава вероятността за всеки конкретен брой голове.

Поасоново разпределение за брой голове във футбол

За футболен мач имам средно 1,4 гола на домакин и 1,1 гола на гост. Поасон-разпределение ми дава вероятностите: 22% за 0 гола, 32% за 1 гол, 23% за 2 гола, 11% за 3 гола, и т.н. От тези вероятности мога да изчисля имплицитна вероятност за 1Х2, тотал, BTTS, точен резултат.

Основен недостатък на простия Поасон — той приема, че двата отбора отбелязват независимо един от друг. Това не е вярно. Резултатът на единия отбор влияе на тактиката на другия (например, отбор който води 2-0 в края на мача обикновено играе отбранително, което намалява вероятността за повече голове и за двата отбора).

Bivariate Poisson разширява модела, включвайки корелация между двата отбора. Това дава по-точни оценки на резултатите с ниски голове (0-0, 1-0, 1-1) и резултати с повече голове. Дава измерима подобрение в точността на оценките на точен резултат и тотал.

Поасон-семейството модели има свои ограничения. Те приемат, че всеки удар е независим от другите, което не е напълно вярно (моментум, психология). Те приемат стабилна скорост на голове през целия мач, което също не е напълно вярно (отборите атакуват по-агресивно в края на близки мачове). Тези ограничения намаляват точността на модела с няколко процента, но базовата му стойност остава.

Машинно обучение и алтернативни подходи

Последните 5-7 години видяха значителен ръст на машинното обучение в предсказателните модели. Random Forest, Gradient Boosting (XGBoost, LightGBM), и невронни мрежи са най-използваните подходи.

Машинно обучение за прогнозиране на футболни мачове

Тези модели имат предимството да отчитат огромно количество променливи едновременно — стотици статистики за двата отбора, формата, контузии, погода, реферa, ниво на мотивация (изчислено от контекста на първенството). Това позволява по-богато моделиране, отколкото класическите статистически подходи.

Има обаче и недостатъци. Първи — overfitting. Модел с твърде много променливи на ограничена извадка може да „запомни“ историческите данни без да генерализира към бъдещи мачове. Това е изключително често явление в любителските предсказателни модели.

Втори — интерпретируемост. Поасон ми казва „защо“ мач има конкретна оценка — заради средните стойности. Невронна мрежа просто дава число, без обяснение. Това затруднява валидирането и подобряването.

Трети — изискване за качество на данните. ML моделите изискват огромни обеми чисти данни. На по-малки лиги (като ефбет Лига) данните често не са достатъчни за стабилен ML модел.

В моята практика използвам хибриден подход — xG като основа, bivariate Poisson за оценка на разпределения, ML за корекции на специфични фактори (контузии, специфични мачове). Това дава баланс между интерпретируемост и точност.

Оценка на модели

Когато имам модел, как разбирам дали работи? Това е сложен въпрос, и грешките тук са много често срещани.

Оценка на модели чрез Brier score и log loss

Първи показател — точност на класификация. Колко често моделът дава правилния изход (1, Х или 2) като най-вероятен? Това звучи добро, но е подвеждащо. На пазар с фаворит 70% вероятност, модел който винаги предсказва фаворит ще има 70% „точност“ — без реален предиктивен интелект.

Втори показател — log loss (или негативен логаритмен loss). Тази метрика наказва не само грешни предсказания, но и свръх-уверени грешни предсказания. Модел който дава 99% вероятност за изход, който не се случва, получава много по-голяма наказателна стойност от модел който дава 60%. Това е по-стриктна и по-полезна метрика.

Трети показател — Brier score. Подобен на log loss, но с различна математика. И двата работят добре за сравнение на модели.

Andreas Krannich, EVP Integrity Services на Sportradar, описа подхода на компанията в FIFA партньорство, март 2026: „Our integrity services are designed to address risk in a joined-up way, combining bet monitoring through our AI-powered Universal Fraud Detection System — built in-house using more than 20 years of historical data — with rapid reporting from betting operators, alongside comprehensive education and prevention programs.“ Това е пример как индустриалните модели се изграждат — с десетки години историчесчни данни и непрекъсната оценка.

За частен играч, постигането на такова ниво на качество е невъзможно. Но използването на същите принципи — дълга история, стриктна оценка, непрекъсната калибрация — е достъпно. Реалистично, домашен модел с тези принципи може да достигне ROI 2-6% на дистанция от хиляди залози. Sportradar има над 300 оператор-партньори и интегрални услуги за ФИФА, УЕФА, АТП, НБА — индустриалните стандарти определят минималното ниво на конкуренцията.

Често задавани въпроси

Колко мача са нужни за валидиране на модел?

Минимум 500 за първа индикация, 1000-2000 за надеждна оценка, 5000+ за статистическа сигурност. По-малко от 500 мача — резултатът е почти изцяло вариация, не сигнал. Това е една от причините новите модели често ‘изглеждат’ добри в първите 100-200 мача — случайна вариация дава илюзия за работещ модел. Реалното валидиране изисква време и търпение.

Защо машинното обучение не винаги бие Поасон?

Заради overfitting и качество на данните. ML модели с много променливи могат да запомнят историческите шум вместо да научат истинските връзки. На ограничени извадки (по-малки лиги, нови турнири) ML често дава по-слаби резултати от прости Поасон-базирани модели. Поасон е по-консервативен, но и по-стабилен. ML работи добре само с огромни, чисти данни.

Каква е разликата между Brier score и log loss?

И двете са метрики за качество на вероятностни модели — наказват не само грешни предсказания, но и свръх-уверени грешки. Log loss е математически свързан с теорията на информацията и широко използван в машинно обучение. Brier score е по-прост за интерпретация (стойности 0-1, по-ниско е по-добре). На практика двете обикновено дават еднакво подреждане на модели.

Изготвено от редакцията на „Футбол Залози”.