You are currently viewing Le trading appliqué au turf : le marché des paris hippiques (PMU) (Partie 3/3)
  • Auteur/autrice de la publication :
  • Post category:Bourse
  • Temps de lecture :32 min de lecture

Le trading appliqué au turf : le marché des paris hippiques (PMU) (Partie 3/3)

Dans la Partie 1 de cette série, j’ai posé le décor du marché PMU, avec les pools séparés, le rake, les acteurs, l’online / offline et la formation des cotes. Dans la Partie 2, j’ai testé une approche de prédiction pure sur le plat, avec un modèle qui estime une probabilité, que je compare ensuite à celle pricée par le marché (baseline favori placé, puis modèle type Bill Benter (1994)).

Dans cet article, faisant partie de la même série, j’abandonne cette logique. Le marché est resté, au global, plus pertinent que le modèle. À partir du constat de la Partie 2, et surtout de l’analyse de segmentation (confiance, enjeux, nombre de partants), l’objectif est de s’ouvrir à d’autres disciplines et de formaliser le problème autrement, en cartographiant la densité de ROI en fonction de la structure de la course, discipline par discipline, et en testant un arbitrage relatif entre pools (gagnant vs placé).

Dans une première partie, je rappelle le constat de la Partie 2 et je pose deux hypothèses (effet de structure ; arbitrage gagnant / placé). Dans une deuxième partie, je formalise l’effet de structure, avec le modèle (critères, densités bayésiennes, heatmaps), un backtest filtré par densité, puis les résultats discipline par discipline. Dans une troisième partie, je spécifie l’arbitrage de pool, le modèle, puis son backtest. Dans une quatrième partie, je discute limites et risques. Dans une cinquième, j’esquisse des améliorations. Je conclus la série.

Sommaire

1. Objectifs

A. Constat précédent

Dans la Partie 2, la stratégie de prédiction pure consistait à faire produire à un modèle une probabilité (victoire ou place), puis à la comparer à celle mesurée (pricée) par le marché, afin de n’intervenir que lorsqu’un écart semblait favorable. Au global, le marché est resté plus pertinent que le modèle. L’information déjà contenue dans les cotes battait, après rake et frictions, ce que le fondamental (même combiné via \((\alpha,\beta)\)) apportait en incrément.

Le constat opérationnel est donc clair. Il n’est pas intéressant d’attaquer le marché de front, prétendre « mieux prédire » que les cotes pour battre le favori placé sur l’univers entier. En revanche, il reste pertinent d’utiliser l’information déjà présente dans les cotes (confiance implicite, liquidité, structure du peloton) et de chercher des régimes où cette information se traduit par un edge conditionnel, plutôt qu’un edge universel.

L’analyse de segmentation Simple Placé de la Partie 2 a aussi montré que :

  • le ROI varie fortement selon la structure de la course, même lorsque le modèle reste le même ;
  • ce pattern est partagé par les baselines et par le modèle type Benter ;
  • trois leviers concentrent l’essentiel de la variabilité : enjeux, confiance, nombre de partants.

B. Hypothèses

i. Effet de structure

À partir du constat précédent, je ne cherche plus à affiner le même classifieur sur le seul plat. Je distingue deux hypothèses. La première suppose que le choix de la discipline a un effet sur la performance conditionnelle du ROI, via la structure de la course, notamment le nombre de participants, la confiance calculée (ou pricée) par le marché, la liquidité (enjeux), et éventuellement d’autres régimes de peloton. Autrement dit, certaines disciplines seraient plus sensibles au nombre de partants, d’autres au régime de confiance ou à la masse mise. L’objectif est de cartographier cette densité de ROI discipline par discipline, heatmaps nombre de partants et confiance, pour isoler des zones où le pattern est stable, plutôt que de chercher un alpha de ranking universel.

ii. Arbitrage

La seconde hypothèse est qu’il existe une inefficience relative entre la cote du simple gagnant et celle du simple placé. Les deux pools sont distincts. Les flux, le rake et le comportement de la foule n’y sont pas les mêmes. Dans certains cas, la cote simple placé recalculée à partir des cotes simple gagnant (via une transformation type Harville / discount) peut diverger de la cote placé observée sur le marché, offrant alors un edge positif lorsque je joue l’écart, sans prétendre prédire mieux le classement que le marché lui-même.

2. Effet de structure

A. Le modèle

i. Trois critères déterminants

Au travers des backtests et de l’analyse de la Partie 2, trois facteurs ressortent comme les plus déterminants sur la variabilité du ROI :

  1. La confiance du modèle (max proba sur la course) ;
  2. Les enjeux (masse Simple Gagnant, liquidité / attractivité du marché) ;
  3. Le nombre de partants \(N\).

Dans la suite de cette section, je me focalise sur ce trio. Pour chaque discipline, je mesure le ROI conditionnellement à la confiance et au nombre de partants, sous forme de matrices type heatmap. Les enjeux restent un critère de filtre / lecture parallèle (quartiles de liquidité), mais la carte principale visualisée ici est le plan \((N, \text{confiance})\).

ii. Densité empirique et lissage bayésien

L’objectif n’est pas de tracer un ROI brut case par case. Une case avec un ROI exceptionnel mais peu d’échantillon (peu de courses, peu d’euros misés) fausse la lecture. Je construis donc une densité de rendement :

  1. Je découpe le plan en bins, selon le nombre de partants (de 5 à 17+) et la confiance maximale (pas de 0,05) ;
  2. Dans chaque case, j’agrège le profit \(P\) et l’investissement \(I\) (Simple Gagnant, Simple Placé, Couplé Gagnant), densité, non cumul ;
  3. J’applique un lissage spatial gaussien (voisinage, \(\sigma = 1\)) sur \(P\) et \(I\) ;
  4. Je régularise ensuite par un shrinkage bayésien vers le yield global de la grille.

Formellement, soit \(P^{\mathrm{s}}\) et \(I^{\mathrm{s}}\) les matrices de profit et d’investissement après lissage spatial, \(\bar{y} = \sum P / \sum I\) le yield moyen global, \(C\) une constante de régularisation (ici \(C = 10\) euros d’équivalent), et \(Y_{\mathrm{bayes}}\) le yield bayésien (en pourcentage). Ce yield est représenté dans la formule (1).

\[ Y_{\mathrm{bayes}} = 100 \times \frac{P^{\mathrm{s}} + C\,\bar{y}}{I^{\mathrm{s}} + C}. \tag{1} \]

La constante \(C\) pénalise les zones à faible volume. Plus une case a peu d’investissement lissé, plus son yield est tiré vers la moyenne globale. Les cases dont l’investissement lissé reste trop faible (\(I^{\mathrm{s}} \le 10\)) sont masquées (affichées vides). Ce score bayésien évite de surpondérer des événements rares, par exemple une course au fort ROI mais presque sans historique dans le même bin.

iii. Exemple

Pour voir concrètement l’intérêt du shrinkage, prenons un yield global de la grille \(\bar{y} = -5\,\%\) et une constante \(C = 10\) (euros d’équivalent).

Cas A, case bien peuplée, avec un profit \(P = +50\) et un investissement \(I = 1000\). Le yield brut vaut \(+5\,\%\). Soit \(Y\) le yield régularisé de la case. Après régularisation bayésienne, il est représenté dans la formule (2).

\[ Y = 100 \times \frac{50 + 10\times(-0{,}05)}{1000 + 10} \approx +4{,}9\,\%. \tag{2} \]

Le score bouge à peine. L’échantillon est assez grand pour faire confiance à la case.

Cas B, case quasi vide, avec \(P = +20\) et \(I = 10\). Le yield brut explose à \(+200\,\%\). Soit \(Y\) le yield régularisé de la case. Après régularisation, il est représenté dans la formule (3).

\[ Y = 100 \times \frac{20 + 10\times(-0{,}05)}{10 + 10} = +97{,}5\,\%. \tag{3} \]

La valeur reste haute, mais elle est clairement ramenée vers la moyenne. Avec encore moins d’investissement, le tirage vers \(\bar{y}\) serait plus fort.

Sans ce lissage, une heatmap mettrait en avant des mirages (une ou deux courses chanceuses dans un bin rare). Avec, je lis surtout les régimes où le signal survit au volume.

iv. Une heatmap par discipline

Pour chaque discipline (plat, attelé, monté, haie, steeple-chase), je produis la même figure, avec trois matrices empilées (une colonne, trois lignes), Simple Gagnant, Simple Placé, Couplé Gagnant, sur le plan nombre de partants et confiance maximale, et le yield lissé bayésien en couleur (vert = positif, rouge = négatif).

Ces cartes sont agrégées sur toute la période. Elles ne visualisent pas le comportement temporel. Autrement dit, on peut rester plat pendant longtemps, puis gagner beaucoup sur la dernière année par chance. Cette concentration de gains récents peut biaiser la densité de ROI calculée, même après lissage bayésien. La lecture qui suit décrit donc une structure moyenne, pas une trajectoire stable année après année.

La Figure 1 représente la densité de ROI lissé (bayésien) pour la discipline plat, avec trois matrices empilées (Simple Gagnant, Simple Placé, Couplé Gagnant) sur le plan nombre de partants et confiance maximale.

Figure 1 : Densité de ROI lissé (bayésien), discipline plat, entre décembre 2015 et août 2026. De haut en bas : Simple Gagnant, Simple Placé, Couplé Gagnant. Axes : nombre de partants et confiance maximale. Source : pmu.fr.

Figure 1 : Densité de ROI lissé (bayésien), discipline plat, entre décembre 2015 et août 2026. De haut en bas : Simple Gagnant, Simple Placé, Couplé Gagnant. Axes : nombre de partants et confiance maximale. Source : pmu.fr.

Sur le plat, plus le nombre de partants est faible, meilleures sont les performances, comme constaté dans la Partie 2, section 4.E (Analyse). En effet, plus l’effectif est réduit, plus l’incertitude l’est aussi. De plus, un cheval très bon coincé dans la mêlée peut ne jamais avoir l’opportunité de sortir dans la dernière ligne droite, faute de passage, parce que trop de partants l’encerclent. Une confiance élevée reste un gage de performance, cohérent avec la sagesse des foules déjà présente dans les cotes. Le Couplé Gagnant, lui, reste massivement négatif sur presque toute la carte. La structure du plat (ligne droite finale, risque d’enfermement) favorise les simples en petit lot, pas l’exotique.

La Figure 2 représente la même densité de ROI lissé pour la discipline attelé.

Figure 2 : Densité de ROI lissé (bayésien), discipline attelé, entre décembre 2015 et août 2026. De haut en bas : Simple Gagnant, Simple Placé, Couplé Gagnant. Source : pmu.fr.

Figure 2 : Densité de ROI lissé (bayésien), discipline attelé, entre décembre 2015 et août 2026. De haut en bas : Simple Gagnant, Simple Placé, Couplé Gagnant. Source : pmu.fr.

En attelé, le schéma s’inverse. Plus le nombre de partants est élevé, meilleures sont les performances, en particulier pour le Simple Placé. La structure de course n’est plus celle du plat. Le peloton court en file, l’allure est contrainte, et un outsider qui prend le large est plus difficile à rattraper pour les autres. Ce régime de « poursuite » change la carte des niches. On observe aussi une forme d’anomalie sur le Couplé Gagnant, avec des zones très vertes sur une large partie du plan. Là encore, la carte est agrégée. Elle ne dit pas si le signal est régulier dans le temps ou concentré sur une sous-période.

La Figure 3 représente la même densité de ROI lissé pour la discipline monté.

Figure 3 : Densité de ROI lissé (bayésien), discipline monté, entre décembre 2015 et août 2026. De haut en bas : Simple Gagnant, Simple Placé, Couplé Gagnant. Source : pmu.fr.

Figure 3 : Densité de ROI lissé (bayésien), discipline monté, entre décembre 2015 et août 2026. De haut en bas : Simple Gagnant, Simple Placé, Couplé Gagnant. Source : pmu.fr.

Le monté reste du trot, avec les mêmes contraintes d’allure et le même risque de disqualification, mais sous la selle. La carte se rapproche davantage de l’attelé que du plat. Les zones positives du Simple Gagnant et du Couplé Gagnant se concentrent souvent vers des effectifs plus fournis, là où le marché laisse davantage d’espace de cote. Le Simple Placé est plus ambivalent, avec des poches négatives au milieu du plan. La structure (file, poursuite, bruit d’allure) explique pourquoi le petit lot n’y est pas le refuge qu’il était sur le plat.

La Figure 4 représente la même densité de ROI lissé pour la discipline haie.

Figure 4 : Densité de ROI lissé (bayésien), discipline haie, entre décembre 2015 et août 2026. De haut en bas : Simple Gagnant, Simple Placé, Couplé Gagnant. Source : pmu.fr.

Figure 4 : Densité de ROI lissé (bayésien), discipline haie, entre décembre 2015 et août 2026. De haut en bas : Simple Gagnant, Simple Placé, Couplé Gagnant. Source : pmu.fr.

En haie, on retrouve un profil plus proche du plat. Les meilleures zones du Simple Gagnant apparaissent surtout en petit effectif et à confiance moyenne à élevée. Moins de partants, c’est moins de collisions au passage des obstacles et une lecture plus nette du classement. Le Simple Placé reste plus plat, proche de zéro. Le Couplé Gagnant est plus volatil, avec des poches isolées. Le bruit d’événement (faute, refus, chute) reste présent, mais il se dilue moins bien quand le lot est large.

La Figure 5 représente la même densité de ROI lissé pour la discipline steeple-chase.

Figure 5 : Densité de ROI lissé (bayésien), discipline steeple-chase, entre décembre 2015 et août 2026. De haut en bas : Simple Gagnant, Simple Placé, Couplé Gagnant. Source : pmu.fr.

Figure 5 : Densité de ROI lissé (bayésien), discipline steeple-chase, entre décembre 2015 et août 2026. De haut en bas : Simple Gagnant, Simple Placé, Couplé Gagnant. Source : pmu.fr.

Le steeple-chase prolonge la logique des obstacles, avec un bruit d’événement encore plus fort (oxers, rivières, chutes). Comme en haie, les zones favorables du Simple Gagnant et du Couplé Gagnant se situent plutôt en petit lot et à confiance intermédiaire. Le Simple Placé reste plus proche de l’équilibre. La structure de la course (parcours long, fatigabilité, risque de sortie) rend l’effectif réduit plus lisible. Un peloton large multiplie les scénarios d’élimination qui brouillent le signal de cote.

La lecture croisée de ces cartes vise à vérifier l’hypothèse d’un effet de structure par discipline. Les zones vertes / rouges ne se superposent pas d’un code à l’autre. Le plat et les obstacles privilégient souvent le petit effectif. L’attelé (et en partie le monté) inversent le schéma. Rappelons toutefois que ces densités n’affichent pas la trajectoire temporelle. Un régime vert peut cacher une longue période plate suivie d’un cluster de gains récents. C’est précisément ce que le backtest suivant confronte, via un gate de densité puis une stratégie filtrée discipline par discipline.

B. Backtest

Pour introduire la notion temporelle, je vais réaliser des backtests de stratégies basés sur les modèles construits par densité empirique et lissage bayésien juste avant. La période out-of-sample est distincte de celle utilisée pour calibrer le gate de densité sur les heatmaps.

Les métriques retenues sont le ROT, le max drawdown, le pourcentage de courses jouées, la contribution par discipline, ainsi que la séparation online / offline.

Le sizing reste en mise plate, au montant minimum autorisé par le PMU selon le type de pari et le canal. Pour le simple placé, c’est en général 1 € en ligne et 1,50 € hors ligne (comparabilité avec la Partie 2). Enfin, je compare explicitement à la baseline favori placé de la Partie 2.

Pour chaque discipline, je présente quatre graphiques. D’abord le PnL cumulé online et offline (Simple Gagnant, Simple Placé, Couplé Gagnant, et tous types agrégés), puis le nombre de paris par mois online et offline.

La stratégie est le modèle density (gate bayésien nombre de partants et confiance, mise plate). Le filtre d’entrée reprend le seuil d’espérance de la Partie 2. Je ne mise que si \(\hat{p} \times \text{cote} \ge EV_{\min}\), avec \(EV_{\min} = 1\). C’est le seuil d’équilibre du critère de Kelly. Dès que \(p\,C < 1\), la fraction optimale est non positive et le ticket est refusé. Le sizing reste toutefois en mise plate. Je n’active pas ici le demi-Kelly (\(f = \tfrac{1}{2} f^{\star}\)), afin d’isoler l’effet du gate de densité sans confondre avec un effet de taille de position. Lorsque les cotes placé (ou exotiques) manquent côté PMU, elles sont reconstruites via Harville discounté (estimateur type Benter, \(\gamma \approx 0{,}81\)), et non via un Harville pur.

C. Résultats

i. Plat

La Figure 6 montre le PnL cumulé de l’effet de structure en plat online (Simple Gagnant, Simple Placé, Couplé Gagnant, tous types), sur l’univers filtré par densité de yield.

Figure 6 : Effet de structure, PnL cumulé plat online (Simple Gagnant, Simple Placé, Couplé Gagnant, tous types), mise plate, univers filtré par densité de yield, entre décembre 2015 et août 2026. Les barres verticales en pointillés marquent les limites des folds walk-forward. Source : pmu.fr.

Figure 6 : Effet de structure, PnL cumulé plat online (Simple Gagnant, Simple Placé, Couplé Gagnant, tous types), mise plate, univers filtré par densité de yield, entre décembre 2015 et août 2026. Les barres verticales en pointillés marquent les limites des folds walk-forward. Source : pmu.fr.

La Figure 7 montre le même PnL cumulé en plat offline.

Figure 7 : Effet de structure, PnL cumulé plat offline (Simple Gagnant, Simple Placé, Couplé Gagnant, tous types), entre décembre 2015 et août 2026. Les barres verticales en pointillés marquent les limites des folds walk-forward. Source : pmu.fr.

Figure 7 : Effet de structure, PnL cumulé plat offline (Simple Gagnant, Simple Placé, Couplé Gagnant, tous types), entre décembre 2015 et août 2026. Les barres verticales en pointillés marquent les limites des folds walk-forward. Source : pmu.fr.

La Figure 8 présente le nombre de paris par mois en plat online.

Figure 8 : Effet de structure, nombre de paris par mois plat online, entre décembre 2015 et août 2026. Les barres verticales en pointillés marquent les limites des folds walk-forward. Source : pmu.fr.

Figure 8 : Effet de structure, nombre de paris par mois plat online, entre décembre 2015 et août 2026. Les barres verticales en pointillés marquent les limites des folds walk-forward. Source : pmu.fr.

La Figure 9 présente le nombre de paris par mois en plat offline.

Figure 9 : Effet de structure, nombre de paris par mois plat offline, entre décembre 2015 et août 2026. Les barres verticales en pointillés marquent les limites des folds walk-forward. Source : pmu.fr.

Figure 9 : Effet de structure, nombre de paris par mois plat offline, entre décembre 2015 et août 2026. Les barres verticales en pointillés marquent les limites des folds walk-forward. Source : pmu.fr.

Sur le plat, le backtest temporel ne confirme pas la promesse des zones vertes de la heatmap. Sur les données online, le Simple Placé tire l’agrégat vers le bas, le Couplé Gagnant n’est presque jamais joué, et le Simple Gagnant ne remonte qu’en fin de période sur un volume trop mince. Sur les données offline, la dérive est franchement négative sur toutes les formules. Le volume mensuel reste faible. Le gate de densité filtre bien, mais ce qui passe ne suffit pas à produire un edge durable sur cette discipline.

ii. Attelé

La Figure 10 montre le PnL cumulé de l’effet de structure en attelé online.

Figure 10 : Effet de structure, PnL cumulé attelé online (Simple Gagnant, Simple Placé, Couplé Gagnant, tous types), entre décembre 2015 et août 2026. Les barres verticales en pointillés marquent les limites des folds walk-forward. Source : pmu.fr.

Figure 10 : Effet de structure, PnL cumulé attelé online (Simple Gagnant, Simple Placé, Couplé Gagnant, tous types), entre décembre 2015 et août 2026. Les barres verticales en pointillés marquent les limites des folds walk-forward. Source : pmu.fr.

La Figure 11 montre le PnL cumulé en attelé offline.

Figure 11 : Effet de structure, PnL cumulé attelé offline, entre décembre 2015 et août 2026. Les barres verticales en pointillés marquent les limites des folds walk-forward. Source : pmu.fr.

Figure 11 : Effet de structure, PnL cumulé attelé offline, entre décembre 2015 et août 2026. Les barres verticales en pointillés marquent les limites des folds walk-forward. Source : pmu.fr.

La Figure 12 présente le nombre de paris par mois en attelé online.

Figure 12 : Effet de structure, nombre de paris par mois attelé online, entre décembre 2015 et août 2026. Les barres verticales en pointillés marquent les limites des folds walk-forward. Source : pmu.fr.

Figure 12 : Effet de structure, nombre de paris par mois attelé online, entre décembre 2015 et août 2026. Les barres verticales en pointillés marquent les limites des folds walk-forward. Source : pmu.fr.

La Figure 13 présente le nombre de paris par mois en attelé offline.

Figure 13 : Effet de structure, nombre de paris par mois attelé offline, entre décembre 2015 et août 2026. Les barres verticales en pointillés marquent les limites des folds walk-forward. Source : pmu.fr.

Figure 13 : Effet de structure, nombre de paris par mois attelé offline, entre décembre 2015 et août 2026. Les barres verticales en pointillés marquent les limites des folds walk-forward. Source : pmu.fr.

L’attelé est la discipline où l’effet de structure se lit le plus clairement dans le temps. Sur les données online, le bilan agrégé reste légèrement négatif. Le Simple Placé domine le volume et finit sous l’eau, tandis que Simple Gagnant et Couplé Gagnant n’apportent que des gains ponctuels sur très peu de tickets. Sur les données offline, en revanche, la courbe « tous types » finit nettement positive, tirée surtout par le Couplé Gagnant et le Simple Gagnant. Attention toutefois. Une longue phase quasi plate précède une accélération tardive. Le signal existe, mais une partie du PnL final est concentrée en fin de période.

iii. Monté

La Figure 14 montre le PnL cumulé de l’effet de structure en monté online.

Figure 14 : Effet de structure, PnL cumulé monté online, entre décembre 2015 et août 2026. Les barres verticales en pointillés marquent les limites des folds walk-forward. Source : pmu.fr.

Figure 14 : Effet de structure, PnL cumulé monté online, entre décembre 2015 et août 2026. Les barres verticales en pointillés marquent les limites des folds walk-forward. Source : pmu.fr.

La Figure 15 montre le PnL cumulé en monté offline.

Figure 15 : Effet de structure, PnL cumulé monté offline, entre décembre 2015 et août 2026. Les barres verticales en pointillés marquent les limites des folds walk-forward. Source : pmu.fr.

Figure 15 : Effet de structure, PnL cumulé monté offline, entre décembre 2015 et août 2026. Les barres verticales en pointillés marquent les limites des folds walk-forward. Source : pmu.fr.

La Figure 16 présente le nombre de paris par mois en monté online.

Figure 16 : Effet de structure, nombre de paris par mois monté online, entre décembre 2015 et août 2026. Les barres verticales en pointillés marquent les limites des folds walk-forward. Source : pmu.fr.

Figure 16 : Effet de structure, nombre de paris par mois monté online, entre décembre 2015 et août 2026. Les barres verticales en pointillés marquent les limites des folds walk-forward. Source : pmu.fr.

La Figure 17 présente le nombre de paris par mois en monté offline.

Figure 17 : Effet de structure, nombre de paris par mois monté offline, entre décembre 2015 et août 2026. Les barres verticales en pointillés marquent les limites des folds walk-forward. Source : pmu.fr.

Figure 17 : Effet de structure, nombre de paris par mois monté offline, entre décembre 2015 et août 2026. Les barres verticales en pointillés marquent les limites des folds walk-forward. Source : pmu.fr.

En monté, le volume est plus faible qu’en attelé. Sur les données online, le PnL agrégé finit à peine positif, porté surtout par le Simple Placé, avec un Couplé quasi absent et un Simple Gagnant légèrement négatif. Sur les données offline, le bilan « tous types » est positif mais modeste, avec une trajectoire irrégulière et des gains qui s’accélèrent surtout après 2021. Le schéma rappelle l’attelé plus que le plat, sans offrir le même ordre de grandeur de PnL.

iv. Haie

La Figure 18 montre le PnL cumulé de l’effet de structure en haie online.

Figure 18 : Effet de structure, PnL cumulé haie online, entre décembre 2015 et août 2026. Les barres verticales en pointillés marquent les limites des folds walk-forward. Source : pmu.fr.

Figure 18 : Effet de structure, PnL cumulé haie online, entre décembre 2015 et août 2026. Les barres verticales en pointillés marquent les limites des folds walk-forward. Source : pmu.fr.

La Figure 19 montre le PnL cumulé en haie offline.

Figure 19 : Effet de structure, PnL cumulé haie offline, entre décembre 2015 et août 2026. Les barres verticales en pointillés marquent les limites des folds walk-forward. Source : pmu.fr.

Figure 19 : Effet de structure, PnL cumulé haie offline, entre décembre 2015 et août 2026. Les barres verticales en pointillés marquent les limites des folds walk-forward. Source : pmu.fr.

La Figure 20 présente le nombre de paris par mois en haie online.

Figure 20 : Effet de structure, nombre de paris par mois haie online, entre décembre 2015 et août 2026. Les barres verticales en pointillés marquent les limites des folds walk-forward. Source : pmu.fr.

Figure 20 : Effet de structure, nombre de paris par mois haie online, entre décembre 2015 et août 2026. Les barres verticales en pointillés marquent les limites des folds walk-forward. Source : pmu.fr.

La Figure 21 présente le nombre de paris par mois en haie offline.

Figure 21 : Effet de structure, nombre de paris par mois haie offline, entre décembre 2015 et août 2026. Les barres verticales en pointillés marquent les limites des folds walk-forward. Source : pmu.fr.

Figure 21 : Effet de structure, nombre de paris par mois haie offline, entre décembre 2015 et août 2026. Les barres verticales en pointillés marquent les limites des folds walk-forward. Source : pmu.fr.

En haie, l’échantillon est mince. Sur les données online, le PnL reste proche de zéro, avec très peu de tickets hors Simple Placé. Sur les données offline, l’agrégat finit légèrement positif, mais après une longue phase sous l’eau et sur des montants modestes. Le bruit d’obstacle et le faible turnover empêchent de conclure à un edge robuste. On voit surtout une niche fragile, pas une stratégie scalable.

v. Steeple-chase

La Figure 22 montre le PnL cumulé de l’effet de structure en steeple-chase online.

Figure 22 : Effet de structure, PnL cumulé steeple-chase online, entre décembre 2015 et août 2026. Les barres verticales en pointillés marquent les limites des folds walk-forward. Source : pmu.fr.

Figure 22 : Effet de structure, PnL cumulé steeple-chase online, entre décembre 2015 et août 2026. Les barres verticales en pointillés marquent les limites des folds walk-forward. Source : pmu.fr.

La Figure 23 montre le PnL cumulé en steeple-chase offline.

Figure 23 : Effet de structure, PnL cumulé steeple-chase offline, entre décembre 2015 et août 2026. Les barres verticales en pointillés marquent les limites des folds walk-forward. Source : pmu.fr.

Figure 23 : Effet de structure, PnL cumulé steeple-chase offline, entre décembre 2015 et août 2026. Les barres verticales en pointillés marquent les limites des folds walk-forward. Source : pmu.fr.

La Figure 24 présente le nombre de paris par mois en steeple-chase online.

Figure 24 : Effet de structure, nombre de paris par mois steeple-chase online, entre décembre 2015 et août 2026. Les barres verticales en pointillés marquent les limites des folds walk-forward. Source : pmu.fr.

Figure 24 : Effet de structure, nombre de paris par mois steeple-chase online, entre décembre 2015 et août 2026. Les barres verticales en pointillés marquent les limites des folds walk-forward. Source : pmu.fr.

La Figure 25 présente le nombre de paris par mois en steeple-chase offline.

Figure 25 : Effet de structure, nombre de paris par mois steeple-chase offline, entre décembre 2015 et août 2026. Les barres verticales en pointillés marquent les limites des folds walk-forward. Source : pmu.fr.

Figure 25 : Effet de structure, nombre de paris par mois steeple-chase offline, entre décembre 2015 et août 2026. Les barres verticales en pointillés marquent les limites des folds walk-forward. Source : pmu.fr.

Le steeple-chase ressemble à la haie, avec encore moins de volume. Sur les données online, l’agrégat reste négatif sur un échantillon trop petit pour être décisif. Sur les données offline, le PnL « tous types » finit légèrement positif, mais sans trajectoire régulière ni masse de tickets suffisante. Le bruit d’événement (chutes, refus, parcours long) domine. Ce n’est pas un terrain où l’effet de structure, seul, se transforme en edge exploitable au sens « retail ».

D. Synthèse

Le Tableau 1 présente la synthèse des résultats du backtest d’effet de structure, discipline par discipline et formule par formule, en séparant les canaux online et offline.

DisciplineType de pariROT onlineROT offlinePnL onlinePnL offline
PlatSimple Gagnant+36,1 %−15,2 %+11 €−1 372 €
Simple Placé−3,1 %−7,9 %−94 €−661 €
Couplé Gagnantn.d.−32,3 %0 €−1 803 €
Tous types−2,7 %−16,7 %−83 €−3 836 €
AtteléSimple Gagnant+108,3 %+13,1 %+7 €+1 564 €
Simple Placé−1,2 %+2,5 %−101 €+541 €
Couplé Gagnant+422,0 %+23,5 %+11 €+2 276 €
Tous types−1,0 %+10,1 %−84 €+4 381 €
MontéSimple Gagnant−100,0 %+9,4 %−4 €+145 €
Simple Placé+1,2 %+2,8 %+8 €+60 €
Couplé Gagnant0,0 %+13,8 %0 €+157 €
Tous types+0,6 %+7,5 %+4 €+363 €
HaieSimple Gagnantn.d.+6,4 %0 €+84 €
Simple Placé−0,1 %−2,1 %−0 €−25 €
Couplé Gagnantn.d.+12,5 %0 €+101 €
Tous types−0,1 %+4,9 %−0 €+160 €
Steeple-chaseSimple Gagnantn.d.+7,7 %0 €+66 €
Simple Placé−3,3 %−0,5 %−7 €−4 €
Couplé Gagnantn.d.+9,5 %0 €+43 €
Tous types−3,3 %+5,1 %−7 €+106 €

Tableau 1 : Synthèse des résultats, effet de structure (mise plate, gate density), par discipline et type de pari. « Tous types » = somme Simple Gagnant + Simple Placé + Couplé Gagnant. La mention « n.d. » indique une absence de mise (ROT non défini).

Le constat d’ensemble est contrasté. Sur le plat, l’agrégat reste négatif sur les données online comme offline. Les ROT spectaculaires du Simple Gagnant sur les données online reposent sur trop peu d’euros pour compter. Sur les données offline en attelé, le bilan « tous types » est le seul vrai point positif du tableau (+10 % de ROT, plusieurs milliers d’euros de PnL), tiré surtout par le Couplé Gagnant et le Simple Gagnant. Sur les données online, même l’attelé reste légèrement sous l’eau. Monté, haie et steeple-chase affichent des signes positifs sur les données offline, mais sur des volumes trop faibles pour parler d’edge scalable. Autrement dit, la stratégie density met en évidence des niches de structure, surtout en trot attelé hors ligne. Elle ne suffit pas, telle quelle, à justifier une exploitation « retail » robuste sur l’ensemble des disciplines et des canaux. L’intérêt n’est donc pas de scaler ce filtre de densité partout, mais de le traiter comme un filtre de régimes, à croiser ensuite avec un autre angle, notamment l’arbitrage de pool comme abordé dans la prochaine partie.

3. Arbitrage

A. Le modèle

i. Idée générale

Plusieurs déclinaisons restent possibles, à trancher selon ce que les Figures 1, 5 et le backtest de structure montrent. Je peux viser une relative value online vs offline sur le même cheval ou la même formule lorsque les masses séparées divergent au-delà d’un seuil ; une relative value gagnant vs placé, en détectant des incohérences de prix entre les deux pools pour un même peloton (au-delà de Harville / discount) ; ou encore des paires / paniers dans une zone \((N, \text{confiance})\), en surexposant un sous-ensemble de chevaux sous-cotés relativement à un benchmark de marché, sans prétendre au ranking parfait style Benter.

Dans tous les cas, le PnL vise un écart de prix relatifs, pas un tipster. L’hypothèse centrale reste celle de la section 1.B.ii, à savoir une inefficience mesurable entre cote simple gagnant et cote simple placé.

ii. Règles d’entrée / sortie

Le cadre à figer avant backtest combine un univers éventuellement filtré par densité de structure (et par quartile d’enjeux), un signal de spread relatif gagnant / placé (ou online / offline) au-delà d’un seuil, éventuellement conditionné à une zone verte stable sur la heatmap, et une taille de mise d’abord en mise plate (minimum PMU selon formule et canal, soit ~1 € simple placé online et ~1,50 € offline, pour rester comparable à la Partie 2 et au backtest de structure), puis éventuellement une fraction de Kelly bornée avec plafond de market impact. L’horizon s’arrête au départ ; j’exclus les courses à liquidité trop faible, les non-partants de dernière minute et les données manquantes.

iii. Contraintes opérationnelles

Comme rappelé dans la Partie 1 et la Partie 2, l’arbitrage de pool ne se joue pas dans un monde sans friction. Plusieurs contraintes opérationnelles s’imposent à un quant « retail ».

  • Le late money continue de faire bouger les cotes jusqu’à la clôture. Une inefficience visible à un instant donné peut disparaître avant que la mise soit réellement enregistrée.
  • Il n’existe pas d’API d’exécution « retail » directement branchée sur les serveurs centraux. L’exécution passe par l’interface grand public, avec ses délais et ses limites.
  • Les rapports sont tronqués. Un backtest trop « propre » surestime souvent ce que le pool paie réellement.
  • La latence, réseau comme humaine, crée un écart entre la cote signal et la cote obtenue. Cet écart n’est pas un détail. Il peut manger tout l’edge.

Le backtest d’arbitrage devra donc intégrer au minimum ces gardes-fous.

  • Un délai d’exécution conservateur, pour ne pas simuler une réactivité irréaliste.
  • Un scénario où la cote obtenue diffère de la cote signal.
  • Des frais et un TRJ réalistes par pool, afin de rester comparable à la microstructure réelle du marché.

B. Backtest

J’évalue la stratégie d’arbitrage avec le même format graphique que le backtest d’effet de structure, soit quatre graphiques (PnL et nombre de paris, online puis offline), en superposant Simple Placé et Couplé Gagnant. La période out-of-sample est distincte de celle utilisée pour calibrer les seuils de spread ; un walk-forward sur ces seuils reste possible si nécessaire. Les métriques couvrent le ROT, le max drawdown, le pourcentage de courses jouées et la contribution par formule / canal. Le sizing reste en mise plate (minimum PMU selon formule et canal). Je compare explicitement au backtest d’effet de structure (section 2.B) et à la baseline favori placé de la Partie 2.

C. Résultats

La Figure 26 montre le PnL cumulé de l’arbitrage de pool en online (Simple Placé, Couplé Gagnant).

Figure 26 : Arbitrage de pool, PnL cumulé online (Simple Placé, Couplé Gagnant), mise plate, entre décembre 2015 et août 2026. Les barres verticales en pointillés marquent les limites des folds walk-forward. Source : pmu.fr.

Figure 26 : Arbitrage de pool, PnL cumulé online (Simple Placé, Couplé Gagnant), mise plate, entre décembre 2015 et août 2026. Les barres verticales en pointillés marquent les limites des folds walk-forward. Source : pmu.fr.

La Figure 27 montre le PnL cumulé de l’arbitrage de pool en offline.

Figure 27 : Arbitrage de pool, PnL cumulé offline (Simple Placé, Couplé Gagnant), mise plate, entre décembre 2015 et août 2026. Les barres verticales en pointillés marquent les limites des folds walk-forward. Source : pmu.fr.

Figure 27 : Arbitrage de pool, PnL cumulé offline (Simple Placé, Couplé Gagnant), mise plate, entre décembre 2015 et août 2026. Les barres verticales en pointillés marquent les limites des folds walk-forward. Source : pmu.fr.

La Figure 28 présente le nombre de paris par mois de l’arbitrage en online.

Figure 28 : Arbitrage de pool, nombre de paris par mois online (Simple Placé, Couplé Gagnant), entre décembre 2015 et août 2026. Les barres verticales en pointillés marquent les limites des folds walk-forward. Source : pmu.fr.

Figure 28 : Arbitrage de pool, nombre de paris par mois online (Simple Placé, Couplé Gagnant), entre décembre 2015 et août 2026. Les barres verticales en pointillés marquent les limites des folds walk-forward. Source : pmu.fr.

La Figure 29 présente le nombre de paris par mois de l’arbitrage en offline.

Figure 29 : Arbitrage de pool, nombre de paris par mois offline (Simple Placé, Couplé Gagnant), entre décembre 2015 et août 2026. Les barres verticales en pointillés marquent les limites des folds walk-forward. Source : pmu.fr.

Figure 29 : Arbitrage de pool, nombre de paris par mois offline (Simple Placé, Couplé Gagnant), entre décembre 2015 et août 2026. Les barres verticales en pointillés marquent les limites des folds walk-forward. Source : pmu.fr.

Sur les données online, le Simple Placé finit à peine positif, sur un volume très mince, tandis que le Couplé Gagnant n’est jamais joué. Sur les données offline, les deux formules dérivent nettement sous l’eau, avec un Couplé Gagnant qui concentre l’essentiel des pertes. Le rythme mensuel des tickets reste plus élevé hors ligne, mais sans inverser le signe du PnL. Dans l’ensemble, l’arbitrage de pool tel que testé ici ne produit pas de trajectoire exploitable. Le signal de spread ne survit pas aux frictions du canal offline, et le canal online manque de masse.

D. Synthèse

Le Tableau 2 présente la synthèse des résultats du backtest d’arbitrage de pool, pour le Simple Placé et le Couplé Gagnant, en séparant les canaux online et offline.

MétriqueSimple PlacéCouplé Gagnant
OnlineOfflineOnlineOffline
ROT+4,6 %−11,0 %n.d.−31,3 %
PnL cumulé+5 €−482 €0 €−2 336 €
Volume misé104 €4 392 €0 €7 462 €
Nombre de tickets872 73004 634

Tableau 2 : Synthèse des résultats, arbitrage de pool (plat, mise plate, \(EV_{\min} = 1\)), Simple Placé et Couplé Gagnant. « n.d. » : absence de mise online en Couplé Gagnant sur cette période.

Le tableau confirme la lecture des courbes. Sur les données online, le Simple Placé affiche un ROT positif (+4,6 %), mais sur seulement 104 € misés et 87 tickets. Ce n’est pas un edge scalable. Le Couplé Gagnant online n’est pas joué. Sur les données offline, le Simple Placé perd (−11 % de ROT) et le Couplé Gagnant s’effondre (−31 % de ROT, plus de 2 300 € de PnL négatif). Autrement dit, l’arbitrage relatif gagnant / placé, dans ce protocole, n’est pas intéressant à exploiter tel quel. Il ne bat ni le backtest d’effet de structure sur ses niches, ni une logique de sizing prudent face au rake.

4. Limites et risques

A. Surfitting de régimes

Découper l’univers par nombre de partants et par confiance crée vite des tiroirs trop fins. Une case verte sur une heatmap peut reposer sur un volume trop faible pour être robuste hors échantillon. Le lissage bayésien atténue ce risque en tirant les yields extrêmes vers la moyenne, mais il ne le supprime pas. Plus je multiplie les filtres, plus je risque de sélectionner le hasard plutôt qu’une structure stable.

B. Non-stationnarité

Le marché PMU n’est pas figé. La séparation des masses online / offline, la régulation, le comportement de la foule et la liquidité évoluent d’une année à l’autre. Un régime profitable sur 2016-2019 peut disparaître ensuite. Les courbes de PnL de la section 2 montrent d’ailleurs souvent de longues phases plates avant une accélération tardive. Ce n’est pas une preuve de stationnarité.

C. Exécution

Un backtest propre peut rester inexécutable pour un parieur « retail ». Il n’y a pas d’API d’exécution grand public, le late money déplace les cotes jusqu’au départ, et la latence humaine ou technique peut transformer un edge papier en ticket hors prix. Sans contrainte réaliste d’exécution, les résultats restent des bornes optimistes.

D. Risque de modèle

Un écart online / offline, ou gagnant / placé, peut se résorber sans que je puisse « arbitrer » au sens financier strict. Il n’y a pas de short facile sur le pool adverse, ni de convergence garantie avant le départ. L’inefficience relative n’est pas un contrat. C’est une hypothèse empirique, fragile dès que le flux change.

E. Cadre légal

Tout reste borné au cadre des jeux en ligne et du réseau PMU. Les améliorations d’automatisation évoquées plus bas ne justifient aucun contournement réglementaire. L’objectif est de mesurer des frictions réelles, pas de proposer un dispositif hors règles.

5. Améliorations

A. Général

J’introduis déjà un biais méthodologique. Pour le critère de Kelly et le filtre \(EV_{\min}\), j’utilise en pratique la cote finale. Autrement dit, je suppose connaître le prix de clôture au moment de la décision. Ce n’est pas propre au sens strict. En online, toutefois, l’écart peut rester faible si l’entrée est automatisée quelques secondes avant la clôture, par exemple via un script de type Playwright. La cote capturée est alors très proche de la cote finale mesurée. Attention. Cela ne vaut que pour les paris online.

Pour les paris offline, il faudrait être au guichet PMU et valider le ticket plusieurs minutes avant la clôture. C’est beaucoup moins réaliste. Or c’est précisément ce biais d’exécution qui peut expliquer une partie de la surperformance offline visible, par exemple, sur la Figure 15 (monté) et la Figure 19 (haie). Le canal hors ligne paraît plus généreux sur papier, mais il suppose un remplissage que le particulier « retail » ne peut pas reproduire aussi facilement.

Il faut aussi noter que les stratégies qui réussissent sur les données online restent très volatiles, avec de longues périodes de sous-performance. Un ROT final positif ne dit rien sur le chemin. Une bankroll réelle doit survivre à ces creux.

B. Effet de structure

Plusieurs pistes restent ouvertes pour durcir le backtest d’effet de structure. Je peux tester la sensibilité des résultats aux seuils du gate de densité et au paramètre \(C\) du lissage bayésien, retirer les courses à très forte ou très faible liquidité pour isoler l’effet de structure pur, stresser l’hypothèse de remplissage au rapport final, et vérifier la stabilité dans le temps. Une zone verte en plat ne doit surtout pas être extrapolée aveuglément en haie ou en steeple-chase.

C. Arbitrage

Plusieurs tests restent à mener pour durcir le backtest d’arbitrage. Il faut notamment tester la sensibilité aux seuils de spread et au filtre éventuel par densité de structure, stresser l’hypothèse de remplissage au rapport final, simuler un scénario « cote obtenue ≠ cote signal » (latence / late money), et vérifier la stabilité dans le temps avec une séparation claire vis-à-vis de l’edge éventuellement capturé par le seul filtre de structure (section 2).

6. Conclusion

Dans la Partie 1, j’ai d’abord compris le marché. J’y ai distingué le pari mutuel des bookmakers et des exchanges, puis décrit le PMU français. Disciplines, acteurs dont les GPI, masses online et offline, formation des cotes et rake y structurent le terrain de jeu. J’y ai aussi posé le cadre stratégique, avec le late money, les niches et le bruit de la foule.

Dans la Partie 2, j’ai testé la prédiction, sur le plat uniquement. La baseline favori placé (Harville pur puis discounté) a servi de référence. Un modèle type Benter (fondamental, marché et critère de Kelly), puis une variante LambdaRank, ont été évalués en walk-forward. L’analyse de segmentation a ensuite isolé le rôle de la confiance, des enjeux et du nombre de partants.

Dans la Partie 3, j’ai changé de question. J’ai cartographié un effet de structure discipline par discipline, via densités bayésiennes, heatmaps et backtest. J’ai testé un arbitrage relatif entre pools. Enfin, j’ai discuté les limites, les biais d’exécution et les améliorations possibles, sans prétendre battre le marché au ranking.

Alors, un particulier « retail » peut-il gagner de l’argent sur les courses hippiques PMU ? Au global, non de façon robuste et scalable. Le rake, la liquidité, le late money et l’absence d’exécution propre placent la barre très haut. La prédiction pure ne bat pas le marché après frictions. L’arbitrage de pool, tel que testé ici, non plus. L’effet de structure révèle des niches, surtout en attelé hors ligne, mais une partie de cette surperformance offline repose sur une hypothèse de remplissage peu réaliste, et les rares trajectoires online positives restent volatiles, avec de longs creux.

Pour la plupart des parieurs « retail », l’espérance reste négative. Les niches existent. Elles ne sont pas un business plan. Comme sur les marchés financiers, ce sont souvent l’asymétrie d’information et le temps d’exécution qui font la différence pour ceux qui gagnent de l’argent. Sans avantage net sur l’un ou l’autre, le particulier paie surtout le rake.

Laisser un commentaire