Édition 2026 Talk Evals & Observability

Why Ship an AI You Can't Measure? Building an LLM Judge You Can Actually Trust, at the Scale of Millions of Products

Langue EN · FR

Speakers

Adrien Morvan

Adrien Morvan

AI Engineering Manager

Oussama Taki Amrani

Oussama Taki Amrani

AI Engineer

Description

Une IA en production sans mesure de performance, c'est un pari, pas un produit. Chez Mirakl, notre Catalog Transformer convertit chaque jour des catalogues vendeurs bruts en fiches produits prêtes pour les marketplaces: plus de 60 millions de produits traités. Mais comment savoir si le résultat est bon, quand il n'existe souvent pas de réponse unique, seulement des réponses défendables ?

Ce talk raconte comment nous avons construit un panel de LLM judges qui évalue notre système en continu, sur du trafic de production réel, pour un coût maîtrisé et prévisible. Et surtout, pourquoi le juge n'était pas le plus dur : lors de notre première campagne d'annotation, nous, les experts, n'étions unanimes que sur 51 % des cas.

Au programme : un sampling adaptatif par hashing de GTIN qui rend le score reproductible et le budget borné ; un système de labels qui distingue vraies erreurs et ambiguïtés défendables ; la construction d'un golden set et la calibration IA/humain ; et une boucle d'itération du prompt sans régression. Des recettes réutilisables pour évaluer n'importe quel système IA confronté au monde réel, où « correct » n'est jamais binaire.