Édition 2026 Talk Security, Sovereignty & Cost Control

Les leviers FinOps IA qui font vraiment baisser votre facture de LLMs

Langue FR

Speaker

Noé Achache

Noé Achache

CTO & Co-founder at Weflayr

Description

Depuis le début de la vague GenAI, l'industrie a optimisé une seule chose : l'usage. Livrer vite, passer à l'échelle à l'aveugle, et laisser à quelqu'un d'autre le soin de s'occuper de la facture. Eh bien, la facture est arrivée. À mesure que les fonctionnalités IA sont passées de la démo à la production et que l'adoption a décollé, la dépense en tokens est devenue une vraie ligne budgétaire, et les équipes découvrent que leurs coûts d'IA augmentent parfois plus vite que la valeur qu'ils produisent. Et comme la plupart des fournisseurs vendent encore l'inférence à perte, la pression ne fera que croître à mesure qu'ils s'approchent de leur introduction en bourse et ne pourront plus se permettre de subventionner vos charges de travail. En bref : le coût n'est plus un problème d'avenir.

Ce talk est un tour d'horizon pratique de la boîte à outils de réduction des coûts. Les techniques à base de règles (rtk, par exemple) qui fonctionnaient bien pour les agents de code ne se transposent pas à la plupart des autres applications, mais il existe d'autres leviers sur lesquels agir. Certains sont plus accessibles, comme l'optimisation du cache de prompts (nous verrons que les fournisseurs l'implémentent différemment, et pourquoi il vaut mieux mesurer le comportement du cache que faire confiance au procédé), ou le réexamen du choix de modèle par benchmark automatisé et routage sémantique : un modèle plus petit peut se révéler tout aussi performant sur une tâche précise, et la nouvelle génération de modèles à poids ouverts (venus pour l'essentiel de Chine), conçus pour l'efficacité de l'inférence, offre aujourd'hui de très bonnes performances pour une fraction du coût. D'autres demandent plus d'investissement, comme le fine-tuning pour les charges répétitives.
Enfin, nous explorerons l'avenir de l'optimisation avec des techniques émergentes comme l'éviction de tokens, qui permet de ne donner au modèle que ce dont il a besoin sans casser vos caches.

Vous repartirez avec une carte mentale du paysage des coûts de l'IA et des leviers concrets à actionner.