Aller au contenu principal
Faire tourner un modèle

Inférence

Exécution d'un modèle déjà entraîné

Inférence, qu'est-ce que c'est ?

L'inférence est le fait d'utiliser un modèle déjà entraîné pour produire une réponse, par opposition à l'entraînement qui l'a construit. C'est l'opération que votre entreprise réalise des milliers de fois par jour, et la seule qui compte pour dimensionner une installation. Entraîner coûte très cher et se fait une fois ; inférer coûte peu et se fait en permanence.

Aussi appelé : exécution, appel au modèle.

Inférence : qu'est-ce que ça change pour une PME ?

La confusion entre les deux fait renoncer beaucoup d'entreprises à tort. On entend « il faut des fermes de calcul pour faire de l'IA » : c'est vrai pour entraîner un modèle depuis zéro, ce que personne ne vous demande de faire. Faire tourner un modèle déjà entraîné tient sur une machine que vous pouvez acheter, amortir et poser dans votre local technique.

Comment nous traitons Inférence

Nous dimensionnons l'installation sur votre charge réelle : nombre d'utilisateurs, volume de documents, temps de réponse acceptable. Selon le cas, cela va d'un serveur existant à une machine dédiée avec carte graphique, chez vous ou opérée par nous en France.

À retenir

Nos services concernés

À lire ensuite

Demander un audit gratuit Tout le glossaire