Inférence
Exécution d'un modèle déjà entraîné
Inférence, qu'est-ce que c'est ?
L'inférence est le fait d'utiliser un modèle déjà entraîné pour produire une réponse, par opposition à l'entraînement qui l'a construit. C'est l'opération que votre entreprise réalise des milliers de fois par jour, et la seule qui compte pour dimensionner une installation. Entraîner coûte très cher et se fait une fois ; inférer coûte peu et se fait en permanence.
Aussi appelé : exécution, appel au modèle.
Inférence : qu'est-ce que ça change pour une PME ?
La confusion entre les deux fait renoncer beaucoup d'entreprises à tort. On entend « il faut des fermes de calcul pour faire de l'IA » : c'est vrai pour entraîner un modèle depuis zéro, ce que personne ne vous demande de faire. Faire tourner un modèle déjà entraîné tient sur une machine que vous pouvez acheter, amortir et poser dans votre local technique.
Comment nous traitons Inférence
Nous dimensionnons l'installation sur votre charge réelle : nombre d'utilisateurs, volume de documents, temps de réponse acceptable. Selon le cas, cela va d'un serveur existant à une machine dédiée avec carte graphique, chez vous ou opérée par nous en France.
À retenir
- Entraîner et exécuter sont deux opérations sans commune mesure de coût
- Vous n'entraînez pas de modèle, vous en exécutez un
- Le dimensionnement dépend des usages simultanés, pas du volume de données stocké
- Une machine achetée s'amortit, là où un abonnement par utilisateur court sans fin