{"templateName":"base-page-template54","cssClassNames":"page basicpage summit-page","allowedRenditionsWidth":["320","480","640","768","960","1200","1440","1920"],"language":"fr","description":"L’inférence de machine learning exécute un modèle entraîné sur de nouvelles données pour générer des prédictions. Découvrez les différences entre inférence et entraînement, les types par batch, en temps réel et en périphérie, ainsi que les bonnes pratiques pour l’optimiser.","title":"Qu’est-ce que l’inférence de machine learning ? Types et optimisation | Snowflake","analyticsPageType":"homepage","analyticsCategory":"general","analyticsSubCategory":"","excludeFromAnalytics":false,":mappedPath":"/fr/artificial-intelligence/machine-learning/inference/",":type":"snowflake-site/components/structure/page",":items":{"root":{"columnCount":12,"columnClassNames":{"markup_editor_928258845":"aem-GridColumn aem-GridColumn--default--12","experiencefragment-banner":"aem-GridColumn aem-GridColumn--default--12","experiencefragment-header":"aem-GridColumn aem-GridColumn--default--12","responsivegrid":"aem-GridColumn aem-GridColumn--default--12","markup_editor_597730182":"aem-GridColumn aem-GridColumn--default--12","experiencefragment-footer":"aem-GridColumn aem-GridColumn--default--12","experiencefragment":"aem-GridColumn aem-GridColumn--default--12","modal_container":"aem-GridColumn aem-GridColumn--default--12","markup_editor":"aem-GridColumn aem-GridColumn--default--12"},"gridClassNames":"aem-Grid aem-Grid--12 aem-Grid--default--12",":items":{"experiencefragment-banner":{"id":"experiencefragment-b5026a0378","localizedFragmentVariationPath":"/content/experience-fragments/snowflake-site/language-masters/fr/site/pushdown-banner/master/jcr:content","configured":true,":type":"snowflake-site/components/experiencefragment","xfModelPath":"/content/experience-fragments/snowflake-site/language-masters/fr/site/pushdown-banner/master.xfmodel.json?callerPage=/content/snowflake-site/global/fr/artificial-intelligence/machine-learning/inference"},"experiencefragment-header":{"id":"experiencefragment-68430d383e","localizedFragmentVariationPath":"/content/experience-fragments/snowflake-site/language-masters/fr/site/mega-nav-header/master/jcr:content","configured":true,":type":"snowflake-site/components/experiencefragment","xfModelPath":"/content/experience-fragments/snowflake-site/language-masters/fr/site/mega-nav-header/master.xfmodel.json?callerPage=/content/snowflake-site/global/fr/artificial-intelligence/machine-learning/inference"},"responsivegrid":{"columnCount":12,"columnClassNames":{"flexible_column_cont_939100716":"aem-GridColumn aem-GridColumn--default--12","flexible_column_cont":"aem-GridColumn aem-GridColumn--default--12","flexible_column_cont_663228916":"aem-GridColumn aem-GridColumn--default--12","flexible_column_cont_912630531":"aem-GridColumn aem-GridColumn--default--12","flexible_column_cont_1336760939":"aem-GridColumn aem-GridColumn--default--12","flexible_column_cont_1786318617":"aem-GridColumn aem-GridColumn--default--12","flexible_column_cont_1467213961":"aem-GridColumn aem-GridColumn--default--12"},"gridClassNames":"aem-Grid aem-Grid--12 aem-Grid--default--12",":items":{"flexible_column_cont":{"id":"flexible-column-container-9667dd045a","propertiesId":"hub-hero-breadcrumbs","type":"1-column","alignColumns":"top","containerMaxWidth":"extra-large","topPadding":"small","bottomPadding":"none","spaceBetween":"small","reverseOnMobile":false,"carouselOnMobile":false,"propertiesCSSClasses":"page-section","backgroundImageOption":"none","flexible_column_content_container_1":{"layout":"SIMPLE","id":"container-367f208138",":type":"snowflake-site/components/flexible-column-container/flexible-column-content-container",":items":{"breadcrumb":{"id":"breadcrumb-7ec520143b","items":[{"id":"breadcrumb-7ec520143b-item-8fdfff6b6b","link":{"valid":true,"url":"/fr/artificial-intelligence/"},"active":false,"current":false,"title":"Intelligence artificielle",":type":"snowflake-site/components/structure/page","appliedCssClassNames":"summit-page"},{"id":"breadcrumb-7ec520143b-item-93eeea960a","link":{"valid":true,"url":"/fr/artificial-intelligence/machine-learning/"},"active":false,"current":false,"title":"Machine learning",":type":"snowflake-site/components/structure/page","appliedCssClassNames":"summit-page"},{"id":"breadcrumb-7ec520143b-item-a856dee7f1","link":{"valid":true,"url":"/fr/artificial-intelligence/machine-learning/inference/"},"active":true,"current":true,"title":"Inférence",":type":"snowflake-site/components/structure/page","appliedCssClassNames":"summit-page"}],":type":"snowflake-site/components/breadcrumb"}},":itemsOrder":["breadcrumb"]},":type":"snowflake-site/components/flexible-column-container","isBlogPage":false,"isActiveTOC":false,"appliedCssClassNames":"snowflake-flexible-column-container-gray-10-bg"},"flexible_column_cont_939100716":{"id":"flexible-column-container-826f36a415","propertiesId":"hub-hero","type":"2-column-even","alignColumns":"center","containerMaxWidth":"extra-large","topPadding":"extra-small","bottomPadding":"extra-small","spaceBetween":"small","reverseOnMobile":false,"carouselOnMobile":false,"propertiesCSSClasses":"page-section","backgroundImageOption":"none","flexible_column_content_container_1":{"layout":"SIMPLE","id":"container-3350a6c992",":type":"snowflake-site/components/flexible-column-container/flexible-column-content-container",":items":{"title_v2":{"id":"title-v2-88a4ea7c6a","additionalClasses":"hub-hero__headline","type":"heading1","lines":["Inférence de machine learning : comment les modèles entraînés créent de la valeur en production"],":type":"snowflake-site/components/title-v2","appliedCssClassNames":"left-alignment"},"text":{"id":"text-9e5bacc36c","additionalClasses":"hub-hero__subheadline","text":"\u003Cp\u003EL’inférence de machine learning, c’est le moment où les modèles commencent à créer de la valeur en production, en transformant des données récentes en prédictions, scores, classifications, embeddings ou sorties générées exploitables par les systèmes en aval. Mais la fiabilité de l’inférence ne dépend pas uniquement du modèle : les équipes doivent également disposer d’un pipeline de données adapté, d’une architecture d’exécution appropriée, de mécanismes de contrôle des performances et de pratiques de gouvernance efficaces.\u003C/p\u003E","richText":true,":type":"snowflake-site/components/text","appliedCssClassNames":"text-size-regular text-color-text-05"},"container":{"additionalClasses":"hub-hero__authors","layout":"RESPONSIVE_GRID","columnCount":12,"columnClassNames":{"content_chip_copy":"aem-GridColumn aem-GridColumn--default--12","content_chip":"aem-GridColumn aem-GridColumn--default--12"},"gridClassNames":"aem-Grid aem-Grid--12 aem-Grid--default--12","id":"container-259a4d2217",":type":"snowflake-site/components/container",":items":{"content_chip":{"id":"content-chip-02292f2de7","cta":{"id":"cta","showOutboundIcon":false,"linkTargetContentType":"GENERIC",":type":"snowflake-site/components/button","linkType":"SNOWFLAKE_INTERNAL","text":"Lire la biographie"},"image":{"id":"image","height":"800","src":"https://www.snowflake.com/adobe/dynamicmedia/deliver/dm-aid--a7e9fdff-6f08-4edc-9cd1-e213bb234aaa/laurie-macpherson.jpg?quality=85&preferwebp=true","lazyEnabled":true,"alt":"Laurie MacPherson","width":"800",":type":"snowflake-site/components/image"},"headline":{"id":"title","type":"heading5","lines":["Laurie MacPherson","Technical Writer, Snowflake"],":type":"snowflake-site/components/title-v2"},":type":"snowflake-site/components/content-chip"},"content_chip_copy":{"id":"content-chip-5f2ad0a88d","cta":{"id":"cta","showOutboundIcon":false,"linkTargetContentType":"GENERIC",":type":"snowflake-site/components/button","linkType":"SNOWFLAKE_INTERNAL","text":"Lire la biographie"},"image":{"id":"image","height":"709","src":"https://www.snowflake.com/adobe/dynamicmedia/deliver/dm-aid--9ad7a3c0-e23e-4370-bc36-f59a5fe02eff/img-1817.jpg?quality=85&preferwebp=true","lazyEnabled":true,"alt":"David Gaule","width":"709",":type":"snowflake-site/components/image"},"headline":{"id":"title","type":"heading5","lines":["Tracy Kabuya","Contributrice locale, Snowflake"],":type":"snowflake-site/components/title-v2"},":type":"snowflake-site/components/content-chip"}},":itemsOrder":["content_chip","content_chip_copy"],"appliedCssClassNames":"snowflake-responsive-container-inner-padding-small"}},":itemsOrder":["title_v2","text","container"],"appliedCssClassNames":"snowflake-responsive-container-inner-padding-extra-small"},"flexible_column_content_container_2":{"additionalClasses":"hub-hero__video-column","layout":"SIMPLE","id":"container-99780a90c1",":type":"snowflake-site/components/flexible-column-container/flexible-column-content-container",":items":{"youtube":{"id":"embed-a90be8e359","youtubeVideoId":"-HWNc-Hd90U","layout":"responsive","youtubeAspectRatio":"56.25","youtubeAutoPlay":false,"youtubeLoop":false,"youtubeMute":false,"youtubePlaysInline":false,"youtubeRel":false,"embeddableResourceType":"core/wcm/components/embed/v1/embed/embeddable/youtube","type":"EMBEDDABLE",":type":"snowflake-site/components/youtube"}},":itemsOrder":["youtube"]},":type":"snowflake-site/components/flexible-column-container","isBlogPage":false,"isActiveTOC":false,"appliedCssClassNames":"snowflake-flexible-column-container-gray-10-bg"},"flexible_column_cont_1336760939":{"id":"flexible-column-container-572c114f0f","propertiesId":"hub-hero-related-topics","type":"1-column","alignColumns":"top","containerMaxWidth":"extra-large","topPadding":"extra-small","bottomPadding":"medium","spaceBetween":"small","reverseOnMobile":false,"carouselOnMobile":false,"propertiesCSSClasses":"page-section","backgroundImageOption":"none","flexible_column_content_container_1":{"additionalClasses":"related-topics-outer-container border-top","layout":"SIMPLE","id":"container-dc3c7a3fe9",":type":"snowflake-site/components/flexible-column-container/flexible-column-content-container",":items":{"text":{"id":"text-1144e56cb7","additionalClasses":"seo-hub-hero__related-topic-label","text":"\u003Cp\u003ESujets liés au Machine Learning :\u003C/p\u003E\n","richText":true,":type":"snowflake-site/components/text","appliedCssClassNames":"text-size-regular text-color-text-05"},"text_694412536":{"id":"text-da79b98443","additionalClasses":"related-topics","text":"\u003Cul\u003E\n\u003Cli\u003E\u003Ca href=\"https://www.snowflake.com/en/artificial-intelligence/machine-learning/automl/\"\u003EAutoML\u003C/a\u003E\u003C/li\u003E\n\u003Cli\u003E\u003Ca href=\"https://www.snowflake.com/fr/artificial-intelligence/machine-learning/deep-learning/\"\u003EDeep learning\u003C/a\u003E\u003C/li\u003E\n\u003Cli\u003E\u003Ca href=\"https://www.snowflake.com/fr/artificial-intelligence/machine-learning/feature-engineering/\"\u003EFeature engineering\u003C/a\u003E\u003C/li\u003E\n\u003Cli\u003E\u003Ca href=\"https://www.snowflake.com/en/artificial-intelligence/machine-learning/frameworks/\"\u003EFrameworks ML\u003C/a\u003E\u003C/li\u003E\n\u003Cli\u003E\u003Ca href=\"https://www.snowflake.com/en/artificial-intelligence/machine-learning/models/\"\u003EModèles de ML\u003C/a\u003E\u003C/li\u003E\n\u003Cli\u003E\u003Ca href=\"https://www.snowflake.com/fr/artificial-intelligence/machine-learning/mlops/\"\u003EMLOps\u003C/a\u003E\u003C/li\u003E\n\u003Cli\u003E\u003Ca href=\"https://www.snowflake.com/en/artificial-intelligence/machine-learning/neural-network/\"\u003ERéseaux neuronaux\u003C/a\u003E\u003C/li\u003E\n\u003Cli\u003E\u003Ca href=\"https://www.snowflake.com/fr/artificial-intelligence/machine-learning/reinforcement-learning/\"\u003EApprentissage par renforcement\u003C/a\u003E\u003C/li\u003E\n\u003C/ul\u003E\n","richText":true,":type":"snowflake-site/components/text","appliedCssClassNames":"text-size-small"}},":itemsOrder":["text","text_694412536"]},":type":"snowflake-site/components/flexible-column-container","isBlogPage":false,"isActiveTOC":false,"appliedCssClassNames":"snowflake-flexible-column-container-gray-10-bg"},"flexible_column_cont_663228916":{"id":"flexible-column-container-8731f3fb69","propertiesId":"hub-body","type":"2-column-60-40","alignColumns":"top","containerMaxWidth":"extra-large","topPadding":"medium","bottomPadding":"medium","spaceBetween":"small","reverseOnMobile":false,"carouselOnMobile":false,"propertiesCSSClasses":"page-section","backgroundImageOption":"none","flexible_column_content_container_1":{"additionalClasses":"longform-content","layout":"SIMPLE","id":"hub-body-content",":type":"snowflake-site/components/flexible-column-container/flexible-column-content-container",":items":{"callout__0":{"id":"text-6349455865","additionalClasses":"callout callout--general","text":"\u003Cp\u003E\u003Cstrong\u003EDÉFINITION DE L’INFÉRENCE ML\u003C/strong\u003E\u003C/p\u003E\n\u003Cp\u003EL’inférence de machine learning consiste à appliquer un modèle entraîné à des données de production afin de générer une sortie exploitable, par exemple une prédiction, une classification, un score, un embedding, un champ extrait ou une réponse générée.\u003C/p\u003E","richText":true,":type":"snowflake-site/components/text","appliedCssClassNames":"text-size-regular text-color-text-05"},"text__0":{"id":"text-56777ee7c3","text":"\u003Cp\u003ELorsqu’une nouvelle requête atteint une application de production, un modèle de machine learning peut n’avoir que quelques secondes pour évaluer le contexte le plus récent, produire un résultat et le renvoyer au système qui décide de la suite.\u003C/p\u003E\n\u003Cp\u003ECe moment, c’est l’inférence : appliquer un modèle entraîné à des données actualisées pour que l’application puisse agir. En production, l’inférence dépend de tout le parcours d’exécution qui l’entoure. Si un maillon de cette chaîne est défaillant, ralentit ou s’écarte de la logique utilisée lors de l’entraînement, la prédiction risque d’arriver trop tard ou de ne plus être suffisamment en phase avec la réalité pour être utile.\u003C/p\u003E\n\u003Cp\u003ETrace Smith, Senior IA/ML Architect, Applied Field Engineering chez Snowflake, explique pourquoi ce défi de fiabilité ne se résume pas à la vitesse : « Dans les applications de ML en temps réel, comme la détection des fraudes et la maintenance prédictive, la latence et la capacité de mise à l’échelle retiennent l’attention, mais c’est souvent la concordance qui met la production en difficulté. Unifier les transformations, la logique de feature et la mise en production permet d’éviter les écarts entre entraînement et mise en production, et de garder des prédictions fiables à mesure que vous mettez à l’échelle. »\u003C/p\u003E","richText":true,":type":"snowflake-site/components/text","appliedCssClassNames":"text-color-text-05"},"title_what-is-machine-learning-inference":{"id":"title-v2-cb6923aac7","additionalClasses":"anchor-title anchor-title--what-is-machine-learning-inference","type":"heading2","lines":["Qu’est-ce que l’inférence de machine learning ?"],":type":"snowflake-site/components/title-v2"},"text_what-is-machine-learning-inference_0":{"id":"text-03029c83f6","text":"\u003Cp\u003EL’inférence de machine learning consiste à utiliser un modèle entraîné pour générer une sortie à partir de nouvelles données d’entrée inédites. Selon le modèle et la tâche, cette sortie peut être une prédiction, un score de probabilité, une classification, un embedding, une réponse générée ou un champ extrait.\u003C/p\u003E\n\u003Cp\u003EUn pipeline d’inférence se situe généralement entre les données sources et le système de \u003Ca href=\"https://www.snowflake.com/fr/artificial-intelligence/machine-learning/\"\u003Emachine learning\u003C/a\u003E qui consomme le résultat. Il récupère les features requises, transforme l’entrée au format attendu par le modèle, calcule les scores du modèle, convertit la sortie brute en format exploitable et livre cette sortie à une table, une application, un point de terminaison d’inférence ou un processus en aval.\u003C/p\u003E\n\u003Ctable\u003E\u003Cthead\u003E\u003Ctr\u003E\u003Cth\u003EÉtape du pipeline d’inférence\u003C/th\u003E\u003Cth\u003ECe qui se passe\u003C/th\u003E\u003C/tr\u003E\n\u003C/thead\u003E\n\u003Ctbody\u003E\n\u003Ctr\u003E\u003Ctd\u003E\u003Cstrong\u003ERécupération des features\u003C/strong\u003E\u003C/td\u003E\u003Ctd\u003ELe système rassemble les colonnes, fichiers, événements ou features dérivées dont le modèle a besoin\u003C/td\u003E\u003C/tr\u003E\n\u003Ctr\u003E\u003Ctd\u003E\u003Cstrong\u003EPrétraitement des entrées\u003C/strong\u003E\u003C/td\u003E\u003Ctd\u003ELes entrées brutes sont nettoyées, transformées, tokenisées, redimensionnées ou encodées afin de correspondre au format utilisé pendant l’entraînement\u003C/td\u003E\u003C/tr\u003E\n\u003Ctr\u003E\u003Ctd\u003E\u003Cstrong\u003ECalcul des scores du modèle\u003C/strong\u003E\u003C/td\u003E\u003Ctd\u003ELe modèle applique les schémas appris à l’entrée préparée et génère une prédiction, un score, une étiquette, un embedding ou une sortie textuelle\u003C/td\u003E\u003C/tr\u003E\n\u003Ctr\u003E\u003Ctd\u003E\u003Cstrong\u003EPost-traitement de la sortie\u003C/strong\u003E\u003C/td\u003E\u003Ctd\u003ELa sortie brute du modèle est convertie dans un format exploitable, comme une liste classée, un score de confiance, une catégorie business ou une réponse structurée\u003C/td\u003E\u003C/tr\u003E\n\u003Ctr\u003E\u003Ctd\u003E\u003Cstrong\u003ETransmission de la réponse\u003C/strong\u003E\u003C/td\u003E\u003Ctd\u003ELa sortie est écrite dans une table, renvoyée via un point de terminaison, envoyée à une application ou transmise à un autre workflow\u003C/td\u003E\u003C/tr\u003E\n\u003C/tbody\u003E\u003C/table\u003E\n\u003Cp\u003ELa séquence paraît simple, mais le pipeline d’inférence doit préserver les attentes du modèle définies lors de l’entraînement. Par exemple, si une feature est calculée différemment au moment de l’inférence, une même colonne peut représenter un concept business différent de celui utilisé pendant l’entraînement. Ou si le prétraitement est appliqué de façon incohérente, le modèle peut recevoir des valeurs dans un format, à une échelle ou selon une distribution différents de ceux sur lesquels il a appris. En production, l’inférence doit maintenir le pipeline de données environnant suffisamment homogène pour que la sortie reste fiable.\u003C/p\u003E","richText":true,":type":"snowflake-site/components/text","appliedCssClassNames":"text-color-text-05"},"title_inference-vs-training":{"id":"title-v2-43c04c0c85","additionalClasses":"anchor-title anchor-title--inference-vs-training","type":"heading2","lines":["Inférence et entraînement"],":type":"snowflake-site/components/title-v2"},"text_inference-vs-training_0":{"id":"text-40f16dd20f","text":"\u003Cp\u003E\u003Cstrong\u003EL’entraînement\u003C/strong\u003E est la phase où le modèle apprend : il ajuste ses paramètres internes, ou poids, afin de capturer des schémas à partir des données d’entraînement, généralement des données historiques étiquetées pour l’apprentissage supervisé. Il mobilise généralement beaucoup de calcul et s’exécute souvent périodiquement : lorsque de nouvelles données deviennent disponibles, lorsque la performance se dégrade ou lorsque la cible de prédiction change.\u003C/p\u003E\n\u003Cp\u003E\u003Cstrong\u003EL’inférence\u003C/strong\u003E vient ensuite, lorsque le modèle est appliqué à de nouvelles entrées. En production, l’inférence se répète sur des requêtes, des lignes, des événements, des fichiers ou des prompts.\u003C/p\u003E\n\u003Cp\u003ELes exigences d’infrastructure diffèrent fortement entre les deux. L’entraînement est généralement intensif en calcul, mais limité dans le temps : une tâche démarre, peut s’exécuter pendant des heures, puis se termine. L’inférence est continue et sensible à la latence. Dans le cas d’un modèle de détection de fraude, par exemple, la fenêtre entre le lancement d’une transaction et son autorisation peut se mesurer en millisecondes.\u003C/p\u003E\n\u003Cp\u003ELe coût suit une asymétrie similaire. L’entraînement d’un grand modèle peut nécessiter une capacité de calcul importante, mais il s’agit d’une dépense ponctuelle ou périodique. L’inférence s’exécute pendant toute la durée de vie du modèle, souvent à fort volume.\u003C/p\u003E\n\u003Cp\u003EUn modèle performant lors d’une évaluation hors ligne peut tout de même mal fonctionner en production si le pipeline d’inférence fournit des entrées obsolètes, dépasse les budgets de latence ou produit des sorties dans un format que les systèmes en aval ne peuvent pas analyser. La qualité du modèle et la qualité de l’inférence sont liées, mais relèvent de problématiques distinctes.\u003C/p\u003E","richText":true,":type":"snowflake-site/components/text","appliedCssClassNames":"text-color-text-05"},"title_types-of-machine-learning-inference":{"id":"title-v2-7ebb8e19a0","additionalClasses":"anchor-title anchor-title--types-of-machine-learning-inference","type":"heading2","lines":["Types d’inférence de machine learning"],":type":"snowflake-site/components/title-v2"},"text_types-of-machine-learning-inference_0":{"id":"text-5d5e2738a5","text":"\u003Cp\u003ELes principaux types d’inférence de machine learning répondent à des exigences différentes en matière de timing et de déploiement. Pour choisir le type le plus adapté, les équipes doivent tenir compte non seulement de la façon dont le modèle génère une prédiction, mais aussi du moment où la sortie est nécessaire et de l’endroit où le modèle peut s’exécuter.\u003C/p\u003E\n\u003Ch3\u003EInférence par batch\u003C/h3\u003E\n\u003Cp\u003EL’inférence par batch applique un calcul de scores à de nombreux enregistrements à la fois, généralement selon un planning ou dans le cadre d’un pipeline de données défini. Elle est particulièrement utile lorsque les prédictions peuvent être générées avant d’être nécessaires, par exemple pour actualiser des scores clients pendant la nuit, enrichir des données produit avant une mise à jour de catalogue ou générer des prévisions avant le démarrage des workflows de planification.\u003C/p\u003E\n\u003Cp\u003ELes principales exigences portent sur le débit, la fiabilité du traitement et la gestion des sorties. Le système doit être capable de traiter le volume de données attendu, d’achever le traitement dans le délai imparti et de produire les résultats là où les outils d’analyse, les applications ou les équipes opérationnelles en aval pourront les exploiter.\u003C/p\u003E\n\u003Cp\u003EL’inférence par batch convient souvent aux workflows dans lesquels la sortie de prédiction constitue elle-même un actif de données. Il peut être nécessaire de stocker un score d’attrition, une table de recommandations, une prévision de la demande ou le résultat d’une classification de documents, de les associer à d’autres données, puis de les réutiliser dans des processus de reporting, de planification ou des applications métier.\u003C/p\u003E\n\u003Ch3\u003EInférence en temps réel ou en ligne\u003C/h3\u003E\n\u003Cp\u003EL’inférence en temps réel, également appelée inférence en ligne, génère une prédiction en réponse à une requête. Une application envoie une entrée à un point de terminaison d’inférence, le modèle applique un calcul de scores à cette entrée et l’application reçoit une réponse.\u003C/p\u003E\n\u003Cp\u003EL’inférence en ligne est généralement utilisée lorsque la prédiction influence une interaction ou une décision immédiate. Détection de fraude lors de l’autorisation d’un paiement, classement de contenu pendant une session active, prompts de meilleure action suivante dans une conversation en direct : tous ces cas dépendent de prédictions qui doivent arriver avant que l’instant décisif ne soit passé.\u003C/p\u003E\n\u003Cp\u003EL’inférence en temps réel dépend d’une infrastructure de mise en production de modèles capable de maintenir un modèle chargé, d’accepter les requêtes, d’exécuter le calcul des scores et de renvoyer les réponses dans le budget de latence de l’application. Elle doit gérer la latence par requête, la concurrence, le comportement au démarrage à froid et les objectifs de niveau de service, car le système consommateur attend le résultat.\u003C/p\u003E\n\u003Cp\u003ECe type d’inférence met aussi davantage de pression sur la disponibilité des features. Si le modèle dépend du comportement récent des utilisateurs, de l’état des stocks ou du contexte de transaction, le pipeline d’inférence doit disposer d’un chemin fiable pour récupérer ces entrées rapidement et de manière cohérente.\u003C/p\u003E\n\u003Ch3\u003EInférence en flux\u003C/h3\u003E\n\u003Cp\u003EL’inférence en flux applique en continu un calcul de scores aux données, à mesure que les événements arrivent, sans attendre un batch planifié ni une requête synchrone. Le modèle traite un flux d’entrées, comme des relevés de capteurs, des événements de log ou des données de parcours de navigation, et produit des sorties qui alimentent les systèmes en aval en temps quasi réel.\u003C/p\u003E\n\u003Cp\u003EL’inférence en flux intervient souvent au plus près des workflows de supervision opérationnelle, de calcul du score des risques et d’alerte. Le résultat produit par le modèle peut servir à acheminer un événement, à mettre à jour un score, à déclencher une révision ou à enrichir le contexte d’un système en aval qui traite déjà le flux de données. Le pipeline d’inférence en flux doit coordonner le traitement des événements, l’actualisation des features et la transmission des sorties.\u003C/p\u003E\n\u003Ch3\u003EInférence en périphérie\u003C/h3\u003E\n\u003Cp\u003EL’inférence en périphérie exécute le modèle sur un appareil ou un système local, plutôt que dans un environnement centralisé. Ce type d’inférence s’impose lorsque des contraintes de latence, de connectivité, de confidentialité ou de transfert de données rendent l’inférence centralisée peu pratique. L’inférence en périphérie est fréquente dans les environnements où la prédiction doit être produite au plus près de la source des données, par exemple dans des applications mobiles, des capteurs, des véhicules, des caméras ou des systèmes industriels.\u003C/p\u003E\n\u003Cp\u003ELa contrainte, c’est que les environnements en périphérie disposent de capacités limitées en calcul, en mémoire et en alimentation. Les modèles doivent généralement être compressés, via la quantification, l’élagage ou la distillation des connaissances, avant de pouvoir s’exécuter de manière fiable dans les limites de l’appareil.\u003C/p\u003E","richText":true,":type":"snowflake-site/components/text","appliedCssClassNames":"text-color-text-05"},"callout_types-of-machine-learning-inference_0":{"id":"text-90c1908550","additionalClasses":"callout callout--warning","text":"\u003Cp\u003E\u003Cstrong\u003EPIÈGE COURANT\u003C/strong\u003E\u003C/p\u003E\n\u003Cp\u003ELes équipes ne doivent pas partir du principe qu’un modèle performant hors ligne le sera aussi en production. Des entrées obsolètes, une logique de feature incohérente, des problèmes de latence ou des formats de sortie inutilisables peuvent fragiliser l’inférence, même lorsque le modèle lui-même est solide.\u003C/p\u003E","richText":true,":type":"snowflake-site/components/text","appliedCssClassNames":"text-size-regular text-color-text-05"},"title_inference-metrics-to-track-in-production":{"id":"title-v2-11f1005e31","additionalClasses":"anchor-title anchor-title--inference-metrics-to-track-in-production","type":"heading2","lines":["Indicateurs d’inférence à suivre en production"],":type":"snowflake-site/components/title-v2"},"text_inference-metrics-to-track-in-production_0":{"id":"text-59ab374f86","text":"\u003Cp\u003EUne fois le modèle passé en production, les équipes ont besoin d’indicateurs qui décrivent à la fois le comportement du modèle et son comportement à l’exécution. L’exactitude, la précision, le rappel et les autres mesures de qualité d’un modèle sont importantes, mais elles ne permettent pas de déterminer si le pipeline d’inférence respecte son objectif de latence, traite le volume de données requis ou produit des résultats à un coût soutenable.\u003C/p\u003E\n\u003Cp\u003ELes indicateurs à mesurer dépendent du schéma d’inférence. Les traitements par batch mettent généralement l’accent sur le débit, le temps d’exécution et le coût par prédiction. L’inférence en ligne privilégie la latence, le taux d’erreur et le comportement au démarrage à froid. L’inférence LLM ajoute des mesures au niveau des tokens, car la longueur de sortie, la vitesse de génération et la taille du contexte influencent directement la latence comme le coût.\u003C/p\u003E\n\u003Ctable\u003E\u003Cthead\u003E\u003Ctr\u003E\u003Cth\u003EIndicateur\u003C/th\u003E\u003Cth\u003ECe qu’il mesure\u003C/th\u003E\u003Cth\u003EUtilité\u003C/th\u003E\u003C/tr\u003E\n\u003C/thead\u003E\n\u003Ctbody\u003E\n\u003Ctr\u003E\u003Ctd\u003E\u003Cstrong\u003ELatence\u003C/strong\u003E\u003C/td\u003E\u003Ctd\u003ETemps écoulé entre l’entrée et une sortie exploitable\u003C/td\u003E\u003Ctd\u003EIndique si le pipeline d’inférence répond dans la fenêtre requise par le workflow\u003C/td\u003E\u003C/tr\u003E\n\u003Ctr\u003E\u003Ctd\u003E\u003Cstrong\u003EDébit\u003C/strong\u003E\u003C/td\u003E\u003Ctd\u003ENombre de prédictions terminées sur un intervalle défini\u003C/td\u003E\u003Ctd\u003EPermet de dimensionner les ressources de calcul pour les traitements par batch, les pipelines d’inférence en flux et les points de terminaison à fort volume de requêtes\u003C/td\u003E\u003C/tr\u003E\n\u003Ctr\u003E\u003Ctd\u003E\u003Cstrong\u003ETemps d’exécution du traitement\u003C/strong\u003E\u003C/td\u003E\u003Ctd\u003ETemps total nécessaire pour terminer un traitement d’inférence par batch\u003C/td\u003E\u003Ctd\u003EIndique si le calcul de score planifié se termine avant que les workflows en aval ne dépendent de la sortie\u003C/td\u003E\u003C/tr\u003E\n\u003Ctr\u003E\u003Ctd\u003E\u003Cstrong\u003ECoût par prédiction\u003C/strong\u003E\u003C/td\u003E\u003Ctd\u003ECoût total de l’inférence divisé par le volume de prédictions\u003C/td\u003E\u003Ctd\u003EIndique si la taille du modèle, le choix du matériel et le schéma de requêtes sont soutenables\u003C/td\u003E\u003C/tr\u003E\n\u003Ctr\u003E\u003Ctd\u003E\u003Cstrong\u003EActualisation des features\u003C/strong\u003E\u003C/td\u003E\u003Ctd\u003EÂge des données utilisées au moment du calcul des scores\u003C/td\u003E\u003Ctd\u003EIndique si la prédiction reflète les données actuelles des clients, des transactions, des stocks ou des processus\u003C/td\u003E\u003C/tr\u003E\n\u003Ctr\u003E\u003Ctd\u003E\u003Cstrong\u003EQualité du modèle en production\u003C/strong\u003E\u003C/td\u003E\u003Ctd\u003EPerformance propre à la tâche sur des données actualisées\u003C/td\u003E\u003Ctd\u003EIndique si les résultats d’évaluation hors ligne restent valables après le déploiement\u003C/td\u003E\u003C/tr\u003E\n\u003Ctr\u003E\u003Ctd\u003E\u003Cstrong\u003EDérive\u003C/strong\u003E\u003C/td\u003E\u003Ctd\u003EÉvolution des entrées, des sorties ou des résultats observés\u003C/td\u003E\u003Ctd\u003ESignale quand le modèle, la logique de feature ou les données d’entraînement peuvent nécessiter une revue\u003C/td\u003E\u003C/tr\u003E\n\u003Ctr\u003E\u003Ctd\u003E\u003Cstrong\u003EUtilisation\u003C/strong\u003E\u003C/td\u003E\u003Ctd\u003EUtilisation du CPU, du GPU ou de l’accélérateur pendant l’inférence\u003C/td\u003E\u003Ctd\u003ERévèle une capacité inutilisée, une saturation ou une inadéquation entre la charge de travail et le calcul\u003C/td\u003E\u003C/tr\u003E\n\u003Ctr\u003E\u003Ctd\u003E\u003Cstrong\u003ETemps de démarrage à froid\u003C/strong\u003E\u003C/td\u003E\u003Ctd\u003ETemps nécessaire avant la première prédiction après le démarrage ou la mise à l’échelle\u003C/td\u003E\u003Ctd\u003EAffecte les charges de travail intermittentes et les points de terminaison avec autoscaling\u003C/td\u003E\u003C/tr\u003E\n\u003Ctr\u003E\u003Ctd\u003E\u003Cstrong\u003ETaux d’erreur\u003C/strong\u003E\u003C/td\u003E\u003Ctd\u003ERequêtes d’inférence échouées, expirées ou non valides\u003C/td\u003E\u003Ctd\u003EIdentifie les points de rupture du pipeline d’inférence en conditions de production\u003C/td\u003E\u003C/tr\u003E\n\u003Ctr\u003E\u003Ctd\u003E\u003Cstrong\u003EVitesse de génération des tokens\u003C/strong\u003E\u003C/td\u003E\u003Ctd\u003ETokens par seconde et temps jusqu’au premier token pour l’inférence LLM\u003C/td\u003E\u003Ctd\u003EMontre à quelle vitesse un LLM démarre et termine une réponse générée\u003C/td\u003E\u003C/tr\u003E\n\u003Ctr\u003E\u003Ctd\u003E\u003Cstrong\u003EVolume de tokens et coût des réponses\u003C/strong\u003E\u003C/td\u003E\u003Ctd\u003ETokens d’entrée, tokens de sortie et coût par réponse générée\u003C/td\u003E\u003Ctd\u003EAide à déterminer si la longueur du prompt, la longueur de sortie, le choix du modèle et le volume d’utilisation sont viables\u003C/td\u003E\u003C/tr\u003E\n\u003Ctr\u003E\u003Ctd\u003E\u003Cstrong\u003EExploitabilité des résultats\u003C/strong\u003E\u003C/td\u003E\u003Ctd\u003ELe résultat arrive au bon format et au bon emplacement\u003C/td\u003E\u003Ctd\u003EDétermine si la prédiction peut entrer dans le workflow suivant\u003C/td\u003E\u003C/tr\u003E\n\u003C/tbody\u003E\u003C/table\u003E","richText":true,":type":"snowflake-site/components/text","appliedCssClassNames":"text-color-text-05"},"title_optimizing-inference-performance-and-cost":{"id":"title-v2-0542f29225","additionalClasses":"anchor-title anchor-title--optimizing-inference-performance-and-cost","type":"heading2","lines":["Optimiser la performance et le coût de l’inférence"],":type":"snowflake-site/components/title-v2"},"text_optimizing-inference-performance-and-cost_0":{"id":"text-d87d05eadf","text":"\u003Cp\u003EL’optimisation de l’inférence a deux points de départ : le modèle et le pipeline.\u003C/p\u003E\n\u003Cp\u003E\u003Cstrong\u003ECôté modèle,\u003C/strong\u003E la taille et la précision sont les principales variables. La quantification réduit la précision numérique des poids et des activations. Le passage de FP32 à INT8 réduit l’empreinte mémoire et améliore souvent le débit sur du matériel compatible, avec un risque pour la précision que les équipes valident sur des données proches de la production. L’élagage supprime les paramètres qui contribuent peu à la qualité de sortie, ce qui réduit les besoins en calcul et en mémoire pour un modèle qui atteint toujours le seuil d’exactitude exigé. La distillation des connaissances entraîne un modèle plus petit à reproduire approximativement le comportement d’un modèle plus grand. C’est utile lorsque le modèle complet est précis, mais trop coûteux ou trop lent pour l’environnement de mise en production cible.\u003C/p\u003E\n\u003Cp\u003E\u003Cstrong\u003ECôté pipeline,\u003C/strong\u003E le fonctionnement par batch est le levier le plus accessible. Regrouper les requêtes améliore l’utilisation du matériel et le débit, même si cela introduit une latence que les charges de travail par batch peuvent absorber plus facilement que les points de terminaison en temps réel. Le fonctionnement par batch dynamique ajuste la taille des groupes en fonction du trafic entrant, ce qui aide à équilibrer ces exigences concurrentes.\u003C/p\u003E\n\u003Cp\u003ELe choix du matériel influence les coûts et la performance. Les CPU conviennent aux charges de travail à faible volume ou moins intensifs en calcul, tandis que les GPU offrent des avantages considérables en matière de débit pour l’inférence de deep learning lorsque les tailles de batch et de modèle permettent de bien les exploiter.\u003C/p\u003E\n\u003Cp\u003ELe format du modèle et l’environnement d’exécution influencent la portabilité et la vitesse d’exécution. ONNX donne aux équipes un moyen de représenter les modèles dans différents frameworks et environnements d’exécution. TensorRT peut optimiser l’inférence de deep learning sur les GPU grâce à des techniques comme la fusion de couches, le calibrage de la précision, la sélection de noyaux et l’optimisation de graphes.\u003C/p\u003E\n\u003Cp\u003EL’inférence LLM implique d’autres considérations de réglage. La longueur du prompt, l’utilisation de la fenêtre de contexte et les limites maximales de tokens de sortie influencent toutes le coût de calcul par requête. Un cache KV stocke les calculs clé-valeur d’attention issus du contexte précédent, afin que le modèle ne les recalcule pas à chaque token. Le décodage spéculatif utilise un modèle d’ébauche plus petit pour proposer des tokens qu’un modèle plus grand vérifie, ce qui améliore le débit lorsque le processus de vérification accepte suffisamment de tokens d’ébauche. Les variantes approximatives peuvent privilégier la vitesse au détriment de la qualité.\u003C/p\u003E\n\u003Cp\u003EImportant à retenir : pour optimiser, vous devez savoir ce que vous cherchez à optimiser. Réduire la latence et améliorer le débit exigent souvent des approches différentes, et ces deux objectifs peuvent entrer en conflit avec les cibles de coût. Les équipes qui mesurent avant d’optimiser évitent de remplacer un problème par un autre.\u003C/p\u003E","richText":true,":type":"snowflake-site/components/text","appliedCssClassNames":"text-color-text-05"},"callout_optimizing-inference-performance-and-cost_0":{"id":"text-24eba544b1","additionalClasses":"callout callout--tip","text":"\u003Cp\u003E\u003Cstrong\u003EASTUCE\u003C/strong\u003E\u003C/p\u003E\n\u003Cp\u003EMesurez avant d’optimiser : déterminez si la charge de travail a besoin d’une latence plus faible, d’un débit plus élevé, d’un coût réduit ou de features plus récentes, car optimiser l’un de ces axes peut créer des compromis avec les autres.\u003C/p\u003E","richText":true,":type":"snowflake-site/components/text","appliedCssClassNames":"text-size-regular text-color-text-05"},"title_governance-considerations-for-ml-inference":{"id":"title-v2-8277566d4b","additionalClasses":"anchor-title anchor-title--governance-considerations-for-ml-inference","type":"heading2","lines":["Considérations de gouvernance pour l’inférence ML"],":type":"snowflake-site/components/title-v2"},"text_governance-considerations-for-ml-inference_0":{"id":"text-fbfd5897c7","text":"\u003Cp\u003EL’inférence ML utilise des données, des modèles et des sorties qui peuvent tous être soumis à des exigences de \u003Ca href=\"https://www.snowflake.com/fr/artificial-intelligence/ai-governance/\"\u003Egouvernance\u003C/a\u003E. Par exemple, les données d’entrée peuvent contenir des champs sensibles, ou le modèle peut être approuvé pour certains cas d’usage, mais pas pour d’autres. Les équipes doivent donc savoir quelles données ont été utilisées, quelle version du modèle a généré la sortie, qui peut accéder au résultat et si la prédiction convient au workflow qui la consomme. La traçabilité, les contrôles d’accès, les métadonnées de modèle et la surveillance des modèles contribuent tous à établir ce contexte.\u003C/p\u003E\n\u003Cp\u003ELa gouvernance est particulièrement importante lorsque les sorties d’inférence deviennent des actifs de données réutilisables. Sans responsables clairement désignés, sans gestion des versions ni politiques d’accès, ces sorties peuvent être difficiles à auditer, à expliquer ou à réutiliser en toute sécurité.\u003C/p\u003E","richText":true,":type":"snowflake-site/components/text","appliedCssClassNames":"text-color-text-05"},"title_running-inference-in-snowflake":{"id":"title-v2-e81fd14a85","additionalClasses":"anchor-title anchor-title--running-inference-in-snowflake","type":"heading2","lines":["Exécuter l’inférence dans Snowflake"],":type":"snowflake-site/components/title-v2"},"text_running-inference-in-snowflake_0":{"id":"text-5363a4b29f","text":"\u003Cp\u003ELes workflows d’inférence en production sont des workflows de données. Le modèle a besoin d’entrées issues des systèmes de données de l’entreprise, et les sorties doivent généralement retourner dans ces mêmes systèmes : jointes aux enregistrements client, écrites dans une table lue par un outil de BI, ou transmises à un pipeline en aval.\u003C/p\u003E\n\u003Cp\u003ESnowflake prend en charge l’inférence de modèles avec deux moteurs de calcul : le moteur SQL du warehouse et \u003Ca href=\"https://docs.snowflake.com/fr/developer-guide/snowpark-container-services/overview\"\u003ESnowpark Container Services\u003C/a\u003E. Le Snowflake Model Registry fournit une interface unifiée pour les deux.\u003C/p\u003E\n\u003Cp\u003EPour les charges de travail par batch à haut débit, les Snowflake Batch Inference Jobs utilisent Snowpark Container Services pour fournir du calcul distribué au calcul de scores à grande échelle de jeux de données statiques ou mis à jour périodiquement. Cela inclut les données non structurées stockées dans les zones de préparation Snowflake. Pour la mise en production en temps réel, Snowflake prend en charge le déploiement de modèles sous forme de points de terminaison HTTP managés via Snowpark Container Services, afin de maintenir le déploiement des modèles connecté à l’environnement même où résident les données sous-jacentes.\u003C/p\u003E\n\u003Cp\u003ELes \u003Ca rel=\"noopener noreferrer\" href=\"https://docs.snowflake.cn/en/user-guide/snowflake-cortex/ai-documents\"\u003ECortex AI Functions\u003C/a\u003E étendent l’inférence à l’analyse basée sur les LLM appliquée aux données gouvernées : complétion, embedding, extraction, analyse des opinions, résumé, traduction et traitement multimodal de documents grâce à des fonctions comme AI_PARSE_DOCUMENT. Ces fonctions s’exécutent sur des données déjà présentes dans Snowflake, sans les déplacer vers un système externe.\u003C/p\u003E\n\u003Cp\u003ELa valeur tient à l’homogénéité architecturale. Différentes charges de travail d’inférence exigent toujours des schémas d’exécution différents, mais elles peuvent rester connectés aux données, à la gestion des modèles et aux workflows de sortie que les équipes de production utilisent déjà. Snowflake permet aux équipes de choisir le modèle le mieux adapté à la charge de travail, tout en gardant l’inférence au plus près des données d’entreprise dont elle dépend.\u003C/p\u003E\n","richText":true,":type":"snowflake-site/components/text","appliedCssClassNames":"text-color-text-05"},"title_turning-inference-into-a-production-data-workflow":{"id":"title-v2-eb9f86e0ed","additionalClasses":"anchor-title anchor-title--turning-inference-into-a-production-data-workflow","type":"heading2","lines":["Transformer l’inférence en workflow de données de production"],":type":"snowflake-site/components/title-v2"},"text_turning-inference-into-a-production-data-workflow_0":{"id":"text-28de564af8","text":"\u003Cp\u003EL’architecture d’inférence doit suivre le parcours de données. Le modèle a besoin d’entrées alignées sur la logique utilisée lors de l’entraînement, le pipeline doit disposer d’une puissance de calcul suffisante pour respecter les exigences de délai du workflow, et la sortie doit arriver là où les analyses, les applications ou les systèmes en aval peuvent l’exploiter. Séparer ces différents éléments entraîne des déplacements de données, des duplications et multiplie les risques de divergence dans la logique de calcul des features ou dans le traitement des résultats.\u003C/p\u003E\n\u003Cp\u003EExécuter l’inférence au plus près des données d’entreprise aide les équipes à traiter les sorties de modèle comme des données de production, et non comme des réponses de modèle isolées. Le résultat est un parcours plus fiable, depuis les données sources jusqu’à la prise de décision métier, en passant par le calcul des scores du modèle, avec moins de transferts entre les systèmes chargés de préparer les données, d’exécuter le modèle et d’exploiter les résultats.\u003C/p\u003E","richText":true,":type":"snowflake-site/components/text","appliedCssClassNames":"text-color-text-05"},"callout_turning-inference-into-a-production-data-workflow_0":{"id":"text-20060a7a45","additionalClasses":"callout callout--general","text":"\u003Cp\u003E\u003Cstrong\u003EÀ RETENIR\u003C/strong\u003E\u003C/p\u003E\n\u003Cp\u003EL’inférence de machine learning est le moment où les modèles entraînés créent de la valeur en production en transformant des entrées à jour en sorties exploitables. Mais sa fiabilité dépend de tout le parcours d’exécution, récupération de feature, prétraitement, calcul des scores, post-traitement, livraison, contrôles de performance et gouvernance, pas seulement du modèle.\u003C/p\u003E","richText":true,":type":"snowflake-site/components/text","appliedCssClassNames":"text-size-regular text-color-text-05"}},":itemsOrder":["callout__0","text__0","title_what-is-machine-learning-inference","text_what-is-machine-learning-inference_0","title_inference-vs-training","text_inference-vs-training_0","title_types-of-machine-learning-inference","text_types-of-machine-learning-inference_0","callout_types-of-machine-learning-inference_0","title_inference-metrics-to-track-in-production","text_inference-metrics-to-track-in-production_0","title_optimizing-inference-performance-and-cost","text_optimizing-inference-performance-and-cost_0","callout_optimizing-inference-performance-and-cost_0","title_governance-considerations-for-ml-inference","text_governance-considerations-for-ml-inference_0","title_running-inference-in-snowflake","text_running-inference-in-snowflake_0","title_turning-inference-into-a-production-data-workflow","text_turning-inference-into-a-production-data-workflow_0","callout_turning-inference-into-a-production-data-workflow_0"],"appliedCssClassNames":"snowflake-responsive-container-inner-padding-medium"},"flexible_column_content_container_2":{"additionalClasses":"hub-sidebar","layout":"SIMPLE","id":"hub-body-aside",":type":"snowflake-site/components/flexible-column-container/flexible-column-content-container",":items":{"container":{"additionalClasses":"sticky-sidebar","layout":"RESPONSIVE_GRID","columnCount":12,"columnClassNames":{"text_943981956_copy_":"aem-GridColumn aem-GridColumn--default--12","text_copy":"aem-GridColumn aem-GridColumn--default--12"},"gridClassNames":"aem-Grid aem-Grid--12 aem-Grid--default--12","id":"container-1a958cdd43",":type":"snowflake-site/components/container",":items":{"text_943981956_copy_":{"id":"text-45c59a26f2","additionalClasses":"eyebrow-text","text":"\u003Cp\u003EDans ce guide\u003C/p\u003E\n","richText":true,":type":"snowflake-site/components/text","appliedCssClassNames":"text-size-regular"},"text_copy":{"id":"text-1cabc1d1fa","additionalClasses":"page-toc","text":"\u003Cul\u003E\u003Cli data-anchor=\"what-is-machine-learning-inference\"\u003EQu’est-ce que l’inférence de machine learning ?\u003C/li\u003E\u003Cli data-anchor=\"inference-vs-training\"\u003EInférence et entraînement\u003C/li\u003E\u003Cli data-anchor=\"types-of-machine-learning-inference\"\u003ETypes d’inférence de machine learning\u003C/li\u003E\u003Cli data-anchor=\"inference-metrics-to-track-in-production\"\u003EIndicateurs d’inférence à suivre en production\u003C/li\u003E\u003Cli data-anchor=\"optimizing-inference-performance-and-cost\"\u003EOptimiser la performance et le coût de l’inférence\u003C/li\u003E\u003Cli data-anchor=\"governance-considerations-for-ml-inference\"\u003EConsidérations de gouvernance pour l’inférence ML\u003C/li\u003E\u003Cli data-anchor=\"running-inference-in-snowflake\"\u003EExécuter l’inférence dans Snowflake\u003C/li\u003E\u003Cli data-anchor=\"turning-inference-into-a-production-data-workflow\"\u003ETransformer l’inférence en workflow de données de production\u003C/li\u003E\u003C/ul\u003E","richText":true,":type":"snowflake-site/components/text","appliedCssClassNames":"text-size-small text-color-text-05"}},":itemsOrder":["text_943981956_copy_","text_copy"],"appliedCssClassNames":"snowflake-responsive-container-inner-padding-medium"}},":itemsOrder":["container"],"appliedCssClassNames":"snowflake-responsive-container-inner-padding-small"},":type":"snowflake-site/components/flexible-column-container","isBlogPage":false,"isActiveTOC":false},"flexible_column_cont_1786318617":{"id":"flexible-column-container-99294f2e90","propertiesId":"hub-faq","type":"2-column-40-60","alignColumns":"top","containerMaxWidth":"extra-large","topPadding":"large","bottomPadding":"large","spaceBetween":"small","reverseOnMobile":false,"carouselOnMobile":false,"backgroundImageOption":"none","flexible_column_content_container_1":{"layout":"SIMPLE","id":"hub-faq-intro",":type":"snowflake-site/components/flexible-column-container/flexible-column-content-container",":items":{"title_v2_copy":{"id":"title-v2-66b7006be6","additionalClasses":"hub-faq__headline","type":"heading2","lines":["Foire aux questions"],":type":"snowflake-site/components/title-v2","appliedCssClassNames":"left-alignment"},"text_copy":{"id":"text-6af60e954e","additionalClasses":"hub-faq__subheadline","text":"\u003Cp\u003ELes réponses des experts Snowflake à vos questions fréquentes sur l’inférence ML.\u003C/p\u003E\n","richText":true,":type":"snowflake-site/components/text","appliedCssClassNames":"text-color-text-05"}},":itemsOrder":["title_v2_copy","text_copy"],"appliedCssClassNames":"snowflake-responsive-container-inner-padding-extra-small"},"flexible_column_content_container_2":{"layout":"SIMPLE","id":"hub-faq-accordions",":type":"snowflake-site/components/flexible-column-container/flexible-column-content-container",":items":{"simple_snowflake_acc":{"id":"simple-snowflake-accordion-c894e9337f","additionalClasses":"seo-hub__faqs","showDivider":false,"accordionItemsList":[{"title":"Qu’est-ce qui consomme le plus de calcul : l’entraînement ou l’inférence ?","richText":"\u003Cp\u003EL’entraînement est généralement plus intensif en calcul par exécution, car le modèle doit apprendre à partir de données historiques et mettre à jour ses paramètres. L’inférence peut consommer davantage de calcul sur l’ensemble du cycle de vie en production, car elle s’exécute de façon répétée, souvent pour chaque demande de prédiction, tâche de calcul de scores planifiée, flux d’événements, fichier ou prompt.\u003C/p\u003E"},{"title":"Qu’est-ce que la latence d’inférence et pourquoi est-elle importante ?","richText":"\u003Cp\u003ELa latence d’inférence correspond au temps nécessaire pour produire une prédiction après la réception d’une entrée par le système. Dans l’inférence en ligne, la latence affecte l’application ou l’utilisateur qui attend une réponse. Dans l’inférence par batch, la latence désigne généralement le temps nécessaire pour terminer la tâche de calcul des scores avant le démarrage du workflow suivant. Les objectifs de latence doivent refléter le workflow, car les différentes tâches fonctionnent sur des fenêtres de temps distinctes.\u003C/p\u003E"},{"title":"Qu’est-ce qu’un point de terminaison d’inférence ?","richText":"\u003Cp\u003EUn point de terminaison d’inférence est une interface que les applications ou services utilisent pour envoyer une entrée à un modèle et recevoir des prédictions en retour. L’inférence en ligne utilise souvent des points de terminaison HTTP afin qu’une application puisse demander une prédiction de manière synchrone. L’inférence par batch ne nécessite pas forcément de point de terminaison si le modèle calcule les scores des lignes d’une table ou des fichiers stockés dans une zone de préparation, puis réécrit les résultats dans un espace de stockage.\u003C/p\u003E"},{"title":"Quelle différence entre l’inférence par batch et l’inférence en temps réel ?","richText":"\u003Cp\u003EL’inférence par batch permet de calculer les scores d’un grand nombre d’enregistrements en une seule fois, généralement selon une planification définie ou dans le cadre d’un pipeline. L’inférence en temps réel effectue le calcul du score d’une entrée en réponse à une requête, souvent via un point de terminaison d’inférence. L’inférence par batch optimise généralement le débit, le temps d’exécution du traitement et le coût par prédiction. L’inférence en temps réel optimise généralement une faible latence, la concurrence, le taux d’erreur et le comportement au démarrage à froid.\u003C/p\u003E"},{"title":"Pourquoi l’actualisation des features affecte-t-elle la qualité de l’inférence ?","richText":"\u003Cp\u003EL’actualisation des caractéristiques indique dans quelle mesure les données d’entrée sont récentes au moment où le modèle calcule ses scores. Un modèle d’intention client qui s’appuie sur des comportements obsolètes, un modèle de fraude qui ignore des transactions récentes ou une prévision de demande qui ne reflète pas l’inventaire mis à jour peuvent produire des sorties qui ne correspondent plus à la réalité business. Les exigences d’actualisation varient selon la charge de travail, mais tout pipeline d’inférence doit indiquer clairement l’âge des entrées au moment du calcul du score.\u003C/p\u003E"}],":type":"snowflake-site/components/simple-snowflake-accordion"}},":itemsOrder":["simple_snowflake_acc"]},":type":"snowflake-site/components/flexible-column-container","isBlogPage":false,"isActiveTOC":false,"appliedCssClassNames":"snowflake-flexible-column-container-gray-10-bg"},"flexible_column_cont_1467213961":{"id":"flexible-column-container-07fe4f3053","propertiesId":"hub-explore-resources-header","type":"1-column","alignColumns":"top","containerMaxWidth":"extra-large","topPadding":"large","bottomPadding":"none","spaceBetween":"small","reverseOnMobile":false,"carouselOnMobile":false,"backgroundImageOption":"none","flexible_column_content_container_1":{"layout":"SIMPLE","id":"container-1f5f3407e7",":type":"snowflake-site/components/flexible-column-container/flexible-column-content-container",":items":{"title_v2":{"id":"title-v2-892cf35ea7","additionalClasses":"hub-explore-resources-header__headline","type":"heading2","lines":["Explorez les ressources sur l’IA"],":type":"snowflake-site/components/title-v2","appliedCssClassNames":"left-alignment"}},":itemsOrder":["title_v2"]},":type":"snowflake-site/components/flexible-column-container","isBlogPage":false,"isActiveTOC":false,"appliedCssClassNames":"snowflake-flexible-column-container-gray-10-bg"},"flexible_column_cont_912630531":{"id":"flexible-column-container-b406bdac96","propertiesId":"hub-explore-resources-grid","type":"1-column","alignColumns":"top","containerMaxWidth":"extra-large","topPadding":"small","bottomPadding":"large","spaceBetween":"small","reverseOnMobile":false,"carouselOnMobile":false,"backgroundImageOption":"none","flexible_column_content_container_1":{"layout":"SIMPLE","id":"hub-explore-resources-grid-inner",":type":"snowflake-site/components/flexible-column-container/flexible-column-content-container",":items":{"resource_chip_0":{"id":"content-chip-74b0fb50fd","tagText":"GUIDE","tagColor":"#71D3DC","cta":{"id":"cta","showOutboundIcon":false,"buttonLink":{"valid":true,"url":"https://www.snowflake.com/en/developers/guides/intro-to-machine-learning-with-snowpark-ml-for-python/"},"linkTargetContentType":"GENERIC",":type":"snowflake-site/components/button","linkType":"SNOWFLAKE_EXTERNAL","text":"Lire la suite"},"headline":{"id":"title-v2-98f38df546","type":"heading5","lines":["Bien démarrer avec le développement ML dans Snowflake"],":type":"snowflake-site/components/title-v2"},":type":"snowflake-site/components/content-chip","appliedCssClassNames":"snowflake-content-chip-white-bg"},"resource_chip_1":{"id":"content-chip-dcecdc92b6","tagText":"GUIDE","tagColor":"#71D3DC","cta":{"id":"cta","showOutboundIcon":false,"buttonLink":{"valid":true,"url":"https://www.snowflake.com/en/developers/guides/snowpark-container-services-model-serving-guide/"},"linkTargetContentType":"GENERIC",":type":"snowflake-site/components/button","linkType":"SNOWFLAKE_EXTERNAL","text":"Lire la suite"},"headline":{"id":"title-v2-99511280b2","type":"heading5","lines":["Model Serving dans Snowpark Container Services"],":type":"snowflake-site/components/title-v2"},":type":"snowflake-site/components/content-chip","appliedCssClassNames":"snowflake-content-chip-white-bg"},"resource_chip_2":{"id":"content-chip-7a88f37def","tagText":"BLOG","tagColor":"#71D3DC","cta":{"id":"cta","showOutboundIcon":false,"buttonLink":{"valid":true,"url":"https://www.snowflake.com/en/blog/engineering/scalable-model-serving-architecture/"},"linkTargetContentType":"GENERIC",":type":"snowflake-site/components/button","linkType":"SNOWFLAKE_EXTERNAL","text":"Lire la suite"},"headline":{"id":"title-v2-3ade97559e","type":"heading5","lines":["Service de modèles à grande échelle : vue d’ensemble de l’architecture"],":type":"snowflake-site/components/title-v2"},":type":"snowflake-site/components/content-chip","appliedCssClassNames":"snowflake-content-chip-white-bg"},"resource_chip_3":{"id":"content-chip-c0e0179f29","tagText":"BLOG","tagColor":"#71D3DC","cta":{"id":"cta","showOutboundIcon":false,"buttonLink":{"valid":true,"url":"https://www.snowflake.com/en/blog/engineering/snowflake-ml-runtime-vs-databricks-tpcx-ai/"},"linkTargetContentType":"GENERIC",":type":"snowflake-site/components/button","linkType":"SNOWFLAKE_EXTERNAL","text":"Lire la suite"},"headline":{"id":"title-v2-c36c3ff491","type":"heading5","lines":["Accélérer l’entraînement distribué avec Snowflake ML"],":type":"snowflake-site/components/title-v2"},":type":"snowflake-site/components/content-chip","appliedCssClassNames":"snowflake-content-chip-white-bg"}},":itemsOrder":["resource_chip_0","resource_chip_1","resource_chip_2","resource_chip_3"]},":type":"snowflake-site/components/flexible-column-container","isBlogPage":false,"isActiveTOC":false,"appliedCssClassNames":"snowflake-flexible-column-container-gray-10-bg"}},":itemsOrder":["flexible_column_cont","flexible_column_cont_939100716","flexible_column_cont_1336760939","flexible_column_cont_663228916","flexible_column_cont_1786318617","flexible_column_cont_1467213961","flexible_column_cont_912630531"],":type":"wcm/foundation/components/responsivegrid"},"modal_container":{"layout":"SIMPLE","id":"container-422193e147",":type":"snowflake-site/components/modal/modal-container",":items":{},":itemsOrder":[]},"markup_editor_928258845":{"id":"markup-editor-d316931223","title":" ","cssContent":".snowflake-flexible-column-container-gray-10-bg\u003E.snowflake-flexible-column-container{background-color:var(--ui-background-05) !important}.text-size-regular:has(.seo-hub-hero__related-topic-label){display:flex;align-items:center}.hub-hero__headline span{text-transform:none !important}.hub-hero__subheadline p{max-width:70ch;margin-top:8px}.hub-hero__authors \u003E .container \u003E .cmp-container \u003E .aem-container{display:flex;flex-direction:row}.hub-hero__authors \u003E .container \u003E .cmp-container \u003E .aem-container \u003E div{width:auto !important;margin:24px 48px 0 0 !important}.hub-hero__authors .heading-5-v2{gap:var(--spacing-00)}.hub-hero__authors .snowflake-content-chip-button{display:none !important}.hub-hero__authors .snowflake-person-chip-content .body-2,.hub-hero__authors .snowflake-content-chip-content .snowflake-title-v2-line{font-size:16px !important;line-height:20px !important;font-family:\"Lato\",sans-serif !important;color:#000 !important;font-weight:600 !important}.hub-hero__authors .snowflake-person-chip-content .body-3,.hub-hero__authors .snowflake-content-chip-content .snowflake-title-v2-line:not(:first-child){font-weight:400 !important;color:var(--text-05) !important;font-size:16px !important}.hub-hero__authors .snowflake-image-container img{aspect-ratio:1 !important;border-radius:100%;overflow:hidden}.hub-hero__authors .snowflake-person-chip-avatar{width:56px;height:56px}.hub-hero__authors .snowflake-content-chip{align-items:center;display:inline-flex}.hub-hero__authors .snowflake-content-chip-image{max-width:56px;line-height:0;margin-right:var(--spacing-03)}.hub-hero__authors .snowflake-person-chip-inner-horizontal{gap:var(--spacing-03)}@media screen and (min-width:1367px){.hub-hero__headline .heading-1-v2{font-size:48px;line-height:44px}}#hub-explore-resources-grid-inner\u003E.container\u003E.cmp-container\u003E.aem-container{display:flex;flex-direction:row;flex-wrap:wrap;gap:24px}#hub-explore-resources-grid-inner\u003E.container\u003E.cmp-container\u003E.aem-container::before,#hub-explore-resources-grid-inner\u003E.container\u003E.cmp-container\u003E.aem-container::after{display:none}#hub-explore-resources-grid-inner\u003E.container\u003E.cmp-container\u003E.aem-container\u003Ediv{width:calc(25% - 18px)}.text-color-text-05 .snowflake-text h2,.text-color-text-05.cq-Editable-dom h2,.text-color-text-05 .snowflake-text h3,.text-color-text-05.cq-Editable-dom h3,.text-color-text-05 .snowflake-text h4,.text-color-text-05.cq-Editable-dom h4,.text-color-text-05 .snowflake-text h5,.text-color-text-05.cq-Editable-dom h5,.text-color-text-05 .snowflake-text h6,.text-color-text-05.cq-Editable-dom h6{color:#000 !important}",":type":"snowflake-site/components/markup-editor","isGSAPEnabled":false},"markup_editor_597730182":{"id":"markup-editor-8622c71081","title":" ","cssContent":".sf-copy-markdown [data-copy-md]{display:inline-flex;align-items:center;gap:6px;padding:8px 16px;font-family:'Texta',sans-serif;text-transform:uppercase;font-weight:800 !important;font-size:14px;font-weight:500;color:#11567f;background:#f0faff;border:1px solid #b8e6f9;border-radius:24px;cursor:pointer;transition:background .2s ease,border-color .2s ease,color .2s ease}.sf-copy-markdown [data-copy-md]:hover{background:#ddf3fc;border-color:#29b5e8}.sf-copy-markdown [data-copy-md][data-copied=\"1\"]{color:#0f7b3e;background:#ecfdf5;border-color:#6ee7a0;pointer-events:none}.sf-copy-markdown [data-copy-md] svg{flex-shrink:0}.longform-conten .snowflake-content-chip-white-bg .snowflake-content-chip{box-shadow:0 0 24px 4px rgba(0,0,0,.02),0 4px 8px 0 rgba(0,0,0,.04);flex-direction:row-reverse;align-items:center}.longform-conten .snowflake-content-chip-button{display:none}.longform-conten .snowflake-content-chip-image__inner{aspect-ratio:5 / 3;display:flex;justify-content:center;align-items:center;background-color:var(--ui-01);border-radius:4px}.longform-conten .snowflake-content-chip-image{margin-right:0;margin-left:48px}.longform-conten .snowflake-content-chip-image img{width:50%;border-radius:0 !important;object-fit:contain}.longform-content .black-blue-text-color .snowflake-title-v2-line:not(:first-child){font-size:14px !important;font-weight:400 !important;color:rgba(0,0,0,.6) !important;margin-top:8px !important}.page-toc ul li:first-child{padding-top:0 !important}.page-toc ul li:last-child{padding-bottom:0 !important}.seo-hub__top-bar \u003E .container \u003E .cmp-container \u003E .aem-container \u003E div:first-child{flex-grow:1}.sf-copy-markdown{margin-top:40px !important}.page-toc ul{margin-top:16px !important}.seo-hub__top-bar \u003E .container \u003E .cmp-container \u003E .aem-container{display:flex;justify-content:space-between}.sf-copy-markdown{}.callout.snowflake-text p:not(:first-child){margin-top:var(--spacing-01)}.callout \u003E span \u003E p:first-child \u003E strong,.callout \u003E span \u003E p:first-child \u003E b{text-transform:uppercase;font-family:'Texta',sans-serif;font-size:16px !important;color:var(--ui-01) !important}.seo-hub-hero__subheadline p{max-width:50ch}.tag-group ul{list-style-type:none;padding:0;margin:0;display:flex;flex-direction:row;row-gap:12px;column-gap:8px;align-items:center;flex-wrap:wrap}.tag-group ul li:first-child{flex-shrink:0}.tag-group ul li a{display:inline-block;padding:2px 12px;border-radius:48px;background-color:#ededed;color:#666;font-size:14px !important}@media screen and (min-width:1367px){.seo-hub-hero__headline span.snowflake-title-v2-line{font-size:56px !important}}.callout.snowflake-text p:not(:first-child){margin-top:var(--spacing-01)}.callout \u003E span \u003E p:first-child \u003E b{text-transform:uppercase;font-family:'Texta',sans-serif;font-size:16px !important;color:var(--ui-01) !important}.seo-hub-hero__subheadline p{max-width:80ch}#hero:has(.snowflake-youtube-lite) .seo-hub-hero__subheadline p{max-width:50ch}.tag-group ul{list-style-type:none;padding:0;margin:0;display:flex;flex-direction:row;row-gap:12px;column-gap:8px;align-items:center;flex-wrap:wrap}.tag-group ul li:first-child{width:100%;flex-shrink:0}.tag-group ul li a{display:inline-block;padding:2px 12px;border-radius:48px;background-color:#ededed;color:#666;font-size:14px !important}@media screen and (min-width:1367px){.seo-hub-hero__headline span.snowflake-title-v2-line{font-size:56px !important}}",":type":"snowflake-site/components/markup-editor","isGSAPEnabled":false},"markup_editor":{"id":"markup-editor-2cdddf81cc","title":" ","cssContent":"div.snowflake-breadcrumb a.snowflake-breadcrumb-item,.snowflake-breadcrumb div.snowflake-breadcrumb-item{text-transform:none;font-weight:500}.snowflake-breadcrumb svg{display:none !important}.snowflake-breadcrumb a:has(svg)::after{content:'/';margin:0 12px;color:#666}.hub-sidebar{padding:0 40px}.sticky-sidebar{max-width:340px;margin-left:auto}.page-toc ul{list-style-type:none;padding:0}.page-toc li{padding:8px 16px;border-left:4px solid var(--ui-01);cursor:pointer;transition:300ms ease all}.page-toc li:hover{color:var(--ui-01);border-color:#7fd3f1;transition:300ms ease all}.callout,.customer-card{background-color:#eef9fd;border-left:4px solid var(--ui-01);padding:24px 24px 24px 32px;border-radius:4px}.logo-container{max-width:180px}.longform-content li{margin-top:1rem !important}div.longform-content p{max-width:80ch}.bolder .snowflake-title-v2-line{font-weight:900 !important}.border-top\u003Ediv{border-top:1px solid #ccc;padding-top:48px}.related-topics ul{list-style-type:none;padding:0;margin:0;display:flex;gap:8px;flex-wrap:wrap}.related-topics li{display:inline-block;border:1px solid #ccc;padding:4px 12px;border-radius:24px}div.longform-content .snowflake-text h2,div.longform-content .snowflake-text .heading-2-v2,div.longform-content .snowflake-text h3,div.longform-content .snowflake-text .heading-3-v2,div.longform-content .snowflake-title-v2 .heading-3-v2,div.longform-content .snowflake-text h4,div.longform-content .snowflake-text .heading-4-v2,div.longform-content .snowflake-title-v2 .heading-4-v2,div.longform-content .snowflake-text h5,div.longform-content .snowflake-text .heading-5-v2,div.longform-content .snowflake-title-v2 .heading-5-v2,div.longform-content .snowflake-text h6,div.longform-content .snowflake-title-v2 .heading-6-v2,div.longform-content .snowflake-text .heading-6-v2{text-transform:none !important}div.longform-content .snowflake-text h2,div.longform-content .snowflake-text .heading-2-v2,div.longform-content .snowflake-text h3,div.longform-content .snowflake-text .heading-3-v2,div.longform-content .snowflake-text h4,div.longform-content .snowflake-text .heading-4-v2,div.longform-content .snowflake-text h5,div.longform-content .snowflake-text .heading-5-v2,div.longform-content .snowflake-text h6,div.longform-content .snowflake-text .heading-6-v2{margin-top:1.5rem !important;line-height:1.1 !important}div.longform-content .snowflake-text h3,div.longform-content .snowflake-text .heading-3-v2,div.longform-content .snowflake-title-v2 .heading-3-v2,div.longform-content .snowflake-text h4,div.longform-content .snowflake-text .heading-4-v2,div.longform-content .snowflake-title-v2 .heading-4-v2,div.longform-content .snowflake-text h5,div.longform-content .snowflake-text .heading-5-v2,div.longform-content .snowflake-title-v2 .heading-5-v2,div.longform-content .snowflake-text h6,div.longform-content .snowflake-text .heading-6-v2,div.longform-content .snowflake-title-v2 .heading-6-v2{font-family:Lato,sans-serif !important;font-weight:800 !important}div.longform-content .snowflake-text h2,div.longform-content .snowflake-text .heading-2-v2,div.longform-content .snowflake-title-v2 .heading-2-v2{text-transform:none !important;font-size:28px !important}div.longform-content .snowflake-text h3,div.longform-content .snowflake-text .heading-3-v2,div.longform-content .snowflake-title-v2 .heading-3-v2{font-size:22px !important}div.longform-content .snowflake-text h4,div.longform-content .snowflake-text .heading-4-v2,div.longform-content .snowflake-title-v2 .heading-4-v2{font-size:18px !important}div.longform-content .snowflake-text h5,div.longform-content .snowflake-text .heading-5-v2,div.longform-content .snowflake-title-v2 .heading-5-v2{font-size:16px !important}div.longform-content .snowflake-text h6,div.longform-content .snowflake-text .heading-6-v2,div.longform-content .snowflake-title-v2 .heading-6-v2{font-size:14px !important}@media screen and (min-width:992px){div.longform-content .snowflake-text h2,div.longform-content .snowflake-text .heading-2-v2,div.longform-content .snowflake-title-v2 .heading-2-v2{font-size:38px !important}div.longform-content .snowflake-text h3,div.longform-content .snowflake-text .heading-3-v2,div.longform-content .snowflake-title-v2 .heading-3-v2{font-size:26px !important}div.longform-content .snowflake-text h4,div.longform-content .snowflake-text .heading-4-v2,div.longform-content .snowflake-title-v2 .heading-4-v2{font-size:22px !important}div.longform-content .snowflake-text h5,div.longform-content .snowflake-text .heading-5-v2,div.longform-content .snowflake-title-v2 .heading-5-v2{font-size:18px !important}div.longform-content .snowflake-text h6,div.longform-content .snowflake-text .heading-6-v2,div.longform-content .snowflake-title-v2 .heading-6-v2{font-size:16px !important}}.sticky-sidebar .page-toc li.is-active{font-weight:600;color:var(--snow-blue,#29b5e8)}.sticky-sidebar .page-toc li[data-anchor]{cursor:pointer}.longform-content table{margin-top:24px;margin-bottom:24px;width:100%;background-color:var(--ui-background-01);border-collapse:collapse;border:2px solid var(--ui-background-09);font-family:'Lato',sans-serif;color:var(--ui-background-09)}.longform-content table thead{background-color:var(--ui-01)}.longform-content th,.longform-content td{min-width:120px;border:2px solid var(--ui-background-09);padding:var(--spacing-01)}.longform-content ol{margin-top:0 !important}.longform-content ol li{margin-bottom:1rem !important}.longform-content ul li{margin:0;padding:0 0 0 32px;position:relative}.longform-content ul{list-style-type:none}.longform-content ul li::before{content:\"\";display:block;border-radius:100%;background:#29b5e8;width:18px;height:18px;position:absolute;top:4px;left:0;border:5px solid #e5f2f7;box-sizing:border-box}.seo-customer.snowflake-card-v2-advanced-horizontal .snowflake-card-v2-advanced-image-container{max-width:200px}.seo-customer.snowflake-card-v2-advanced-horizontal .snowflake-card-v2-advanced-image-container img{object-fit:contain}.related-topics-outer-container \u003E .container \u003E .cmp-container \u003E .aem-container{display:flex;flex-direction:row}.related-topics-outer-container \u003E .container \u003E .cmp-container \u003E .aem-container \u003E div{width:auto !important;margin:0 !important}.related-topics-outer-container \u003E .container \u003E .cmp-container \u003E .aem-container \u003E div:first-child{margin-right:16px !important;flex-shrink:0}","jsContent":"(function(){var OFFSET=100;if(window.gsap&&window.ScrollTrigger){gsap.registerPlugin(ScrollTrigger);var sidebar=document.querySelector('.sticky-sidebar');var body=document.querySelector('.longform-content');if(sidebar&&body){ScrollTrigger.create({trigger:sidebar,start:'top 100px',endTrigger:body,end:'bottom bottom',pin:sidebar,pinSpacing:false});}}document.addEventListener('click',function(e){var li=e.target.closest('li[data-anchor]');if(!li)return;var slug=li.getAttribute('data-anchor');var heading=document.querySelector('.anchor-title--'+CSS.escape(slug));if(!heading)return;e.preventDefault();var top=heading.getBoundingClientRect().top+window.pageYOffset-OFFSET;window.scrollTo({top:top,behavior:'smooth'});history.replaceState(null,'','#'+slug);},false);var headings=document.querySelectorAll('[class*=\"anchor-title--\"]');if(headings.length&&'IntersectionObserver'in window){var io=new IntersectionObserver(function(entries){entries.forEach(function(entry){if(!entry.isIntersecting)return;var cls=Array.from(entry.target.classList).find(function(c){return c.indexOf('anchor-title--')===0;});if(!cls)return;var slug=cls.replace('anchor-title--','');document.querySelectorAll('li[data-anchor]').forEach(function(li){li.classList.toggle('is-active',li.getAttribute('data-anchor')===slug);});});},{rootMargin:'-20% 0px -70% 0px',threshold:0});headings.forEach(function(h){io.observe(h);});}})();",":type":"snowflake-site/components/markup-editor","isGSAPEnabled":true},"experiencefragment-footer":{"id":"experiencefragment-f94012d5d3","localizedFragmentVariationPath":"/content/experience-fragments/snowflake-site/language-masters/fr/site/footer/master/jcr:content","configured":true,":type":"snowflake-site/components/experiencefragment","xfModelPath":"/content/experience-fragments/snowflake-site/language-masters/fr/site/footer/master.xfmodel.json?callerPage=/content/snowflake-site/global/fr/artificial-intelligence/machine-learning/inference"},"experiencefragment":{"id":"experiencefragment-f7b00dd987","localizedFragmentVariationPath":"/content/experience-fragments/snowflake-site/language-masters/fr/site/footer-legal-disclaimers/master/jcr:content","configured":true,":type":"snowflake-site/components/experiencefragment","xfModelPath":"/content/experience-fragments/snowflake-site/language-masters/fr/site/footer-legal-disclaimers/master.xfmodel.json?callerPage=/content/snowflake-site/global/fr/artificial-intelligence/machine-learning/inference"}},":itemsOrder":["experiencefragment-banner","experiencefragment-header","responsivegrid","modal_container","markup_editor_928258845","markup_editor_597730182","markup_editor","experiencefragment-footer","experiencefragment"],":type":"wcm/foundation/components/responsivegrid"}},":itemsOrder":["root"],":hierarchyType":"page",":path":"/content/snowflake-site/global/fr/artificial-intelligence/machine-learning/inference","coveoConfig":{"pipeline":"snowflake.com","searchHub":"snowflake.com","organizationId":"snowflakecomputingproduction8neljofn","apiKey":"xx335921a6-2a0a-40f2-a167-e390b4766c3d"},"analyticsDebugMode":false,"analyticsData":{"excludeFromAnalytics":false,"subCategory":"","pageType":"homepage","templateName":"base-page-template54","siteName":"snowflake","pageUrl":"/content/snowflake-site/global/fr/artificial-intelligence/machine-learning/inference","language":"fr","category":"general","pageName":"Inférence de machine learning : comment les modèles entraînés créent de la valeur en production","contentTags":[]},"analyticsContentTags":[],"analyticsEnabled":true,"isPasswordProtected":false,"locale":"fr"}
  