Le World Tour de Snowflake dans votre ville

Découvrez comment les équipes dirigeantes déploient les agents à grande échelle. Trouvez un arrêt près de chez vous.

Qu'est-ce que l'AutoML ? Un guide sur le machine learning automatisé

Découvrez ce qu'est l'AutoML, comment il fonctionne et pourquoi il est important. Découvrez ses principaux composants et cas d'usage, ainsi que la manière dont une plateforme data peut améliorer les workflows de ML automatisés.

  • Présentation
  • Qu'est-ce que l'AutoML ?
  • Pourquoi l'AutoML est un levier stratégique
  • Principaux composants de l'AutoML
  • Six cas d'usage courants de l'AutoML
  • Principales limites de l'AutoML
  • Conclusion
  • FAQ sur l'AutoML
  • Clients utilisant le machine learning de Snowflake
  • Ressources sur le machine learning

Présentation

Il n'est pas exagéré d'expliquer que le machine learning a changé le monde. Apprendre aux machines à penser en leur donnant des exemples de ce que vous voulez qu'elles apprennent (données), au lieu de règles préprogrammées (code), a permis un large éventail d'applications pratiques. Des systèmes de diagnostic en radiologie aux filtres anti-spam en passant par les véhicules semi-autonomes, tout a été développé grâce au machine learning (ML).

Le ML est également à la base des grands modèles de langage et des applications d'IA générative qui en ont émergé. Mais la création et l'entraînement de modèles de ML demandent beaucoup de temps et de ressources, nécessitant des investissements importants en infrastructure et une vaste expertise en IA. C'est pourquoi une nouvelle catégorie d'outils qui automatisent bon nombre de ces processus, connue sous le nom d'AutoML, a capté l'attention des data scientists, des ingénieurs, des analystes et des utilisateurs métier. 

Dans ce guide, nous allons expliquer ce qu'est l'AutoML et comment il aide à combler les écarts en matière de connaissances entre les équipes de data science et les utilisateurs non spécialistes, rendant l'IA plus évolutive et accessible à tous au sein d'une entreprise.

Qu'est-ce que l'AutoML ?

L'AutoML utilise des logiciels pour gérer automatiquement les étapes clés de la création d'un modèle de machine learning, telles que la sélection des bons algorithmes, le réglage des paramètres du modèle et la transformation des données brutes dans un format que le modèle comprendra, un processus connu sous le nom de feature engineering. Cela peut réduire le temps dont les ingénieurs ont besoin pour créer un modèle simple de plusieurs mois à quelques jours, voire quelques heures. L'AutoML démocratise l'IA en permettant aux utilisateurs dans des domaines tels que la santé, la finance et le marketing de créer leurs propres modèles sans nécessiter d'expertise technique approfondie.

Pourquoi l'AutoML est un levier stratégique

Voici cinq façons dont l'AutoML change les règles de la création de modèles :

  • Il démocratise le développement : L'AutoML supprime les barrières techniques, de sorte que les experts du domaine dans un large éventail de secteurs peuvent créer des modèles sophistiqués sans expertise préalable en machine learning.
  • Il stimule la productivité : En automatisant des processus chronophages tels que le feature engineering, la sélection d'algorithmes et le réglage des paramètres, l'AutoML réduit considérablement le temps nécessaire à la création de modèles.
  • Il améliore la précision : Les plateformes AutoML testent systématiquement des centaines de combinaisons d'algorithmes et de paramètres, découvrant souvent des modèles plus performants qui pourraient échapper aux praticiens humains.
  • Il améliore la reproductibilité : Les plateformes AutoML documentent automatiquement toutes les décisions et tous les paramètres de modélisation, créant ainsi une piste d'audit claire qui rend simple la reproduction des résultats et la compréhension exacte de la façon dont les modèles ont été créés.
  • Il renforce l'homogénéité : L'AutoML garantit que les méthodes de validation, de validation croisée et d'évaluation sont appliquées de manière cohérente, réduisant ainsi les erreurs humaines qui peuvent conduire à des prédictions inexactes.

Principaux composants de l'AutoML

Voici les principaux composants d'un pipeline AutoML :
 

Prétraitement des données

À ce stade, la plateforme nettoie et prépare les données brutes en gérant les valeurs manquantes, en supprimant les valeurs aberrantes et en convertissant les types de données dans des formats adaptés aux algorithmes de machine learning, garantissant ainsi la qualité et l'homogénéité des données avant le début de l'entraînement du modèle.
 

Feature engineering

Ensuite, la plateforme transforme les données brutes en générant de nouvelles variables, en encodant les données catégorielles, en mettant à l'échelle les caractéristiques numériques et en sélectionnant les caractéristiques les plus pertinentes pour améliorer les prédictions du modèle.
 

Sélection du modèle

L'AutoML teste systématiquement plusieurs algorithmes de machine learning (comme les arbres de décision, les réseaux de neurones ou les méthodes d'ensemble) pour identifier l'approche qui fonctionne le mieux pour le jeu de données et le problème spécifiques. 
 

Entraînement

L'étape la plus essentielle consiste à fournir au modèle de grandes quantités de données d'exemple (comme des milliers d'e-mails étiquetés « spam » ou « non spam ») afin qu'il puisse apprendre à reconnaître les modèles et les relations au sein de ces données. Il peut ensuite utiliser ces modèles appris pour faire des prédictions ou prendre des décisions concernant des données inédites.
 

Modélisation d'ensemble

Cette étape implique l'entraînement de différents modèles de machine learning sur le même jeu de données, puis la combinaison de leurs prédictions pour parvenir à une décision finale. La modélisation d'ensemble produit généralement des résultats plus précis et efficaces que n'importe quel modèle individuel en réduisant l'impact des faiblesses et des biais d'un modèle particulier.
 

Réglage des hyperparamètres

En effectuant automatiquement le réglage des paramètres qui contrôlent la façon dont chaque algorithme apprend (tels que les taux d'apprentissage, les profondeurs d'arbre ou les paramètres de régularisation), l'AutoML permet aux utilisateurs d'identifier la meilleure combinaison de paramètres.
 

Évaluation et validation

Les entreprises ont besoin d'un modèle qui fonctionne bien avec de nouvelles données inédites. Les procédures de test telles que la validation croisée rassemblent des métriques telles que l'exactitude, la précision et le rappel, tout en vérifiant le surapprentissage (lorsqu'un modèle fonctionne mal sur des données en dehors de son ensemble d'entraînement) ou les biais.
 

Déploiement et surveillance 

L'AutoML identifiera automatiquement le modèle le plus performant pour une utilisation en production et mettra en place des systèmes pour suivre les performances au fil du temps. Cela permet de s'assurer que les modèles continuent de fonctionner efficacement à mesure que les conditions du monde réel changent, en évitant la dérive du modèle et en déclenchant un réentraînement si nécessaire.
 

Ingénierie de l'explicabilité

Dans la mesure du possible, les développeurs voudront être en mesure d'expliquer pourquoi un modèle a fait une prédiction particulière, en évitant les modèles « boîte noire » où le processus de décision est entièrement opaque. Les plateformes AutoML sont souvent dotées d'outils qui documentent l'ensemble du processus de modélisation, y compris la façon dont les données ont été prétraitées et pourquoi elles ont choisi certains algorithmes.

En Europe, le règlement sur l'intelligence artificielle (AI Act) impose des obligations de transparence et d'explicabilité pour les systèmes d'IA à haut risque. Les modèles de ML utilisés dans des domaines tels que le scoring de crédit, le diagnostic médical ou le recrutement doivent pouvoir justifier leurs décisions. L'AutoML facilite cette conformité grâce à la documentation automatique du pipeline de modélisation, mais les modèles d'ensemble complexes restent un défi pour l'explicabilité exigée par la réglementation.

Six cas d'usage courants de l'AutoML

Étant donné que presque tous les secteurs d'activité utilisent des modèles de machine learning, il existe de nombreux endroits où l'AutoML peut accélérer les initiatives de ML d'une organisation. Voici six cas d'usage courants où l'AutoML peut aider :
 

1. Prévision des ventes  

L'AutoML aide les entreprises à créer des modèles pour analyser les données de vente historiques, les modèles saisonniers et les tendances du marché. Les entreprises peuvent rapidement ajuster les stocks, le personnel et les budgets en fonction de ces prédictions automatisées, sans avoir besoin de faire appel à une équipe de data science. 
 

2. Détection de la fraude 

Les banques et les processeurs de paiement utilisent le ML pour signaler les transactions frauduleuses potentielles en temps réel. L'AutoML permet aux analystes de la fraude et aux gestionnaires de risques de créer des modèles plus rapidement afin qu'ils puissent suivre le rythme de l'évolution des tactiques des fraudeurs. 
 

3. Prédiction de l'attrition 

Les services d'abonnement et les opérateurs de télécommunications utilisent le ML pour signaler les clients susceptibles d'annuler leur service, ce qui leur permet de mener des efforts de fidélisation proactifs. L'automatisation permet aux entreprises de tester et de déployer rapidement de nouveaux modèles d'attrition à mesure que le comportement des clients évolue.
 

4. Diagnostic des maladies

Le machine learning aide les prestataires de soins de santé à analyser les images médicales, les résultats d'analyses et les symptômes des patients pour faciliter les diagnostics et les traitements. À mesure que de nouvelles recherches médicales et données sur les patients deviennent disponibles, l'AutoML peut mettre à jour en continu les modèles existants pour s'assurer que les patients reçoivent les meilleurs soins possibles.
 

5. Optimisation des stocks

Les acteurs du retail utilisent des modèles pour prédire la demande de produits spécifiques à différents endroits, ce qui les aide à stocker les bons articles au bon moment. L'AutoML peut aider les opérations de retail à créer des modèles pour différentes catégories de produits ou emplacements de magasins et à réentraîner automatiquement les modèles à mesure que les conditions du marché changent.
 

6. Déploiement d'une tarification dynamique

L'AutoML permet aux plateformes d'e-commerce et aux services de covoiturage de déployer des modèles de tarification dynamique en intégrant automatiquement des flux de données en temps réel, et d'expérimenter rapidement différentes stratégies de tarification sur divers marchés, produits ou zones de service. Cela permet aux organisations de maximiser leurs revenus sans nécessiter d'ajustements de prix manuels fréquents.

Principales limites de l'AutoML

Les plateformes AutoML offrent des avantages utiles à chaque entreprise. Elles peuvent accélérer le développement de modèles, réduire l'erreur humaine, libérer les data scientists pour des tâches plus stratégiques et démocratiser l'accès à l'IA dans toute l'organisation. Mais elles souffrent également de certaines limites inhérentes. Par exemple :
 

Elles offrent des solutions génériques

L'AutoML a tendance à appliquer des approches standard qui peuvent ne pas capturer les aspects uniques de problèmes spécialisés, passant potentiellement à côté de solutions personnalisées que des experts du domaine développeraient pour des secteurs ou des cas d'usage spécifiques.
 

Elles ont une compréhension limitée des domaines business

Les systèmes AutoML manquent de contexte métier et d'expertise spécialisée pour des secteurs ou des domaines spécifiques, passant potentiellement à côté de nuances importantes qu'un expert humain pourrait saisir, telles que des régularités métier saisonnières ou des contraintes réglementaires.
 

Ils sont soumis au principe du "données médiocres en entrée, résultats médiocres en sortie". 

Les plateformes AutoML ne peuvent pas corriger des données de qualité fondamentalement médiocre. Si vos données d'entrée sont biaisées, incomplètes ou non pertinentes, les systèmes automatisés généreront des résultats peu fiables.
 

Elles ne sont pas très flexibles 

Les utilisateurs avancés peuvent se heurter à des limites lorsqu'ils tentent de mettre en œuvre des techniques spécialisées, des algorithmes personnalisés ou des étapes de prétraitement complexes qui dépassent les capacités automatisées de la plateforme.
 

Les outils de feature engineering peuvent être limités 

Bien que les plateformes AutoML gèrent le feature engineering de base, elles peuvent passer à côté de créations de caractéristiques avancées et spécifiques à un domaine qui amélioreraient significativement les performances du modèle.
 

Elles pourraient avoir un problème de boîte noire

Bien qu'une plateforme AutoML puisse être capable d'expliquer comment un seul modèle de ML fait des prédictions, les modèles d'ensemble complexes peuvent être beaucoup plus difficiles à interpréter ou à expliquer. Cela les rend inadaptées aux applications nécessitant des niveaux élevés de transparence, telles que les diagnostics de santé ou les approbations de prêts.
 

Elles peuvent être coûteuses et difficiles à abandonner 

De nombreuses plateformes AutoML sont coûteuses et créent des dépendances vis-à-vis de systèmes propriétaires, ce qui rend difficile la migration des modèles vers d'autres environnements ou leur maintenance de manière autonome.

Ces limites expliquent pourquoi l'AutoML fonctionne mieux comme un outil pour augmenter l'expertise humaine, plutôt que de la remplacer complètement.

Conclusion

L'AutoML démocratise le machine learning en permettant aux experts du domaine de tous les secteurs de créer des modèles prédictifs sophistiqués sans expertise technique, compressant des mois de développement en quelques jours et accélérant considérablement l'adoption de l'IA en entreprise.

Les plateformes AutoML sont capables de tester systématiquement des centaines de combinaisons d'algorithmes pour identifier celles qui génèrent les résultats les plus fiables. Les plateformes appliquent également des bonnes pratiques constantes pour la validation et l'évaluation, réduisant les erreurs humaines qui peuvent compromettre la performance du modèle.

Cependant, les équipes doivent également tenir compte des limites de l'AutoML, qui incluent le manque de contexte sur le sujet, les problèmes potentiels d'interprétabilité et une forte dépendance à la qualité des données. 

Lorsqu'il est mis en œuvre avec une attention appropriée à la gouvernance des données, à l'infrastructure de qualité et à la supervision humaine, l'AutoML peut être un outil puissant qui amplifie l'expertise humaine et permet aux organisations de faire évoluer les initiatives d'IA dans toute leur entreprise.

FAQ sur l'AutoML

Le machine learning est le domaine plus vaste qui consiste à apprendre aux ordinateurs à apprendre des modèles à partir de données et à faire des prédictions. L'AutoML automatise les tâches complexes et chronophages du machine learning, telles que la sélection d'algorithmes et le réglage des paramètres. Essentiellement, le machine learning est la science et l'AutoML est un ensemble d'outils automatisés qui rend ces modèles accessibles aux non-scientifiques.

Les MLOps se concentrent sur les aspects opérationnels du déploiement, de la surveillance et de la maintenance des modèles de machine learning dans les environnements de production. L'AutoML automatise le développement initial et l'entraînement de ces modèles. Alors que l'AutoML vous aide à créer des modèles rapidement, les MLOps s'assurent qu'ils fonctionnent de manière fiable dans des applications du monde réel et continuent de bien fonctionner même lorsque les conditions changent.

Les principaux fournisseurs de technologie tels qu'Amazon, Google et Microsoft proposent des plateformes AutoML dans le cadre de leurs portefeuilles cloud. D'autres entreprises telles que DataRobot, H20.ai et IBM Watson fournissent des outils similaires. De plus, les entreprises peuvent tirer parti de bibliothèques Python open source gratuites comme Auto-sklearn et TPOT, qui automatisent les workflows scikit-learn avec un contrôle total sur la personnalisation.

L'AutoML évolue pour s'intégrer aux modèles de fondation et aux grands modèles de langage, permettant aux utilisateurs d'affiner des modèles pré-entraînés plutôt que de les créer de toutes pièces. Des outils AutoML spécialisés émergent pour des domaines tels que la vision par ordinateur, le traitement du langage naturel et la prévision de séries temporelles. De plus, les plateformes AutoML modernes se concentrent davantage sur l'explicabilité, les considérations éthiques liées à l'IA et les approches hybrides qui combinent des processus automatisés avec l'expertise et la supervision humaines.