
Rakuten économise 60 % sur les coûts d'infrastructure avec Snowflake
Rakuten réduit les coûts et lance de nouveaux produits plus rapidement pour une expérience client plus personnalisée.
Découvrez ce qu'est l'AutoML, comment il fonctionne et pourquoi il est important. Découvrez ses principaux composants et cas d'usage, ainsi que la manière dont une plateforme data peut améliorer les workflows de ML automatisés.
Il n'est pas exagéré d'expliquer que le machine learning a changé le monde. Apprendre aux machines à penser en leur donnant des exemples de ce que vous voulez qu'elles apprennent (données), au lieu de règles préprogrammées (code), a permis un large éventail d'applications pratiques. Des systèmes de diagnostic en radiologie aux filtres anti-spam en passant par les véhicules semi-autonomes, tout a été développé grâce au machine learning (ML).
Le ML est également à la base des grands modèles de langage et des applications d'IA générative qui en ont émergé. Mais la création et l'entraînement de modèles de ML demandent beaucoup de temps et de ressources, nécessitant des investissements importants en infrastructure et une vaste expertise en IA. C'est pourquoi une nouvelle catégorie d'outils qui automatisent bon nombre de ces processus, connue sous le nom d'AutoML, a capté l'attention des data scientists, des ingénieurs, des analystes et des utilisateurs métier.
Dans ce guide, nous allons expliquer ce qu'est l'AutoML et comment il aide à combler les écarts en matière de connaissances entre les équipes de data science et les utilisateurs non spécialistes, rendant l'IA plus évolutive et accessible à tous au sein d'une entreprise.
L'AutoML utilise des logiciels pour gérer automatiquement les étapes clés de la création d'un modèle de machine learning, telles que la sélection des bons algorithmes, le réglage des paramètres du modèle et la transformation des données brutes dans un format que le modèle comprendra, un processus connu sous le nom de feature engineering. Cela peut réduire le temps dont les ingénieurs ont besoin pour créer un modèle simple de plusieurs mois à quelques jours, voire quelques heures. L'AutoML démocratise l'IA en permettant aux utilisateurs dans des domaines tels que la santé, la finance et le marketing de créer leurs propres modèles sans nécessiter d'expertise technique approfondie.
Voici cinq façons dont l'AutoML change les règles de la création de modèles :
Voici les principaux composants d'un pipeline AutoML :
À ce stade, la plateforme nettoie et prépare les données brutes en gérant les valeurs manquantes, en supprimant les valeurs aberrantes et en convertissant les types de données dans des formats adaptés aux algorithmes de machine learning, garantissant ainsi la qualité et l'homogénéité des données avant le début de l'entraînement du modèle.
Ensuite, la plateforme transforme les données brutes en générant de nouvelles variables, en encodant les données catégorielles, en mettant à l'échelle les caractéristiques numériques et en sélectionnant les caractéristiques les plus pertinentes pour améliorer les prédictions du modèle.
L'AutoML teste systématiquement plusieurs algorithmes de machine learning (comme les arbres de décision, les réseaux de neurones ou les méthodes d'ensemble) pour identifier l'approche qui fonctionne le mieux pour le jeu de données et le problème spécifiques.
L'étape la plus essentielle consiste à fournir au modèle de grandes quantités de données d'exemple (comme des milliers d'e-mails étiquetés « spam » ou « non spam ») afin qu'il puisse apprendre à reconnaître les modèles et les relations au sein de ces données. Il peut ensuite utiliser ces modèles appris pour faire des prédictions ou prendre des décisions concernant des données inédites.
Cette étape implique l'entraînement de différents modèles de machine learning sur le même jeu de données, puis la combinaison de leurs prédictions pour parvenir à une décision finale. La modélisation d'ensemble produit généralement des résultats plus précis et efficaces que n'importe quel modèle individuel en réduisant l'impact des faiblesses et des biais d'un modèle particulier.
En effectuant automatiquement le réglage des paramètres qui contrôlent la façon dont chaque algorithme apprend (tels que les taux d'apprentissage, les profondeurs d'arbre ou les paramètres de régularisation), l'AutoML permet aux utilisateurs d'identifier la meilleure combinaison de paramètres.
Les entreprises ont besoin d'un modèle qui fonctionne bien avec de nouvelles données inédites. Les procédures de test telles que la validation croisée rassemblent des métriques telles que l'exactitude, la précision et le rappel, tout en vérifiant le surapprentissage (lorsqu'un modèle fonctionne mal sur des données en dehors de son ensemble d'entraînement) ou les biais.
L'AutoML identifiera automatiquement le modèle le plus performant pour une utilisation en production et mettra en place des systèmes pour suivre les performances au fil du temps. Cela permet de s'assurer que les modèles continuent de fonctionner efficacement à mesure que les conditions du monde réel changent, en évitant la dérive du modèle et en déclenchant un réentraînement si nécessaire.
Dans la mesure du possible, les développeurs voudront être en mesure d'expliquer pourquoi un modèle a fait une prédiction particulière, en évitant les modèles « boîte noire » où le processus de décision est entièrement opaque. Les plateformes AutoML sont souvent dotées d'outils qui documentent l'ensemble du processus de modélisation, y compris la façon dont les données ont été prétraitées et pourquoi elles ont choisi certains algorithmes.
En Europe, le règlement sur l'intelligence artificielle (AI Act) impose des obligations de transparence et d'explicabilité pour les systèmes d'IA à haut risque. Les modèles de ML utilisés dans des domaines tels que le scoring de crédit, le diagnostic médical ou le recrutement doivent pouvoir justifier leurs décisions. L'AutoML facilite cette conformité grâce à la documentation automatique du pipeline de modélisation, mais les modèles d'ensemble complexes restent un défi pour l'explicabilité exigée par la réglementation.
Étant donné que presque tous les secteurs d'activité utilisent des modèles de machine learning, il existe de nombreux endroits où l'AutoML peut accélérer les initiatives de ML d'une organisation. Voici six cas d'usage courants où l'AutoML peut aider :
L'AutoML aide les entreprises à créer des modèles pour analyser les données de vente historiques, les modèles saisonniers et les tendances du marché. Les entreprises peuvent rapidement ajuster les stocks, le personnel et les budgets en fonction de ces prédictions automatisées, sans avoir besoin de faire appel à une équipe de data science.
Les banques et les processeurs de paiement utilisent le ML pour signaler les transactions frauduleuses potentielles en temps réel. L'AutoML permet aux analystes de la fraude et aux gestionnaires de risques de créer des modèles plus rapidement afin qu'ils puissent suivre le rythme de l'évolution des tactiques des fraudeurs.
Les services d'abonnement et les opérateurs de télécommunications utilisent le ML pour signaler les clients susceptibles d'annuler leur service, ce qui leur permet de mener des efforts de fidélisation proactifs. L'automatisation permet aux entreprises de tester et de déployer rapidement de nouveaux modèles d'attrition à mesure que le comportement des clients évolue.
Le machine learning aide les prestataires de soins de santé à analyser les images médicales, les résultats d'analyses et les symptômes des patients pour faciliter les diagnostics et les traitements. À mesure que de nouvelles recherches médicales et données sur les patients deviennent disponibles, l'AutoML peut mettre à jour en continu les modèles existants pour s'assurer que les patients reçoivent les meilleurs soins possibles.
Les acteurs du retail utilisent des modèles pour prédire la demande de produits spécifiques à différents endroits, ce qui les aide à stocker les bons articles au bon moment. L'AutoML peut aider les opérations de retail à créer des modèles pour différentes catégories de produits ou emplacements de magasins et à réentraîner automatiquement les modèles à mesure que les conditions du marché changent.
L'AutoML permet aux plateformes d'e-commerce et aux services de covoiturage de déployer des modèles de tarification dynamique en intégrant automatiquement des flux de données en temps réel, et d'expérimenter rapidement différentes stratégies de tarification sur divers marchés, produits ou zones de service. Cela permet aux organisations de maximiser leurs revenus sans nécessiter d'ajustements de prix manuels fréquents.
Les plateformes AutoML offrent des avantages utiles à chaque entreprise. Elles peuvent accélérer le développement de modèles, réduire l'erreur humaine, libérer les data scientists pour des tâches plus stratégiques et démocratiser l'accès à l'IA dans toute l'organisation. Mais elles souffrent également de certaines limites inhérentes. Par exemple :
L'AutoML a tendance à appliquer des approches standard qui peuvent ne pas capturer les aspects uniques de problèmes spécialisés, passant potentiellement à côté de solutions personnalisées que des experts du domaine développeraient pour des secteurs ou des cas d'usage spécifiques.
Les systèmes AutoML manquent de contexte métier et d'expertise spécialisée pour des secteurs ou des domaines spécifiques, passant potentiellement à côté de nuances importantes qu'un expert humain pourrait saisir, telles que des régularités métier saisonnières ou des contraintes réglementaires.
Les plateformes AutoML ne peuvent pas corriger des données de qualité fondamentalement médiocre. Si vos données d'entrée sont biaisées, incomplètes ou non pertinentes, les systèmes automatisés généreront des résultats peu fiables.
Les utilisateurs avancés peuvent se heurter à des limites lorsqu'ils tentent de mettre en œuvre des techniques spécialisées, des algorithmes personnalisés ou des étapes de prétraitement complexes qui dépassent les capacités automatisées de la plateforme.
Bien que les plateformes AutoML gèrent le feature engineering de base, elles peuvent passer à côté de créations de caractéristiques avancées et spécifiques à un domaine qui amélioreraient significativement les performances du modèle.
Bien qu'une plateforme AutoML puisse être capable d'expliquer comment un seul modèle de ML fait des prédictions, les modèles d'ensemble complexes peuvent être beaucoup plus difficiles à interpréter ou à expliquer. Cela les rend inadaptées aux applications nécessitant des niveaux élevés de transparence, telles que les diagnostics de santé ou les approbations de prêts.
De nombreuses plateformes AutoML sont coûteuses et créent des dépendances vis-à-vis de systèmes propriétaires, ce qui rend difficile la migration des modèles vers d'autres environnements ou leur maintenance de manière autonome.
Ces limites expliquent pourquoi l'AutoML fonctionne mieux comme un outil pour augmenter l'expertise humaine, plutôt que de la remplacer complètement.
L'AutoML démocratise le machine learning en permettant aux experts du domaine de tous les secteurs de créer des modèles prédictifs sophistiqués sans expertise technique, compressant des mois de développement en quelques jours et accélérant considérablement l'adoption de l'IA en entreprise.
Les plateformes AutoML sont capables de tester systématiquement des centaines de combinaisons d'algorithmes pour identifier celles qui génèrent les résultats les plus fiables. Les plateformes appliquent également des bonnes pratiques constantes pour la validation et l'évaluation, réduisant les erreurs humaines qui peuvent compromettre la performance du modèle.
Cependant, les équipes doivent également tenir compte des limites de l'AutoML, qui incluent le manque de contexte sur le sujet, les problèmes potentiels d'interprétabilité et une forte dépendance à la qualité des données.
Lorsqu'il est mis en œuvre avec une attention appropriée à la gouvernance des données, à l'infrastructure de qualité et à la supervision humaine, l'AutoML peut être un outil puissant qui amplifie l'expertise humaine et permet aux organisations de faire évoluer les initiatives d'IA dans toute leur entreprise.
Le machine learning est le domaine plus vaste qui consiste à apprendre aux ordinateurs à apprendre des modèles à partir de données et à faire des prédictions. L'AutoML automatise les tâches complexes et chronophages du machine learning, telles que la sélection d'algorithmes et le réglage des paramètres. Essentiellement, le machine learning est la science et l'AutoML est un ensemble d'outils automatisés qui rend ces modèles accessibles aux non-scientifiques.
Les MLOps se concentrent sur les aspects opérationnels du déploiement, de la surveillance et de la maintenance des modèles de machine learning dans les environnements de production. L'AutoML automatise le développement initial et l'entraînement de ces modèles. Alors que l'AutoML vous aide à créer des modèles rapidement, les MLOps s'assurent qu'ils fonctionnent de manière fiable dans des applications du monde réel et continuent de bien fonctionner même lorsque les conditions changent.
Les principaux fournisseurs de technologie tels qu'Amazon, Google et Microsoft proposent des plateformes AutoML dans le cadre de leurs portefeuilles cloud. D'autres entreprises telles que DataRobot, H20.ai et IBM Watson fournissent des outils similaires. De plus, les entreprises peuvent tirer parti de bibliothèques Python open source gratuites comme Auto-sklearn et TPOT, qui automatisent les workflows scikit-learn avec un contrôle total sur la personnalisation.
L'AutoML évolue pour s'intégrer aux modèles de fondation et aux grands modèles de langage, permettant aux utilisateurs d'affiner des modèles pré-entraînés plutôt que de les créer de toutes pièces. Des outils AutoML spécialisés émergent pour des domaines tels que la vision par ordinateur, le traitement du langage naturel et la prévision de séries temporelles. De plus, les plateformes AutoML modernes se concentrent davantage sur l'explicabilité, les considérations éthiques liées à l'IA et les approches hybrides qui combinent des processus automatisés avec l'expertise et la supervision humaines.