Explor.ai
Une pile d’IA générative mieux gouvernée sur Amazon Bedrock pour améliorer les marges SaaS
/ En bref
Explor.ai est une société de conseil en intelligence artificielle qui conçoit des solutions sur mesure pour ses clients. L’une d’elles est Estimai, une plateforme automatisée d’analyse de plans de construction qui combine l’IA générative aux modèles de vision par ordinateur d’Explor.ai, entraînés spécialement à cette fin, pour extraire des données structurées de plans d’architecture complexes. À mesure qu’Estimai prenait de l’envergure, sa pile d’IA multifournisseur rendait difficile l’évaluation du coût réel de traitement de chaque document ou de la consommation générée par chaque client. Ingeno a regroupé les charges de travail d’IA générative d’Estimai sur Amazon Bedrock et mis en place une couche d’accès gouvernée qui mesure et attribue chaque appel de modèle. Explor.ai dispose ainsi d’une vue plus claire des coûts par service, modèle, type de document et client. L’entreprise peut donc s’appuyer sur ces données pour optimiser ses marges, orienter ses décisions en matière de tarification à l’usage et simplifier l’exploitation de la plateforme, sans compromettre les délais de traitement.
Durée
3 mois
Catégorie
Services en ligne
Projet
Gouvernance des coûts d’IA générative sur Amazon Bedrock
/ Le client
Une société de conseil en IA derrière un SaaS de construction
Explor.ai est une société de conseil en intelligence artificielle qui conçoit et développe des solutions d’IA sur mesure. Estimai est l’une de ces solutions : un produit SaaS destiné au secteur de la construction. À partir de plans d’architecture au format PDF, Estimai extrait des données structurées sur des éléments comme les fenêtres, les prises électriques, les murs-rideaux, les tableaux et les légendes.
Les entrepreneurs utilisent Estimai pour préparer des soumissions précises beaucoup plus rapidement qu’en lisant les plans manuellement. Estimai est une plateforme SaaS multilocataire en production qui sert des clients payants et traite à grande échelle des documents complexes, avec des résultats attendus en quelques secondes.
Au-delà des modèles de fondation, l’équipe de science des données d’Explor.ai développe et réentraîne continuellement ses propres modèles de vision par ordinateur à partir de ses données de construction annotées. Ces modèles réalisent les tâches spécialisées de détection et de segmentation qu’exige la lecture de plans. Cette capacité est entièrement développée à l’interne par Explor.ai.
/ Le défi
L’inférence n’est pas une dépense informatique, c’est un coût des produits vendus
L’IA générative est au cœur d’Estimai. Chaque document téléversé par un client déclenche des charges de travail qui sollicitent des modèles de fondation. Le coût de l’inférence ne constitue donc pas une simple dépense informatique : il fait partie du coût des produits vendus.
Au fil de l’évolution de la plateforme, ces charges de travail ont été réparties entre plusieurs fournisseurs : l’un pour les modèles de langage, un autre pour la reconnaissance optique de caractères (ROC) des documents, un autre encore pour l’orchestration des pipelines, en plus d’AWS. Comme chaque fournisseur présentait ses coûts différemment, il était difficile d’obtenir une vue unifiée des coûts d’exploitation variables de la plateforme.
Cette situation soulevait deux défis commerciaux étroitement liés.
D’abord, Explor.ai devait connaître le coût réel du traitement d’un document et déterminer quels services, modèles ou types de documents étaient à l’origine de ces coûts. Sans cette visibilité, il était difficile d’établir l’ordre de priorité des possibilités de réduction des coûts.
Ensuite, l’entreprise avait besoin de mieux comprendre la consommation par client. Dans un environnement SaaS multilocataire où l’utilisation peut varier considérablement d’un client à l’autre, cette information est essentielle pour prendre des décisions de tarification et de facturation qui reflètent la consommation réelle.
Toute modification devait également préserver les performances de traitement de la plateforme. Estimai permet de préparer des soumissions de façon interactive; l’amélioration de la gouvernance des coûts ne pouvait donc pas se faire au détriment de la latence.
/ La solution
Une couche d’accès gouvernée sur Amazon Bedrock
Ingeno a regroupé les charges de travail d’IA générative d’Estimai sur Amazon Bedrock et mis en œuvre une couche de gouvernance conçue pour mesurer et attribuer chaque invocation de modèle.
Plutôt que de réécrire chaque service applicatif afin qu’il communique directement avec Amazon Bedrock, Ingeno a conservé l’abstraction de modèles déjà utilisée par la plateforme et l’a reliée à un serveur mandataire gouverné exécuté sur AWS Fargate. Les services applicatifs font référence à des alias de modèles stables, tandis que le serveur mandataire associe ces alias à des profils d’inférence d’application Amazon Bedrock dédiés.
Cette approche permet d’attribuer l’utilisation des modèles et les coûts par service et par environnement dans AWS Cost Explorer. En parallèle, le serveur mandataire consigne chaque requête en y associant le client qui la génère. Explor.ai obtient ainsi une vue presque en temps réel de la consommation de ses clients, parallèlement au rapprochement des coûts AWS.
Grâce à cette visibilité, Explor.ai peut repérer les parcours de traitement les plus coûteux et intervenir. Chaque tâche peut être acheminée vers un modèle de taille appropriée, la mise en cache des invites d’Amazon Bedrock peut être appliquée aux instructions récurrentes et les fonctions redondantes de fournisseurs externes peuvent être regroupées sur AWS. Le transfert d’une plus grande partie des charges de travail vers AWS a également donné accès à des possibilités de financement AWS qui n’étaient pas offertes avec l’ancienne pile fragmentée.
La même couche de gouvernance centralise aussi la gestion des versions de modèles au moyen d’alias, assure un mécanisme de repli en cas d’erreur d’un fournisseur, partage les limites de débit et les périodes de temporisation entre les instances, et empêche les services applicatifs de contourner le parcours gouverné. La charge de travail s’exécute dans la région AWS Canada (Centre) afin de répondre aux exigences de résidence des données.
Au-delà de l’IA générative, le mandat a également permis de regrouper d’autres charges de travail de la plateforme sur AWS. Les tâches plus légères des pipelines s’exécutent sur AWS Lambda et AWS Step Functions, les services plus exigeants de traitement de documents s’exécutent sur AWS Fargate, les documents sont stockés dans Amazon S3 et les charges de travail de ROC ont été transférées vers Amazon Textract. Cette démarche a réduit le nombre de fournisseurs externes nécessaires à l’exploitation de la plateforme et a regroupé une plus grande part des coûts globaux dans un seul environnement infonuagique.
/ Les résultats
Attribution complète des coûts, calcul divisé par deux, latence préservée
La couverture de l’attribution des coûts est passée de pratiquement 0 % à 100 % des requêtes d’IA générative acheminées par la couche gouvernée. Chaque requête est maintenant attribuée à un client, à un service et à un modèle. Avant le mandat, aucune de ces dépenses ne pouvait être attribuée.
Explor.ai peut repérer les parcours de traitement coûteux et accorder la priorité à des possibilités concrètes d’optimisation, comme le choix de modèles de taille appropriée et la mise en cache des invites.
La consommation peut être mesurée par client, ce qui fournit les données nécessaires pour prendre des décisions de tarification et de facturation fondées sur l’utilisation réelle plutôt que sur des moyennes globales.
Les délais de traitement ont été préservés. La plateforme exécute jusqu’à 75 appels parallèles à des modèles de fondation pour un même document, avec des résultats attendus en quelques secondes. Lors de la mise en service, le trafic réel des clients a été acheminé par la couche gouvernée vers Amazon Bedrock sans aucune régression par rapport aux critères de latence convenus.
Les coûts de calcul ont été divisés par deux. Le calcul représente environ le tiers des coûts variables de la plateforme.
Environ 90 % des coûts variables de la plateforme sont désormais engagés sur AWS. Trois fournisseurs externes ont été retirés du périmètre opérationnel.
Les alias de modèles centralisés, le mécanisme de repli et la limitation partagée du débit facilitent une gestion cohérente des modèles dans l’ensemble des services.
L’un des principaux enseignements du mandat est que le simple transfert d’un modèle vers Amazon Bedrock ne réduit pas, à lui seul, le prix de l’inférence. La valeur commerciale découle de la gouvernance et de la visibilité établies autour de ces charges de travail : comprendre l’origine des coûts, sélectionner le bon modèle pour chaque tâche, mettre en cache les instructions répétées, regrouper les services aux fonctions redondantes et tirer parti des programmes AWS offerts.
/ Technologies
Amazon Bedrock, AWS Fargate, AWS Lambda, AWS Step Functions, Amazon Textract, Amazon S3, Amazon RDS, Amazon ElastiCache, Amazon Cognito et AWS Secrets Manager.
/ Technologies

