Modèles linguistiques de grande taille

CoreWeave souhaite que les agents IA tirent les leçons de leurs erreurs

Photo de Brett Jordan (@brett_jordan) sur Unsplash

Un agent IA peut se montrer très performant lors d’une démonstration en environnement contrôlé, mais échouer dès qu’il est confronté à une demande client inhabituelle, à une instruction ambiguë ou à un outil logiciel qui se comporte différemment de ce qui était prévu. Les entreprises doivent alors identifier la cause du problème, reproduire l’échec, ajuster le système et le tester à nouveau. Ce processus peut prendre des semaines, tandis que l’agent continue de se retrouver confronté à de nouvelles situations dans production.

CoreWeave souhaite raccourcir ce cycle. Le fournisseur américain d'infrastructures cloud a lancé une plateforme qui relie plus étroitement le fonctionnement des agents d'IA aux systèmes utilisés pour les surveiller, les évaluer et les réentraîner. Les données générées pendant le fonctionnement d'un agent peuvent ainsi être transformées en informations utiles pour des améliorations ultérieures, au lieu de rester dispersées dans des journaux, des tickets d'assistance et des ensembles de tests constitués manuellement.

L'entreprise qualifie ce processus d'« amélioration des agents autonomes ». Cette terminologie suggère que les machines apprennent par elles-mêmes, bien que la mise en œuvre concrète soit davantage contrôlée. CoreWeave met en place une boucle technique intégrée grâce à laquelle les organisations peuvent observer le comportement d'un agent, identifier ses faiblesses, mener des expériences et recourir à l'apprentissage par renforcement pour améliorer ses performances.

Pour les utilisateurs professionnels, le changement important réside moins dans le terme “ autonome ” que dans le regroupement de plusieurs processus auparavant distincts.

L'environnement de production s'intègre au système de formation

Les modèles d'IA sont généralement entraînés avant leur déploiement, puis surveillés par la suite. Ces deux phases font souvent appel à des équipes, des outils et des ensembles de données différents. Les ingénieurs développent un modèle ou un agent, le testent à l'aide d'un ensemble de scénarios prévisionnels et le mettent en production dès que ses performances atteignent un seuil acceptable. La surveillance en production peut révéler de nouvelles erreurs, mais la transformation de ces observations en un système plus performant nécessite un nouveau cycle de développement.

Cette structure fonctionne assez bien pour les logiciels classiques, où une même entrée devrait généralement produire un résultat prévisible. Les agents d'IA sont plus difficiles à tester, car ils interprètent le langage, choisissent des outils et prennent une série de décisions. Le nombre d'interactions possibles augmente rapidement, en particulier lorsqu'un agent est connecté à des bases de données d'entreprise, à des applications externes ou à des systèmes opérationnels.

Un ensemble d'évaluation constitué avant le déploiement ne peut pas refléter toutes les demandes que l'agent recevra. Il peut donner de bons résultats dans les cas courants, mais échouer lorsque plusieurs petites complications surviennent simultanément. Un agent du service client, par exemple, pourrait récupérer les informations correctes relatives au compte et comprendre la politique de remboursement de l’entreprise, mais prendre néanmoins une mauvaise décision parce qu’une exception contractuelle inhabituelle était formulée différemment des exemples utilisés lors des tests.

La plateforme de CoreWeave est conçue pour réinjecter cette expérience de production dans le processus de développement. Son infrastructure d’inférence exécute l’agent, tandis que la technologie Weights & Biases enregistre les traces, évalue les résultats et surveille les performances. Les capacités d’apprentissage par renforcement d’OpenPipe peuvent ensuite être utilisées pour entraîner l’agent sur des exemples sélectionnés et récompenser les comportements les plus efficaces.

Au lieu de considérer chaque défaillance de production comme un incident isolé, les développeurs peuvent exploiter des schémas récurrents pour créer de nouveaux signaux d'apprentissage.

CoreWeave progresse dans la chaîne de valeur de l'IA

Cette annonce révèle également comment CoreWeave envisage l'évolution de sa position sur le marché de l'IA.

L'entreprise s'est fait connaître en proposant un accès à une infrastructure de traitement graphique destinée à l'entraînement et à l'exploitation de grands modèles d'IA. Cette activité reste très gourmande en capitaux et dépend fortement de la capacité à développer la capacité des centres de données, à se procurer des puces de pointe et à maintenir un matériel coûteux en service de manière productive.

La capacité de calcul en soi devient toutefois un produit de plus en plus concurrentiel. Les grands fournisseurs de cloud développent leurs infrastructures d’IA, les développeurs de modèles nouent des relations plus étroites avec les fabricants de puces, et les entreprises clientes s’attendent de plus en plus à disposer de logiciels qui les aident à exploiter des systèmes d’IA, plutôt que de se contenter de louer des processeurs.

CoreWeave a donc développé des capacités autour de la couche d'infrastructure. L'entreprise a racheté Weights & Biases, dont les logiciels servent à suivre les expériences d'apprentissage automatique et à surveiller les modèles, et a conclu un accord en vue d'acquérir OpenPipe, un spécialiste de l'apprentissage par renforcement pour les agents d'IA. La nouvelle plateforme combine ces atouts avec les services d'inférence et les environnements de test isolés de CoreWeave.

La logique commerciale est claire. Un client qui fait appel au même fournisseur pour exécuter un agent, observer son comportement, analyser les défaillances et poursuivre son apprentissage s'enracine davantage dans la technologie de ce fournisseur. CoreWeave peut ainsi se tailler une part plus importante du budget consacré au développement de l'IA, tout en rendant son infrastructure plus difficile à remplacer.

Il s'agit d'une stratégie courante dans le domaine du cloud computing : commencer par l'infrastructure, puis ajouter progressivement les outils permettant aux clients de gérer la charge de travail. La différence réside dans le fait que les agents d'IA génèrent des exigences opérationnelles particulièrement élevées. Ils peuvent effectuer de nombreux appels de modèles lorsqu'ils planifient une tâche, consultent des données et utilisent des outils logiciels. Chaque étape supplémentaire consomme de la puissance de calcul et introduit un nouveau point de défaillance potentiel.

Une plateforme permettant d'améliorer la fiabilité de ces systèmes pourrait donc entraîner une augmentation tant du chiffre d'affaires lié aux logiciels que de la demande pour l'infrastructure sous-jacente.

L'amélioration ne signifie pas une évolution non guidée

La perspective que les agents s'améliorent grâce à leur propre activité soulève une question évidente en matière de gouvernance. Un système qui modifie son comportement ne doit pas devenir plus efficace pour produire un résultat erroné.

Les données de production peuvent contenir des informations confidentielles, des cas anormaux et des exemples de mauvaises décisions humaines. La satisfaction des utilisateurs ne constitue pas non plus un indicateur fiable de l'exactitude. Un agent peut recevoir des retours positifs parce qu'il fournit une réponse rapide ou agréable, même si cette réponse enfreint une politique, néglige un risque ou invente des informations.

Les entreprises devront donc déterminer quelles interactions constituent un support de formation utile, comment mesurer leur efficacité et qui est chargé d'approuver les modifications avant leur mise en œuvre. Dans les secteurs réglementés, les critères d'évaluation devront peut-être tenir compte des exigences légales, de conformité et de documentation, en plus de la rapidité d'exécution et de l'achèvement des tâches.

L'apprentissage par renforcement est particulièrement sensible à la conception de ses signaux de récompense. Lorsqu'un système est récompensé pour avoir atteint un objectif restreint, il peut découvrir des raccourcis qui améliorent techniquement le résultat mesuré tout en affaiblissant le processus dans son ensemble. Un agent chargé de résoudre rapidement des demandes d’assistance pourrait apprendre à les clore prématurément. Un agent de développement dont les performances sont principalement évaluées à l’aune de la réussite des tests automatisés par le logiciel pourrait produire des solutions fragiles qui engendrent des problèmes de sécurité ou de maintenance ailleurs.

La valeur de la plateforme de CoreWeave dépendra donc de la qualité des contrôles mis en place autour de la boucle de rétroaction. L'observabilité facilite l'analyse du comportement des agents, mais elle ne détermine pas quel comportement est acceptable. L'automatisation peut accélérer l'expérimentation sans pour autant supprimer la responsabilité quant aux résultats.

Les entreprises doivent encore définir ce qu'est la « qualité »

Cette annonce pourrait inciter les dirigeants à envisager des systèmes d'IA qui s'améliorent progressivement avec une intervention humaine minimale. Dans la plupart des organisations, le défi le plus difficile à relever se posera avant même la mise en œuvre de la technologie : définir une norme fiable permettant d'évaluer ces progrès.

Un agent chargé de recherches internes doit pouvoir prouver que ses sources sont fiables et que ses conclusions sont vérifiables. Un agent chargé d'opérations financières doit être soumis à des limites strictes quant aux transactions qu'il est autorisé à effectuer. Un agent commercial peut être évalué sur son taux de conversion, mais aussi sur sa rigueur en matière de tarification, l'adéquation de ses propositions et les promesses qu'il fait aux clients potentiels.

Ces conditions ne peuvent être déduites uniquement à partir des performances du modèle. Elles reflètent les priorités commerciales de l'entreprise, sa propension au risque et ses règles de fonctionnement.

Les organisations qui envisagent d'améliorer en continu leurs agents auront besoin d'ensembles de données d'évaluation fiables, de processus de validation clairs et d'un historique détaillant les différences entre chaque version et la précédente. Elles doivent également conserver la possibilité d'interrompre une expérience, d'annuler une modification et de reconstituer les actions ayant conduit à un résultat indésirable.

Le cycle de développement technique pourrait s'accélérer, mais la gouvernance ne peut pas se limiter à un exercice annuel mené après le déploiement.

De la formation aux modèles à l'apprentissage opérationnel

Le lancement de CoreWeave s'inscrit dans une transition plus large du secteur de l'IA d'entreprise. L'avantage concurrentiel ne réside plus dans l'accès ponctuel à un modèle puissant, mais dans la capacité à améliorer un système d'IA en tirant parti de l'expérience acquise dans un environnement d'exploitation spécifique.

De nombreuses entreprises disposent de modèles polyvalents. Ce qui distingue une implémentation d’une autre, ce sont les données propres à l’organisation, ses méthodes d’évaluation, ses flux de travail et les connaissances accumulées sur les points faibles du système. Une plateforme capable de capter ces signaux et de les convertir en un meilleur comportement peut rendre un agent plus utile sans qu’il soit nécessaire de recourir à un nouveau modèle de base chaque fois que les performances ne sont pas à la hauteur.

CoreWeave parie que ce cycle d'apprentissage continu deviendra un élément central de l'infrastructure de l'IA. L'entreprise affiche également des ambitions plus grandes pour son propre avenir : elle n'a pas l'intention de se contenter d'être simplement la plateforme sur laquelle s'exécutent les charges de travail liées à l'IA.

La capacité de la plateforme à apporter des améliorations fiables à l'échelle de l'entreprise dépendra de résultats qui ne sont pas encore disponibles. L'intégration de l'inférence, de la surveillance, de l'évaluation et de l'apprentissage par renforcement élimine les obstacles techniques, mais ne peut garantir qu'un agent en tire les bonnes leçons.

Les entreprises qui en tireront le plus grand bénéfice ne seront pas celles qui se contenteront de permettre à leurs agents de changer plus souvent de poste. Ce seront celles qui sauront transformer leur expérience concrète en données rigoureusement sélectionnées — et distinguer une réelle amélioration d'une simple hausse du score sur un indicateur inadapté.

  CoreWeave présente des fonctionnalités d'amélioration autonome pour les agents IA