Un bras robotique s’approche d’un tiroir de cuisine, referme la pince sur la poignée, tire, et rate. Il recommence : même geste, même échec. Un robot ordinaire répéterait cette scène indéfiniment, prisonnier d’une mémoire qui s’efface à chaque tentative. Un système présenté fin juin 2026 par les laboratoires de recherche de NVIDIA et quatre universités américaines change cette donne : voici, documenté à grande échelle, un robot qui apprend de ses erreurs, les couche noir sur blanc, et les relit la prochaine fois qu’il affronte un problème semblable, même sur un bras totalement différent.

L’amnésie, maladie chronique des robots codeurs

Depuis quelques années, une partie des roboticiens confie la programmation des gestes non plus à des ingénieurs, mais à un modèle de langage : cette même famille d’intelligence artificielle qui rédige des textes ou répond à des questions, ici détournée pour écrire de courts programmes qui pilotent bras et pinces. L’idée séduit. Plutôt que de deviner un mouvement au hasard, le robot écrit un vrai code, l’exécute, observe s’il a réussi, puis corrige sa copie.

Le problème, documenté par l’équipe de Runyu Lu et de ses coauteurs de NVIDIA, de l’Université du Michigan, de Berkeley et de Carnegie Mellon, est que ce travail de correction part systématiquement à la poubelle une fois la tâche terminée. Le robot qui a mis vingt minutes à comprendre comment attraper un bol sans le renverser oubliera tout au bol suivant. Un roboticien humain, lui, ne repart jamais de zéro : quinze ans à réparer des prises ratées finissent par devenir un réflexe. C’est cet écart, entre la mémoire qui s’accumule chez l’humain et celle qui s’efface chez la machine, que l’équipe a voulu combler avec un système baptisé ASPIRE.

https://research.nvidia.com/labs/gear/aspire/assets/videos/EvoForestCover.mp4?v=6

Un carnet de bord pour bras robotiques

ASPIRE repose sur trois pièces qui s’emboîtent. La première observe : chaque tentative de préhension, chaque trajectoire du bras, est enregistrée en détail, avec des images, pour qu’on puisse rejouer l’instant précis où tout a dérapé plutôt que de constater un simple échec global.

La deuxième pièce est la vraie nouveauté : une bibliothèque de compétences (les « skills »), un peu comme un carnet de bord que le robot tiendrait lui-même à jour. Chaque fois qu’une correction fonctionne, elle y est consignée sous une forme précise : dans quelle situation elle s’applique, quel était le problème, et un exemple de code qui le résout. La fois suivante, avant d’écrire un nouveau programme, le robot consulte ce carnet plutôt que de repartir d’une page blanche.

La troisième pièce, une recherche évolutionniste (le système génère plusieurs variantes de solutions différentes, un peu comme une sélection naturelle accélérée, et ne conserve que les meilleures), l’empêche de s’entêter indéfiniment sur une même idée vouée à l’échec.

Illustration : exemple de journal de bord détaillé tenu par ASPIRE lors d’une tentative de saisie d’une radio, avec la correction de trajectoire trouvée par le système (source : NVIDIA GEAR Lab et coauteurs, arXiv:2607.00272).

Un robot qui apprend de ses erreurs, chiffres à l’appui

Les résultats, publiés dans un article scientifique mis en ligne début juillet 2026 sur arXiv (une plateforme où les chercheurs déposent leurs études avant leur validation formelle par d’autres scientifiques), mesurent un vrai saut. Sur un test classique de manipulation à deux bras, se passer un objet de main en main, le taux de réussite grimpe de 20 % pour un robot codeur ordinaire à 92 % une fois équipé de la bibliothèque de compétences d’ASPIRE, selon les auteurs. Sur des tâches ménagères simulées, comme aller chercher une radio posée sur un meuble, la réussite passe de 56 % à 88 %.

Le résultat le plus parlant concerne toutefois les tâches que le robot n’a jamais vues. En réutilisant les compétences accumulées sur quatre-vingt-dix tâches d’entraînement, ASPIRE réussit une tâche inédite et longue, qui enchaîne plusieurs étapes, dans 31 % des cas, contre 4 % pour les méthodes précédentes. Et sur un vrai bras, hors simulation, une compétence apprise a même pu être transférée à un second robot de conception différente pour soulever une canette : la réussite est passée de 13 tentatives sur 20 à 19 sur 20, avec près de dix fois moins de calcul nécessaire pour y parvenir, précise l’équipe.

Le vrai basculement : apprendre sans tout réapprendre

Ce que révèle surtout ASPIRE, au-delà des pourcentages, c’est un changement de méthode. Jusqu’ici, améliorer une intelligence artificielle voulait presque toujours dire une chose : la réentraîner, en ajustant des milliards de paramètres numériques internes grâce à une technique appelée descente de gradient (imaginez des millions de minuscules cadrans que l’on tourne d’un cran à chaque essai, jusqu’à ce que le comportement s’améliore). Cette méthode fonctionne, mais elle coûte cher et son résultat final, un amas de chiffres, reste largement impossible à inspecter ou à corriger à la main.

Jim Fan, chercheur chez NVIDIA qui codirige le laboratoire à l’origine du projet, résume le basculement : l’entraînement ne repose plus sur la descente de gradient mais sur le raffinement de compétences, et le produit fini n’est plus un tas de poids numériques mais une bibliothèque qui grandit sans cesse. L’enjeu dépasse la robotique : si perfectionner une machine peut consister à lui faire tenir des notes lisibles plutôt qu’à la réentraîner intégralement, corriger une erreur ou vérifier ce qu’une IA a vraiment appris devient, en théorie, à la portée de quiconque sait lire du code, pas seulement d’un supercalculateur. C’est une question que nous posions déjà à propos des modèles de monde utilisés par l’industrie de l’IA : distinguer le prouvé du promis.

La mémoire, nouvel organe des robots

ASPIRE n’est ni un bras, ni une pince, ni un capteur : c’est un logiciel, ce qui rend son rôle moins spectaculaire à filmer, mais tout aussi décisif. Si l’on compare un robot à un corps, ASPIRE ne touche ni aux muscles, ces moteurs qui font bouger les articulations, ni à la peau, ces capteurs qui perçoivent le contact. Il agit plutôt comme la mémoire musculaire que développe un artisan à force de répéter un geste.

La preuve la plus convaincante tient dans un détail technique : des compétences apprises en simulation sur un bras de type Franka, une référence académique courante, ont été réutilisées presque telles quelles sur un robot à deux bras entièrement différent, dans le monde réel. Cette mémoire des erreurs n’est donc pas soudée à un squelette particulier. Elle voyage d’un corps de robot à un autre, ce qui en fait une pièce potentiellement partageable, un peu à l’image du chemin parcouru par les robots humanoïdes pour passer des laboratoires aux chaînes de montage.

Illustration : compétences apprises en simulation (préhension, navigation, ouverture de tiroir) puis transférées sur des bras robotiques réels (source : NVIDIA GEAR Lab et coauteurs, arXiv:2607.00272).

Ce qu’ASPIRE ne sait pas encore faire

Les auteurs eux-mêmes tempèrent l’enthousiasme. ASPIRE n’est pas un système capable d’apprendre seul, en continu, dans le monde réel sans supervision : il lui manque des garde-fous essentiels, comme la capacité à vérifier de façon fiable qu’une tâche a bien été réussie, ou à remettre une scène en état après un essai raté sans risquer d’endommager le matériel.

Le système dépend en outre d’un modèle de langage de pointe, coûteux à faire fonctionner, et rien ne garantit qu’un modèle plus petit suffirait à soutenir la même boucle de correction, une question d’accès qui pourrait creuser l’écart entre laboratoires richement dotés et équipes plus modestes. La bibliothèque de compétences, enfin, ne dispose d’aucun mécanisme pour être nettoyée à mesure qu’elle grossit : rien n’empêche, à terme, qu’elle s’encombre de fausses bonnes idées.

Il faut aussi garder à l’esprit ce que signifie vraiment ce chiffre de 31 % sur les tâches inédites : sept fois sur dix, le robot échoue encore. Le progrès est réel, mais l’autonomie fiable au quotidien reste, pour l’instant, une promesse plutôt qu’un fait acquis.

Retour au tiroir de cuisine

Reprenons la scène du départ. Le même tiroir, la même pince qui referme dans le vide. Mais cette fois, après l’échec, le bras ne répète pas machinalement le geste qui n’a pas fonctionné : quelque part dans sa mémoire logicielle, une note laissée par une tentative précédente lui souffle d’essayer un angle d’approche différent.

Rien d’intelligent, à proprement parler, dans ce réflexe : seulement une trace qui persiste là où, hier encore, il n’y avait que l’oubli. Les chercheurs se gardent bien de parler d’intuition. Mais ils viennent peut-être d’en écrire le premier brouillon.

Sources

Lire l’étude complète : « ASPIRE: Agentic Skills Discovery for Robotics », arXiv:2607.00272 (2026).

Laisser un commentaireAnnuler la réponse.