Veille IA Veille IA sans buzz : pour stratèges québécois.
La veille

GPT-6 Astra en robotique : 7 tâches sur 100 réussies, et d'où vient vraiment le « saut qualitatif »

2 min de lecture · The Decoder · 12 sept. 2026
Vérification : Présentation trompeuse Le contenu est authentique, mais présenté d'une manière qui lui fait dire autre chose. « GPT-6 Astra montrerait un « saut qualitatif » en raisonnement spatial, d'après des bancs d'essai précoces. » Voir la publication d'origine (ouvre un nouvel onglet)

D'après The Decoder : « GPT-6 Astra appears to show a "step change" in spatial reasoning based on early benchmarks », relayé par The Decoder

GPT-6 Astra en robotique : 7 tâches sur 100 réussies, et d'où vient vraiment le « saut qualitatif »

Image : générée (Gemini)

Rédigé à partir du média cité; chaque fait est vérifié contre le texte source.

À retenir

  • Les chiffres viennent d'un banc d'essai dont le texte ne nomme aucune organisation ni affiliation : seulement un dépôt public contenant le code, les vidéos et les résultats.
  • 7 sur 100 et 46 sur 100 disent deux choses différentes : la tâche menée à terme, et la distance parcourue vers elle. Le second flatte davantage que le premier.
  • La formule « saut qualitatif en raisonnement spatial » est l'appréciation d'un chercheur, Yoav Artzi, portant sur un AUTRE banc, REMAP, encore non publié et sans chiffre.
  • Le même chercheur pose sa propre limite : même GPT-6 Astra n'atteint pas ce que font les humains dans d'autres situations.
  • L'hypothèse d'un entraînement sur de grandes quantités de données 3D est présentée comme une supposition, pas comme un fait confirmé par OpenAI.

Pourquoi ça compte

Deux affirmations voyagent ensemble alors qu'elles ne reposent pas sur la même chose : des chiffres publiés avec leur code d'un côté, l'impression d'un chercheur sur un banc non publié de l'autre. C'est la seconde qui donne le titre, et c'est la première qui est vérifiable. Le tri n'est pas un détail de style : il décide de ce qu'on peut affirmer.

Chiffre-clé

7 tâches entièrement complétées sur 100 par GPT-6 Astra, contre 0 pour MolmoAct2, sur les mêmes robots à deux bras. Score de progression médian : 46 sur 100 contre 12. Le texte parle par ailleurs de 200 essais sans préciser comment ils se répartissent entre les deux modèles.

Action concrète

Devant une annonce de « saut qualitatif », chercher à quel banc d'essai le chiffre est rattaché. Ici, le banc qui porte les chiffres n'est pas celui qui porte la formule : celui de la formule n'est pas publié.

D'après un média relais

Sources

🔧 Outils mentionnés

🔐 Connexion rapide

Entrez votre courriel pour recevoir un code à 6 chiffres.

Pas besoin de mot de passe ni d'inscription. Entrez votre courriel, recevez un code par courriel, et c'est tout !