153 essais autonomes, 18 modèles d'IA : aucun ne bat le record humain
D'après Prime Intellect - NanoGPT Speedrun Frontier (résultats et classement), relayé par Hacker News (frontpage)
Photo : Brett Sayles, Pexels
Rédigé à partir de la source originale; chaque fait est vérifié contre le texte source.
À retenir
- Sur la piste « optimiseur » de ce concours, on compte le nombre d'étapes d'entraînement nécessaires pour amener un petit modèle de langage à une qualité fixée. Moins il en faut, mieux c'est : le départ est à 3 290 étapes, le record humain à 2 600.
- Le meilleur résultat revient à Fable 5, qui descend à 2 726, soit 81,7 % de l'écart comblé entre le départ et le record humain. Il reste donc au-dessus de la barre humaine.
- Aucun autre modèle ne dépasse 53,6 % de l'écart comblé. Le deuxième, Opus 5, s'arrête à 2 920.
- Le meilleur score est aussi celui qui a demandé le plus de temps : Fable 5 a travaillé 8,7 jours en autonomie, contre 2,9 jours pour Opus 5.
- Ce classement se lit avec prudence : Prime Intellect a conçu le banc d'essai, l'a exécuté, et son propre outil d'orchestration « prime-agent » y figure au troisième rang.
Pourquoi ça compte
Les classements de modèles mesurent d'ordinaire des réponses à des questions. Ici, on mesure autre chose : la capacité à mener seul un travail de recherche long, avec des essais, des erreurs et des reprises. Le résultat donne un plafond chiffré plutôt qu'une impression, et ce plafond reste sous la barre humaine.
Chiffre-clé
2 726, le meilleur résultat obtenu par une IA (Fable 5), contre 2 600 pour le record humain et 3 290 au point de départ, selon Prime Intellect le 22 août 2026. Soit 81,7 % de l'écart comblé, mais pas franchi.
Action concrète
Prime Intellect publie 41 enregistrements complets du travail de ses agents, avec les appels d'outils et les brouillons. C'est une occasion rare de voir comment une IA s'y prend sur une tâche longue, plutôt que de s'en tenir au score final.
Fondée sur la source originale
Sources
- Prime Intellect - NanoGPT Speedrun Frontier (résultats et classement) : Source primaire : page de recherche du laboratoire, qui publie ses propres mesures.
- Relais média : Hacker News (frontpage) → · Lire en français