Veille IA Veille IA sans buzz : pour stratèges québécois.
La veille

Un signal, pas une preuve : la ressemblance mesurée entre Qwen 3.8 et GPT-5.5 Pro

3 min de lecture · Hacker News (frontpage) · 9 sept. 2026
Vérification : Contexte manquant L'information est exacte, mais il lui manque un élément sans lequel on la comprend mal. « Un test de convergence des réponses suggère que Qwen 3.8 aurait pu être entraîné sur les traces de raisonnement de GPT-5.5 Pro (distillation). » Voir la publication d'origine (ouvre un nouvel onglet)

D'après Reasoning prefills on a few open models, v1.1 (gist de Meng Zhang / wsxiaoys) et Discussion Hacker News (item 49630026), relayé par Hacker News (frontpage)

Un signal, pas une preuve : la ressemblance mesurée entre Qwen 3.8 et GPT-5.5 Pro

Image : générée (Gemini)

Rédigé à partir de la source originale; chaque fait est vérifié contre le texte source.

À retenir

  • Le protocole (gist de Meng Zhang, TabbyML) compare, sur 45 problèmes, une réponse normale à une réponse amorcée avec le premier 1 % du raisonnement de GPT-5.5 Pro : chez Qwen3.8-A95B, la similarité des réponses passe de 16,79 % à 34,97 %, un bond de 18,18 points.
  • L'effet est le plus marqué sur les problèmes scientifiques et mathématiques (+26,99 points), et nettement plus fort que chez les modèles témoins testés en parallèle : DeepSeek V4 Flash (-1,17 point) et Kimi K3 (+4,54 points).
  • L'auteur formule l'hypothèse, prudemment, que Qwen aurait pu être exposé à des traces de raisonnement de GPT-5.5 Pro pendant son entraînement - une hypothèse, pas une démonstration : aucune donnée d'entraînement n'est montrée.
  • Repris sur Hacker News et Reddit, le test attire surtout des critiques méthodologiques : échantillon de 45 cas jugé trop petit, sans intervalle de confiance ni répétition avec d'autres formulations.
  • laveille.ai a déjà couvert d'autres facettes de la famille Qwen3.8 en août 2026 (prix, poids réel, performance sur Mac Studio) : cette fiche porte sur un angle distinct, la ressemblance mesurée avec GPT-5.5 Pro, pas sur les mêmes modèles ni la même question.

Pourquoi ça compte

Si le signal se confirmait par des tests indépendants plus rigoureux, il alimenterait un débat plus large sur la distillation entre laboratoires d'IA et la confiance qu'on peut accorder aux modèles ouverts. Mais l'échantillon est petit (45 cas), sans réplication connue, et une plus grande sensibilité de Qwen aux indices techniques pourrait aussi expliquer l'écart, sans impliquer de distillation : ce test mesure une ressemblance de comportement, pas une preuve d'entraînement.

Chiffre-clé

16,79 % à 34,97 % (+18,18 points) : c'est le bond de similarité mesuré par Meng Zhang (TabbyML) sur 45 problèmes, relayé sur Hacker News le 9 septembre 2026.

Action concrète

Avant de traiter une mesure comme celle-ci comme une preuve, vérifier si le protocole et les données brutes sont publiés - c'est le cas ici, dans le gist - et si d'autres l'ont reproduite de façon indépendante.

Repères datés

Fondée sur la source originale

Sources

🔧 Outils mentionnés

🔐 Connexion rapide

Entrez votre courriel pour recevoir un code à 6 chiffres.

Pas besoin de mot de passe ni d'inscription. Entrez votre courriel, recevez un code par courriel, et c'est tout !