Comment DeepSeek décrit son propre fonctionnement
L'article explore le fonctionnement de DeepSeek via une interview du modèle lui-même. Le modèle distingue observations, inférences et suppositions, admettant ne pas voir ses propres poids. L'auteur compare ensuite ces déclarations aux publications publiques.
« DeepSeek clearly separates what it knows from what it is inferring. » - Hacker News (frontpage)
Que faut-il retenir ?
- DeepSeek sépare ses réponses en observations, inférences et suppositions.
- Le modèle admet ne pas voir ses propres poids, routage ou cartes d'attention.
- L'interview est comparée aux publications publiques pour vérifier les déclarations.
- DeepSeek mentionne utiliser Transformer + MoE, avec seulement un sous-ensemble de paramètres activés par entrée.
Pourquoi cette nouvelle compte-t-elle ?
Cette analyse montre comment un modèle d'IA peut décrire son propre fonctionnement, tout en révélant ses limites. Cela aide les développeurs à comprendre le comportement des modèles et leurs contraintes, essentiel pour leur utilisation et amélioration.
256 experts, 671B/37B params
Public concerné : développeurs
Comment DeepSeek décrit-il son propre fonctionnement interne ?
DeepSeek sépare ses réponses en observations, inférences et suppositions. Il admet ne pas voir ses propres poids ou architecture interne, mais décrit des éléments comme l'utilisation de Transformer + MoE, vérifiés par des publications publiques.
🔧 Outils mentionnés