Veille IA Veille IA sans buzz : pour stratèges québécois.
La veille

Ollama v0.33 branche Claude Desktop sur vos modèles locaux

3 min de lecture · github.com · 26 août 2026

D'après Ollama - notes de version 0.33.0 (GitHub)

Ollama v0.33 branche Claude Desktop sur vos modèles locaux

Image : générée (Gemini)

Rédigé à partir de la source originale; chaque fait est vérifié contre le texte source.

À retenir

  • Les notes de version parlent d'Ollama comme d'un « fournisseur de passage tiers » pour l'application de bureau Claude. Concrètement, le calcul se fait sur votre ordinateur, pas sur un serveur distant.
  • Le correctif le plus parlant touche le cache : sur les modèles à couches récurrentes, une requête dont 46 000 jetons sur 47 000 étaient déjà traités devait tout recalculer depuis zéro.
  • Les points de reprise d'un préremplissage interrompu, la phase où le modèle lit la requête avant de répondre, sont maintenant fiables « par construction » : une requête annulée puis relancée repart où elle s'était arrêtée.
  • Ollama a désactivé le message de compte à rebours de jetons de Claude Code. Il le plaçait en tête de requête, ce qui cassait le cache à chaque appel.
  • Côté installation : un empaquetage cassé par des hypothèses propres à macOS, qui touchait les versions Linux et Windows, est corrigé.

Pourquoi ça compte

Un modèle qui s'exécute sur votre machine change la trajectoire de ce que vous lui confiez : le texte soumis est traité localement, il ne part pas vers le serveur d'un fournisseur de modèles. N'en concluez pas à une confidentialité complète pour autant : l'application de bureau Claude reste un logiciel connecté, et les notes de version d'Ollama ne disent rien de ce qu'elle échange par ailleurs. Ce que cette version ajoute n'est donc ni de la puissance ni une garantie, c'est de la commodité : les notes annoncent qu'on peut « maintenant » configurer « facilement » ce raccordement.

Chiffre-clé

46 000 jetons sur 47 000 : la part d'une requête déjà traitée qui devait pourtant être recalculée depuis zéro, sur les modèles à couches récurrentes, avant ce correctif. Un jeton est le fragment de texte que le modèle traite un à un. Notes de version d'Ollama 0.33.0, 21 août 2026.

Citation

« Les développeurs peuvent maintenant configurer facilement l'application de bureau Claude pour qu'elle fonctionne avec Ollama comme fournisseur de passage tiers. » Notes de version d'Ollama 0.33.0, 21 août 2026 (traduit de l'anglais)

Action concrète

Pour essayer un modèle local : installer Ollama, y télécharger un modèle, puis le déclarer dans les réglages de l'application de bureau Claude. Vérifier d'abord la mémoire vive de la machine : c'est elle, et non un serveur distant, qui fera le calcul.

Fondée sur la source originale

Sources

🔧 Outils mentionnés

🔐 Connexion rapide

Entrez votre courriel pour recevoir un code à 6 chiffres.

Pas besoin de mot de passe ni d'inscription. Entrez votre courriel, recevez un code par courriel, et c'est tout !