Ollama 0.32.6 est disponible depuis le 4 août 2026, et la mise à jour vise directement celles et ceux qui font tourner une IA locale sur leur ordinateur. La version accélère automatiquement Qwen3.5 sur les GPU Apple grâce à la prédiction de plusieurs jetons à la fois, améliore la compatibilité avec l’API OpenAI et corrige quelques détails de l’interface en terminal. Ce n’est pas une nouvelle famille de modèles : c’est l’outil qui les fait tourner qui devient plus pratique.
La mise à jour intéresse surtout les utilisateurs de macOS Apple Silicon, les personnes qui branchent Ollama à une application existante et les curieux qui veulent garder leurs requêtes sur leur machine. Les utilisateurs Linux et Windows profitent aussi de plusieurs corrections, mais pas du gain MLX réservé à l’écosystème Apple. Et il y a un caillou dans la chaussure : la génération d’images expérimentale est temporairement retirée, avec la recommandation de rester en 0.32.5 si tu en as besoin.
Qwen3.5 accélère sans réglage supplémentaire
Le changement le plus visible concerne Qwen3.5 sur les Mac équipés d’une puce Apple. Ollama utilise désormais automatiquement la tête MTP du modèle pour proposer plusieurs jetons à l’avance, puis vérifier la réponse. Cette technique, appelée décodage spéculatif, évite de faire travailler le modèle au même rythme pour chaque morceau de texte et peut réduire le temps d’attente.
Le mot important est « automatiquement ». Tu n’as pas à choisir un paramètre obscur ni à installer un moteur séparé : la version 0.32.6 active le mécanisme quand le modèle et le matériel sont compatibles. Le gain dépendra évidemment de la puce, de la taille du modèle et de la longueur de la réponse. Ollama ne promet pas que ton vieux Mac deviendra une station de calcul ; il lui évite simplement quelques temps morts.

Visuel : carte du dépôt officiel Ollama sur GitHub, générée par GitHub à partir du projet public : https://github.com/ollama/ollama
Une API OpenAI moins surprenante
Ollama expose depuis longtemps une interface compatible avec l’API OpenAI, ce qui permet de brancher des clients existants sur un modèle local en changeant surtout l’adresse du serveur. La version 0.32.6 affine ce comportement pour les réponses diffusées en continu : le rôle n’apparaît que dans le premier morceau, la raison de fin arrive dans son propre morceau et l’usage des jetons est séparé quand l’option correspondante est activée.
Cela paraît technique, mais l’effet est concret. Une application qui attend le format habituel d’OpenAI a moins de chances de mal interpréter le flux, d’afficher une fin de réponse comme un nouveau message ou de perdre les statistiques de consommation. Pour un utilisateur, cela signifie surtout moins de rustines entre Ollama et les interfaces de discussion, les assistants de code ou les outils maison.
Les réponses coupées redeviennent lisibles
Autre correction utile : lorsqu’une réponse atteint la limite de longueur, Ollama renvoie désormais finish_reason: length au lieu de tool_calls. Le champ indique clairement qu’il manque de la place, au lieu de laisser croire à l’application qu’une fonction doit être exécutée. Les clients qui affichent ou journalisent cette information pourront donc expliquer correctement pourquoi la réponse s’arrête au milieu.
Ce genre de détail ne fera pas la une de ton écran, mais il évite des comportements pénibles dans les agents locaux. Une réponse tronquée n’est pas une demande d’outil ; la confondre avec un appel à une fonction peut déclencher une étape inutile ou bloquer un scénario automatisé. Les logiciels deviennent fiables quand ils arrêtent de raconter des histoires différentes avec le même champ JSON.
Une fonction retirée, et une limite à connaître
Ollama retire temporairement la génération d’images expérimentale dans cette version. Le projet recommande de rester sur 0.32.5 pour conserver cette possibilité. Ce retrait rappelle une règle simple avec les fonctions de laboratoire : elles peuvent disparaître ou changer de forme sans la stabilité d’un usage classique. Si tu avais installé Ollama uniquement pour créer des images localement, ne lance donc pas la mise à jour les yeux fermés.
Pour le reste, la version 0.32.6 met aussi à jour ses moteurs MLX et llama.cpp, corrige l’affichage de tableaux dans l’interface terminal et améliore la complétion de fichiers. Le modèle cloud Kimi K3 peut maintenant proposer son étiquette cloud au lieu d’échouer quand aucun tag local par défaut n’est publié. Ce sont de petites améliorations, mais elles touchent exactement les endroits où un outil local fait perdre du temps : téléchargement, affichage et branchement aux clients.
Faut-il installer Ollama 0.32.6 maintenant ?
Oui si tu utilises Qwen3.5 sur un Mac Apple Silicon, si tu relies Ollama à une application compatible OpenAI ou si tu veux les corrections générales. Avant la mise à jour, vérifie simplement si ton installation dépend de la génération d’images expérimentale. Dans ce cas, garde 0.32.5 ou prévois un retour arrière propre plutôt que de découvrir la disparition au moment où tu as besoin du bouton.
La vraie nouvelle est finalement assez saine : l’IA locale progresse aussi par plomberie. Un flux mieux formaté, une réponse correctement classée et quelques jetons économisés changent davantage l’usage quotidien qu’un slogan sur un modèle miraculeux. Le futur de l’IA sur ton ordinateur ressemble parfois moins à un robot brillant qu’à un tuyau qui fuit enfin un peu moins.
Sources
Ollama, notes de version officielles de la version 0.32.6, publiée le 4 août 2026 : https://github.com/ollama/ollama/releases
Ollama, documentation officielle de la compatibilité avec l’API OpenAI : https://github.com/ollama/ollama/blob/main/docs/openai.md
Ollama, blog officiel — historique des évolutions MLX et de la génération d’images expérimentale : https://ollama.com/blog
Dépôt officiel Ollama, fonctionnalités, code et documentation : https://github.com/ollama/ollama
—
Recherche, relecture et illustration assistées par IA. Le contenu reflète le travail éditorial de la rédaction.




No comments yet