Illustration sombre d’un assistant IA local fonctionnant sur un téléphone et un ordinateur

LFM2.5-2.6B : l’agent IA local qui tient dans un téléphone

LFM2.5-2.6B fait tourner un agent IA local sur un téléphone ou un petit PC. Vitesse, outils, confidentialité et limites avant de télécharger.

LFM2.5-2.6B est le nouveau modèle de Liquid AI pour celles et ceux qui veulent un agent IA local, rapide et peu gourmand. Il tient sur un téléphone ou un petit ordinateur, sait appeler des outils et peut enchaîner des tâches sans envoyer chaque phrase dans le nuage. Sur le papier, c’est exactement le genre de modèle qui peut rendre l’IA privée moins pénible à installer.

Le piège serait de le vendre comme un remplaçant universel des gros modèles. LFM2.5-2.6B vise surtout les assistants locaux, l’extraction de données et les automatisations répétitives. Pour écrire du code complexe ou répondre à des questions de connaissance très pointues, Liquid AI recommande elle-même de choisir plus gros.

Un petit modèle qui sait vraiment utiliser des outils

LFM2.5-2.6B compte environ 2,6 milliards de paramètres et dispose d’un contexte annoncé de 128 000 jetons. Dit autrement, il peut garder beaucoup de texte sous les yeux sans réclamer une machine de laboratoire. Surtout, son entraînement a ciblé les appels d’outils, la recherche web, les traces d’agents et les tâches en plusieurs étapes.

La différence se voit dans l’usage. Un chatbot classique répond à une demande ; ce modèle peut choisir un outil, attendre son résultat, puis poursuivre la tâche. Tu peux donc l’imaginer derrière une interface locale, un assistant de fichiers, une extraction de tableaux ou un service qui lance des actions simples avec validation humaine.

Il existe en version originale, GGUF pour llama.cpp, ONNX pour les appareils et MLX pour les Mac Apple Silicon. Cette variété compte davantage que le nom de l’architecture : elle évite de transformer chaque test local en concours de compilation.

Un graphique officiel, mais pas une promesse magique

Crédit : Liquid AI, « LFM2.5-2.6B : Deploy Agents Everywhere », https://www.liquid.ai/blog/lfm2-5-2-6b

Liquid AI annonce jusqu’à 220 jetons par seconde sur un Apple M5 Max et 113 jetons par seconde sur un Ryzen AI Max+ 395, avec moins de 2,5 Go de mémoire dans ses essais. La société affirme aussi qu’un téléphone capable peut atteindre environ 30 jetons par seconde. Ce sont des mesures du constructeur, avec une configuration et des paramètres précis : elles donnent une direction, pas une garantie pour ton vieux portable.

Le point intéressant est ailleurs : un agent n’a pas besoin de produire un roman à chaque étape. Pour classer des documents, remplir une fiche, appeler une API locale ou résumer une page, la vitesse et la faible consommation peuvent compter plus que la qualité littéraire. Le modèle devient alors un composant discret qui travaille en arrière-plan, pas une diva qui monopolise le serveur.

L’IA privée devient enfin raisonnable

Faire tourner LFM2.5-2.6B en local réduit la quantité de données envoyées à un fournisseur externe. Les prompts, les résultats d’outils et les documents restent sur la machine si tu choisis une pile locale de bout en bout. Cela ne rend pas automatiquement l’installation sûre : un agent qui peut lire des fichiers ou lancer des commandes reste un logiciel puissant, même quand il n’appelle aucun service distant.

La licence et les formats ouverts facilitent aussi les essais. Tu peux télécharger les poids, choisir llama.cpp, Transformers, vLLM ou ONNX, puis brancher le modèle à un outil compatible avec une API de type OpenAI. La documentation de Liquid AI mentionne explicitement des harnesses comme Hermes Agent, OpenClaw et Pi, ce qui réduit le bricolage pour les utilisateurs déjà équipés.

Pour un téléphone, un mini-PC ou un serveur familial, le gain est concret : pas de facturation au jeton, moins de latence et la possibilité de couper le réseau. En contrepartie, il faut gérer les mises à jour, les modèles téléchargés, la consommation et les permissions. La confidentialité ne se décrète pas avec un autocollant « local » sur la boîte.

Des résultats solides, avec une limite très nette

Dans les résultats publiés, LFM2.5-2.6B se montre compétitif face à des modèles deux à quatre fois plus gros sur le suivi d’instructions et l’utilisation d’outils. Il dépasse notamment les modèles Gemma comparés par Liquid AI sur plusieurs évaluations d’agents. La société indique toutefois que le codage reste le domaine où les modèles plus grands gardent une avance claire.

Cette nuance change la manière de le choisir. Pour un assistant qui trie, cherche, extrait et déclenche des actions encadrées, le petit modèle est séduisant. Pour développer une application entière, vérifier une analyse complexe ou produire une réponse experte sans outils, il vaut mieux prévoir un modèle plus puissant ou une validation humaine. Un modèle rapide qui se trompe vite reste un modèle qui se trompe.

Comment l’essayer sans transformer ton week-end en chantier

Le chemin le plus simple passe par Hugging Face, un format adapté à ton matériel et un moteur d’inférence connu. Sur CPU, la variante GGUF avec llama.cpp est la plus évidente ; sur Mac Apple Silicon, MLX est prévue pour ça ; sur un serveur avec GPU, vLLM ou SGLang vise plutôt le débit. La documentation Liquid AI fournit aussi une commande llama.cpp qui télécharge directement le modèle.

Commence avec une tâche sans danger : résumer un fichier de test, extraire des champs d’un document non sensible ou appeler un outil qui ne modifie rien. Ensuite seulement, ajoute des permissions. Pour les opérations irréversibles, garde une validation humaine et limite les répertoires accessibles. L’IA locale peut éviter la fuite de données ; elle ne peut pas empêcher une mauvaise consigne de faire des dégâts.

Le bon modèle pour les petites tâches

LFM2.5-2.6B ne cherche pas à gagner la guerre des modèles géants. Il propose quelque chose de plus utile au quotidien : un agent capable, téléchargé une fois, qui répond vite sur du matériel courant et qui peut rester à la maison. Pour l’assistant privé, l’automatisation légère et les traitements en volume, c’est une direction beaucoup plus intéressante qu’un énième chatbot qui réclame un abonnement.

Ses limites sont claires : performances constructeur à prendre avec recul, codage moins convaincant, mise en place locale à sécuriser et qualité variable selon la tâche. Mais le rapport entre taille, vitesse et appels d’outils mérite un vrai test. L’IA locale ne sera pas gagnée par le plus gros modèle, mais par celui que tu peux réellement laisser tourner.

Sources

Liquid AI — annonce et détails techniques : https://www.liquid.ai/blog/lfm2-5-2-6b

Hugging Face — présentation, benchmarks et démonstration : https://huggingface.co/blog/LiquidAI/lfm2-5-2-6b

Hugging Face — fiche du modèle et formats disponibles : https://huggingface.co/LiquidAI/LFM2.5-2.6B

Documentation Liquid AI — modèle et exécution avec llama.cpp : https://docs.liquid.ai/lfm/models/lfm25-2.6b



Recherche, relecture et illustration assistées par IA. Le contenu reflète le travail éditorial de la rédaction.

No comments yet