Enregistrer une idée dans son téléphone prend trois secondes. Retrouver cette idée deux semaines plus tard, au milieu de 47 mémos baptisés « Nouvel enregistrement 12 », relève déjà de l’archéologie. Pour les réunions, c’est pire : une heure d’audio, trois personnes qui parlent en même temps et cette phrase fatale à la fin — « quelqu’un fera le compte rendu ».
Les services de transcription dans le cloud promettent de régler le problème. Tu leur envoies le fichier, ils te rendent du texte, parfois un résumé et une liste de tâches. C’est confortable. C’est aussi une drôle d’habitude lorsqu’un enregistrement contient une stratégie commerciale, un problème de santé, les coordonnées d’un client ou simplement une conversation qui ne regarde pas un serveur situé à l’autre bout du monde.
Il existe une autre méthode : enregistrer avec ton téléphone ou un petit dictaphone, transférer le fichier sur ton ordinateur, puis laisser **Whisper** le transcrire localement. Un second modèle local peut ensuite produire le résumé, les décisions et les actions. Une fois les modèles téléchargés, aucun audio ni texte n’a besoin de quitter la machine.
Le montage en une phrase
Le système repose sur quatre briques simples :
- un téléphone ou un enregistreur produit un fichier audio ;
- FFmpeg le convertit si nécessaire dans un format propre ;
- Whisper transforme la voix en texte sur ton ordinateur ;
- un petit LLM lancé avec Ollama résume la transcription.
Le mot important est **local**. Télécharger un modèle au départ nécessite Internet, mais traiter ensuite les enregistrements ne demande aucun service distant. Tu peux même couper le Wi-Fi pendant un test. Si la transcription continue, le nuage marketing peut aller pleuvoir ailleurs.
Whisper est un système de reconnaissance vocale publié par OpenAI en 2022. Son entraînement s’appuie sur 680 000 heures d’audio multilingue. Il reconnaît le français, résiste plutôt bien aux accents et au bruit, et peut ajouter des horodatages. Le modèle n’est pas parfait : un nom propre rare, une référence technique ou une voix lointaine peuvent encore finir dans le broyeur à syllabes.
Quel matériel faut-il vraiment ?
Tu n’as pas besoin d’acheter un pendentif « IA » ou un dictaphone à abonnement. Pour commencer, utilise l’application d’enregistrement de ton téléphone. Pose-le au centre de la table, évite de le cacher sous un dossier et active le mode avion si tu ne veux pas qu’un appel transforme la réunion en podcast expérimental.
Un petit enregistreur dédié devient intéressant si tu réalises souvent des entretiens. Cherche surtout une prise USB, l’enregistrement en WAV ou en MP3, une autonomie correcte et la possibilité de désactiver les fonctions cloud. La qualité du microphone compte davantage que le logo « AI » imprimé sur la boîte.
Pour la transcription, les besoins dépendent du modèle. Le projet `whisper.cpp` annonce environ 388 Mo de mémoire pour le modèle `base`, 852 Mo pour `small`, 2,1 Go pour `medium` et 3,9 Go pour `large`. Un PC ordinaire peut donc travailler sur CPU. Une carte graphique accélère l’opération, mais elle n’est pas obligatoire.
Pour du français courant, voici un choix raisonnable :
Machine | Modèle conseillé | Résultat attendu
Petit portable ou mini-PC | `base` | Rapide, mais plus fragile sur les noms et le bruit
PC récent sans GPU dédié | `small` | Bon compromis pour mémos et réunions propres
PC avec 16 à 32 Go de RAM | `medium` | Plus précis, traitement plus long sur CPU
GPU NVIDIA récent | `large-v3-turbo` | Très bonne précision et vitesse confortable
Le meilleur modèle reste celui que tu peux réellement utiliser. Une transcription parfaite livrée demain est souvent moins utile qu’une bonne transcription disponible avant que tout le monde ait oublié la réunion.
Choisir entre whisper.cpp et faster-whisper
Il existe plusieurs manières d’exécuter Whisper. Deux projets dominent les usages locaux.
**whisper.cpp** est une implémentation C/C++ légère, compatible avec Windows, macOS, Linux, Android, iOS, Raspberry Pi et Docker. Elle sait travailler uniquement sur CPU, exploiter différentes technologies GPU et utiliser des modèles quantifiés moins gourmands. C’est le choix pratique pour un outil autonome ou un vieux PC que tu refuses courageusement d’envoyer à la retraite.
**faster-whisper** réimplémente Whisper avec CTranslate2. Il s’intègre facilement dans un script Python et peut exploiter la quantification 8 bits. Ses propres mesures montrent des gains importants par rapport à l’implémentation Python originale, mais les résultats dépendent du processeur, du GPU, du modèle et des paramètres. Les benchmarks ne sont pas une prophétie gravée sur un radiateur de serveur.
Pour un premier montage reproductible, `whisper.cpp` est rassurant. Pour automatiser un dossier, filtrer les silences et manipuler les segments en Python, `faster-whisper` devient plus souple.
Installer la transcription locale avec whisper.cpp
Sous Ubuntu ou Debian, installe d’abord les outils de compilation et FFmpeg :
sudo apt update
sudo apt install -y git cmake build-essential ffmpegRécupère ensuite le projet et compile-le :
git clone https://github.com/ggml-org/whisper.cpp.git
cd whisper.cpp
cmake -B build
cmake --build build -j --config ReleaseTélécharge le modèle multilingue `small` :
sh ./models/download-ggml-model.sh smallLe client accepte un WAV mono 16 bits à 16 kHz. Convertis ton fichier provenant du téléphone :
ffmpeg -i reunion.m4a -ar 16000 -ac 1 -c:a pcm_s16le reunion.wavLance enfin la transcription française et demande un fichier texte :
./build/bin/whisper-cli \
-m models/ggml-small.bin \
-f reunion.wav \
-l fr \
-otxtTu obtiens normalement `reunion.wav.txt`. Pour conserver des sous-titres horodatés, remplace ou complète `-otxt` par `-osrt`. Les horodatages sont utiles pour revenir à l’audio lorsqu’une phrase semble douteuse.
La version automatisable avec faster-whisper
Crée un environnement Python isolé pour éviter de transformer ton système en vide-grenier de dépendances :
python3 -m venv .venv
source .venv/bin/activate
python -m pip install --upgrade pip
pip install faster-whisperCrée un fichier `transcrire.py` :
from pathlib import Path
from faster_whisper import WhisperModel
audio = Path("reunion.m4a")
model = WhisperModel("small", device="cpu", compute_type="int8")
segments, info = model.transcribe(
str(audio),
language="fr",
vad_filter=True,
beam_size=5,
)
lignes = []
for segment in segments:
minutes = int(segment.start // 60)
secondes = int(segment.start % 60)
lignes.append(f"[{minutes:02d}:{secondes:02d}] {segment.text.strip()}")
sortie = audio.with_suffix(".txt")
sortie.write_text("\n".join(lignes), encoding="utf-8")
print(f"Transcription créée : {sortie}")Puis exécute-le :
python transcrire.pyL’option `vad_filter=True` active la détection d’activité vocale. Elle aide à ignorer les longs silences, qui encouragent parfois Whisper à inventer une formule de politesse sortie de nulle part. Sur une machine équipée correctement pour CUDA, tu peux utiliser `device="cuda"` et `compute_type="float16"`.
Résumer sans renvoyer le texte dans le cloud
La transcription locale ne sert à rien si tu colles ensuite le résultat dans un chatbot distant. Pour terminer la chaîne hors ligne, installe Ollama et télécharge un modèle instruct adapté à ta RAM. Un modèle de 7 à 12 milliards de paramètres suffit généralement pour résumer une réunion en français.
Vérifie les modèles présents :
ollama listTu peux demander un résumé depuis le terminal :
ollama run qwen3:8b "$(cat <<'EOF'
Tu es un secrétaire de réunion rigoureux.
À partir de la transcription fournie :
- rédige un résumé factuel ;
- liste les décisions ;
- liste les actions avec responsable et échéance quand ils sont explicites ;
- indique les points incertains ;
- n'invente aucune information.
TRANSCRIPTION :
$(cat reunion.txt)
EOF
)"Pour les longues réunions, la limite de contexte du modèle peut être dépassée. Découpe alors la transcription en sections, résume chaque section, puis demande une synthèse des résumés. Évite surtout de présenter une supposition comme une décision : un LLM local peut halluciner avec exactement le même aplomb qu’un LLM cloud. Il a simplement la politesse de le faire chez toi.
Ollama expose aussi une API locale sur `http://localhost:11434/api`. Un script peut donc envoyer automatiquement la transcription au modèle et enregistrer sa réponse sans contacter Internet. Attention au choix du modèle : Ollama propose également des modèles cloud. Pour garantir le traitement local, utilise un modèle téléchargé sur la machine et vérifie son exécution avec `ollama ps`.
Le véritable bouton « un clic »
Le montage devient agréable lorsqu’un dossier surveillé remplace toutes les commandes manuelles. Le flux peut être aussi simple que ceci :
Entrée audio → conversion → transcription → résumé → archiveCrée par exemple quatre dossiers : `audio-a-traiter`, `transcriptions`, `resumes` et `archives`. Un script lancé depuis un raccourci parcourt les nouveaux fichiers, appelle FFmpeg, lance Whisper, transmet le texte à l’API locale d’Ollama, puis déplace l’original dans les archives.
Sous Linux, ce script peut être déclenché par un service `systemd --user` ou un outil de surveillance comme `inotifywait`. Sous Windows, un script PowerShell associé à un raccourci suffit. Sur macOS, Automator ou un raccourci de dossier fait le travail. Commence par une commande volontaire : l’automatisation totale est séduisante jusqu’au jour où elle transcrit pendant trois heures un podcast téléchargé par erreur.
Plusieurs personnes parlent : la limite à connaître
Whisper transcrit la parole, mais n’identifie pas automatiquement et proprement chaque participant. La **diarisation** consiste à séparer les segments par locuteur : « intervenant 1 », « intervenant 2 », etc. WhisperX ajoute cette possibilité ainsi qu’un alignement plus précis des mots.
Cette étape complique cependant le projet. Certains modèles de diarisation demandent un compte ou un jeton pour être téléchargés, et distinguer deux voix proches reste imparfait. Une solution simple consiste à demander à chacun d’annoncer son prénom au début, à placer correctement le micro et à vérifier manuellement les décisions importantes.
Pour un mémo personnel, oublie la diarisation. Pour un entretien à deux, elle peut être utile. Pour une table ronde de douze personnes dans une salle réverbérante, aucun drapeau « IA » ne remplacera un bon dispositif audio.
Local ne signifie pas automatiquement sécurisé
Le traitement local réduit fortement l’exposition, mais le fichier reste sensible. Si ton ordinateur est compromis, si le dossier est synchronisé vers un cloud par défaut ou si les sauvegardes ne sont pas chiffrées, Whisper n’aura rien sauvé du tout.
Quelques règles évitent le grand numéro du coffre-fort posé devant une fenêtre ouverte :
- chiffre le disque de l’ordinateur ;
- stocke les enregistrements dans un dossier non synchronisé ;
- supprime l’audio quand sa conservation n’est plus nécessaire ;
- protège les sauvegardes ;
- n’expose pas l’API Ollama sur le réseau sans contrôle d’accès ;
- bloque temporairement le réseau pour vérifier qu’aucune étape ne dépend d’un service distant.
Il faut aussi informer les personnes enregistrées et disposer d’une base légitime pour le faire. Dans le cadre professionnel, la CNIL rappelle notamment qu’un employeur ne peut pas enregistrer les conversations de salariés à leur insu et que la captation doit rester nécessaire et proportionnée. « Mais tout restait sur mon PC » n’est pas un permis d’enregistrer tout le monde en douce.
Ce que tu gagnes, et ce que tu acceptes
Le dictaphone IA local demande davantage de préparation qu’un SaaS. Tu dois télécharger des modèles, choisir un niveau de qualité, surveiller l’espace disque et parfois corriger une commande. En échange, tu contrôles les fichiers, tu ne paies pas chaque minute transcrite et tu peux adapter entièrement la sortie.
Le résultat n’est pas toujours « parfait en un clic ». Une mauvaise prise de son reste mauvaise, un nom propre doit être vérifié et un résumé automatique ne remplace pas la validation humaine. Mais le système devient très vite assez bon pour transformer des mémos oubliés en notes exploitables et des réunions interminables en comptes rendus relisibles.
Commence petit : un mémo de deux minutes, le modèle `small`, une transcription texte et un résumé local. Coupe Internet pendant le second essai. Si tout fonctionne encore, tu possèdes réellement ton dictaphone IA — et pas simplement une télécommande élégante pour le serveur de quelqu’un d’autre.
Sources
- OpenAI, présentation et fonctionnement de Whisper : https://openai.com/index/whisper/
- Dépôt officiel OpenAI Whisper : https://github.com/openai/whisper
- whisper.cpp, plateformes, installation, modèles et mémoire : https://github.com/ggml-org/whisper.cpp
- faster-whisper, installation et benchmarks : https://github.com/SYSTRAN/faster-whisper
- WhisperX, alignement et diarisation : https://github.com/m-bain/whisperX
- Documentation de l’API locale Ollama : https://docs.ollama.com/api/introduction
- CNIL, écoute et enregistrement des appels sur le lieu de travail : https://www.cnil.fr/fr/lecoute-et-lenregistrement-des-appels-sur-le-lieu-de-travail
Articles connexes
- Pas besoin de GPU à 2 000 € : faire tourner un LLM rapide sur ton PC ou ton serveur
- Open WebUI : la façade qui transforme Ollama en véritable service IA
- Lokus 1.3 transforme tes notes en refuge local
—
Recherche, relecture et illustration assistées par IA. Le contenu reflète le travail éditorial de la rédaction.




No comments yet