Navin

Réunions

Transcrire une réunion d'une heure malgré les limites des API STT

10 août 2026 · 4 min de lecture · Équipe Navin

Durée, taille, format : pourquoi les API de transcription refusent les réunions longues, et comment Navin prépare l'audio localement (mono 16 kHz, découpage, WAV) pour transcrire une heure sans échec.

Un enregistrement d'une heure fait typiquement 60 à 120 Mo et dépasse à la fois la limite de durée et la limite de taille de la plupart des API de transcription. C'est la raison pour laquelle tant d'outils échouent sur les réunions longues. Le module Meeting de Navin résout le problème là où il coûte le moins cher : dans le navigateur, avant l'upload.

Docs : Transcription · Meeting · Dépannage

Pourquoi les providers refusent votre fichier

Les API de reconnaissance vocale imposent deux plafonds indépendants, et une réunion longue tape dans les deux.

LimiteOrdre de grandeur courantCe qui se passe si vous la dépassez
Durée d'un envoi25 à 300 secondes selon le providerRequête rejetée, aucun texte
Taille de l'upload4 à 25 MoRejet, parfois après plusieurs minutes d'attente
Formats acceptésVariable, webm/opus souvent refuséErreur de format sur un fichier pourtant valide

Envoyer un fichier brut d'une heure revient donc à jouer contre trois contraintes en même temps. La bonne stratégie n'est pas de trouver un provider plus permissif, c'est de préparer l'audio correctement.

Ce que fait Navin avant d'envoyer quoi que ce soit

À l'import d'un fichier, le bureau #/meeting applique une chaîne de préparation entièrement locale :

  1. Décodage du fichier dans le navigateur.
  2. Passage en mono, parce qu'un deuxième canal n'apporte rien à un modèle de parole et double la charge utile.
  3. Rééchantillonnage à 16 kHz, la fréquence sur laquelle les modèles de reconnaissance vocale sont entraînés.
  4. Découpage en segments sous la limite de durée configurée pour votre provider.
  5. Envoi séquentiel des segments, avec une progression visible du type Transcription 4/24.
  6. Recomposition du transcript dans l'ordre.

L'effet du seul rééchantillonnage est spectaculaire : une heure de stéréo 48 kHz en 16 bits pèse environ 660 Mo en PCM, contre environ 110 Mo en mono 16 kHz. Même contenu utile, presque six fois moins de données à transmettre.

Si le décodage échoue, sur un conteneur exotique par exemple, le fichier part tel quel et le provider tranche. Vous obtenez alors un message d'erreur explicite plutôt qu'un silence.

Le live n'attend pas la fin de la réunion

En enregistrement direct, la même logique s'applique en continu. Le micro est diffusé par tranches de 25 secondes, réduites automatiquement si votre provider plafonne plus bas, et chaque tranche est transcrite puis ajoutée au transcript pendant que la réunion continue. Vous lisez ce qui vient d'être dit au lieu d'attendre un traitement final.

Le conteneur est choisi selon ce que la plateforme supporte, dans l'ordre audio/webm;codecs=opus, audio/webm, audio/mp4, audio/ogg;codecs=opus. Pour les providers qui refusent l'Opus du navigateur, la conversion en WAV est faite côté client, sans réglage à faire.

Gagner en précision sans changer de budget

LevierEffortGain typique
Modèle STT plus fort dans Réglages -> VoixUn réglageLe meilleur gain unitaire, surtout accents et jargon
Micro proche, un locuteur par appareilOrganisationnelSupprime les erreurs qu'aucun post-traitement ne rattrape
Action Passe haute précisionUn clicRépare les erreurs ASR évidentes et la ponctuation
Action Identifier les speakersUn clicÉtiquette les tours de parole, sans inventer de noms
Vocabulaire métier dans les notesTrente secondesAide le modèle sur les sigles et noms propres

Quand l'import s'arrête en cours de route

Un segment peut échouer. Dans ce cas le transcript conserve tout ce qui a réussi avant l'incident : vous relancez l'import pour la suite au lieu de tout reprendre. Les messages d'erreur nomment la contrainte réellement touchée, durée, taille ou format, ce qui évite de changer de provider pour un problème d'encodage.

FAQ

Quelle durée maximale de réunion est supportée ?

Il n'y a pas de plafond côté Navin. La durée est bornée par la patience du provider et par le temps de traitement, puisque les segments partent l'un après l'autre.

Le découpage coupe-t-il des mots ?

Le découpage se fait sur des segments de durée fixe, donc une coupure peut tomber au milieu d'une phrase. La passe haute précision recolle la ponctuation et les phrases tronquées.

Faut-il convertir mon fichier avant l'import ?

Non dans le cas général : le décodage et la conversion sont faits localement. Ne reencodez que si un message d'erreur mentionne explicitement le format.

Puis-je transcrire sans micro, à partir d'un enregistrement de visio ?

Oui, c'est le cas d'usage principal de l'import. Exportez l'enregistrement depuis votre outil de visio et déposez-le dans le bureau Meeting.

Le traitement local ralentit-il ma machine ?

Le décodage et le rééchantillonnage sont brefs et se font une fois par fichier. Le temps dominant reste l'aller-retour réseau avec le provider.

Télécharger Navin · Docs Transcription · Réunions IA locales · Modèles gratuits et rate limits

Essayez Navin sur votre machine

Agent local, multiplateforme. Code, debug, scrape, leads, sécurité et review - sans quitter Navin.

À lire aussi