Audio en texte — transcription en paragraphes avec intervenants
Outil en ligne pour transcrire des enregistrements audio et vidéo — réunions, entretiens, cours, podcasts et mémos vocaux — en texte. Le résultat arrive en paragraphes, avec les étiquettes d’intervenants et les horodatages ; on peut le corriger sur la page, le copier ou le télécharger en DOCX, PDF, TXT ou en sous-titres SRT/VTT. Les fichiers courts sont reconnus dans le navigateur, ceux de plusieurs heures sur notre serveur, avec un e-mail dès que le texte est prêt.
Comment transcrire un audio en texte
MP3, WAV, M4A, FLAC, OGG, WebM ou une vidéo — glissez le fichier sur la page ou choisissez-le sur l’appareil.
Choisissez la langue et la qualité, cochez « Étiqueter les intervenants » et indiquez le nombre de participants si vous le connaissez.
Corrigez les mots et les noms des intervenants directement sur la page, puis copiez le texte ou téléchargez DOCX, PDF, TXT, SRT ou VTT.
Transformez une conversation enregistrée en document lisible : qui a dit quoi, et quand
Vous préférez dicter en direct ? 🎤 Écrire à la voix
Les fichiers sont transcrits un par un ; chaque texte terminé est enregistré dans l’historique ci-dessous. Chaque fichier est une exécution distincte.
📝 Noms et termes (facultatif)
Votre texte transcrit apparaîtra ici.
Transcription
Le compte rendu est rédigé par un modèle de langage. Pour l’analyse, le texte est transmis à un fournisseur d’IA tiers (Anthropic, États-Unis). Avant l’envoi, nous remplaçons par des marqueurs les numéros de passeport, identifiants fiscaux et sociaux, numéros de compte et de carte, téléphones et e-mails ; les noms, les sociétés et les adresses restent dans le texte — n’importez pas une conversation dont vous n’avez pas le droit de partager le contenu avec des tiers. Chaque point est vérifié : il n’apparaît que si sa citation figure mot pour mot dans votre texte. Cela écarte les conclusions inventées, mais ne rend pas l’analyse infaillible — recoupez l’essentiel avec l’enregistrement.
📖 Historique
Quel modèle choisir, et ce qu’il coûte
La reconnaissance tourne dans votre navigateur : le modèle est téléchargé une fois puis mis en cache. Les modèles plus gros entendent mieux les accents et le bruit, mais prennent plus de temps sur la même machine.
| Modèle | Téléchargement unique | Temps par minute d’audio | Quand le choisir |
|---|---|---|---|
| Rapide | ~75 MB | environ 1 min | Brouillon rapide, parole claire, une seule voix |
| Précis | ~150 MB | environ 3 min | Enregistrements courants — le compromis habituel |
| Haute précision (small) | ~250 MB | environ 6 min | Accents, bruit de fond, plusieurs intervenants |
| Premium (Large v3 Turbo) | ~600 MB | dépend du GPU | Audio le plus difficile ; exige un GPU ou un CPU récent |
D’une vidéo on extrait d’abord la piste audio : une heure filmée au téléphone pèse 2–3 Go, dont environ 30 Mo de son.