Aller au contenu

Transcrire un audio

Enregistrez directement au micro ou déposez vos fichiers existants — plusieurs à la fois si vous le souhaitez — et récupérez le texte avec des horodatages exportables en sous-titres. La reconnaissance vocale s'exécute sur votre appareil et rien n'est envoyé : décisif pour les entretiens, les cours et tout ce qui est confidentiel.

Ajouter des fichiers audio

ou glissez-les ici

Ajoutez un ou plusieurs fichiers audio, ou enregistrez directement au micro.

Ensuite, essayez

Convertisseur SRT ↔ VTT
Convertissez des sous-titres entre les formats SRT et WebVTT
Outils de texte

Your files are processed locally in your browser. They are not uploaded to our servers.

Comment l'utiliser

  1. Ajoutez vos fichiers audio — MP3, WAV, M4A, OGG, FLAC et la plupart des formats fonctionnent — ou cliquez sur « Enregistrer maintenant » pour capter au micro.
  2. Choisissez un modèle : rapide pour un brouillon, précis pour le meilleur résultat. Indiquez la langue parlée si vous la connaissez, ou laissez-la détecter.
  3. Lancez la transcription. Chaque fichier reçoit sa propre transcription à copier ou télécharger en TXT, SRT ou VTT — ou tout d'un coup dans un ZIP.

Qu'est-ce que cet outil ?

Transcrire un audio exécute Whisper, le modèle de reconnaissance vocale d'OpenAI, directement dans votre navigateur via WebAssembly et WebGPU. Le modèle est téléchargé une fois depuis un CDN public puis mis en cache ; votre enregistrement, lui, n'est envoyé nulle part. C'est tout l'enjeu : la transcription est précisément la tâche où le fichier est sensible — entretiens d'embauche, séances de thérapie, notes médicales, enregistrements juridiques, enquêtes non publiées — et toutes les solutions courantes demandent d'abord de l'envoyer sur un serveur. Comme tout se passe en local, il n'y a ni quota de minutes, ni filigrane, ni compte. Whisper est multilingue, transcrit des dizaines de langues et peut traduire en anglais dans la même passe. Les fichiers sont traités les uns après les autres avec le modèle chargé une seule fois : un lot coûte donc à peine plus qu'un seul enregistrement.

Utilisations courantes

  • Transformer un entretien ou une réunion en texte consultable
  • Produire des sous-titres SRT ou VTT à partir de la piste sonore d'une vidéo
  • Mettre par écrit un cours ou un épisode de podcast sans le taper
  • Obtenir une transcription anglaise d'un enregistrement en langue étrangère

Questions fréquentes

Mon enregistrement est-il envoyé quelque part ?

Non. Le modèle vocal s'exécute dans votre navigateur : l'audio ne quitte jamais votre appareil. Seul le modèle est téléchargé (environ 40 à 250 Mo selon celui que vous choisissez), puis mis en cache par votre navigateur.

Combien de temps cela prend-il ?

Cela dépend du navigateur. Chrome et Edge sur ordinateur utilisent WebGPU et ne prennent qu'une fraction de la durée de l'enregistrement. Safari et les navigateurs anciens basculent sur un mode plus lent, où la transcription dure à peu près autant que l'enregistrement. Le petit modèle est nettement plus rapide pour un simple brouillon.

Indique-t-il qui parle ?

Non. La transcription est un texte continu, sans séparation par locuteur. Distinguer les voix demande un second modèle, différent, qui ne fait pas partie de cet outil — bon à savoir avant de l'utiliser sur un entretien à plusieurs.

Puis-je transcrire une vidéo ?

Pas directement : cet outil prend des fichiers audio. Extrayez d'abord la piste avec le Convertisseur vidéo en MP3, puis transcrivez-la. Les horodatages restent alignés sur la vidéo d'origine, les sous-titres tombent donc juste.