Améliorez vos réunions dès maintenant.
Configuration en deux minutes. Une offre gratuite à vie. Une qualité professionnelle dès le premier jour. Transformez vos réunions en une expérience positive et enrichissante
Trois façons d'obtenir une transcription dans ChatGPT, et celle que tout le monde choisit est la moins documentée.


ChatGPT peut transcrire de l'audio, mais ce n'est pas une solution de transcription complète. Il convertit la parole en texte par le mode Enregistrement, par la dictée et en traitant un fichier audio que vous lui envoyez, et il le fait assez bien pour une note vocale ou un extrait court. Ce qui lui manque, c'est la structure et la régularité qu'exige la transcription de réunion.
L'écart entre ces deux choses est précisément l'endroit où la plupart des gens se bloquent. La voie de l'envoi de fichier fonctionne, et c'est aussi celle sur laquelle OpenAI ne publie rien : le même fichier peut revenir sous forme de transcription propre un jour, et de résumé vague le lendemain.
Ce guide ChatGPT transcription audio détaille ce que ChatGPT sait faire et ne sait pas faire de l'audio en 2026, les étapes de chaque méthode, les limites réellement documentées, et le moment où un outil d'enregistrement et de transcription des réunions devient le meilleur choix.
| Chemin | Où Cela Fonctionne | Ce Que Vous Obtenez | Limite Documentée |
|---|---|---|---|
| Mode Enregistrement | Application de bureau macOS, sur Plus, Pro, Business, Enterprise et Edu | Transcription avec identification des intervenants, résumé, canvas | 4 heures par session |
| Envoi de fichier audio | Web, iOS, Android et bureau | Une transcription, de qualité variable selon le fichier | Aucune publiée par OpenAI |
| Dictée | Web, iOS et Android, tous les plans | Texte modifiable dans la zone de message | Aucune publiée |
| Vocal | Applications ChatGPT | Une transcription ajoutée à la conversation après coup | Aucune publiée |
| API (gpt-transcribe) | Intégrations développeurs | Transcription, segments d'intervenants en option | 25 Mo par fichier |
Tableau mis à jour le : 6 août 2026.
Trois méthodes, avec des usages différents.

C'est la voie la plus rapide pour un entretien, un mémo vocal ou un extrait de réunion court, et elle fonctionne depuis un téléphone comme depuis un ordinateur.
C'est aussi la partie de ChatGPT sur laquelle OpenAI ne publie rien. En août 2026, la liste des types de fichiers pris en charge par OpenAI couvre XLSX, XLS, CSV, TSV, DOCX, PPTX, PDF et TXT, et aucune note de version n'a jamais annoncé l'envoi de fichier audio. Le 13 juillet 2026, quand un utilisateur a demandé la prise en charge native du .mp3 et du .mp4, le support d'OpenAI a répondu que la demande serait transmise à l'équipe « afin qu'elle soit enregistrée et étudiée pour un développement futur ».
L'effet concret, c'est l'irrégularité plutôt que l'échec. Aucune liste de formats, aucun plafond de taille, aucune garantie de comportement : ce que vous récupérez sur un fichier donné ne se prévoit pas à l'avance.
Nous l'avons testé nous-mêmes en août 2026. Nous avons pris un enregistrement Google Meet de 33 minutes, exporté depuis l'appel, puis envoyé à ChatGPT. Il est revenu en moins de 5 minutes, la vitesse n'a donc jamais été le problème.
Le problème, c'est ce qui est revenu. Le résultat était peu concluant, nettement moins clair et moins direct que ce qu'un assistant de réunion dédié renvoie pour le même appel. Un seul enregistrement ne fait pas un benchmark, mais il correspond à ce que l'absence de documentation laissait déjà attendre : rien n'est spécifié sur ce chemin, donc rien n'y est garanti.
MeetGeek supprime l'export. Il rejoint l'appel depuis votre agenda, le transcrit en plus de 100 langues en identifiant chaque intervenant, puis rédige seul le compte rendu, les moments clés et les actions à suivre. Tout reste consultable d'une réunion à l'autre et rejoint vos outils via plus de 20 intégrations natives.
Essayez MeetGeek Gratuitement
Le mode Enregistrement est la route documentée, et la seule qui produise une identification des intervenants.

Ce que publie l'article du centre d'aide OpenAI sur ChatGPT record à son sujet :
Pour voir ce que cela donne face à un outil qui rejoint l'appel, consultez le comparatif entre le mode Enregistrement de ChatGPT et MeetGeek.
La dictée convertit la parole en texte que vous pouvez corriger avant d'envoyer. Le 26 juin 2026, OpenAI a mis à niveau le modèle qui l'alimente sur tous les plans, sur le web, iOS et Android, avec un taux d'erreur sur les mots « au moins 10 % inférieur pour les principales langues testées par rapport au modèle de production précédent ».
Elle convient aux entrées courtes : une idée à fixer, un message que vous préférez dire plutôt que taper. Elle n'est pas conçue pour un enregistrement de 40 minutes.
Oui, et c'est la même voie d'envoi de fichier que plus haut. Joignez le fichier et demandez à ChatGPT de l'analyser plutôt que de le transcrire : vous obtenez un résumé, des points clés ou des actions à suivre sans passer par une transcription intégrale.
La réserve est la même, et elle pèse plus lourd ici. Comme OpenAI ne documente rien sur le traitement de l'audio envoyé, une analyse peut être fouillée sur un fichier et superficielle sur un autre, sans aucun message d'erreur pour expliquer la différence. Sur un enregistrement long, la version superficielle est le résultat le plus probable.
Le mode Vocal fonctionne autrement. OpenAI indique qu'une transcription est ajoutée à la conversation après un échange vocal, avec une réserve : elle « n'est pas un enregistrement mot à mot et peut ne pas correspondre exactement à ce qui a été dit ». Le Vocal convient donc pour capter votre propre réflexion, et reste peu fiable comme preuve de ce qu'une autre personne a dit. Si le fichier est un mémo vocal, les étapes changent selon l'appareil, et notre guide pour transcrire des mémos vocaux en texte les détaille.
Il faut séparer la question en deux, les réponses n'étant pas les mêmes.
Dans l'application ChatGPT, OpenAI ne publie aucune liste de formats audio ni aucun plafond de taille propre à l'audio. Les règles générales fixent 512 Mo par fichier, 3 envois par jour sur l'offre Free et jusqu'à 80 fichiers toutes les 3 heures sur les offres payantes. La seule limite de durée publiée pour la transcription reste les 4 heures du mode Enregistrement.
Dans l'API, le guide reconnaissance vocale d'OpenAI est explicite : fichiers jusqu'à 25 Mo, aux formats mp3, mp4, mpeg, mpga, m4a, wav ou webm. Aucune limite en minutes n'y figure, ce qui explique que les fichiers longs se découpent selon leur poids plutôt que selon leur durée.
Ces valeurs circulent partout comme s'il s'agissait des limites de l'application. Ce n'est pas le cas. Le plafond de 25 Mo encadre une requête développeur vers le point de terminaison de transcription, pas un fichier glissé dans une fenêtre de conversation.
Les modèles de transcription de première ligne d'OpenAI ont changé en juillet 2026. Le 28 juillet 2026, l'entreprise a publié gpt-transcribe pour la transcription de fichiers et gpt-live-transcribe pour le flux à faible latence dans l'API.
whisper-1 reste disponible, mais OpenAI le positionne désormais pour des tâches précises plutôt que comme modèle par défaut : horodatage au niveau du mot, sous-titres SRT et VTT, traduction vers l'anglais. Whisper lui-même date de septembre 2022, quand OpenAI l'a entraîné sur 680 000 heures de données supervisées multilingues.
Cet historique compte pour une raison pratique. Les benchmarks publiés de Whisper décrivent un modèle de 2022, ils disent donc très peu de chose sur une transcription produite par ChatGPT aujourd'hui. OpenAI ne nomme aucun modèle derrière le mode Enregistrement, et rien du tout pour les fichiers envoyés.
OpenAI ne publie aucun pourcentage de précision pour ChatGPT lui-même. Tout chiffre précis que vous verrez circuler est donc une estimation, pas une donnée constructeur.
Ce qu'OpenAI publie donne en revanche une direction. Lors d'une évaluation interne en environnement bruité, son instantané gpt-4o-mini-transcribe de décembre 2025 a produit environ 90 % d'hallucinations en moins que Whisper v2, et la mise à niveau de la dictée de juin 2026 a réduit le taux d'erreur sur les mots « d'au moins 10 % pour les principales langues testées ».
La précision réelle bouge avec les quatre mêmes variables que d'habitude : le bruit de fond, les prises de parole simultanées, la distance au micro et la langue. Sur la voie de l'envoi de fichier s'ajoute un cinquième problème, et ce n'est pas la vitesse. Dans notre propre test, le résultat est revenu vite et restait trop vague pour être exploitable. Traitez toute sortie comme un premier jet, et vérifiez à la main les noms, les chiffres et les décisions.
Dans le mode Enregistrement, oui. OpenAI documente qu'il distingue plusieurs intervenants et que, faute d'identifier quelqu'un par son nom, il applique une étiquette générique du type Speaker 1, que vous pouvez renommer une fois l'enregistrement créé.
Sur un fichier envoyé, ne comptez pas dessus. Les étiquettes apparaissent de façon irrégulière, et OpenAI ne documente rien qui vous dise quand les attendre.
Dans l'API, l'identification des intervenants a son propre modèle. gpt-4o-transcribe-diarize s'exécute sur le point de terminaison de transcription avec response_format: diarized_json et renvoie des segments annotés par intervenant. Le guide de migration d'OpenAI précise que ce modèle « n'est pas pris en charge dans l'API Realtime ».
ChatGPT ne rejoint pas votre appel en tant que participant. Aucun robot de réunion n'est documenté.
Ce qui existe, c'est la récupération de ce que d'autres systèmes ont déjà produit. L'application Zoom pour ChatGPT fait remonter les résumés, décisions, transcriptions et enregistrements générés par Zoom AI Companion, plutôt que de capter l'appel. L'application Microsoft Teams renvoie le texte de la transcription quand elle existe et que l'utilisateur y a accès, et pour les enregistrements elle renvoie « les métadonnées de l'enregistrement, pas le contenu du fichier ».
Le flux ChatGPT réaliste pour une réunion se joue donc après coup : enregistrez l'appel ailleurs, exportez le fichier, envoyez-le, et espérez qu'il revienne exploitable. C'est exactement ce que nous avons testé sur un enregistrement Google Meet de 33 minutes, et ce qui est revenu n'était pas à transmettre à un collègue.
Les équipes qui ont besoin que l'appel lui-même soit capté branchent un assistant sur leur agenda. MeetGeek rejoint automatiquement les appels planifiés sur Zoom, Microsoft Teams et Google Meet, transcrit en 100+ langues avec reconnaissance automatique des intervenants, puis rédige des comptes rendus de réunion générés par IA avec moments clés et actions à suivre.
.webp)
Deux différences pèsent le plus face à la route ChatGPT. Chaque appel atterrit dans une bibliothèque de réunions consultable plutôt qu'au fond du fil où il a été créé, ce qui permet de retrouver une décision trois mois plus tard. Et l'envoi de fichier y est une fonctionnalité prise en charge, avec une liste de formats annoncée, MP3, MP4, WAV, M4A et WEBM, plutôt qu'un comportement non documenté. L'outil s'appuie sur les conformités SOC 2 Type II, HIPAA et RGPD et sert 50 000+ équipes dans 100+ pays. L'offre gratuite couvre 3 heures de transcription par mois.
.webp)
Si vous voulez que la transcription se fasse sans avoir à penser à la lancer, laissez l'assistant rejoindre votre prochain appel.
Essayez MeetGeek Gratuitement
Vous pouvez envoyer un fichier vidéo exactement comme un fichier audio, puis demander la transcription de ce qui a été dit. La même réserve s'applique : aucune liste de formats publiée, aucun plafond de taille, aucune garantie.
Le mode Enregistrement capte par ailleurs l'audio système sur un Mac, donc lire une vidéo pendant l'enregistrement produit une transcription par la route documentée. Côté API, le mp4 et le webm sont des formats d'entrée acceptés.
Pour un flux répétable plutôt qu'une manipulation ponctuelle, les étapes pour convertir un fichier MP4 en transcription couvrent les outils qui prennent le fichier directement.
Une fois le texte disponible, ChatGPT devient réellement bon. Trois prompts couvrent l'essentiel.
Nettoyer le texte : « Nettoie cette transcription. Supprime les mots de remplissage, corrige la grammaire et conserve intacte chaque attribution de prise de parole. »
Extraire les engagements : « Extrais les actions à suivre sous forme de tableau avec les colonnes tâche, responsable et échéance. Signale toute action dont le responsable n'a pas été nommé. »
Traiter un enregistrement long : « Ceci est la partie 3 sur 5 d'une transcription de réunion. Résume-la en puces et liste les questions ouvertes. Ne résume pas encore la réunion dans son ensemble. »
Le dernier compte plus qu'il n'y paraît. Les transcriptions longues se dégradent collées d'un seul bloc, et l'échec est silencieux : le modèle résume ce qu'il a retenu et laisse le reste de côté sans le signaler.
gpt-transcribe et gpt-live-transcribe, publiés le 28 juillet 2026.
De trois façons. Envoyez le fichier dans une nouvelle conversation et demandez une transcription, ce qui marche sur le web comme sur mobile. Utilisez le mode Enregistrement dans l'application de bureau macOS, la route documentée et la seule qui identifie les intervenants. Ou dictez sur le web, iOS et Android pour des entrées courtes.
Oui. Joignez le fichier à une conversation et demandez une transcription. Le MP3, le M4A et le WAV sont les formats les plus réguliers. Ce que vous ne trouverez pas, c'est de la documentation : la liste des types de fichiers pris en charge par OpenAI ne mentionne aucun format audio et aucune note de version n'a annoncé la fonctionnalité, donc ni limite de taille officielle ni garantie de comportement sur laquelle vous appuyer.
OpenAI ne publie aucune limite de durée pour les envois. Lors de notre test d'août 2026, un enregistrement Google Meet de 33 minutes est revenu en moins de 5 minutes : la contrainte n'est donc pas la vitesse, mais la qualité du résultat, peu concluant plutôt qu'exploitable. Le mode Enregistrement, la route documentée, plafonne les sessions à 4 heures.
Plus par défaut. OpenAI a publié gpt-transcribe et gpt-live-transcribe le 28 juillet 2026, et whisper-1 est désormais positionné pour l'horodatage au niveau du mot, les sous-titres SRT et VTT, et la traduction vers l'anglais. OpenAI ne nomme publiquement aucun modèle derrière le mode Enregistrement.
Pas en la rejoignant. ChatGPT n'a aucun robot de réunion. L'application Zoom pour ChatGPT fait remonter les résumés, décisions, transcriptions et enregistrements que Zoom AI Companion a déjà produits. Pour capter l'appel lui-même, un assistant connecté à votre agenda prend en charge l'enregistrement, la transcription et les notes sans que personne ait à les lancer.
Configuration en deux minutes. Une offre gratuite à vie. Une qualité professionnelle dès le premier jour. Transformez vos réunions en une expérience positive et enrichissante

