Mejora tus reuniones ahora.
Configuración en dos minutos. Plan gratuito para siempre. Calidad empresarial desde el primer día. Convierte tus reuniones en una experiencia positiva y gratificante
Tres formas de sacar una transcripción de ChatGPT, y la que casi todos eligen primero es la que OpenAI menos documenta.


ChatGPT puede transcribir audio, pero no es una solución de transcripción completa. Convierte la voz en texto por tres vías, el modo Grabar, el dictado y la subida de un archivo, y lo hace lo bastante bien para una nota de voz o un clip corto. Lo que le falta es la estructura y la consistencia que exige la transcripción de reuniones.
La distancia entre esas dos cosas es donde se atasca casi todo el mundo. La vía de subida funciona, y es además aquella sobre la que OpenAI no publica nada, así que el mismo archivo puede volver un día como una transcripción limpia y al día siguiente como un resumen vago.
Esto es exactamente lo que ChatGPT puede y no puede hacer con audio en 2026, los pasos de cada método, los límites que sí están documentados y en qué punto conviene una herramienta de grabación y transcripción de reuniones.
| Vía | Dónde Funciona | Qué Obtienes | Límite Documentado |
|---|---|---|---|
| Modo Grabar | App de escritorio para macOS, en Plus, Pro, Business, Enterprise y Edu | Transcripción con etiquetas de hablante, resumen y canvas | 4 horas por sesión |
| Subida de archivo de audio | Web, iOS, Android y escritorio | Una transcripción, con calidad variable según el archivo | Ninguno publicado por OpenAI |
| Dictado | Web, iOS y Android, todos los planes | Texto editable en la caja de mensaje | Ninguno publicado |
| Voz | Apps de ChatGPT | Una transcripción añadida al chat al terminar | Ninguno publicado |
| API (gpt-transcribe) | Integraciones de desarrollo | Transcripción y segmentos de hablante opcionales | 25 MB por archivo |
Tabla actualizada por última vez el: 6 de agosto de 2026.
Tres métodos, con trabajos distintos.

Es la vía más rápida para una entrevista, una nota de voz o un clip corto de reunión, y funciona igual desde el celular que desde el escritorio.
También es la parte de ChatGPT sobre la que OpenAI no publica nada. A agosto de 2026, la lista oficial de tipos de archivo compatibles cubre XLSX, XLS, CSV, TSV, DOCX, PPTX, PDF y TXT, y ninguna nota de versión ha anunciado nunca la subida de archivos de audio. Cuando un usuario pidió soporte nativo para .mp3 y .mp4 el 13 de julio de 2026, el soporte de OpenAI respondió que la petición se enviaría al equipo "para que quede registrada y se considere en el desarrollo futuro".
El efecto práctico es la inconsistencia, no el fallo. No hay lista publicada de formatos, tope de tamaño ni garantía de comportamiento sobre la que planificar, así que lo que recibes en un archivo concreto no es algo que puedas predecir de antemano.
Lo probamos de primera mano en agosto de 2026. Tomamos una grabación de 33 minutos de Google Meet, la exportamos de la llamada y la subimos a ChatGPT. Volvió en menos de 5 minutos, así que la velocidad nunca fue el problema.
El problema fue lo que volvió. El resultado quedó poco concluyente, bastante menos claro y menos directo que lo que devuelve un asistente de reuniones dedicado para esa misma llamada. Una sola grabación no es un benchmark, pero coincide con lo que la documentación ausente ya dejaba entrever: nada de esta vía está especificado, así que nada está garantizado.
MeetGeek se salta la exportación por completo. Entra en la llamada desde tu calendario, transcribe en más de 100 idiomas identificando quién habla, y después redacta solo las notas, los momentos clave y las tareas. Todo queda buscable entre todas tus reuniones y llega a tus herramientas mediante más de 20 integraciones nativas.
Prueba MeetGeek Gratis
El modo Grabar es la vía documentada, y la única que produce etiquetas de hablante.

Esto es lo que publica el artículo del centro de ayuda de OpenAI sobre ChatGPT Record:
Para ver cómo se compara con una herramienta que entra sola a la llamada, revisa el modo Grabar de ChatGPT frente a MeetGeek.
El dictado convierte la voz en texto que puedes editar antes de enviarlo. El 26 de junio de 2026 OpenAI actualizó el modelo de fondo en todos los planes de web, iOS y Android, con una tasa de error por palabra "al menos un 10% menor en los idiomas principales probados que la del modelo de producción anterior".
Sirve para entradas cortas: una idea que quieres dejar capturada, un mensaje que prefieres hablar en lugar de escribir. No está hecho para una grabación de 40 minutos.
Sí, y es la misma vía de subida que vimos arriba. Adjunta el archivo y pídele a ChatGPT que lo analice en lugar de transcribirlo, y obtienes un resumen, los puntos clave o las tareas sin pasar por una transcripción completa.
La advertencia es la misma, y aquí pesa más. Como OpenAI no documenta cómo se trata el audio que subes, un análisis puede salir minucioso en un archivo y pobre en el siguiente, sin mensaje de error que explique la diferencia. En una grabación larga, lo pobre es lo más probable.
La Voz funciona distinto. OpenAI indica que se añade una transcripción al chat después de cada conversación por voz, con la advertencia de que "no son registros textuales y pueden no coincidir exactamente con lo que se dijo". Sirve para capturar tus propias ideas y no como registro de lo que dijo otra persona. Si el archivo es una nota de voz, los pasos cambian según el dispositivo y los cubrimos en la guía para transcribir notas de voz a texto.
Conviene separar la respuesta en dos, porque son distintas.
Dentro de la app de ChatGPT, OpenAI no publica ninguna lista de formatos de audio ni un tope de tamaño para audio. Las reglas generales son un techo de 512 MB por archivo, 3 subidas por día en Free y hasta 80 archivos cada 3 horas en los planes de pago. El único límite de duración publicado para transcripción son las 4 horas del modo Grabar.
En la API, la guía de voz a texto de OpenAI es explícita: archivos de hasta 25 MB, en mp3, mp4, mpeg, mpga, m4a, wav o webm. No hay límite documentado en minutos, y por eso los archivos largos se parten por tamaño y no por tiempo.
Esos valores se citan a menudo como si fueran límites de la app. No lo son. El tope de 25 MB rige una petición al endpoint de transcripción, no un archivo que arrastras a una ventana de chat.
Los modelos de transcripción de primera línea de OpenAI cambiaron en julio de 2026. El 28 de julio de 2026 la compañía lanzó gpt-transcribe para transcripción de archivos y gpt-live-transcribe para streaming de baja latencia en la API.
whisper-1 sigue disponible, pero ahora queda para tareas concretas y no como opción por defecto: marcas de tiempo a nivel de palabra, subtítulos SRT y VTT, y traducción al inglés. Whisper es de septiembre de 2022, cuando OpenAI lo entrenó con 680.000 horas de datos supervisados multilingües.
Esa historia importa por una razón práctica. Los benchmarks de Whisper describen un modelo de 2022, así que dicen poco sobre una transcripción que ChatGPT produce hoy. OpenAI no dice qué modelo mueve el modo Grabar, y no nombra ninguno para los archivos que subes.
OpenAI no publica ningún porcentaje de precisión para ChatGPT, así que cualquier cifra que circule es una estimación externa y no un dato del proveedor.
Lo que OpenAI sí publica es direccional. En una evaluación interna con ruido, su snapshot de diciembre de 2025 de gpt-4o-mini-transcribe produjo aproximadamente 90% menos alucinaciones que Whisper v2, y la actualización del dictado de junio de 2026 redujo la tasa de error por palabra "al menos un 10% en los idiomas principales probados".
La precisión sigue moviéndose con las mismas cuatro variables de siempre: ruido de fondo, hablantes que se pisan, distancia al micrófono e idioma. En la vía de subida hay un quinto problema, y no es la velocidad. En nuestra prueba de agosto de 2026 el resultado volvió en menos de 5 minutos y aun así fue demasiado vago para actuar sobre él. Trata cualquier salida como un primer borrador y revisa a mano nombres, cifras y decisiones.
En el modo Grabar, sí. OpenAI documenta que distingue varios hablantes y que, cuando no identifica a alguien por su nombre, aplica una etiqueta genérica como Speaker 1, que puedes renombrar después.
En un archivo que subes, no cuentes con ello. Las etiquetas aparecen de forma inconsistente y OpenAI no documenta nada que te permita anticipar cuándo esperarlas.
En la API, el etiquetado de hablantes tiene su propio modelo. gpt-4o-transcribe-diarize corre sobre el endpoint de transcripciones con response_format: diarized_json y devuelve segmentos anotados por hablante. La guía de migración de OpenAI indica que ese modelo "no es compatible con la Realtime API".
ChatGPT no entra a tu llamada como participante. No existe un bot de reuniones documentado.
Lo que sí existe es la recuperación de lo que otros sistemas ya produjeron. La app de Zoom para ChatGPT muestra resúmenes, decisiones, transcripciones y grabaciones que generó Zoom AI Companion, en lugar de capturar la llamada. La app de Microsoft Teams devuelve el texto de la transcripción cuando existe y el usuario tiene acceso, y de las grabaciones devuelve "metadatos de la grabación, no el contenido del archivo".
Así que el flujo realista de ChatGPT para una reunión llega después: graba la llamada en otro lado, exporta el archivo, súbelo y espera que vuelva algo utilizable. Ese es el flujo que probamos con una grabación de 33 minutos de Google Meet, y lo que volvió no era algo para enviarle a un colega.
Los equipos que necesitan capturar la llamada en sí conectan un asistente al calendario. MeetGeek entra solo a las reuniones agendadas de Zoom, funciona igual en Microsoft Teams y también graba las videollamadas de Google Meet. Las transcribe en 100+ idiomas con reconocimiento automático de hablantes y redacta notas de reunión con IA con momentos destacados y tareas, sin que nadie se lo pida.
.webp)
Hay dos diferencias que pesan frente a la ruta de ChatGPT. Cada llamada queda en una biblioteca de reuniones con búsqueda y no dentro del hilo de chat donde se creó, así que puedes encontrar una decisión tres meses después. Y las subidas son una función soportada, con lista de formatos declarada, MP3, MP4, WAV, M4A y WEBM. Cumple con SOC 2 Type II, HIPAA y RGPD, y lo usan 50.000+ equipos en 100+ países. El plan gratuito incluye 3 horas de transcripción al mes.
.webp)
Si quieres que la transcripción ocurra sin que tengas que acordarte de iniciarla, deja que entre a tu próxima llamada.
Prueba MeetGeek Gratis
Puedes subir un video igual que subes un audio y pedir una transcripción de lo que se dijo. Aplica la misma advertencia: no hay lista de formatos documentada, ni tope de tamaño, ni garantía.
El modo Grabar además captura el audio del sistema en una Mac, así que reproducir un video mientras grabas da una transcripción por la vía documentada. En la API, mp4 y webm son formatos de entrada admitidos.
Para un flujo repetible en vez de un caso aislado, los pasos para convertir un archivo MP4 en transcripción cubren las herramientas que aceptan el archivo directo.
Una vez que el texto existe, ChatGPT es realmente bueno. Tres prompts cubren casi todo lo que hace falta.
Limpiarla: "Limpia esta transcripción. Elimina muletillas, corrige la gramática y mantén intacta cada atribución de hablante".
Sacar los compromisos: "Extrae las tareas en una tabla con columnas de tarea, responsable y fecha límite. Marca cualquier tarea en la que no se haya indicado el responsable".
Manejar una grabación larga: "Esta es la parte 3 de 5 de la transcripción de una reunión. Resúmela en viñetas y lista las preguntas abiertas. Todavía no resumas la reunión completa".
Ese último importa más de lo que parece. Las transcripciones largas se degradan al pegarse en un solo bloque, y la falla es silenciosa: el modelo resume lo que retuvo y se salta el resto sin avisarte.
gpt-transcribe y gpt-live-transcribe, lanzados el 28 de julio de 2026.
Hay tres formas. Sube el archivo a un chat nuevo y pide la transcripción, que funciona en web y en el celular. Usa el modo Grabar de la app de escritorio para macOS, la vía documentada y la que etiqueta a los hablantes. O usa el dictado en web, iOS y Android para entradas habladas cortas.
Sí. Adjunta el archivo a un chat y pide la transcripción. MP3, M4A y WAV son los más consistentes. Lo que no vas a encontrar es documentación: el artículo de tipos de archivo compatibles de OpenAI no lista ningún formato de audio y ninguna nota de versión ha anunciado la función, así que no hay límite de tamaño oficial ni garantía de comportamiento en la que apoyarte.
OpenAI no publica ningún límite de duración para las subidas. En nuestra prueba de agosto de 2026, una grabación de 33 minutos de Google Meet se procesó en menos de 5 minutos, así que la restricción no es la velocidad sino la calidad del resultado: volvió poco concluyente y no como transcripción utilizable. El modo Grabar, la vía documentada, limita las sesiones a 4 horas.
No hay uno específico para audio en la app de ChatGPT. Las subidas generales tienen un tope de 512 MB, con 3 subidas por día en Free y hasta 80 archivos cada 3 horas en planes de pago. La cifra de 25 MB que tanto se cita es el límite de una petición a la API, no de la app.
No como modelo por defecto. OpenAI lanzó gpt-transcribe y gpt-live-transcribe el 28 de julio de 2026, y whisper-1 quedó para marcas de tiempo por palabra, subtítulos SRT y VTT, y traducción al inglés. OpenAI no dice qué modelo mueve el modo Grabar.
No entrando a ella. ChatGPT no tiene bot de reuniones. La app de Zoom para ChatGPT solo muestra resúmenes, decisiones, transcripciones y grabaciones que Zoom AI Companion ya produjo. Para capturar la llamada en sí, un asistente que entra desde tu calendario se encarga de la grabación, la transcripción y las notas sin que nadie las inicie.
Configuración en dos minutos. Plan gratuito para siempre. Calidad empresarial desde el primer día. Convierte tus reuniones en una experiencia positiva y gratificante

