Optimieren Sie Ihre Meetings jetzt.
Zwei Minuten Einrichtung. Kostenlose Basisversion für immer. Vom ersten Tag an auf Unternehmensniveau. Machen Sie Meetings zu einer positiven und lohnenden Erfahrung
Drei Wege zu einem Transkript aus ChatGPT, und ausgerechnet den meistgenutzten dokumentiert OpenAI am wenigsten.


ChatGPT kann Audio transkribieren, ist aber keine vollständige Transkriptionslösung. Wer mit ChatGPT Audio transkribieren möchte, wandelt Sprache über Record Mode, über Diktat und über den Upload einer Audiodatei in Text um, und für eine Sprachnotiz oder einen kurzen Ausschnitt reicht das gut aus. Was fehlt, sind Struktur und Konsistenz, wie eine Meeting-Transkription sie braucht.
Zwischen diesen beiden Punkten bleiben die meisten hängen. Der Weg über den Upload funktioniert, und er ist zugleich der Weg, zu dem OpenAI nichts veröffentlicht. Dieselbe Datei kann heute als sauberes Transkript zurückkommen und morgen als vage Zusammenfassung.
Hier steht, was ChatGPT 2026 mit Audio kann und was nicht, welche Schritte jeder Weg verlangt, welche Limits tatsächlich dokumentiert sind und wann ein spezialisiertes Tool für automatische Aufzeichnung und Transkription die bessere Wahl ist.
| Weg | Wo Es Funktioniert | Was Sie Bekommen | Dokumentiertes Limit |
|---|---|---|---|
| Record Mode | macOS-Desktop-App, in Plus, Pro, Business, Enterprise und Edu | Transkript mit Sprecherlabels, Zusammenfassung, Canvas | 4 Stunden pro Sitzung |
| Audiodatei per Upload | Web, iOS, Android und Desktop | Ein Transkript, die Qualität schwankt je nach Datei | Keines von OpenAI veröffentlicht |
| Diktat | Web, iOS und Android, alle Pläne | Bearbeitbarer Text im Eingabefeld | Keines veröffentlicht |
| Voice | ChatGPT-Apps | Transkript, das im Anschluss im Chat landet | Keines veröffentlicht |
| API (gpt-transcribe) | Entwickler-Integrationen | Transkript, optional Sprechersegmente | 25 MB pro Datei |
Tabelle zuletzt aktualisiert am: 6. August 2026.
Drei Wege, mit sehr unterschiedlichen Aufgaben.

Das ist der schnellste Weg, wenn Sie eine Audiodatei transkribieren lassen wollen: ein Interview, eine Sprachnachricht oder ein kurzer Meeting-Ausschnitt. Er funktioniert vom Telefon genauso wie vom Desktop, und wer eine MP3 transkribieren will, braucht in ChatGPT keinen Umweg über den Mac.
Es ist zugleich der Teil von ChatGPT, zu dem OpenAI nichts veröffentlicht. Stand August 2026 umfasst OpenAIs Liste der unterstützten Dateitypen XLSX, XLS, CSV, TSV, DOCX, PPTX, PDF und TXT, und keine Release Note hat den Upload von Audiodateien je angekündigt. Als ein Nutzer am 13. Juli 2026 nach nativer Unterstützung für .mp3 und .mp4 fragte, antwortete der OpenAI-Support, die Anfrage werde an das Team weitergeleitet, damit sie erfasst und für eine mögliche künftige Entwicklung berücksichtigt werden könne.
In der Praxis heißt das Unbeständigkeit statt Ausfall. Es gibt keine veröffentlichte Formatliste, keine Größengrenze und keine Verhaltensgarantie, mit der Sie planen könnten. Was bei einer bestimmten Datei zurückkommt, lässt sich vorher nicht sagen.
Wir haben das im August 2026 selbst getestet. Wir haben eine 33-minütige Google-Meet-Aufzeichnung aus dem Call exportiert und in ChatGPT hochgeladen. Das Ergebnis lag in unter 5 Minuten vor, an der Geschwindigkeit lag es also nie.
Das Problem war, was zurückkam. Die Ausgabe war unschlüssig, merklich weniger klar und weniger direkt als das, was ein spezialisierter Meeting-Assistent für denselben Call liefert. Eine einzelne Aufnahme ist kein Benchmark, aber sie passt zu dem, was die fehlende Dokumentation ohnehin nahelegt: Für diesen Weg ist nichts spezifiziert, also ist auch nichts garantiert.
MeetGeek spart den Export komplett. Es tritt dem Call über Ihren Kalender bei, transkribiert in über 100 Sprachen samt Sprechererkennung und schreibt Protokoll, Highlights und Action Items selbst. Alles bleibt über sämtliche Meetings hinweg durchsuchbar und landet über 20+ native Integrationen in Ihren Tools.
MeetGeek Kostenlos Testen
Record Mode ist der dokumentierte Weg und der einzige, der Sprecherlabels erzeugt. Unter macOS kann ChatGPT transkribieren, ohne dass Sie Zusatzsoftware installieren oder jemals eine Datei hochladen.

Das veröffentlicht OpenAIs Hilfeartikel zu ChatGPT Record dazu:
Wie sich das gegen ein Tool schlägt, das dem Meeting selbst beitritt, zeigt der Vergleich ChatGPT Record Mode gegen MeetGeek.
Diktat wandelt Gesprochenes in Text um, den Sie vor dem Senden noch bearbeiten können. Am 26. Juni 2026 hat OpenAI das zugrunde liegende Modell in allen Plänen im Web, unter iOS und Android aktualisiert, mit einer Wortfehlerrate, die für die getesteten Hauptsprachen mindestens 10 % niedriger liegt als beim vorherigen Produktionsmodell.
Das passt zu kurzen Eingaben: ein Gedanke, den Sie festhalten wollen, eine Nachricht, die Sie lieber sprechen als tippen. Für eine Aufnahme von 40 Minuten ist es nicht gebaut.
Ja, und es ist derselbe Upload-Weg. Hängen Sie die Datei an und bitten Sie ChatGPT, sie auszuwerten statt zu transkribieren, dann bekommen Sie eine Zusammenfassung, Kernpunkte oder Aufgaben, ohne den Umweg über ein vollständiges Transkript.
Der Vorbehalt ist derselbe, und hier wiegt er schwerer. Weil OpenAI nichts darüber veröffentlicht, wie eine hochgeladene Audiodatei verarbeitet wird, kann eine Auswertung bei der einen Datei gründlich ausfallen und bei der nächsten dünn, ohne Fehlermeldung, die den Unterschied erklärt. Bei einer Aufnahme jenseits von 30 Minuten ist dünn das wahrscheinlichere Ergebnis.
Ein Sonderfall bleibt das OGG-Format, in dem viele Messenger ihre Sprachnachrichten ablegen: Es steht in keiner der beiden Formatlisten. Wandeln Sie eine solche Sprachnachricht vorher in MP3 oder M4A um.
Was dabei verloren geht, sollten Sie kennen. Alles, was ausschließlich im Klang steckt, also Tonfall, Pausen oder Lautstärke, taucht in einer Textauswertung nicht mehr auf. Wer Audiodateien oder Sprachnachrichten analysieren lässt, bekommt eine Inhaltsanalyse, keine Stimmanalyse. OpenAI veröffentlicht für keinen dieser Wege eine Genauigkeitsangabe.
Voice funktioniert anders. Laut OpenAI wird nach einem Voice-Gespräch ein Transkript im Chat ergänzt, mit dem ausdrücklichen Hinweis, dass Voice-Transkripte keine wortgetreuen Protokolle sind. Damit taugt Voice gut, um eigene Gedanken festzuhalten, und schlecht als Beleg dafür, was jemand anderes gesagt hat. Bei einem Sprachmemo unterscheiden sich die Schritte je nach Gerät. Wie Sie Sprachmemos in Text umwandeln, steht in einem eigenen Leitfaden.
Diese Frage zerfällt in zwei, denn die Antworten unterscheiden sich deutlich.
In der ChatGPT-App veröffentlicht OpenAI weder eine Liste der Audioformate noch eine audiospezifische Größengrenze. Die allgemeinen Dateiregeln nennen 512 MB pro Datei als Obergrenze, 3 Uploads pro Tag im Free-Plan und bis zu 80 Dateien alle 3 Stunden in den kostenpflichtigen Plänen. Die einzige irgendwo veröffentlichte Längenbegrenzung für Transkription sind die 4 Stunden im Record Mode.
In der API wird OpenAIs Speech-to-Text-Leitfaden konkret: Dateien bis 25 MB, in mp3, mp4, mpeg, mpga, m4a, wav oder webm. Eine dokumentierte Grenze nach Minuten gibt es nicht, weshalb lange Dateien nach Größe geteilt werden und nicht nach Laufzeit.
Diese API-Werte kursieren weithin, als wären sie App-Limits. Das sind sie nicht. Die Grenze von 25 MB gilt für eine Entwickleranfrage an den Transkriptions-Endpunkt, nicht für eine Datei, die jemand ins Chatfenster zieht.
Die vorderste Reihe der OpenAI-Transkriptionsmodelle hat sich im Juli 2026 geändert. Am 28. Juli 2026 veröffentlichte das Unternehmen gpt-transcribe für die Transkription von Dateien und gpt-live-transcribe für Streaming mit niedriger Latenz in der API.
whisper-1 bleibt verfügbar, wird von OpenAI inzwischen aber für bestimmte Aufgaben positioniert statt als Standard: Zeitstempel auf Wortebene, Untertitel in SRT und VTT sowie Übersetzung ins Englische. Whisper selbst stammt vom September 2022, als OpenAI das Modell mit 680.000 Stunden mehrsprachiger, überwacht gelabelter Daten trainierte.
Diese Vorgeschichte hat einen praktischen Grund. Die veröffentlichten Whisper-Benchmarks beschreiben ein Modell von 2022 und sagen damit kaum etwas über ein Transkript aus, das ChatGPT heute erzeugt. Welches Modell hinter Record Mode arbeitet, nennt OpenAI öffentlich nicht, und für hochgeladene Dateien nennt es gar kein Modell.
OpenAI veröffentlicht für ChatGPT selbst keinen Genauigkeitswert. Jede konkrete Prozentzahl, die Ihnen dazu begegnet, ist die Schätzung von jemandem und keine Herstellerangabe.
Was OpenAI veröffentlicht, gibt immerhin die Richtung vor. In einer internen Auswertung unter Störgeräuschen erzeugte der Snapshot von gpt-4o-mini-transcribe aus dem Dezember 2025 rund 90 % weniger Halluzinationen als Whisper v2, und das Diktat-Update vom Juni 2026 senkte die Wortfehlerrate für die getesteten Hauptsprachen um mindestens 10 %.
Die ChatGPT Transkription ist in einer ruhigen Aufnahme mit einer sprechenden Person also deutlich belastbarer als in einem Meeting mit 5 Teilnehmern und einem Laptop-Mikrofon in der Tischmitte. Die Genauigkeit hängt an denselben 4 Variablen wie eh und je: Hintergrundgeräusche, gleichzeitig sprechende Personen, Abstand zum Mikrofon und Sprache.
Auf dem Upload-Weg kommt ein fünftes Problem dazu, und es ist nicht die Geschwindigkeit. In unserem eigenen Test kam das Ergebnis in unter 5 Minuten zurück und war trotzdem zu vage, um damit zu arbeiten. Behandeln Sie jede Ausgabe als ersten Entwurf und prüfen Sie Namen, Zahlen und Entscheidungen von Hand.
Im Record Mode ja. OpenAI dokumentiert, dass mehrere Sprecher unterschieden werden. Wo sich jemand nicht namentlich zuordnen lässt, vergibt ChatGPT ein generisches Label wie Sprecher 1, das Sie nach der Aufnahme umbenennen können.
Bei einer hochgeladenen Datei sollten Sie nicht damit rechnen. Sprecherlabels erscheinen dort unbeständig, und OpenAI dokumentiert nichts, woraus sich ableiten ließe, wann sie auftauchen und wann nicht.
In der API hat die Sprechererkennung ein eigenes Modell. gpt-4o-transcribe-diarize läuft am Transkriptions-Endpunkt mit response_format: diarized_json und liefert Segmente mit Sprecherangabe zurück. OpenAIs Migrationsleitfaden hält fest, dass dieses Modell in der Realtime API nicht unterstützt wird. Einen Genauigkeitswert für die Sprechererkennung veröffentlicht OpenAI an keiner der beiden Stellen.
ChatGPT tritt Ihrem Meeting nicht als Teilnehmer bei. Einen dokumentierten Meeting-Bot gibt es nicht.
Was es gibt, ist der Abruf dessen, was andere Systeme bereits erzeugt haben. Die Zoom-App für ChatGPT holt Zusammenfassungen, Entscheidungen, Transkripte und Aufzeichnungen hervor, die Zoom AI Companion erstellt hat, statt das Gespräch selbst aufzuzeichnen. Die Microsoft-Teams-App liefert Transkripttext, sofern ein Transkript existiert und die Person Zugriff darauf hat, und gibt bei Aufzeichnungen ausdrücklich Metadaten der Aufnahme zurück, nicht den Inhalt der Aufnahmedatei.
Am nächsten an eine Live-Aufnahme kommt Record Mode, der den Systemton auf Ihrem Mac mitschneidet, während ein Call läuft. Das funktioniert, mit 3 Einschränkungen: nur macOS, maximal 4 Stunden, und ChatGPT informiert niemanden sonst im Gespräch. Die Einwilligung einzuholen, bleibt vollständig Ihre Aufgabe.
Sonst liegt der realistische ChatGPT-Ablauf für ein Meeting im Nachhinein: den Call anderswo aufzeichnen, die Datei exportieren, hochladen und hoffen, dass etwas Brauchbares zurückkommt. Genau diesen Ablauf haben wir mit einer 33-minütigen Google-Meet-Aufzeichnung getestet, und was zurückkam, hätten wir niemandem im Team weitergeleitet.
Teams, die das Gespräch selbst mitschneiden müssen, koppeln stattdessen einen Assistenten an den Kalender. MeetGeek tritt geplanten Terminen automatisch bei, ob über die Zoom Integration, die Integration für Microsoft Teams oder die Anbindung an Google Meet, transkribiert in 100+ Sprachen mit automatischer Sprechererkennung und schreibt KI-gestützte Meeting-Protokolle mit Highlights und Aufgaben, ohne dass jemand einen Prompt eingeben muss.
.webp)
Zwei Unterschiede zum ChatGPT-Weg wiegen am schwersten. Jedes Gespräch landet in einer durchsuchbaren Meeting-Bibliothek statt im Chat-Thread, in dem es entstanden ist, sodass Sie eine Entscheidung auch 3 Monate später noch finden. Und der Upload ist hier eine unterstützte Funktion mit veröffentlichter Formatliste, MP3, MP4, WAV, M4A und WEBM, statt undokumentiertes Verhalten. Der Betrieb ist nach SOC 2 Type II, HIPAA und DSGVO abgesichert, im Einsatz bei 50.000+ Teams in 100+ Ländern. Der kostenlose Plan enthält 3 Stunden Transkription pro Monat.
.webp)
Wenn das Transkript entstehen soll, ohne dass Sie daran denken müssen, lassen Sie den Assistenten Ihrem nächsten Termin beitreten.
MeetGeek Kostenlos Testen
Wenn ChatGPT gestern noch transkribiert hat und heute nicht mehr, liegt das seltener an einem harten Fehler als an der Grundlage. Der häufigste Ausgang ist kein Ausfall, sondern ein vages Ergebnis. Die Ursachen lassen sich der Reihe nach abhaken:
Wenn Sie Transkripte regelmäßig und nicht gelegentlich brauchen, ist die belastbare Antwort nicht ein weiterer Workaround, sondern ein Weg mit veröffentlichten Limits.
Sie können eine Videodatei genauso hochladen wie eine Audiodatei und um ein Transkript des Gesagten bitten. Es gilt derselbe Vorbehalt: keine dokumentierte Formatliste, keine Größengrenze, keine Garantie.
Zwei weitere Wege sind belastbarer. Record Mode schneidet den Systemton auf einem Mac mit, ein während der Aufnahme abgespieltes Video liefert also ein Transkript über den dokumentierten Weg. Und die API akzeptiert mp4 und webm als Eingabeformate.
Für einen wiederholbaren Ablauf statt einer Einzellösung zeigen die Schritte, wie Sie eine MP4-Datei in ein Transkript umwandeln, welche Werkzeuge die Datei direkt annehmen.
Sobald Text vorliegt, ist ChatGPT wirklich stark. Drei Prompts decken das meiste ab, was gebraucht wird.
Aufräumen: „Bereinige dieses Transkript. Entferne Füllwörter, korrigiere die Grammatik und lasse jede Sprecherzuordnung unverändert.“
Zusagen herausziehen: „Extrahiere die Aufgaben als Tabelle mit den Spalten Aufgabe, verantwortliche Person und Frist. Markiere jeden Punkt, bei dem keine verantwortliche Person genannt wurde.“
Lange Aufnahmen behandeln: „Das ist Teil 3 von 5 eines Meeting-Transkripts. Fasse ihn in Stichpunkten zusammen und liste offene Fragen auf. Fasse das Meeting noch nicht als Ganzes zusammen.“
Der letzte Prompt wiegt schwerer, als er aussieht. Lange Transkripte verlieren an Qualität, wenn sie in einem Block eingefügt werden, und das Scheitern verläuft leise: Das Modell fasst zusammen, was es behalten hat, und lässt den Rest weg.
gpt-transcribe und gpt-live-transcribe, veröffentlicht am 28. Juli 2026. whisper-1 bleibt für Zeitstempel, Untertitel und Übersetzung ins Englische.
Auf 3 Wegen. Laden Sie die Audiodatei in einen neuen Chat und bitten Sie um ein Transkript, das funktioniert im Web und mobil. Nutzen Sie Record Mode in der macOS-Desktop-App, den dokumentierten Weg und den einzigen mit Sprecherlabels. Oder diktieren Sie im Web, unter iOS und Android, was für kurze Eingaben gedacht ist und nicht für ganze Aufnahmen.
Ja. Hängen Sie die Datei an einen Chat an und bitten Sie um ein Transkript. MP3, M4A und WAV laufen am zuverlässigsten durch. Was Sie nicht finden werden, ist Dokumentation: In OpenAIs Artikel zu den unterstützten Dateitypen steht kein Audioformat, und keine Release Note hat die Funktion je angekündigt. Es gibt also keine offizielle Größengrenze und keine Verhaltensgarantie, auf die Sie sich stützen könnten.
Ja. Eine fertige Aufnahme laden Sie genauso hoch wie jede andere Datei, damit kann ChatGPT Audios transkribieren, die längst auf der Festplatte liegen. Wenn Sie ein dokumentiertes Verfahren brauchen, starten Sie stattdessen Record Mode auf dem Mac und spielen die Aufnahme über den Systemton ab.
Für Uploads veröffentlicht OpenAI keine Längenbegrenzung. In unserem Test im August 2026 war eine 33-minütige Google-Meet-Aufzeichnung in unter 5 Minuten verarbeitet, die Grenze ist also nicht die Geschwindigkeit, sondern die Qualität des Ergebnisses: Es war unschlüssig statt ein brauchbares Transkript. Record Mode, der dokumentierte Weg, begrenzt eine Sitzung auf 4 Stunden.
Ja, über denselben Upload-Weg. Ein Sonderfall ist das OGG-Format, das viele Messenger verwenden und das in keiner der beiden Formatlisten steht. Wandeln Sie die Nachricht vorher in MP3 oder M4A um. Tonfall und Pausen bleiben in jedem Fall außen vor, weil die Auswertung am Inhalt hängt und nicht am Klang.
Eine audiospezifische Grenze veröffentlicht OpenAI für die App nicht. Allgemeine Datei-Uploads enden bei 512 MB, mit 3 Uploads pro Tag im Free-Plan und bis zu 80 Dateien alle 3 Stunden in den bezahlten Plänen. Die oft zitierten 25 MB gelten für die API und nicht für die App.
Nicht als Standard. OpenAI hat am 28. Juli 2026 gpt-transcribe und gpt-live-transcribe veröffentlicht, und whisper-1 ist heute für Wort-Zeitstempel, Untertitel in SRT und VTT sowie Übersetzung ins Englische positioniert. Welches Modell Record Mode antreibt, nennt OpenAI öffentlich nicht.
Nicht, indem es beitritt. ChatGPT hat keinen Meeting-Bot. Die Zoom-App für ChatGPT holt Zusammenfassungen, Entscheidungen, Transkripte und Aufzeichnungen hervor, die Zoom AI Companion bereits erstellt hat. Um das Gespräch selbst zu erfassen, übernimmt ein Meeting-Assistent, der aus dem Kalender heraus beitritt, Aufzeichnung, Transkription und Notizen, ohne dass jemand etwas startet.
Zwei Minuten Einrichtung. Kostenlose Basisversion für immer. Vom ersten Tag an auf Unternehmensniveau. Machen Sie Meetings zu einer positiven und lohnenden Erfahrung

