Audio in Text umwandeln, mit Sprechernamen und Zeitstempeln
Eine Stunde Interview von Hand abzutippen dauert vier bis fünf Stunden. Schick die Aufnahme an deinen todo.is-Agenten: Er transkribiert sie, kennzeichnet, wer spricht, setzt Zeitstempel zum Zurückspringen und markiert alles, was er nicht klar verstanden hat, damit du weißt, was du prüfen musst.
Der Prompt
- Transkribiere die angehängte Audiodatei: [AUDIODATEI ANHÄNGEN]. Es ist [WAS ES IST] auf [SPRACHE]. Es sprechen: [SPRECHER]. Kennzeichne jeden Redebeitrag mit dem Namen und setz bei jedem Sprecherwechsel einen Zeitstempel. Stil: [TRANSKRIPTIONSSTIL]. Markiere unverständliche Wörter als (unverständlich 12:34) mit Zeitangabe. Gib mir [FORMAT] und eine Liste der Namen, Orte und Fachbegriffe, bei deren Schreibweise du unsicher warst.
Was du ändern solltest
- [AUDIODATEI ANHÄNGEN]: MP3, WAV, M4A, OGG, FLAC oder eine andere Audiodatei anhängen, bis 50 MB.
- [WAS ES IST]: Z. B. „ein Forschungsinterview für meine Masterarbeit“, „eine Podcast-Folge“, „ein Kundengespräch“ oder „eine Vorlesung“.
- [SPRACHE]: Z. B. „Deutsch“, „Schweizerdeutsch und Hochdeutsch gemischt“ oder „Deutsch und Englisch“.
- [SPRECHER]: Namen und Rollen, z. B. „Dr. Anna Brandt (Interviewerin), Thomas Hahn (Befragter)“.
- [TRANSKRIPTIONSSTIL]: Z. B. „geglättet (ohne Äh und Wiederholungen)“ oder „wörtlich, jedes Wort, für die qualitative Forschung“.
- [FORMAT]: Z. B. „eine Word-Datei“, „reine TXT“, „beides“ oder „ein Google Doc in meinem Drive“.
Beispielergebnis
- Transkript: Forschungsinterview mit Thomas Hahn
- 52 Min. · 2 Sprecher · geglättet · 7.860 Wörter · Deutsch
- Auszug
- [00:00:04] Dr. Anna Brandt: Danke, dass Sie sich Zeit nehmen. Zum Einstieg: Wie sind Sie zum Gemeinschaftsgarten gekommen?
- [00:00:11] Thomas Hahn: Das war 2019. Wir waren gerade in die Siedlung gezogen, und hinter dem Parkplatz lag eine Brachfläche. Eine Nachbarin, Frau Yilmaz, hat in jeden Briefkasten einen Zettel geworfen, wer mitmachen will.
- [00:00:29] Dr. Anna Brandt: Und warum haben Sie zugesagt?
- [00:00:32] Thomas Hahn: Ehrlich gesagt, ich war einsam. Ich habe im Homeoffice gearbeitet und kannte niemanden. Der Garten war ein Grund, samstags rauszugehen.
- [00:14:08] Thomas Hahn: Im zweiten Jahr gab es einen kleinen Zuschuss vom Bezirksamt, aber das Wasser war immer das Problem. Wir hatten einen Schlauch aus der Wohnung [unverständlich 00:14:15], was eigentlich nicht erlaubt war.
- Was das Transkript enthält
- • Sprechernamen bei jedem Beitrag, nicht „Sprecher 1“
- • Ein Zeitstempel bei jedem Sprecherwechsel, damit du jedes Zitat in der Aufnahme wiederfindest
- • Geglättet: Äh, Satzabbrüche und Wortwiederholungen entfernt, der Inhalt bleibt unverändert
- • 4 Markierungen [unverständlich], wo ein Bus vorbeifuhr oder beide gleichzeitig sprachen
- Bitte diese Schreibweisen prüfen
- • „Yilmaz“ (Nachbarin)
- • „Siedlung am Grünhain“ (zweimal gehört, evtl. „Grünhang“)
- • „Bürgerstiftung Gartenfonds“
- Hinweis zur Genauigkeit
- Klare Aufnahmen werden in der Regel sehr genau transkribiert. Dialekt, Durcheinanderreden und Hintergrundgeräusche senken die Genauigkeit, also jedes Zitat vor der Veröffentlichung prüfen.
So geht’s mit todo.is
- Kopiere den Prompt und trag Sprache, Sprecher, Stil und Format ein.
- Hänge die Aufnahme in todo.is an oder schick die Datei per Telegram, WhatsApp oder E-Mail an deinen Agenten.
- Dein Agent transkribiert sie, kennzeichnet die Sprecher und schickt dir die Transkriptdatei.
- Frag weiter, etwa „finde jede Stelle, an der Thomas über Finanzierung spricht“ oder „fass die Hauptthemen zusammen“.
Tipps für ein besseres Ergebnis
- Nenn Sprechernamen und Rollen gleich zu Beginn. Aus „Sprecher 1“ werden echte Namen und das Transkript ist sofort nutzbar.
- Für Abschlussarbeiten und qualitative Forschung wörtlich transkribieren lassen. Pausen und Zögern können für die Auswertung wichtig sein; frag nach, welche Transkriptionsregeln dein Lehrstuhl verlangt.
- Schick vorab eine Liste schwieriger Namen und Fachbegriffe. Dein Agent schreibt sie dann durchgehend richtig.
- Nimm nah am Mikrofon in einem ruhigen Raum auf. Das bringt mehr Genauigkeit als jede Einstellung.
Audio in Text umwandeln: häufige Fragen
- Wie genau ist die KI-Transkription von Audio in Text? Bei klarer Sprache ohne viel Hintergrundgeräusch meist sehr genau. Starker Dialekt, überlappende Stimmen und Lärm verursachen mehr Fehler; dein Agent markiert unklare Stellen.
- Kann die KI verschiedene Sprecher unterscheiden? Ja. Nenn die Namen, dann kennzeichnet dein Agent jeden Beitrag. Sehr ähnliche Stimmen können manchmal verwechselt werden, wichtige Zitate also prüfen.
- Welche Sprachen werden transkribiert? Viele Sprachen, auch Aufnahmen, in denen zwischen zwei Sprachen gewechselt wird. Sag, welche Sprachen vorkommen.
- Bleibt meine Aufnahme privat? Audio und Transkript bleiben im Arbeitsbereich deines eigenen Agenten, nur er nutzt sie. Hol dir vor der Aufnahme das Einverständnis der Beteiligten.
JavaScript is required to use the todo.is app.