Formate
Welches Transkript-Format für welche Aufgabe
Ein Transkript ist nicht eine Sache. Eine Notiz-App will Markdown, ein Modell will Klartext, ein Videoplayer will SRT oder VTT, ein Skript will JSON. Wähle das Format nach der Aufgabe, nicht umgekehrt.
Markdown, für Notizen und Wiki-Seiten
Markdown ist zum Lesen und Verlinken da. Überschriften, Fett, Aufzählungen - es rendert in Obsidian, Notion, einer statischen Seite oder auf GitHub ohne Zusatzaufwand, und bleibt schlicht genug, um es zu diffen und zu versionieren.
Nutze es, wenn das Transkript in eine persönliche Wissensbasis oder eine Wiki-Seite neben anderen Notizen soll. Es ist das Format, gegen das du Links und Zitate schreibst, nicht das, das du einem Modell fütterst.
Klartext, zum Einfügen in ein Modell
Klartext hat kein Markup zum Entfernen und keine Formatierung, über die ein Modell stolpert. Füge ein Klartext-Transkript in ein Chat-Fenster oder einen Prompt ein, und jedes Token ist Transkript, keine Syntax.
Es ist auch das kleinste Format, was zählt, wenn das Kontextfenster knapp wird. Wenn die Aufgabe "fasse das zusammen" oder "beantworte Fragen dazu" lautet, ist Klartext der Weg mit dem wenigsten Widerstand.
SRT und VTT, für Untertitel
SRT und VTT haben eine Aufgabe: zeitcodierter Text unter einem Video. Beide kodieren Start- und Endzeit pro Zeile, und beide werden von Videoplayern, Schnittprogrammen und den meisten Plattformen nativ gelesen, auf die du Material hochlädst.
SRT ist das ältere, einfachere Format und das, was die meiste Schnittsoftware erwartet. VTT bringt Styling und Positionierung mit und ist der Web-Standard - das Format, das YouTube und Browser-Videoplayer direkt lesen.
JSON, für Pipelines und strukturierte Verarbeitung
JSON ist für Code da, nicht zum Lesen. Segmente, Zeitstempel und Sprecher-Labels kommen als strukturierte Felder heraus, über die ein Skript iterieren, filtern oder die es in ein anderes System einspeisen kann - einen Suchindex, eine Datenbank, einen zweiten Modellaufruf.
Wenn du auf Transkripten etwas aufbaust, statt eins zu lesen, fang hier an. Es ist das einzige Format, das Sprecher- und Zeitinformationen maschinenadressierbar hält statt in Text eingebettet.
Vocateca exportiert alle davon
Jedes Transkript in Vocateca - lokale Datei, YouTube-Video, Podcast-Folge, Instagram-Video - exportiert aus derselben Quelle nach Markdown, Klartext, SRT, VTT und JSON. Zeitstempel pro Segment und Sprecher-Labels bleiben in jedem Format erhalten, das sie unterstützt.
Du wählst das Format nicht beim Transkribieren. Du wählst es, wenn du weißt, wofür das Transkript ist.