Werkzeuge

Das Transkript ist die Schnittstelle zwischen Audio und Modellen

Kein LLM liest Audio wirklich direkt - es liest Text über Audio, oder ein Transkript darunter. Akzeptiert man das, hört das Transkript auf, eine Ausgabe zu sein, die man kurz überfliegt, und wird zur API-Oberfläche zwischen gesprochenem Audio und jedem Modell oder Agenten, der damit arbeiten will.

Audio ist keine Schnittstelle, Text ist eine

Ein Modell kann ein Meeting zusammenfassen, Aufgaben extrahieren oder Fragen zu einem Interview beantworten - aber erst, nachdem jemand das Audio in Text verwandelt hat. Dieser Schritt ist nicht optional und nicht umsonst; er ist die eigentliche Schnittstelle. Läuft er schief - Zeitstempel weg, Sprecher vermischt, Rohtext verloren -, erbt alles Weitere den Verlust.

Behandle Transkription als Infrastruktur, nicht als Bequemlichkeit für den Einzelfall. Wenn Audio regelmäßig in deine Pipeline geht, ist das, was es in Text verwandelt, eine Abhängigkeit wie jede andere - und sie sollte skriptfähig sein.

Aus einem Skript: vocateca transcript <url|file>

Die CLI nimmt eine URL oder eine lokale Datei und liefert ein Transkript: vocateca transcript <url|file>. Ein YouTube-Link, eine Podcast-Folge, eine Audio- oder Videodatei auf der Platte - derselbe Befehl, dieselbe Ausgabeform, ausgeführt aus einem Shell-Skript, einem Cron-Job oder einer CI-Pipeline.

Kein Dashboard, kein Upload-Schritt, kein API-Key zu provisionieren. Der Befehl läuft auf dem Gerät und endet mit einem Transkript, das du direkt in den nächsten Schritt leiten kannst - grep es, füttere es einem Modell, schreib es auf die Platte.

Aus einem Agenten: der MCP-Server

Ein Agent, der über das Model Context Protocol arbeitet, ruft keine CLI auf - er ruft ein Tool auf. Vocatecas MCP-Server stellt Transkription direkt als eines dieser Tools bereit, sodass ein Agent ihm mitten in einer Aufgabe eine URL oder eine Datei übergeben und Text zurückbekommen kann, ohne einen Menschen dazwischen.

Das ist der Unterschied zwischen einem Transkript, das du von Hand holst, und einem, das sich ein Agent selbst holt, während er ein anderes Ziel verfolgt - ein Thema recherchieren, eine Frage beantworten, einen Rückstau an Aufnahmen zusammenfassen.

Open-core, damit du siehst, was passiert

Die CLI und der MCP-Server sind open-core, Apache-2.0. Wie aus Audio Text wird, ist keine Black Box, der du von einer Landingpage aus vertrauen musst - lies den Code, führ ihn selbst aus, forke ihn, wenn du musst.

Das Transkript ist die API. Sobald Audio Text ist, kann jedes LLM es lesen - das Modell, nicht das Audioformat, ist die Wahl, die dir bleibt.