SRT- oder VTT-Untertitel - Wann Selbst Erstellen
Greifen Sie zum Untertitel-Generator - SRT- und VTT-Dateien Erstellen, wenn Sie eine Untertiteldatei mit Zeitmarken brauchen und das Video Ihr Gerät nicht verlassen darf. Dort erzeugen zwei verschiedene Wege Untertitel, und der falsche kostet Sie entweder einen unnötigen Download oder eine Genauigkeit, die Sie nie erreicht haben.
Welchen der beiden Wege Ihre Aufgabe braucht
Der erste Weg ist Spracherkennung. Ein kompaktes Whisper-Modell läuft auf Ihrem eigenen Gerät und schreibt den Untertiteltext für Sie, zeitlich abgeleitet aus den Segmentgrenzen, die es selbst findet. Der Preis ist ein Download von etwa 40 MB, der erst geholt wird, wenn Sie die Schaltfläche mit genau dieser Größenangabe anklicken, und den der Browser danach behält.
Der zweite Weg braucht überhaupt kein Modell. Wenn Sie die Worte schon haben - ein Skript, ein Sprecherblatt, ein von jemandem getipptes Transkript - fügen Sie alles in das Skriptfeld ein, und jede Zeile wird über die Länge der gewählten Datei verteilt getaktet. Es wird nichts heruntergeladen, und die Taktung ist Rechnen statt Raten.
Die Frage ist also einfach, ob Sie die Worte bereits besitzen. Wenn ja, ist der manuelle Weg schneller und in der Schreibweise exakt. Wenn nein, kann nur die Erkennung sie überhaupt erzeugen.
SRT oder VTT, entschieden durch das Ziel der Datei
Beide Formate kommen aus derselben Untertiteltabelle auf der Seite, die Wahl ist also keine Festlegung, und beide zu exportieren kostet nichts extra. Sie unterscheiden sich in drei sichtbaren Details.
| Detail | SRT | VTT |
|---|---|---|
| Erste Zeile der Datei | Die Untertitelnummer, beginnend bei 1 | Wörtlich das Wort WEBVTT |
| Trennzeichen vor den Millisekunden | Komma, wie in 00:00:04,120 | Punkt, wie in 00:00:04.120 |
| Nummerierung der Untertitel | Jeder Untertitel wird nummeriert | Nummerierung ist nicht erforderlich |
VTT ist das Format, das ein HTML-Videoelement bei einer Textspur erwartet, also die natürliche Wahl, wenn das Video in eine Seite eingebettet wird. SRT ist das ältere Beidateiformat, das Desktop-Player und Untertiteleditoren seit Jahren annehmen, also die sicherere Wahl, wenn Sie die Datei an jemanden weitergeben oder in einen Editor importieren. Wenn Sie wirklich nicht wissen, was der Empfänger möchte, laden Sie beide aus demselben Durchlauf herunter und lassen ihn eine davon löschen.
Die Zahlen, die entscheiden, ob die Seite zur Datei passt
Vier Grenzen der Seite sind fest, und es sind die, die man vor der Dateiwahl kennen sollte, nicht danach.
| Grenze | Wert | Was das für Sie bedeutet |
|---|---|---|
| Modell-Download | Etwa 40 MB | Einmal bezahlt, danach vom Browser behalten |
| Längste Medien pro Durchlauf | Etwa 15 Minuten | Längere Dateien werden abgewiesen, mit Nennung der echten Länge |
| Erkennungsfenster | 30 Sekunden, 2 Sekunden Überlappung | Die Statuszeile zählt sie im Verlauf mit |
| Kürzester manueller Untertitel | 1,2 Sekunden | Sehr kurze Zeilen bleiben lesbar |
| Länge einer manuellen Zeile | Etwa 84 Zeichen | Längere Sätze werden am Satzende, dann an Kommas geteilt |
| Gesprochene Sprachen | 12 benannte, plus automatische Erkennung | Die Sprache zu benennen ist besser, als sie erkennen zu lassen |
Wenn die Fünfzehn-Minuten-Grenze für Sie entscheidet
Medien über etwa fünfzehn Minuten werden sofort abgewiesen, und die Meldung nennt die tatsächlich gemessene Länge, damit Sie wissen, um wie viel Sie darüber liegen. Einen Stapelmodus gibt es auch nicht, ein Durchlauf ist also eine Datei. Eine vierzigminütige Aufnahme bedeutet daher, sie vorher in drei oder vier Teile zu schneiden, jeden Teil zu untertiteln und die Dateien danach zusammenzufügen - was auch heißt, die Zeitmarken jedes Teils ab dem zweiten von Hand zu verschieben.
Das ist echte Arbeit, und es ist der ehrliche Grund, die Dauer vor dem Start zu prüfen und nicht erst, nachdem das Modell geladen ist. Bei allem, was lang genug für einen Schnitt ist, entscheiden Sie vorab, ob Untertitel den Aufwand wert sind oder ob ein einfaches Transkript genügt.
Wenn Ihr Container sich gar nicht öffnen lässt
Die Seite holt die Tonspur direkt aus dem Container, mit dem Dekoder des Browsers selbst, und deshalb funktionieren MP4, M4V, WEBM und MOV neben reinem Ton in MP3, WAV, M4A und OGG. Deshalb endet die Liste auch dort. Hinter der Seite steht kein Server, der übernehmen könnte, ein Container, den der Browser nicht dekodieren kann, lässt sich hier also nicht transkribieren, und MKV ist der Fall, den die meisten treffen.
Die Lösung liegt davor: Verpacken Sie die Datei zuerst nach MP4 und bringen Sie sie zurück. Am Untertitellauf ändert sich nichts, sobald der Ton erreichbar ist.
Wenn Sie eigentlich ein einfaches Transkript wollten
Getaktete Untertitel sind die richtige Ausgabe, wenn etwas den Text synchron zum Ton wiedergibt. Wollen Sie stattdessen einen Absatz zum Lesen, Zitieren oder Einfügen in ein Dokument, stehen die Zeitmarken im Weg, und Sprache zu Text ist die Seite für genau diese Form.
Beide Seiten teilen dasselbe zwischengespeicherte Modell, die eine auszuprobieren und dann zur anderen zu wechseln bedeutet also nicht, zweimal herunterzuladen.
Was Sie trotzdem von Hand korrigieren
Das Erkennungsmodell ist absichtlich klein, und genau das macht den Download überhaupt praktikabel. Rechnen Sie damit, Eigennamen, Fachbegriffe und Satzzeichen vor der Veröffentlichung zu korrigieren, und zwar in der Untertiteltabelle auf der Seite, wo der Text jedes Untertitels bearbeitbar ist und der Download aus dem aufgebaut wird, was die Tabelle sagt.
Zwei konkrete Nebeneffekte lohnen die Aufmerksamkeit. Weil die Erkennungsfenster zwei Sekunden überlappen und diese Überlappung nicht automatisch entfernt wird, kann ein Wort genau an der Naht am Ende eines Untertitels und noch einmal am Anfang des nächsten erscheinen. Und weil das Bearbeiten des Textes den Untertitel nicht neu taktet, behält eine viel kürzer oder länger umgeschriebene Zeile ihren ursprünglichen Anfang und ihr Ende, eine starke Umschreibung kann also eine Korrektur von Hand verlangen.
Was die Seite nicht tut
Sie brennt die Untertitel nicht ins Bild; die Ausgabe ist eine eigene Datei, die Sie neben dem Video laden. Sie übersetzt nicht, die Untertitel kommen also in der gesprochenen Sprache zurück. Untertitel liegen auf Segmentebene und nicht auf Wortebene, Karaoke-Hervorhebung liegt damit außerhalb des Umfangs. Nichts, was Sie laden oder erzeugen, wird über die Sitzung hinaus behalten, es gibt kein Wasserzeichen auf der Ausgabe, und es gibt kein Konto und keinen Bezahltarif im Weg.
Why trust these tools
- Ten-plus years of web tooling. The freetoolonline editorial team has shipped browser-based utilities since 2015. The goal has never changed: get you to a working output fast, without an install.
- No install, no sign-up. Open a tool and get a working output in seconds - nothing to download and no account to create. Tools that need heavy processing run it on our service, so even a low-powered machine gets the job done.
- Analytics stops at the page view. We measure which pages get visited, not what you type or upload inside a tool. There is nothing to sign in to and no profile is attached to your input.
- Open-source core components. The processing engines underneath (libheif, libde265, pdf-lib, terser, clean-css, ffmpeg.wasm, and others) are public and audit-able. We link to each one in its tool page's footer.
- Free, with or without ads. All tools are fully functional without sign-up. The Disable Ads button in the header is always available if you need a distraction-free run.