Subtítulos SRT o VTT - Cuándo Crearlos Tú Mismo
Recurre al Generador de Subtítulos - Crea Archivos SRT y VTT cuando necesites un archivo de subtítulos con tiempos y el vídeo no pueda salir de tu equipo. Allí hay dos caminos distintos que producen subtítulos, y elegir el equivocado cuesta una descarga que no hacía falta o una precisión que nunca tuviste.
Cuál de los dos caminos pide tu trabajo
El primer camino es el reconocimiento de voz. Un modelo Whisper compacto se ejecuta en tu propio dispositivo y escribe el texto de los subtítulos por ti, con tiempos tomados de los límites de segmento que él mismo encuentra. Cuesta una descarga de unos 40 MB, que solo se busca cuando pulsas el botón que anuncia ese tamaño, y el navegador la conserva después.
El segundo camino no necesita ningún modelo. Si ya tienes las palabras - un guion, una hoja de locución, una transcripción que alguien escribió - pégalas en el cuadro de guion y cada línea se temporiza a lo largo de la duración del archivo que elegiste. No se descarga nada, y la temporización es aritmética en lugar de una suposición.
Así que la pregunta es simplemente si ya tienes las palabras. Si las tienes, el camino manual es más rápido y exacto en la ortografía. Si no, el reconocimiento es el único que puede inventarlas.
SRT o VTT, decidido por el destino del archivo
Ambos formatos salen de la misma tabla de subtítulos de la página, así que elegir no es un compromiso y exportar los dos no cuesta nada. Se diferencian en tres detalles visibles.
| Detalle | SRT | VTT |
|---|---|---|
| Primera línea del archivo | El número del subtítulo, empezando en 1 | La palabra literal WEBVTT |
| Separador antes de los milisegundos | Coma, como en 00:00:04,120 | Punto, como en 00:00:04.120 |
| Numeración de los subtítulos | Cada subtítulo va numerado | La numeración no es obligatoria |
VTT es el formato que un elemento de vídeo HTML espera en una pista, así que es la opción natural cuando el vídeo se va a incrustar en una página. SRT es el formato lateral más antiguo que los reproductores de escritorio y los editores de subtítulos aceptan desde hace años, así que es la opción más segura cuando vas a entregar el archivo a otra persona o importarlo en un editor. Cuando de verdad no sepas cuál quiere el destinatario, descarga los dos de la misma ejecución y deja que borre uno.
Las cifras que deciden si la página sirve para el archivo
Cuatro de los límites de la página son fijos, y son los que conviene conocer antes de elegir un archivo, no después.
| Límite | Valor | Qué significa para ti |
|---|---|---|
| Descarga del modelo | Unos 40 MB | Se paga una vez y luego la guarda el navegador |
| Duración máxima por ejecución | Unos 15 minutos | Los archivos más largos se rechazan, indicando la duración real |
| Ventana de reconocimiento | 30 segundos, con 2 de solapamiento | La línea de estado las va contando mientras avanza |
| Subtítulo manual más corto | 1,2 segundos | Las líneas muy cortas siguen siendo legibles |
| Longitud de línea manual | Unos 84 caracteres | Las frases más largas se dividen al final de la frase y luego en las comas |
| Idiomas hablados | 12 con nombre, más detección automática | Nombrar el idioma es mejor que dejarlo a la detección |
Cuando el límite de quince minutos decide por ti
El material de más de unos quince minutos se rechaza de entrada, y el mensaje indica la duración que midió de verdad, para que sepas por cuánto te pasaste. Tampoco hay modo por lotes, así que cada ejecución es un archivo. Una grabación de cuarenta minutos significa entonces cortarla antes en tres o cuatro trozos, subtitular cada uno y unir los archivos después - lo que también implica desplazar a mano los tiempos de cada trozo a partir del segundo.
Eso es trabajo real, y es la razón honesta para comprobar la duración antes de empezar y no después de que el modelo se haya descargado. Para cualquier cosa lo bastante larga como para exigir división, decide de antemano si los subtítulos valen la pena o si bastaría una transcripción simple.
Cuando tu contenedor no abre en absoluto
La página extrae la pista de audio directamente del contenedor usando el descodificador del propio navegador, y por eso MP4, M4V, WEBM y MOV funcionan junto al audio puro en MP3, WAV, M4A y OGG. También por eso la lista termina ahí. No hay servidor detrás de la página que tome el relevo, así que un contenedor que el navegador no puede descodificar no se puede transcribir aquí, y MKV es el caso más habitual.
La solución está antes: remultiplexa el archivo a MP4 y vuelve a traerlo. Nada de la ejecución cambia una vez que el audio es accesible.
Cuando lo que querías era una transcripción simple
Los subtítulos con tiempos son la salida correcta cuando algo va a reproducir el texto sincronizado con el audio. Si en cambio quieres un párrafo para leer, citar o pegar en un documento, los tiempos estorban, y Voz a Texto es la página hecha para ese formato.
Las dos páginas comparten el mismo modelo en caché, así que probar una y pasar luego a la otra no significa descargar dos veces.
Lo que aún tendrás que corregir a mano
El modelo de reconocimiento es pequeño a propósito, y eso es lo que hace práctico descargarlo. Cuenta con corregir nombres propios, jerga y puntuación antes de publicar, y cuenta con hacerlo en la tabla de subtítulos de la página, donde el texto de cada subtítulo es editable y la descarga se reconstruye a partir de lo que diga la tabla.
Merece la pena vigilar dos efectos concretos. Como las ventanas de reconocimiento se solapan dos segundos y ese solapamiento no se elimina automáticamente, una palabra situada justo en la unión puede aparecer al final de un subtítulo y otra vez al principio del siguiente. Y como editar el texto de un subtítulo no lo vuelve a temporizar, una línea que reescribas mucho más corta o más larga conserva su inicio y su fin originales, así que una reescritura grande puede pedir un ajuste manual.
Lo que la página no hace
No incrusta los subtítulos en la imagen; la salida es un archivo aparte que cargas junto al vídeo. No traduce, así que los subtítulos vuelven en el idioma que se habló. Los subtítulos son por segmento y no por palabra, así que el resaltado estilo karaoke queda fuera del alcance. Nada de lo que cargues o produzcas se guarda más allá de la sesión, no hay marca de agua en la salida y no hay cuenta ni plan de pago por medio.
Why trust these tools
- Ten-plus years of web tooling. The freetoolonline editorial team has shipped browser-based utilities since 2015. The goal has never changed: get you to a working output fast, without an install.
- No install, no sign-up. Open a tool and get a working output in seconds - nothing to download and no account to create. Tools that need heavy processing run it on our service, so even a low-powered machine gets the job done.
- Analytics stops at the page view. We measure which pages get visited, not what you type or upload inside a tool. There is nothing to sign in to and no profile is attached to your input.
- Open-source core components. The processing engines underneath (libheif, libde265, pdf-lib, terser, clean-css, ffmpeg.wasm, and others) are public and audit-able. We link to each one in its tool page's footer.
- Free, with or without ads. All tools are fully functional without sign-up. The Disable Ads button in the header is always available if you need a distraction-free run.