Transcribidor

Genera subtítulos desde tu audio

Obtén un archivo SRT o VTT con marcas de tiempo, listo para YouTube, Premiere o VLC. Sin subir nada a internet.

Suelta tu audio aquí

MP3, M4A, WAV, AAC, OGG, OPUS, FLAC y archivos de video. No se sube a ningún servidor.

Seleccionar archivo
Tu audio no sale de tu equipo Se procesa en el navegador. Nada se sube ni se guarda en ningún servidor.
Usa tu tarjeta gráfica Con WebGPU la transcripción va varias veces más rápido. Si no está, usa el procesador.
Sin límite ni registro Los archivos que quieras, del largo que quieras. Gratis y sin crear una cuenta.
Publicidad

Cómo funciona

Eliges el archivo

Queda cargado en la memoria de tu navegador. No viaja a ninguna parte.

Se descarga el modelo

Solo la primera vez. Después queda guardado en tu navegador y empieza al instante.

Tu equipo transcribe

Con la GPU si tu navegador la ofrece, o con el procesador si no.

Copias o descargas

Texto plano, con marcas de tiempo, subtítulos SRT o VTT, o Markdown.

Sobre esta herramienta

Los subtítulos se generan con las marcas de tiempo que el modelo detecta en el audio, divididas en bloques legibles. Puedes descargarlos en SRT (el estándar de toda la vida) o en VTT (el que usan los reproductores web), y ajustarlos después en cualquier editor.

Publicidad

Preguntas frecuentes

¿Qué diferencia hay entre SRT y VTT?

Son casi lo mismo. SRT es el formato clásico que aceptan YouTube, VLC, Premiere y prácticamente todo. VTT es su versión pensada para la web, usada por el reproductor de video de HTML5. Aquí puedes descargar cualquiera de los dos.

¿Se sube mi audio a algún servidor?

No. La transcripción ocurre entera dentro de tu navegador, usando el procesador y la tarjeta gráfica de tu propio equipo. El archivo nunca viaja por internet: puedes comprobarlo desactivando la conexión una vez cargado el modelo.

¿Cuánto cuesta?

Nada. Como el trabajo lo hace tu computador y no un servidor nuestro, no hay costo por minuto ni límite de archivos.

¿Hay límite de duración?

No imponemos ninguno. El límite real es la memoria de tu equipo. Grabaciones de una a dos horas funcionan bien en un computador moderno.

¿Por qué la primera vez demora más?

La primera transcripción descarga el modelo de reconocimiento de voz. El peso depende de la calidad que elijas y de si tu equipo tiene GPU: va desde unos 77 MB hasta 1,6 GB en el modelo más preciso. Queda guardado en tu navegador, así que las siguientes veces empieza de inmediato.

¿Qué idiomas reconoce?

Alrededor de un centenar. Viene configurado en español, pero puedes cambiarlo o dejarlo en detección automática desde las opciones.

¿Necesito una tarjeta gráfica potente?

No es obligatoria. Si tu navegador soporta WebGPU la transcripción usa la GPU y va varias veces más rápido; si no, funciona igual con el procesador, solo más lento.

Otras herramientas