Transcribir Audio y Video a Texto con Whisper Local

Transcribe audio y video a texto directo en tu navegador con Whisper corriendo localmente, sin enviar el archivo a ningun servidor. Obten texto continuo, segmentos con timestamp y subtitulos SRT/VTT.

Usa la herramienta

Tu archivo se procesa localmente en tu dispositivo y no se envia a nuestros servidores. Solo los archivos del modelo de IA se descargan (una vez, con cache) para ejecutar la transcripcion en el navegador.

Audio o video para transcribir

Acepta MP3, WAV, M4A, AAC, OGG, OPUS, FLAC, MP4, MOV, WEBM, MKV y mas.

Guía rápida y contexto de uso

Transcripcion local con Whisper, sin subir archivos

Esta herramienta usa un modelo Whisper multilingue que corre completamente en tu navegador, mediante WebGPU cuando esta disponible (con respaldo automatico a procesamiento por CPU). El archivo de audio o video nunca se envia a nuestro servidor: la extraccion de audio, la normalizacion y la inferencia ocurren localmente en tu dispositivo.

Solo los archivos del modelo de IA (pesos de Whisper) se descargan desde Hugging Face la primera vez que usas la herramienta. Despues de eso, el navegador guarda esos archivos en cache y las proximas transcripciones no requieren una nueva descarga.

Audio o video, con extraccion automatica de la pista de audio

Puedes subir archivos de audio (MP3, WAV, M4A, AAC, OGG, OPUS, FLAC) o de video (MP4, MOV, WEBM, MKV y otros). Cuando el archivo es un video, solo se extrae y procesa la pista de audio; los cuadros de video no se usan en la transcripcion.

La herramienta primero intenta decodificar el audio usando APIs nativas del navegador. Si el formato o codec no es compatible directamente, recurre a un conversor local (FFmpeg compilado a WebAssembly) para extraer el audio antes de transcribir, sin depender de subir el archivo.

  • Elegir el nivel de calidad (Rapido, Equilibrado o Alta calidad).
  • Elegir el idioma manualmente o dejar que Whisper lo detecte automaticamente.
  • Transcribir en el idioma original o traducir al ingles.
  • Seguir el progreso real de descarga del modelo y de transcripcion por tramo.
  • Cancelar en cualquier momento sin congelar la pagina.

Timestamps, reproductor sincronizado y exportacion

El resultado incluye timestamps por segmento, mostrados tanto en el texto continuo como en la lista de segmentos. Haz clic en cualquier timestamp para mover el reproductor de audio/video exactamente a ese punto.

Puedes copiar el texto plano, copiarlo con timestamps, o exportar en TXT, TXT con timestamps, SRT (subtitulos), WebVTT o un JSON estructurado con los segmentos, idioma y duracion.

Rendimiento, limites y privacidad

En dispositivos con soporte WebGPU, la transcripcion corre acelerada por GPU. Sin WebGPU, la herramienta usa procesamiento por CPU (WebAssembly), que funciona en practicamente cualquier navegador pero es mas lento, especialmente en celulares.

Los archivos muy largos requieren mas memoria del navegador; hay un limite practico de duracion para evitar que la pestana se congele. Ningun audio, video o texto transcrito se guarda en nuestros servidores ni se envia a analytics.

Preguntas frecuentes

¿Mi audio o video se sube a un servidor?

No. La extraccion de audio y la transcripcion ocurren localmente en tu navegador. Solo los archivos del modelo de IA se descargan desde Hugging Face para ejecutar la inferencia en tu dispositivo; tu archivo de media nunca sale del navegador.

¿Que formatos de audio y video son compatibles?

Audio: MP3, WAV, M4A, AAC, OGG, OPUS y FLAC. Video: MP4, MOV, WEBM, MKV y otros contenedores con una pista de audio que tu navegador o el conversor local de respaldo puedan leer.

¿Funciona sin una tarjeta grafica compatible con WebGPU?

Si. Cuando WebGPU no esta disponible, la herramienta cambia automaticamente a procesamiento por CPU. Es mas lento, pero la transcripcion sigue corriendo completamente en el navegador.

¿Puedo exportarlo como archivo de subtitulos?

Si. Puedes exportar el resultado en SRT o WebVTT, ademas de TXT simple, TXT con timestamps y un JSON estructurado con los segmentos.

¿Puedo elegir el idioma o traducir al ingles?

Si. Puedes dejar que Whisper detecte el idioma automaticamente o elegir uno especifico, ademas de elegir entre transcribir en el idioma original o traducir el audio al ingles.

Enlaces útiles para continuar tareas parecidas sin empezar de cero.

Atajos para usos frecuentes con el mismo flujo completo.

Privacidad y procesamiento local

Las herramientas de esta página se ejecutan en el navegador y no envían automáticamente el contenido ingresado a un backend. Esto mejora privacidad y reduce latencia.