Cada voz, palabra por palabra.

Precisión de la transcripción: qué dicen las pruebas públicas

7,90 €por archivo, hasta 3 horas

Un archivo, un precio. Sin suscripción.

  • Sin registro
  • Los 2 primeros minutos, gratis
  • Privado: se borra a las 24 horas si no lo pides

Ninguna transcripción automática es perfecta. Aquí tienes los datos públicos del motor que usamos, qué significan y cómo comprobar la calidad con tu propia grabación antes de pagar.

  • Versión literal + editada
  • 6 archivos: Word, TXT, Markdown
  • Más de 90 idiomas
  • Cada hablante identificado
  • Reembolso en 7 días

Dos versiones de cada transcripción

Literal Cada palabra tal como se dijo, muletillas incluidas.

Entrevistadora

Entonces, eh, ¿cómo empezaste, cómo empezaste con la panadería?

Lucía

Pues, em, empecé en 2019 con un solo horno y con mi amigo Marco Beluchi. El primer año fue muy duro.

Editada Corregida y maquetada, con títulos y resumen. Sin añadir nada.

Los comienzos

Entrevistadora

Entonces, ¿cómo empezaste con la panadería?

Lucía

Pues empecé en 2019 con un solo horno y con mi amigo Marco Bellucci. El primer año fue muy duro.

Los nombres que escribes corrigen la ortografía: «Marco Beluchi» pasa a ser «Marco Bellucci».

Qué es la tasa de error de palabras

La tasa de error de palabras (WER, por sus siglas en inglés) compara la transcripción automática con una transcripción de referencia. Cuenta las palabras cambiadas, las que faltan y las que sobran, y las divide por el total de palabras de la referencia. Un 2,33 % equivale a unas 2 palabras erróneas de cada 100. Cuanto más baja, mejor.

Resultados en pruebas públicas

El Open ASR Leaderboard (Hugging Face y otros; versión 4 del artículo, 30 de marzo de 2026) mide los modelos con habla leída (FLEURS, MLS y CoVoST-2). Tasa de error en su prueba multilingüe:

Modelo Español Italiano Francés Alemán
ElevenLabs Scribe v2 (el que usa Dettalo) 2,33 % 2,58 % 3,28 % 2,27 %
AssemblyAI Universal-3 Pro (versión de marzo de 2026) 2,34 % 3,94 % 3,74 % 2,34 %
Cohere Transcribe (modelo abierto) 2,81 % 3,44 % 4,05 % 3,84 %
Speechmatics Enhanced 2,78 % 5,58 % 5,04 % 2,84 %
Voxtral Small 24B (modelo abierto) 3,04 % 3,91 % 4,13 % 3,01 %
Whisper large-v3 (modelo abierto) 3,65 % 4,69 % 6,36 % 4,26 %

En español, Scribe v2 y AssemblyAI, nuestro motor de reserva, están prácticamente empatados.

En la clasificación de Artificial Analysis, sobre todo en inglés y con unas 8 horas de conversaciones, discursos parlamentarios y conferencias de resultados de empresas, Scribe v2 obtiene un 2,2 %: por detrás de MAI-Transcribe-2 (2,0 %) y por delante de Gemini 3.5 Transcribe (2,6 %), Voxtral Small (2,8 %), AssemblyAI Universal-3 Pro (3,1 %), OpenAI GPT Transcribe (3,3 %) y Deepgram Nova-3 (5,2 %).

ElevenLabs sitúa el español en su nivel más alto, «Excellent» (tasa de error de hasta el 5 %).

Por qué tu grabación tendrá más errores

Estas pruebas usan habla leída, clara y grabada de cerca. En una grabación real hay ruido, distancia al micrófono, personas que se pisan y acentos marcados, y todo eso sube la tasa de error. Por eso no te prometemos una cifra para tu archivo: lees gratis los 2 primeros minutos de tu propia grabación, con los hablantes identificados y en las dos versiones, y decides si pagas. La vista previa está lista en unos 2 minutos.

Cómo mejorar la precisión

  • Distancia: el micrófono, cerca de quien habla. Un móvil en el centro de una mesa grande capta peor a quien está lejos.
  • Ruido: evita música, ventiladores y cafeterías.
  • Turnos: que no hablen dos personas a la vez.
  • Nombres y términos: escribe hasta 60 (apellidos, siglas, tecnicismos).
  • Hablantes: indica cuántas personas hablan.
  • Idioma: si la vista previa lo detecta mal, elige el correcto y se vuelve a generar.

Cómo funciona

1

Sube el archivo

Arrastra un audio o un video de hasta 3 horas. Sin registro.

2

Lee la vista previa gratis

En unos 2 minutos lees los 2 primeros minutos, con cada voz identificada, en versión literal y editada.

3

Paga una vez

Escribe tu correo y paga solo por este archivo. Sin suscripción.

4

Descarga

Te enviamos un enlace privado. Confirma los nombres y descarga 6 archivos.

Cuánto cuesta una transcripción

PrecioCómo se paga
Transcripción humana (Rev) 1,99 US$ por minuto: unos 119 US$ por una hora Por minuto de audio
Apps de suscripción (TurboScribe, Otter) 16,99–20 US$ al mes, o 8,33–10 US$ al mes en pago anual Plan mensual o anual
Dettalo 7,90 € por archivo, hasta 3 horas Una vez por archivo, sin suscripción
Precios de rev.com, turboscribe.ai y otter.ai, consultados el 7 de octubre de 2026. [1] [2] [3]

Preguntas frecuentes

¿Qué precisión tiene Dettalo en español?

Usamos ElevenLabs Scribe v2, que en el Open ASR Leaderboard (habla leída en español) tiene una tasa de error de palabras del 2,33 %: unas 2 palabras erróneas de cada 100. En grabaciones reales la tasa sube. La vista previa gratis de los 2 primeros minutos te enseña la precisión con tu propio archivo.

¿Por qué mi grabación tiene más errores que las pruebas?

Las pruebas usan habla leída y grabada con claridad. El ruido, la distancia al micrófono, las voces que se pisan y los acentos marcados aumentan los errores.

¿Cómo puedo mejorar el resultado?

Graba cerca de quien habla y en un sitio tranquilo, indica cuántas personas hablan y escribe hasta 60 nombres y términos para que salgan bien escritos.

¿La versión editada corrige los errores?

Corrige los errores de reconocimiento evidentes y los nombres, y lista cada cambio al final. Lo que no se entiende en el audio no se inventa: revisa nombres, cifras y citas antes de publicar.

¿Y si después de pagar el resultado no me convence?

Tienes 7 días para pedir el reembolso completo con un clic en la página del pedido, sin dar explicaciones. Más en reembolsos.