Cada voz, palabra por palabra.
Precisión de la transcripción: qué dicen las pruebas públicas
Un archivo, un precio. Sin suscripción.
- Sin registro
- Los 2 primeros minutos, gratis
- Privado: se borra a las 24 horas si no lo pides
Pago cancelado. Tu vista previa sigue aquí.
Vista previa gratis: los 2 primeros minutos
·
Tu transcripción completa
7,90 €Un archivo, un precio. Sin suscripción.
- Versión literal y editada
- 6 archivos: Word, TXT y Markdown
- Cada hablante identificado, con los nombres que confirmes
- Resumen y puntos clave
- Reembolso en 7 días, sin preguntas
Pago seguro con Stripe: tarjeta, Apple Pay, Google Pay
Con tarjeta solo se cobra cuando la transcripción ha pasado nuestra revisión.
Enviado. El enlace funciona durante 24 horas.
Ninguna transcripción automática es perfecta. Aquí tienes los datos públicos del motor que usamos, qué significan y cómo comprobar la calidad con tu propia grabación antes de pagar.
- Versión literal + editada
- 6 archivos: Word, TXT, Markdown
- Más de 90 idiomas
- Cada hablante identificado
- Reembolso en 7 días
Dos versiones de cada transcripción
Literal Cada palabra tal como se dijo, muletillas incluidas.
Entonces, eh, ¿cómo empezaste, cómo empezaste con la panadería?
Pues, em, empecé en 2019 con un solo horno y con mi amigo Marco Beluchi. El primer año fue muy duro.
Editada Corregida y maquetada, con títulos y resumen. Sin añadir nada.
Los comienzos
Entonces, ¿cómo empezaste con la panadería?
Pues empecé en 2019 con un solo horno y con mi amigo Marco Bellucci. El primer año fue muy duro.
Los nombres que escribes corrigen la ortografía: «Marco Beluchi» pasa a ser «Marco Bellucci».
Qué es la tasa de error de palabras
La tasa de error de palabras (WER, por sus siglas en inglés) compara la transcripción automática con una transcripción de referencia. Cuenta las palabras cambiadas, las que faltan y las que sobran, y las divide por el total de palabras de la referencia. Un 2,33 % equivale a unas 2 palabras erróneas de cada 100. Cuanto más baja, mejor.
Resultados en pruebas públicas
El Open ASR Leaderboard (Hugging Face y otros; versión 4 del artículo, 30 de marzo de 2026) mide los modelos con habla leída (FLEURS, MLS y CoVoST-2). Tasa de error en su prueba multilingüe:
| Modelo | Español | Italiano | Francés | Alemán |
|---|---|---|---|---|
| ElevenLabs Scribe v2 (el que usa Dettalo) | 2,33 % | 2,58 % | 3,28 % | 2,27 % |
| AssemblyAI Universal-3 Pro (versión de marzo de 2026) | 2,34 % | 3,94 % | 3,74 % | 2,34 % |
| Cohere Transcribe (modelo abierto) | 2,81 % | 3,44 % | 4,05 % | 3,84 % |
| Speechmatics Enhanced | 2,78 % | 5,58 % | 5,04 % | 2,84 % |
| Voxtral Small 24B (modelo abierto) | 3,04 % | 3,91 % | 4,13 % | 3,01 % |
| Whisper large-v3 (modelo abierto) | 3,65 % | 4,69 % | 6,36 % | 4,26 % |
En español, Scribe v2 y AssemblyAI, nuestro motor de reserva, están prácticamente empatados.
En la clasificación de Artificial Analysis, sobre todo en inglés y con unas 8 horas de conversaciones, discursos parlamentarios y conferencias de resultados de empresas, Scribe v2 obtiene un 2,2 %: por detrás de MAI-Transcribe-2 (2,0 %) y por delante de Gemini 3.5 Transcribe (2,6 %), Voxtral Small (2,8 %), AssemblyAI Universal-3 Pro (3,1 %), OpenAI GPT Transcribe (3,3 %) y Deepgram Nova-3 (5,2 %).
ElevenLabs sitúa el español en su nivel más alto, «Excellent» (tasa de error de hasta el 5 %).
Por qué tu grabación tendrá más errores
Estas pruebas usan habla leída, clara y grabada de cerca. En una grabación real hay ruido, distancia al micrófono, personas que se pisan y acentos marcados, y todo eso sube la tasa de error. Por eso no te prometemos una cifra para tu archivo: lees gratis los 2 primeros minutos de tu propia grabación, con los hablantes identificados y en las dos versiones, y decides si pagas. La vista previa está lista en unos 2 minutos.
Cómo mejorar la precisión
- Distancia: el micrófono, cerca de quien habla. Un móvil en el centro de una mesa grande capta peor a quien está lejos.
- Ruido: evita música, ventiladores y cafeterías.
- Turnos: que no hablen dos personas a la vez.
- Nombres y términos: escribe hasta 60 (apellidos, siglas, tecnicismos).
- Hablantes: indica cuántas personas hablan.
- Idioma: si la vista previa lo detecta mal, elige el correcto y se vuelve a generar.
Cómo funciona
Sube el archivo
Arrastra un audio o un video de hasta 3 horas. Sin registro.
Lee la vista previa gratis
En unos 2 minutos lees los 2 primeros minutos, con cada voz identificada, en versión literal y editada.
Paga una vez
Escribe tu correo y paga solo por este archivo. Sin suscripción.
Descarga
Te enviamos un enlace privado. Confirma los nombres y descarga 6 archivos.
Cuánto cuesta una transcripción
| Precio | Cómo se paga | |
|---|---|---|
| Transcripción humana (Rev) | 1,99 US$ por minuto: unos 119 US$ por una hora | Por minuto de audio |
| Apps de suscripción (TurboScribe, Otter) | 16,99–20 US$ al mes, o 8,33–10 US$ al mes en pago anual | Plan mensual o anual |
| Dettalo | 7,90 € por archivo, hasta 3 horas | Una vez por archivo, sin suscripción |
Preguntas frecuentes
¿Qué precisión tiene Dettalo en español?
Usamos ElevenLabs Scribe v2, que en el Open ASR Leaderboard (habla leída en español) tiene una tasa de error de palabras del 2,33 %: unas 2 palabras erróneas de cada 100. En grabaciones reales la tasa sube. La vista previa gratis de los 2 primeros minutos te enseña la precisión con tu propio archivo.
¿Por qué mi grabación tiene más errores que las pruebas?
Las pruebas usan habla leída y grabada con claridad. El ruido, la distancia al micrófono, las voces que se pisan y los acentos marcados aumentan los errores.
¿Cómo puedo mejorar el resultado?
Graba cerca de quien habla y en un sitio tranquilo, indica cuántas personas hablan y escribe hasta 60 nombres y términos para que salgan bien escritos.
¿La versión editada corrige los errores?
Corrige los errores de reconocimiento evidentes y los nombres, y lista cada cambio al final. Lo que no se entiende en el audio no se inventa: revisa nombres, cifras y citas antes de publicar.
¿Y si después de pagar el resultado no me convence?
Tienes 7 días para pedir el reembolso completo con un clic en la página del pedido, sin dar explicaciones. Más en reembolsos.