每个人的话,一字不差。
转写有多准?看评测,更要看你自己的录音
一个文件,付一次钱,不用订阅。
- 不用注册
- 前 2 分钟免费看
- 文件保密:不下单 24 小时后删除
付款已取消,你的预览还在这里。
免费预览:前 2 分钟
·
完整文稿
¥68一个文件,付一次钱,不用订阅。
- 原文版和整理版
- 6 个文件:Word、TXT、Markdown
- 分清每个说话人,名字由你确认
- 摘要和要点
- 7 天内全额退款,不问原因
由 Stripe 安全支付:支付宝、微信支付、银行卡
银行卡先冻结金额,转写通过检查后才扣款。
已发送,链接 24 小时内有效。
言录 Dettalo 的语音识别用的是 ElevenLabs Scribe v2。下面是独立评测的数据和中文的情况,以及为什么你自己录音的前 2 分钟比任何表格都更能说明问题。
- 原文版 + 整理版
- 6 个文件:Word、TXT、Markdown
- 支持 90 多种语言
- 分清每个说话人
- 7 天内可退款
每份文稿都有两个版本
原文版 照录音逐字记下,语气词也保留。
那个,你当初,你当初是怎么开始做烘焙的?
嗯,我是二零一九年开始的,就,就一个烤箱,还有我朋友王小雨。第一年真的特别难。
整理版 纠错、分段、加小标题和摘要,不增加内容。
创业的开始
你当初是怎么开始做烘焙的?
我是 2019 年开始的,就一个烤箱,还有我朋友王晓宇。第一年真的特别难。
你填的人名会用来纠正写法:“王小雨”改成“王晓宇”。
错误率怎么看
词错误率(WER)是识别错的词(被替换、漏掉或多出来的)占实际说出词数的比例。3% 就是大约每 100 个词错 3 个,数字越低越好。中文词与词之间没有空格,通常按字来算,叫字错误率(CER)。只有同一套测试得出的数字,才能互相比较。
西班牙语、意大利语、法语、德语
Hugging Face 等机构 2026 年 3 月 30 日发布的 Open ASR Leaderboard 论文(第 4 版),多语言部分用的是朗读语音(FLEURS、MLS、CoVoST-2)。词错误率如下,越低越好:
| 模型 | 西班牙语 | 意大利语 | 法语 | 德语 |
|---|---|---|---|---|
| ElevenLabs Scribe v2(言录使用) | 2.33% | 2.58% | 3.28% | 2.27% |
| AssemblyAI Universal-3 Pro(2026 年 3 月版) | 2.34% | 3.94% | 3.74% | 2.34% |
| Cohere Transcribe(开源模型) | 2.81% | 3.44% | 4.05% | 3.84% |
| Speechmatics Enhanced | 2.78% | 5.58% | 5.04% | 2.84% |
| Voxtral Small 24B(开源模型) | 3.04% | 3.91% | 4.13% | 3.01% |
| Whisper large-v3(开源模型) | 3.65% | 4.69% | 6.36% | 4.26% |
在这张表里,Scribe v2 四种语言的错误率都最低;西班牙语上 AssemblyAI 只差 0.01 个百分点。AssemblyAI 也是言录的备用引擎。
英语
Artificial Analysis 的语音转文字排行榜以英语为主,用了约 8 小时的对话、议会演讲和财报电话会议录音。词错误率:MAI-Transcribe-2 2.0%,ElevenLabs Scribe v2 2.2%,Gemini 3.5 Transcribe 2.6%,Voxtral Small 2.8%,AssemblyAI Universal-3 Pro 3.1%,OpenAI GPT Transcribe 3.3%,Deepgram Nova-3 5.2%。在这里 Scribe v2 排第二。
中文呢?
中文还没有独立的公开评测,所以我们不给中文准确率的具体数字。ElevenLabs 在官方文档里,把英语、西班牙语、法语、意大利语、德语、荷兰语、葡萄牙语和日语列在最高一档(“Excellent”,词错误率 ≤ 5%),把普通话和粤语列在第二档(“High accuracy”,词错误率 5%–10%)。中文通常按字错误率衡量,这个分级只能作为参考。
为什么你的录音会比评测差
朗读语音比真实录音容易得多。噪音、离麦克风远、几个人同时说话、口音重,都会让错误率上升。评测能告诉你哪个引擎好,却不能告诉你你的录音转出来会怎样。
用自己的录音检查
上传后大约 2 分钟,就能免费看前 2 分钟的文字:说话人已分好,原文版和整理版都有。重点看人名、数字、术语和几个人同时说话的地方,也看看说话人有没有分对:同一个人有没有被拆成两个,两个人有没有被并成一个。识别出的语言不对,可以选正确的语言,预览会重新生成。付款后 7 天内不满意,可以在订单页一键全额退款。
想减少错误:靠近说话人录音,环境尽量安静,一次一个人说话;上传时告诉我们几个人说话,并填上最多 60 个人名和术语。
怎么用
上传
拖入录音或视频,最长 3 小时,不用注册。
免费看预览
大约 2 分钟后,就能看到前 2 分钟的文字,分好说话人,原文版和整理版都有。
付一次钱
填邮箱,只为这个文件付钱,不用订阅。
下载
我们把专属链接发到你的邮箱。确认说话人名字后下载 6 个文件。
常见问题
中文转写的准确率是多少?
中文还没有独立的公开评测,所以我们不给具体数字。ElevenLabs 把普通话和粤语列在“High accuracy”一档(词错误率 5%–10%)。最可靠的办法是免费看你自己录音的前 2 分钟。
转写能做到一个字都不错吗?
不能。任何语音识别都会出错,人名、数字、多人同时说话、噪音和浓重的口音都会导致错误。付钱之前,先看你自己录音的前 2 分钟。
哪家语音识别最准?
要看语言和测试。在以英语为主的 Artificial Analysis 排行榜上,MAI-Transcribe-2 错误率最低(2.0%),ElevenLabs Scribe v2 其次(2.2%)。在 Open ASR Leaderboard 的多语言测试中,Scribe v2 在西班牙语、意大利语、法语和德语上错误率最低。
为什么我的录音转出来比评测差?
朗读语音比真实录音容易。噪音、离麦克风远、几个人同时说话和浓重的口音,都会让错误率上升。
整理版会改正识别错误吗?
会改正明显的识别错误和人名,删掉语气词,并在文末列出每一处改动。整理版是根据原文版的文字生成的,听不到录音,所以只能改正从上下文看得出来的错误。人名、数字和引语请自己核对。
转出来不满意怎么办?
下单后 7 天内,在订单页一键全额退款,不需要理由,文件会立即删除。详见退款。