无论您是整理定性研究数据的研究者、赶稿的记者,还是手机里存着一学期田野录音的学生,人工转写一小时录音通常需要四到六小时。Axilero 只需几分钟即可完成,并且对每一个任务都使用 Whisper Large-v3 — 目前公开可用的最高精度语音模型,而不仅限于付费任务。
采访内容同时也是个人数据。您的录音仅在欧盟服务器上处理,转写完成的瞬间即被自动删除 — 不存档,也绝不用于训练 AI 模型。账户中只保留文字稿,您可以随时删除。
上传录音
MP3、WAV、M4A、MP4 等大多数格式均可直接使用 — 包括视频,无需转换。
自动完成转写
系统自动检测语言(支持 95 种以上),并识别和标注说话人。一小时的采访通常几分钟即可完成。
编辑并导出
在浏览器编辑器中修正人名或专业术语,然后导出为 Word、纯文本或带时间戳的 JSON。
转写完成的瞬间自动删除音频
仅在位于欧盟的服务器上处理
绝不用于训练 AI 模型,绝不共享
说话人标签自动区分采访者与受访者
每份文字稿都可以包含自动说话人识别。问答会分别标注为 Speaker 1、Speaker 2 等 — 两人访谈会呈现为清晰的对话,而不是一整块文字。对小组访谈和焦点小组,每个声音都会获得独立标签。
为真实录音环境而设计
采访很少有录音棚级的音质。Whisper Large-v3 在处理口音、即兴发言、语句中断和专业术语方面远优于轻量级模型 — 这正是我们对每位用户都运行完整模型的原因。清晰音频可达到 95–98% 的准确率;剩余的修正在浏览器编辑器中即可快速完成。
支持 95 种以上语言的录音并自动检测语言,文字稿还可在 20 多种主要语言之间互译 — 对多语言研究项目非常实用。
受访者可以信赖的保密性
研究伦理委员会和编辑规范越来越关注录音的去向。使用 Axilero,答案很简单:音频在位于欧盟的 GPU 服务器上处理,任务完成即自动删除,绝不用于 AI 训练,也不与任何人共享。这直接符合 GDPR 的数据最小化原则 — 录音在我们系统中只存在转写所需的那几分钟。
从文字稿到可引用的文本
可导出为 DOCX 在 Word 中批注,导出为纯文本或 Markdown 供分析软件使用,或导出为带分段时间戳的 JSON,方便回溯引语出现的确切时刻。时间戳在编辑后依然保留,与原始音频核对始终很方便。
常见问题
转写一小时的采访需要多久?+
通常只需几分钟。转写在 GPU 服务器上以数倍于实时的速度运行;您可以离开页面稍后再回来 — 任务会继续进行。
它能区分采访者和受访者吗?+
可以。启用说话人标签后,每个声音都会被自动识别并标注为 Speaker 1、Speaker 2 等。多人参与的焦点小组同样适用。
有口音或噪音较大的录音,准确率如何?+
我们对每个任务都使用 Whisper Large-v3,它对口音和不完美的音频有很强的适应性。清晰录音可达 95–98% 的准确率;严重的背景噪音或说话重叠会降低准确率,内置编辑器可以快速修正。
我的采访内容保密吗?+
音频仅在欧盟服务器上处理,转写完成后立即自动删除。我们绝不用您的数据训练模型,也不与任何人共享。账户中只保留文字稿,您可以随时删除。
费用是多少?+
免费套餐每天可转写 3 次(每个文件最长 30 分钟),无需信用卡。Pro 为每月 $15,转写次数和时长不限,并包含 AI 摘要和 API 访问。
支持哪些导出格式?+
Word (DOCX)、纯文本、Markdown、带时间戳的 JSON,以及字幕格式(SRT、VTT)。