應用截圖

詳細介紹

浏览器中易用的语音合成与识别工具! Speech to Text (Voice Recognition) 是一款使用两种不同语音识别引擎,将您的语音转换为文本的扩展。 第一个引擎是用于音频转录的 HTML5 原生 Web Speech API。在大多数现代浏览器中,它默认处于启用状态(更多信息:https://webaudio.github.io/web-speech-api/)。第二个 API 是 Whisper AI 引擎,它使用新的人工智能方法转录音频(更多信息:https://huggingface.co/onnx-community/whisper-base)。请注意,选择 Whisper AI 时,应用需要下载 AI 引擎的训练数据(约 280MB)。因此,请耐心等待应用加载。 两种引擎都能识别多种语言及相关方言。使用此扩展时,只需打开附加组件界面,然后点击大麦克风图标,即可开始将语音转换为文本。请注意,附加组件首次启动时会请求麦克风权限。请接受该权限,才能开始使用附加组件。所有捕获的文本都放在界面顶部的文本区域。使用 Ctrl + C 键盘组合复制文本。关闭后,此附加组件没有后台活动。 注意:Whisper AI 引擎加载完成后,可以完全离线运行。此外,您可以拖放音频文件开始转录。请注意,Web Speech API 不提供此功能。如果您想通过音频文件进行转录,请将其切分为小段音频(每段大约几分钟),因为 AI 引擎在浏览器中本地运行,内存和处理能力有限,因此无法处理大型音频文件。 如果您发现了需要报告的错误,请填写附加组件主页上的错误报告表单 (https://mybrowseraddon.com/speech-to-text.html)。