插件信息
应用截图
详细介绍
功能强大的光学字符识别(OCR)扩展,可截取图像并将其转换为文本
此扩展为浏览器添加一个用于执行 OCR 的工具栏按钮。按下此操作按钮后,用户可以在当前活动窗口中选择一个区域。扩展会截取该区域,并使用内置的强大 OCR 引擎(Tesseract 引擎)尝试识别其中的文字。此扩展使用“tesseract.js”库,支持 100 多种语言、自动文字方向识别和文字系统检测。
此扩展会在页面中加载 JS 库,并在您使用完毕后将其移除。这样便不会长期占用资源。
引擎:
Tesseract:仅从图像中提取纯文本,不保留格式
IBM Granite-Docling:能够准确解读标题、列表、样式(粗体、斜体)、表格和数学公式。
注意事项:
1. 首次运行时,扩展可能需要几分钟从互联网获取训练数据。由于该资源会被缓存,后续调用都会很快。
2. 光学字符识别(OCR)速度较慢,因此此扩展会为每个检测模块显示进度条。
3. 此扩展离线执行 OCR 过程,不与服务器交互。它只会获取一次语言训练数据库。
4. 此工具可用于提取图像、PDF 文档、PowerPoint 幻灯片中的文字内容,或在禁止用户选择内容时提取网页内容。
5. 如果文字提取的置信度较低,扩展会反转图像颜色并重试(在深色主题下尤其有用)。
6. 如果文字提取不准确,您可以修改图像,再将其拖入界面重试。
更新日志:
版本 0.2.4:
支持浏览器级页面缩放和操作系统级屏幕缩放
新增图像语言检测(仍处于测试阶段)(操作较慢)