从照片、截图和扫描 PDF 中,图片转文字和 PDF OCR 都直接在你的设备上处理。含可选择文字的 PDF 页面会直接读取文字层,而不是执行 OCR。
JPG、PNG、WebP、BMP、PDF · 原始文件不会上传到 MISCLAND 服务器。
不会。您选择的原始图片和 PDF 不会上传到服务器,而是在当前浏览器的内存中处理。
OCR 计算通过 PaddleOCR.js 和 WebAssembly 在您的 PC 或移动设备上运行。MISCLAND 服务器只提供静态 OCR 引擎和模型文件,不接收或存储文档内容及 OCR 结果。
如果 PDF 页面本身已有可选择的文本,PDF.js 会直接提取文字。这比 OCR 更快,也能更准确地保留原始文本。
只有没有文本层的扫描页面或图片型 PDF 才会在浏览器中渲染为图像并进行 OCR。如果同一个 PDF 同时包含文本页面和扫描页面,系统会按页面自动选择合适的处理方式。
可选择韩文、英文、西班牙文、葡萄牙文、法文、德文、意大利文、印度尼西亚文、越南文、阿拉伯文、印地文、简体或繁体中文以及日文。
本工具会使用适合所选语言的 PP-OCRv5 移动端识别模型。只有在选择语言并真正开始 OCR 时才会加载该模型,后续使用会利用浏览器缓存。
OCR 无法保证 100% 准确,因为识别结果会受到原始质量、字号、倾斜、背景和字体的影响。
清晰的印刷文档和扫描件效果最佳。文字很小时请使用高质量模式;对于较淡的黑白扫描件,可尝试文档增强。重要内容请务必与原始文档核对。
可以。支持 WebAssembly 和 Web Worker 的现代移动浏览器均可使用。
OCR 使用您设备的内存和计算资源,因此低配置设备或超大文档可能需要更长时间。在移动设备上,会自动对文件数量、总大小、PDF 页数和图像分辨率采用更低的安全上限。