扫描件 OCR
处理没有文本层的扫描 PDF 和图片式页面。
使用 olmOCR 或 Asta 远程 OCR,把扫描 PDF 和复杂版式提取为 Markdown;支持本地文件、批量任务和 S3 文件。
站长点评:面对复杂 PDF 比普通文本提取更有优势,但必须登录 Asta,文档会上传云端处理。
处理没有文本层的扫描 PDF 和图片式页面。
适合多栏、表格、公式和学术文档等复杂内容。
支持批处理,本地文件之外还可选接入 AWS S3。
把仓库和 Skill 子目录交给智能体。
按仓库说明完成 Asta 账号登录与授权。
例:“将这份扫描 PDF 提取为 Markdown,保留页码”。