Chuyển tới nội dung chính

{/* Trang này được tạo tự động từ SKILL.md của kỹ năng bởi website/scripts/generate-skill-docs.py. Chỉnh sửa nguồn SKILL.md, không phải trang này. */}

Ocr và tài liệu

Trích xuất văn bản từ tệp PDF/quét (pymupdf, marker-pdf).

Siêu dữ liệu kỹ năng

NguồnĐi kèm (được cài đặt theo mặc định)
Đường dẫn

skills/productivity/ocr-and-documents ` | | Phiên bản |

2.3.0 ` | | Tác giả | Đại lý Hermes | | Giấy phép | MIT | | Nền tảng | Linux, macOS, Windows | | Thẻ |

PDF

, `Documents

, `Research

, `Arxiv

, `Text-Extraction

, OCR | | Kỹ năng liên quan | XPROTECTX19XPROTECTX |

Tham khảo: đầy đủ SKILL.md

thông tin

Sau đây là định nghĩa kỹ năng đầy đủ mà Hermes tải khi kỹ năng này được kích hoạt. Đây là những gì tác nhân coi là hướng dẫn khi kỹ năng được kích hoạt.

Trích xuất PDF & Tài liệu

Đối với DOCX: sử dụng Python-docx (phân tích cấu trúc tài liệu thực tế, tốt hơn nhiều so với OCR). Đối với PPTX: xem kỹ năng powerpoint (sử dụng Python-pptx với hỗ trợ slide/ghi chú đầy đủ). Kỹ năng này bao gồm PDF và tài liệu được quét.

Bước 1: URL từ xa có sẵn?

Nếu tài liệu có URL, luôn thử web_extract trước:

` web_extract(urls=["https://arxiv.org/pdf/2402.03300"]) web_extract(urls=["https://example.com/report.pdf"])

` ``Điều này xử lý việc chuyển đổi PDF sang markdown thông qua Firecrawl mà không cần phụ thuộc cục bộ.

Chỉ sử dụng trích xuất cục bộ khi: tệp cục bộ, web_extract không thành công hoặc bạn cần xử lý hàng loạt.

Bước 2: Chọn Local Extractor

Tính năngpymupdf (~25MB)điểm đánh dấu-pdf (~3-5GB)
PDF dựa trên văn bản
PDF được quét (OCR)✅ (hơn 90 ngôn ngữ)
Bàn✅ (cơ bản)✅ (độ chính xác cao)
Phương trình / LaTeX
Khối mã
Biểu mẫu
Xóa đầu trang/chân trang
Phát hiện thứ tự đọc
Trích xuất hình ảnh✅ (được nhúng)✅ (có ngữ cảnh)
Hình ảnh → văn bản (OCR)
EPUB
Đầu ra giảm giá✅ (thông qua pymupdf4LLM)✅ (bản địa, chất lượng cao hơn)
Kích thước cài đặt~25MB~3-5GB (kiểu máy PyTorch +)
Tốc độTức thì~1-14 giây/trang (CPU), ~0,2 giây/trang (GPU)

Quyết định: Sử dụng pymupdf trừ khi bạn cần OCR, phương trình, biểu mẫu hoặc phân tích bố cục phức tạp.

Nếu người dùng cần khả năng đánh dấu nhưng hệ thống thiếu ~5GB đĩa trống:

"Tài liệu này cần OCR/trích xuất nâng cao (marker-pdf), yêu cầu ~5GB cho PyTorch và mô hình. Hệ thống của bạn có [X]GB trống. Tùy chọn: giải phóng dung lượng, cung cấp URL để tôi có thể sử dụng web_extract hoặc tôi có thể thử pymupdf hoạt động với các tệp PDF dựa trên văn bản nhưng không hoạt động với các tài liệu hoặc phương trình được quét."


##pymupdf (nhẹ)

pip install pymupdf pymupdf4LLM

`
``**Thông qua tập lệnh trợ giúp**:

`
`bash
Python scripts/extract_pymupdf.py document.pdf # Plain text
Python scripts/extract_pymupdf.py document.pdf --markdown # Markdown
Python scripts/extract_pymupdf.py document.pdf --tables # Tables
Python scripts/extract_pymupdf.py document.pdf --images out/ # Extract images
Python scripts/extract_pymupdf.py document.pdf --metadata # Title, author, pages
Python scripts/extract_pymupdf.py document.pdf --pages 0-4 # Specific pages

`
``**Nội tuyến**:

`
`bash
Python3 -c "
import pymupdf
doc = pymupdf.open('document.pdf')
for page in doc:
print(page.get_text())
"

`

---

## marker-pdf (OCR chất lượng cao)

`bash

# Check disk space first
Python scripts/extract_marker.py --check`pip install marker-pdf

`
``**Thông qua tập lệnh trợ giúp**:

`
``` bash
Python scripts/extract_marker.py document.pdf # Markdown
Python scripts/extract_marker.py document.pdf --JSON # JSON with metadata
Python scripts/extract_marker.py document.pdf --output_dir out/ # Save images
Python scripts/extract_marker.py scanned.pdf # Scanned PDF (OCR)
Python scripts/extract_marker.py document.pdf --use_LLM # LLM-boosted accuracy

`
``**CLI** (được cài đặt bằng marker-pdf):

`
`bash
marker_single document.pdf --output_dir ./output
marker /path/to/folder --workers 4 # Batch

`

---

## Giấy tờ Arxiv

`

# Abstract only (fast)
web_extract(urls=["https://arxiv.org/abs/2402.03300"])

# Full paper
web_extract(urls=["https://arxiv.org/pdf/2402.03300"])

# Search
web_search(query="arxiv GRPO reinforcement learning 2026")

`

## Tách, Hợp nhất & Tìm kiếm`pymupdf xử lý những thứ này một cách tự nhiên - sử dụng
`execute_code
` hoặc Python nội tuyến:

``` python

# Split: extract pages 1-5 to a new PDF
import pymupdf
doc = pymupdf.open("report.pdf")
new = pymupdf.open()
for i in range(5):
new.insert_pdf(doc, from_page=i, to_page=i)
new.save("pages_1-5.pdf")

`

`
``` python

# Merge multiple PDFs
import pymupdf
result = pymupdf.open()
for path in ["a.pdf", "b.pdf", "c.pdf"]:
result.insert_pdf(pymupdf.open(path))
result.save("merged.pdf")

`

`
``` python

# Search for text across all pages
import pymupdf
doc = pymupdf.open("report.pdf")
for i, page in enumerate(doc):
results = page.search_for("revenue")
if results:
print(f"Page \{i+1}: \{len(results)} match(es)")
print(page.get_text("text"))

`
``Không cần phụ thuộc thêm - pymupdf bao gồm việc phân tách, hợp nhất, tìm kiếm và trích xuất văn bản trong một gói.

---

## Ghi chú
-
`web_extract
` luôn là lựa chọn hàng đầu cho các URL
- pymupdf là mặc định an toàn — tức thì, không cần mô hình, hoạt động ở mọi nơi
- marker-pdf dành cho OCR, tài liệu được quét, phương trình, bố cục phức tạp - chỉ cài đặt khi cần
- Cả hai tập lệnh trợ giúp đều chấp nhận

--help
` để sử dụng đầy đủ
- tải xuống marker-pdf ~ 2,5 GB mô hình xuống

~/.cache/huggingface/
` trong lần sử dụng đầu tiên
- Đối với tài liệu Word:
`pip install Python-docx
` (tốt hơn OCR - phân tích cấu trúc thực tế)
- Đối với PowerPoint: xem kỹ năng
`powerpoint
` (dùng Python-pptx)