OCR bản scan thành văn bản (tiếng Anh)
Trích xuất văn bản từ PDF bản scan bằng OCR offline. Chỉ nhận dạng tiếng Anh, đầu ra là file .txt thuần — đây là chính xác những gì bạn nên kỳ vọng.
Công cụ OCR trong 1FileTool biến một PDF bản scan thành file văn bản thuần trên Mac của bạn — không tải lên, không dịch vụ OCR đám mây. Nó nhận dạng chỉ chữ tiếng Anh và ghi ra file .txt, không phải PDF có thể tìm kiếm.
Bảo vệ file gốc trước đã
Replace source mặc định đang BẬT: file đầu ra ghi đè lên file gốc và không giữ bản sao lưu. Trước khi làm theo, mở Settings › General và tắt Replace source, hoặc chọn một thư mục đầu ra riêng.
Chạy OCR trên bản scan
- Mở PDF Tools › OCR (trang công cụ).
- Thả PDF bản scan vào.
- Chạy. Mỗi trang được render ở 300 DPI rồi nhận dạng, nên bản scan dài sẽ mất một lúc — tiến trình tính theo trang.
- Tìm
<name>_ocr.txttại vị trí đầu ra của bạn. Các trang được ngăn bởi một dòng--- Page Break ---.
Bạn nhận được gì (và không được gì)
- Đầu ra là
.txtthuần — chữ và dấu xuống dòng, không bố cục, không font. Bản scan hai cột sẽ đọc thẳng một mạch. - Nhận dạng chỉ hỗ trợ tiếng Anh. Trang ngôn ngữ khác sẽ ra ký tự rác hoặc trống.
- Bản scan sạch, phẳng với độ tương phản hợp lý nhận dạng tốt. Chữ viết tay, con dấu, ảnh chụp nghiêng và chữ mờ trên giấy nhiệt sẽ cần dọn tay.
- OCR không tạo ra PDF có thể tìm kiếm — nó trích xuất văn bản. Để có đoạn văn chỉnh sửa được trong Word, dùng Scanned PDF to Word.
Nếu bạn cần chữ nằm trong định dạng khác
- Scanned PDF to Word chạy cùng bộ OCR nhưng ghi ra
.docxgồm các đoạn văn thuần — xem PDF to Word. - PDF Tools › Extract Text sao chép lớp chữ nhúng của một PDF kỹ thuật số — tức thì, nhưng sẽ không tìm thấy gì trên bản scan vì scan không có lớp chữ.
Liên quan
- PDF to Word: chế độ visual so với text
- Bảo vệ và che dấu PDF — OCR trước nếu Detect PII báo file là bản scan
- OCR cục bộ và quyền riêng tư
- Vì sao file không bao giờ tải lên
- Nén PDF
Công cụ sử dụng