PDF sang Word: chế độ visual vs text, PDF bản scan
Chuyển PDF thành .docx offline — chế độ visual giữ nguyên bố cục, chế độ text cho đoạn văn chỉnh sửa được, còn Scanned PDF to Word xử lý bản scan.
1FileTool chuyển PDF sang Word offline ngay trên Mac của bạn — file không bao giờ được tải lên, và kết quả xuất hiện dưới dạng <name>_converted.docx. Có ba công cụ cho việc này, và chọn cái nào tùy thuộc bạn cần bố cục hay phần chữ chỉnh sửa được.
Bảo vệ file gốc trước đã
Replace source mặc định đang BẬT: file đầu ra ghi đè lên file gốc và không giữ bản sao lưu. Trước khi làm theo, mở Settings › General và tắt Replace source, hoặc chọn một thư mục đầu ra riêng.
Ba công cụ
- PDF Tools › PDF to Word — chế độ visual. Mỗi trang được nhúng vào .docx dưới dạng ảnh toàn trang, nên file Word trông y hệt PDF. Phù hợp nhất khi bố cục là thứ quan trọng. (PDF to Word)
- PDF Tools › Scanned PDF to Word — chạy OCR trên từng trang và ghi ra các đoạn văn thuần. Phù hợp nhất khi PDF là bản scan và bạn cần chữ chỉnh sửa được. (Scanned PDF to Word)
- PDF Tools › Batch PDF to Word — chế độ visual áp dụng cho cả một thư mục được thả vào. (Batch PDF to Word)
Mỗi chế độ cho ra gì
Chế độ visual — mặc định của PDF to Word và Batch PDF to Word — render từng trang PDF và đặt vào tài liệu dưới dạng hình ảnh. Font chữ, bảng, ảnh và bố cục nhiều cột sống sót nguyên từng pixel. Đánh đổi: phần chữ bên trong là một phần của ảnh, nên bạn không chỉnh sửa được trong Word.
Chế độ text — thứ Scanned PDF to Word sử dụng — trích xuất chữ thật và ghi thành các đoạn văn thường. Kết quả chỉnh sửa được hoàn toàn, nhưng bố cục phức tạp sẽ sập về một luồng đoạn văn đơn giản: bản scan nhiều cột trở thành một cột chữ.
Chuyển đổi PDF bản scan
Bản scan là một bức ảnh của trang — không có lớp chữ nào để sao chép. Scanned PDF to Word chạy OCR tiếng Anh trên mỗi trang và ghi các từ nhận ra thành đoạn văn:
- Thả PDF bản scan lên Scanned PDF to Word.
- Chạy. OCR mất nhiều thời gian hơn hẳn so với chuyển đổi thường — mỗi trang phải được render rồi nhận dạng.
- Mở
<name>_converted.docxvà đọc lại. OCR trên bản scan sạch cho kết quả khá tốt; chữ viết tay, con dấu và chữ mờ sẽ cần sửa lại.
Nếu bạn chỉ cần phần chữ — không cần file Word — OCR sẽ ghi ra một file .txt thuần.
Nếu kết quả trả về trống
Một PDF không có lớp chữ và không có nội dung ảnh nhận dạng được có thể thất bại với lỗi gợi ý thử Scanned PDF to Word. Chạy lại file đó qua công cụ này — nó OCR thay vì trích xuất.
Liên quan
Công cụ sử dụng