← Blog

Cách OCR file PDF để biến bản scan thành tài liệu tìm kiếm được miễn phí

Bạn scan một hợp đồng cũ hay một xấp hóa đơn, lưu thành file PDF, rồi vài tuần sau đi tìm một điều khoản hoặc tên một nhà cung cấp — và Ctrl+F chẳng tìm thấy gì. Đó là vì một bản scan chỉ là tấm ảnh chụp chữ: máy tính của bạn nhìn thấy các điểm ảnh, chứ không phải từ ngữ. OCR khắc phục điều đó, biến một hình ảnh phẳng thành tài liệu mà bạn thực sự có thể tìm kiếm, sao chép và tái sử dụng.

OCR thực chất làm gì với một file PDF

OCR là viết tắt của optical character recognition (nhận dạng ký tự quang học). Nó nhìn vào các hình dạng trong ảnh của trang, suy ra chúng đại diện cho chữ cái và từ ngữ nào, rồi ghi phần chữ đó vào file dưới dạng một lớp ẩn.

Điểm hay là bản scan gốc vẫn được giữ nguyên y như cũ. Phần chữ đã nhận dạng nằm trong một lớp vô hình phía sau ảnh trang, khớp hoàn hảo với những gì bạn nhìn thấy. Vậy nên tài liệu trông giống hệt bản scan ban đầu, nhưng giờ đây mọi từ đều chọn được, tìm kiếm được và sao chép được. Chất lượng hình ảnh không hề thay đổi.

Chỉ một thay đổi đó thôi đã mở ra rất nhiều khả năng. Một file PDF tìm kiếm được cho phép bạn tìm bất kỳ từ khóa nào trong vài giây, sao chép cả một đoạn thay vì gõ lại, và đưa file vào những công cụ khác cần đến chữ thật — chẳng hạn như chuyển nó sang tài liệu chỉnh sửa được sau này.

Cách biến file PDF scan thành tìm kiếm được

Đây là toàn bộ quy trình bằng công cụ OCR PDF. Nó mất khoảng một phút, và không cần đăng ký, không có hình mờ, cũng chẳng phải cài đặt phần mềm nào.

  1. Mở công cụ. Truy cập OCR PDF trên PDF168.
  2. Thêm file PDF scan của bạn. Kéo file vào trang, hoặc nhấp để duyệt và chọn file từ máy tính. Công cụ chấp nhận các file PDF scan và file PDF chỉ chứa hình ảnh.
  3. Đặt ngôn ngữ của tài liệu. Nhập mã ngôn ngữ Tesseract cho tài liệu của bạn — eng cho tiếng Anh, và những mã như chi_tra cho tiếng Trung phồn thể. Khớp đúng ngôn ngữ với nội dung là yếu tố quan trọng nhất quyết định độ chính xác.
  4. Chọn chế độ OCR. Chọn Bỏ qua các trang đã có chữ (lựa chọn mặc định và an toàn nhất) nếu một phần file của bạn vốn đã ở dạng số. Dùng Bắt buộc OCR mọi trang khi ngay cả những trang “có chữ” thực ra cũng chỉ là bản scan.
  5. Chạy công cụ. Bắt đầu quá trình xử lý. File của bạn được tải lên qua kết nối mã hóa đến máy chủ an toàn của chúng tôi, nơi phần chữ được nhận dạng theo từng trang trong một lượt duy nhất.
  6. Tải xuống file PDF tìm kiếm được của bạn. Lưu file được trả về. Nó trông giống hệt như trước, nhưng giờ đây bạn có thể tìm kiếm và chọn từng từ một.

Vậy là xong. Tài liệu nhiều trang được xử lý trọn một lượt và trả về dưới dạng một file duy nhất.

Chọn đúng ngôn ngữ và chế độ

Vài lựa chọn nhỏ tạo nên khác biệt giữa kết quả nhận dạng gần như hoàn hảo và một mớ lộn xộn.

Làm gì với một file PDF tìm kiếm được

Một khi file của bạn đã có lớp chữ thật, rất nhiều khả năng mở ra. Bạn có thể tìm kiếm và sao chép trực tiếp ngay trong bất kỳ trình đọc PDF nào. Bạn có thể tô sáng và chú thích chính những từ thật thay vì vẽ khung lên một hình ảnh. Và bạn có thể đưa file cho các công cụ khác vốn phụ thuộc vào phần chữ chọn được.

Nếu bạn chỉ cần phần chữ thô — không cần bố cục, chỉ cần văn bản sao chép sẵn — hãy cho file tìm kiếm được chạy qua PDF to Text để xuất ra văn bản thuần sạch sẽ. Nếu bạn muốn chỉnh sửa nội dung trong Word, thứ tự đúng là OCR trước, rồi mới đến PDF to Word; chuyển thẳng một bản scan sang Word mà không qua OCR sẽ tạo ra một tài liệu trống rỗng hoặc lộn xộn, bởi vì không có chữ nào để nó mang sang.

Đôi lời về quyền riêng tư

OCR nặng hơn vẻ ngoài của nó — nhận dạng từng ký tự trên từng trang đòi hỏi năng lực tính toán thực sự — nên công cụ này chạy trên máy chủ của chúng tôi chứ không phải trong trình duyệt của bạn. File PDF của bạn được gửi qua kết nối mã hóa (HTTPS), xử lý trên máy chủ an toàn, rồi trả lại cho bạn. File không bị lưu trữ, chia sẻ, hay dùng cho quảng cáo hoặc huấn luyện sau đó, và bạn cũng không cần tài khoản hay email. Với những tài liệu cực kỳ nhạy cảm, vẫn nên xóa các bản làm việc lưu trên máy của bạn một khi đã có bản tìm kiếm được mà bạn cần.

Số hóa một bản scan từng đồng nghĩa với việc phải mua phần mềm máy tính đắt đỏ hoặc gõ lại từng trang bằng tay. Giờ đây bạn chỉ cần thả một file vào OCR PDF, chọn một ngôn ngữ, và tải xuống một tài liệu tìm kiếm được hoàn chỉnh trong chưa đầy một phút — miễn phí, và qua một kết nối an toàn. Hãy lưu lại công cụ này cho xấp tài liệu scan tiếp theo mà bạn không thể tìm kiếm xuyên qua.

Mở OCR PDF →

Câu hỏi thường gặp

OCR là gì và tại sao file PDF scan của tôi lại cần đến nó?

OCR (nhận dạng ký tự quang học) đọc phần chữ nằm trong ảnh của trang và biến nó thành các ký tự thật, chọn được. Một bản scan chỉ là tấm ảnh chụp chữ, nên nếu không có OCR thì bạn không thể tìm kiếm, sao chép hay tô sáng dù chỉ một từ trong đó.

OCR có làm thay đổi diện mạo các trang scan của tôi không?

Không. Công cụ thêm một lớp chữ vô hình nằm sau ảnh trang gốc của bạn, nên bản scan trông y hệt như cũ trong khi các từ ngữ trở nên tìm kiếm và chọn được. Bản scan rõ nét, độ phân giải cao sẽ cho kết quả nhận dạng chính xác nhất.

File của tôi có bị tải lên khi tôi chạy OCR không?

Có. OCR cần năng lực xử lý thực sự, nên file PDF của bạn được gửi qua kết nối mã hóa (HTTPS) đến máy chủ an toàn của chúng tôi, được nhận dạng, rồi trả lại cho bạn. File không bị lưu trữ hay giữ lại sau đó, và bạn cũng không cần tài khoản hay email.