← 部落格

如何免費對 PDF 進行 OCR 並讓掃描檔變成可搜尋

你掃描了一份舊合約,或是一疊收據,存成 PDF,幾週後想找某個條款或某個廠商名稱——結果 Ctrl+F 什麼也找不到。這是因為掃描檔其實只是文字的一張照片:電腦看到的是像素,而不是文字。OCR 解決了這個問題,把一張平面影像變成真正能搜尋、複製、再利用的文件。

OCR 究竟對 PDF 做了什麼

OCR 是光學字元辨識(optical character recognition)的縮寫。它會分析頁面影像中的形狀,判斷它們代表哪些字母與文字,再把這些文字以隱藏圖層的形式寫進檔案裡。

巧妙之處在於,原本的掃描檔完全維持原樣。辨識出來的文字位在頁面影像後方一層看不見的圖層中,和你看到的內容完美對齊。所以文件看起來和你一開始的掃描檔一模一樣,但現在每個字都可以選取、搜尋與複製。視覺品質完全不會改變。

這一個小小的改變,卻釋放了非常多可能性。可搜尋的 PDF 讓你能在幾秒內找到任何詞彙、直接複製整段文字而不必重打,還能把檔案餵給其他需要真正文字的工具——例如之後把它轉成可編輯的文件。

如何讓掃描的 PDF 變成可搜尋

以下是使用 OCR PDF 工具的完整流程。大約只要一分鐘,而且不需要註冊、沒有浮水印,也不必安裝任何軟體。

  1. 開啟工具。 前往 PDF168 上的 OCR PDF
  2. 加入你掃描的 PDF。 把檔案拖曳到頁面上,或點擊瀏覽,從電腦中選取檔案。本工具支援掃描檔與純影像的 PDF。
  3. 設定文件語言。 輸入你文件所對應的 Tesseract 語言代碼——英文是 eng,繁體中文則用 chi_tra 這類代碼。讓語言與內容相符,是影響準確度最關鍵的單一因素。
  4. 選擇 OCR 模式。 如果你檔案中有部分本來就是數位文字,請選 跳過已含文字的頁面(預設值,也是最安全的選擇)。如果連看似「文字」的頁面其實都是掃描檔,就改用 強制對每一頁執行 OCR
  5. 開始執行。 啟動處理程序。你的檔案會透過加密連線上傳到我們的安全伺服器,在那裡一次完成逐頁辨識。
  6. 下載你的可搜尋 PDF。 儲存回傳的檔案。它看起來和先前一樣,但現在你可以搜尋並選取每一個字。

就這麼簡單。多頁文件會一次處理完成,並以單一檔案回傳。

挑選正確的語言與模式

幾個看似不起眼的選擇,往往決定了辨識結果是近乎完美,還是一團亂碼。

拿到可搜尋的 PDF 後可以做什麼

一旦你的檔案有了真正的文字層,許多事情都會變得可行。你可以在任何 PDF 閱讀器中直接搜尋與複製。你可以針對真正的文字進行標示與註解,而不是在影像上畫框框。你也可以把檔案交給其他仰賴可選取文字的工具。

如果你只想要純文字內容——不要版面,只要可直接複製的文字——把這份可搜尋的檔案丟進 PDF to Text,就能得到乾淨的純文字輸出。如果你想在 Word 中編輯內容,正確的順序是先 OCR,再 PDF to Word;若沒有經過 OCR 就把掃描檔直接轉成 Word,只會得到空白或亂碼的文件,因為根本沒有文字可以帶過去。

關於隱私的說明

OCR 比看起來吃重得多——辨識每一頁上的每一個字元需要實際的運算能力——所以這個工具是在我們的伺服器上執行,而不是在你的瀏覽器中。你的 PDF 會透過加密(HTTPS)連線傳送,在安全的伺服器上處理,再回傳給你。處理完後不會被儲存、分享,也不會用於廣告或訓練,而且不需要任何帳號或電子郵件。對於高度機密的文件,當你拿到所需的可搜尋版本後,刪除本機的工作副本仍是個好習慣。

把掃描檔數位化,過去意味著要買昂貴的桌面軟體,或一頁一頁手動重打。現在你只要把檔案丟進 OCR PDF、選好語言,不到一分鐘就能下載一份完全可搜尋的文件——免費,而且透過安全連線完成。把它加入書籤,留給下一疊你搜尋不了的掃描檔吧。

開啟 PDF OCR →

常見問題

什麼是 OCR?為什麼我掃描的 PDF 需要它?

OCR(光學字元辨識)會讀取頁面影像中的文字,並把它轉換成真正、可選取的字元。掃描檔其實只是文字的一張照片,所以沒有 OCR,你連其中一個字都無法搜尋、複製或標示。

OCR 會改變我掃描頁面的外觀嗎?

不會。工具會在你原本的頁面影像後方加上一層看不見的文字層,所以掃描檔看起來一模一樣,但文字卻變得可搜尋、可選取。清晰、高解析度的掃描檔能產生最準確的辨識結果。

執行 OCR 時,我的檔案會被上傳嗎?

會。OCR 需要實際的運算能力,所以你的 PDF 會透過加密(HTTPS)連線傳送到我們的安全伺服器進行辨識,再回傳給你。處理完後不會儲存或保留,也不需要任何帳號或電子郵件。