生成式 AI 如何輔助歷史學研究(五)文獻史料 OCR 篇
對歷史學者而言,史料是建構研究論述的基石。目前雖有部分資料庫已建置全文,但近代史研究常用的各類官方檔案、私人文書乃至大量近代報刊等材料,仍多以掃描影像或 PDF 形式保存。若欲進一步檢索、比對或引述,以往研究者仍須花費不少時間或人力繕打文字檔。隨著近年人工智慧與多模態技術快速發展,文字辨識、版面解析能力及大量批次處理效率也有所提升。本次將為各位介紹 Gemini 雲端免費版、付費版與 Tesseract 地端離線版*三種 OCR 方案,同時提供本館製作免安裝的「系統工具包」。研究者不需自行安裝或撰寫 OCR 程式,只要依史料性質選擇方案、放入 PDF 或圖片,即可進行批次辨識,再透過圖文對照工作台校對結果,減少逐字繕打史料所需的成本。
*地端是一種相對雲端的概念,即不用將資料上傳,可直接在電腦本機運作程式或AI模型,因此可確保資料隱密性及安全性。
目錄
一、選擇適合的 OCR 方案
請先依史料機敏程度、預計處理數量及版面或文字複雜度選擇方案。少量且可公開的史料可先使用 Gemini API 免費版;需要大量、快速批次處理時可使用付費版;若資料涉及個人隱私、典藏機構使用限制或其他保密要求,則應優先採用 Tesseract 地端方案。
| 方案 | 特色與限制 | 適用材料 | 隱私及資料保護程度 | 辨識效果 | 處理速度 | 處理費用 |
|---|---|---|---|---|---|---|
| Gemini API 免費版雲端方案 | 1. 可處理近代印刷品(含表格、多欄版面)及字跡清晰的手稿。 2. 上傳內容及辨識結果可能被用於改善 Google 模型或接受人工審閱,不宜處理機敏、個人或未公開資料。 3. 設有速率與每日使用額度,達到使用上限或遇到尖峰時段時,可能出現延遲。 | 零星、少量且可公開的史料 | 低 | 佳 | 慢 | 免費 |
| Gemini API 付費版雲端方案 | 1. 可處理近代印刷品(含表格、多欄版面)及字跡清晰的手稿。 2. Google 承諾不會將付費帳號客戶上傳雲端資料及辨識結果用於訓練或改善其模型。 3. 需綁定信用卡帳號,費用依實際用量計算,可自行設定付費使用額度上限。 | 大部頭書刊、大量檔案或長期使用需求 | 中 | 佳 | 快 | 視處理數量而定 |
| Tesseract 免費地端方案 | 1. 免費且可離線使用,資料全程留在個人電腦;一般電腦的 CPU 即可運作,不需要 GPU 或高階硬體。 2. 辨識前須指定語言。 3. 處理複雜版式、表格或手稿時,辨識效果不佳。 | 未公開、機敏或不宜上傳第三方平台的文獻 | 高 | 較差 | 快 | 免費 |
註:Gemini API-How Google Uses Your Data:官方說明(最後瀏覽日期:2026.09.23)。
二、前置作業準備
下載對應程式工具包
| 使用方案 | 下載程式工具包 | 接著閱讀 |
|---|---|---|
| Gemini API 免費版 | google free ocr 【下載工具包】 | 三、Gemini API 免費版設定與操作流程 |
| Gemini API 付費版 | google pay ocr 【下載工具包】 | 四、Gemini API 付費版設定與操作流程 |
| Tesseract 5.4 地端版 | Tesseract ocr 【下載工具包】 | 五、Tesseract 5.4 地端版設定與操作流程 |
1. 本工具包適用一般 Windows 電腦,不需 GPU 或高階硬體設備(Mac 系統暫無法直接支援)。
2. 下載 ZIP 壓縮檔後,按滑鼠右鍵選擇「解壓縮全部」,免安裝其他軟體即可使用。
3. 請將解壓縮後的資料夾放在「桌面」、「文件」等方便讀取的位置。
4. 若檔案無法讀取,請優先轉成 PDF、JPG 或 PNG 再測試。
認識程式工具包資料夾主要內容
📁 input_all【放入檔案區】放置待辨識的 PDF 或圖檔
📁 ocr_results【辨識成果區】辨識完成的文字檔(可以筆記本開啟)
⚙️ 1-開始辨識.bat【辨識執行按鈕】連按兩下,系統就會自動開始辨識
🔍 2-對照修訂工作台.bat【校對按鈕】連按兩下,即可對照原圖檢查修改
────────────────────
程式區(勿刪)
📁 _系統核心【內建系統模組】程式工具包所需的系統檔案,請勿更動或刪除。
三、方案一:Gemini API 免費版設定與操作流程
Gemini API 免費版適合處理少量、非機密的書籍或文獻照片。第一次使用時,需先申請一組免費的「API Key」。點擊工具包中的「1-開始辨識.bat」,先貼上您申請的「API Key」,系統會將金鑰儲存在本機。之後只要把要辨識的檔案丟進 input_all 資料夾,再點擊「1-開始辨識.bat」就能批次自動轉成文字。
STEP 1 取得 Gemini 免費 API Key
1. 開啟 Google AI Studio,使用個人 Google 帳號登入。
2. 登入後點選左側 Dashboard,進入再點選 API Keys 頁面,選擇右上角 Create API Key。接著請自行為這支 Key 命名,例如:Gemini API Key for OCR,專案選擇預設的 Default Gemini Project,最後點選 Create Key 即可。
3. API Key 創建完成後,會跳出如下視窗,並產生一組 Key(一串以「A」開頭的字碼),請點選複製並妥善保存勿外流。
STEP 2 放入史料
1. 打開解壓縮後的 google free ocr 資料夾。
2. 將想要辨識的 PDF 檔或圖片,複製並貼到「input_all」資料夾中。(建議初次使用先放 1 本幾頁的 PDF 或 2 至 3 張照片試跑)
看到視窗顯示「金鑰已安全保存至 api_key.txt」就代表成功了!這組金鑰會自動儲存在您的電腦中,之後使用不需再重複輸入。
STEP 3 輸入 API Key(只需初次操作一次)並開始辨識
1. 回到 google free ocr 資料夾,點選「1-開始辨識.bat」啟動程式。
2. 此時畫面上會跳出一個黑色執行視窗,並出現提示:「【初次使用提示】請貼上您的 API Key:」。請直接在黑色視窗內按「滑鼠右鍵」貼上剛才複製的 API Key,然後按 Enter 鍵。
3. 辨識完成後,該視窗會顯示:「所有出版品與圖檔已全數處理!」
● 免費版辨識速率與每日額度會依模型及帳戶狀態調整,待辨識的資料較多時,需花費較多時間,可於睡前輸入處理,起床後確認結果。若出現 HTTP 429 等錯誤訊息,請先保留輸出結果,再繼續辨識未完成的檔案。
● 免費版服務上傳資料及輸出可能用於改善 Google 產品,請勿使用免費版處理機敏、涉及隱私的資料。
4. 辨識完成的文字檔會出現在「ocr_results」資料夾中,使用「筆記本」開啟即可閱讀或複製。
STEP 4 圖文校對並儲存辨識結果
1. 為確保文本正確性,需要人工校對辨識結果時,請回到 google free ocr 資料夾,點選「2-對照修訂工作台.bat」。
2. 開啟校對頁面後,最上方工具列可選擇欲校對的文本。左側查看原件影像,在右側逐字修正辨識文字。
3. 每完成一頁,按右上角的綠色「儲存修改」按鈕或 Ctrl + S。若修改後未儲存,則會出現「有未儲存修改」的字樣以示提醒。
4. 儲存後,程式就會同步更新 ocr_results 資料夾的文字檔內容。
四、方案二:Gemini API 付費版設定與操作流程
付費版適合大量或經常性的批次處理。啟用計費後,建議先設定支出上限,並以少量頁面試跑,再擴大處理範圍。
STEP 1 創建 Gemini API Key 並綁定付費帳戶
1. 開啟 Google AI Studio,使用個人 Google 帳號登入。
2. 登入後點選左側 Dashboard,進入再點選 API Keys 頁面,選擇右上角 Create API Key。接著請自行為這支 Key 命名,例如:Gemini API Key for OCR,專案選擇預設的 Default Gemini Project,最後點選 Create Key 即可。
3. API Key 創建完成後,會跳出如下視窗,並產生一組 Key(一串以「A」開頭的字碼),請點選複製並妥善保存勿外流。
4. API Key 創建完成後,就會在 Google AI Studio 的 API Keys 頁面看到剛建立的 Default Gemini Project 和 API Key。請點選 Set up billing。
5. 依畫面指示填寫聯絡資訊與付款方式,完成帳單帳戶設定。若系統將帳戶設為預付方案,還需依提示預付至少 5 美元(或等值當地貨幣)的額度。
STEP 2 設定預算上限
1. 付費帳戶設定完成後,回到 Google AI Studio,選取左側 Spend,在 Monthly spend cap 區塊點選 Edit spend cap(部分介面可能顯示 Set spend cap),設定每月支出上限後按 Save 儲存。
STEP 3 輸入 API Key(只需初次操作一次)並開始辨識
1. 回到 google pay ocr 資料夾,點選「1-開始辨識.bat」啟動程式。
2. 此時畫面上會跳出一個黑色執行視窗,並出現提示:「請直接在此按右鍵貼上您的 API Key,並按 Enter:」,請在此貼上剛才複製的付費版 API Key。(系統會自動記憶這組 Key,往後不需再輸入)
3. 接著就會自動開始進行辨識,辨識完成後,該視窗會顯示:「全部處理完畢!」
● 如果出現「失敗」訊息,請先查看錯誤原因。若顯示預付額度不足,需先補充預付額度;若顯示已達支出上限,再視需要調整上限。
4. 辨識完成的文字檔會出現在「ocr_results」資料夾中,使用「筆記本」開啟即可閱讀或複製。
STEP 4 圖文校對並儲存辨識結果
1. 為確保文本正確性,需要人工校對辨識結果時,請回到 google pay ocr 資料夾,點選「2-對照修訂工作台.bat」。
2. 開啟校對頁面後,最上方工具列可選擇欲校對的文本。左側查看原件影像,在右側逐字修正辨識文字。
3. 每完成一頁,按右上角的綠色「儲存修改」按鈕或 Ctrl + S。若修改後未儲存,則會出現「有未儲存修改」的字樣以示提醒。
4. 儲存後,程式就會同步更新 ocr_results 資料夾的文字檔內容。
五、方案三:Tesseract 5.4 地端版設定與操作流程
若史料涉及個人隱私、典藏版權限制或機密檔案,不宜上傳至 Google 雲端,可使用 Tesseract 5.4 地端方案。Tesseract 是曾由 Google 長期開發的開源 OCR 引擎,可直接在一般電腦的 CPU 上運作,不需 GPU 或高階硬體,處理速度快;本工具包全程在本機離線執行,資料無須上傳雲端。同類型的 PaddleOCR 中文辨識能力佳,也可使用一般電腦的 CPU 執行,但屬百度開發的系統;若機關對中國大陸開發的軟體或相關資安政策有所限制,請勿在單位主機上使用。
STEP 1 解壓縮並確認 Tesseract ocr 程式工具包完整
1. 完整解壓縮 Tesseract ocr 工具包。
2. 確認資料夾中可找到以下工作資料夾及程式:
📁 ocr_results【辨識成果區】
⚙️ 1-開始辨識(地端離線).bat【處理辨識按鈕】連按兩下,在電腦本機離線辨識
🔍 2-對照修訂工作台.bat【校對按鈕】連按兩下,在本機網頁左右對照原圖檢查修改
────────────────────
📁 系統核心(請勿更動)
3. 本工具包已經幫大家內建好所有必要元件,完全不用連網,解開壓縮檔就能直接執行。
STEP 2 放入史料
1. 將待處理的 PDF 或圖片複製到 input_all 資料夾。(初次使用可先放入 3 至 5 頁測試)
2. 回到 Tesseract ocr 資料夾,連按兩下「1-開始辨識(地端離線).bat」。執行視窗開啟後,請勿關閉視窗或讓電腦進入睡眠。
● 由於地端版模型辨識版型的能力較弱,因此最好能將同語言、類似版型(直式或橫式)的檔案放在一起辨識。
STEP 3 選擇待辨識的語言並開始辨識
1. 點選「1-開始辨識(地端離線)」後,先選擇欲辨識的語言代號。輸入代碼後,按 Enter,即可開始辨識。
2. 當視窗最底下出現「所有圖檔與出版品已全數處理完畢!」時,直接關閉黑色視窗即可。
3. 辨識完成的文字檔會出現在「ocr_results」資料夾中,使用「筆記本」開啟即可閱讀或複製。
STEP 4 圖文校對並儲存辨識結果
1. 為確保文本正確性,需要人工校對辨識結果時,請回到 Tesseract ocr 資料夾,點選「2-對照修訂工作台」。
2. 開啟校對頁面後,最上方工具列可選擇欲校對的文本。左側查看原件影像,在右側逐字修正辨識文字。
3. 每完成一頁,按右上角的綠色「儲存修改」按鈕或 Ctrl + S。若修改後未儲存,則會出現「有未儲存修改」的字樣以示提醒。
4. 儲存後,程式就會同步更新 ocr_results 資料夾的文字檔內容。
結語
史料全文化能提升檢索、比對與文本分析的效率,但 OCR 仍只是整理工作的起點。研究者應依資料性質選擇適當方案,再進行批次處理,最後回到原件完成人工校勘。如此才能在節省轉錄時間的同時,維持史料引用的精準度與可靠性。
本文介紹的三套工具包已備置於雲端硬碟。讀者可依研究材料的性質、處理規模與資安要求選擇版本;若操作上有任何問題,除了可以洽詢本館,也可嘗試讓您的 AI Agent 協助釐清並處理錯誤訊息,甚至進一步調整成符合您工作習慣的更新版本喔!
更多[生成式 AI 與歷史研究系列]文章,可參考:
(1) 歷史學者如何應用 ChatGPT(一)歷史教學篇
(2) 生成式 AI 如何輔助歷史研究(二)口述史篇
(3) 生成式 AI 如何輔助歷史研究(三)數位人文篇
(4) 生成式 AI 如何輔助研究工作(四‧上集):Oral Presentation & International Exchanges
(5) 生成式 AI 如何輔助研究工作(四‧下集):Organize notes & Small Talk after Conference
(6) 學生用AI寫論文怎麼辦?──歷史學教學現場的挑戰與對策
留言
張貼留言