Cara Melakukan OCR pada PDF (Agar Bisa Dicari)
Panduan langkah demi langkah agar PDF hasil pindai bisa dicari dengan OCR: pilih bahasa dokumen, lapisan teks ditambahkan secara lokal di browser, file tidak pernah diunggah.
Kenali TeksPDF hasil pindai adalah foto teks: terlihat bisa dibaca, tetapi bagi setiap kotak pencarian, salin-tempel, dan alat ekstraksi teks, halaman itu kosong. OCR (optical character recognition) memperbaikinya dengan mengenali huruf dan menambahkan lapisan teks tak terlihat di atas hasil pindai. Panduan ini menunjukkan caranya dengan alat OCR PDF dari AmiPDF, yang menjalankan seluruh proses pengenalan di browser Anda: file tidak pernah meninggalkan perangkat Anda, hal yang penting untuk kontrak, rekam medis, dan dokumen identitas. Anda memilih satu atau beberapa bahasa dokumen, alat ini mengenali setiap halaman, dan hasilnya adalah PDF yang sama, kini bisa dicari dan disalin.
Menjalankan OCR, langkah demi langkah
Buka alat OCR dan tambahkan hasil pindai Anda
Buka alat OCR PDF AmiPDF dan letakkan PDF hasil pindai ke area unggah. Dokumen hasil pindai hingga batas halaman alat ini diterima; jika hasil pindai Anda berupa buku tebal, potong dulu menjadi beberapa bagian dengan split PDF lalu proses setiap bagian.

Pilih bahasa dokumen
Pilih setiap bahasa yang muncul dalam dokumen, hingga batas per proses. Memilih dua atau tiga bahasa ketika teks memang bercampur dapat meningkatkan akurasi pengenalan; menambahkan bahasa yang tidak ada dalam dokumen hanya memperlambat proses. Mesin dan paket bahasa diunduh sekali saat pertama digunakan lalu disimpan dalam cache setelahnya.

Jalankan pengenalan
Klik mulai dan pantau kemajuan per halaman. Pengenalan berjalan di perangkat Anda dengan WebAssembly; pindaian 10 halaman biasanya memerlukan beberapa menit bergantung pada mesin Anda. Biarkan tab tetap terbuka sampai proses selesai; alat ini menyusun hasilnya secara otomatis.

Unduh PDF yang bisa dicari
Simpan hasilnya; dokumennya sama secara visual, kini dengan lapisan teks tak terlihat di bawahnya. Pencarian berfungsi di pembaca PDF mana pun, salin-tempel menghasilkan teks sungguhan, dan Anda bisa mengambil isinya nanti dengan PDF to Markdown. Sebuah tombol juga menyediakan teks hasil pengenalan mentah sebagai file .txt untuk pemeriksaan cepat.

Mendapatkan hasil terbaik
Pindaian yang bersih dikenali lebih baik
Halaman yang lurus, pencahayaan merata, dan 300 DPI adalah kondisi terbaik. Foto dari ponsel yang miring kehilangan akurasi di bagian tepi; jika sumbernya dari kamera ponsel, luruskan dan potong dulu; alat crop PDF dapat memangkas tepi gelap yang mengganggu pengenalan.
Periksa pratinjau teks
OCR bersifat statistik: akurasi 100% tidak dijamin, terutama pada fonta yang tidak biasa atau kontras rendah. Gunakan tampilan teks yang diekstrak untuk memeriksa sepintas beberapa paragraf sebelum mengandalkan pencarian, dan jalankan ulang dengan bahasa yang disesuaikan jika hasilnya tampak kacau.
Lewati OCR untuk PDF berbasis teks
Jika alat memberi tahu bahwa dokumen sudah memiliki lapisan teks, Anda tidak memerlukannya; alat ekstraksi seperti PDF to Word bekerja langsung dan selesai dalam hitungan detik.
Pertanyaan yang sering diajukan
Apakah file saya benar-benar tidak diunggah ke mana pun?
Benar, pengenalan berjalan di browser Anda melalui WebAssembly. Satu-satunya lalu lintas jaringan adalah pengunduhan sekali pakai mesin OCR dan paket bahasa, yang disimpan dalam cache untuk pemakaian berikutnya.
Berapa banyak bahasa yang bisa saya pilih?
Hingga batas per proses yang ditampilkan di halaman. Campur bahasa dengan bebas, misalnya Inggris dan Mandarin dalam satu kontrak dwibahasa, tetapi lewati bahasa yang tidak ada dalam dokumen; bahasa itu hanya memperlambat proses.
Apakah OCR akan mengubah tampilan hasil pindai saya?
Tidak. Halaman tetap seperti aslinya; teks yang dikenali ditambahkan sebagai lapisan tak terlihat yang diposisikan di bawah hasil pindai. Anda melihat dokumen yang sama, tetapi pencarian dan salin kini berfungsi.