Cách OCR PDF (tạo văn bản có thể tìm kiếm)
Hướng dẫn từng bước để tạo PDF quét có thể tìm kiếm bằng OCR: chọn ngôn ngữ tài liệu, lớp văn bản được thêm cục bộ trong trình duyệt, tệp không bao giờ được tải lên.
Nhận dạng văn bảnPDF quét là một bức ảnh chụp văn bản: trông có vẻ đọc được, nhưng với mọi ô tìm kiếm, thao tác sao chép dán và công cụ trích xuất văn bản, các trang đều trống rỗng. OCR (nhận dạng ký tự quang học) khắc phục điều đó bằng cách nhận dạng các chữ cái và thêm một lớp văn bản vô hình lên trên bản quét. Hướng dẫn này chỉ cho bạn cách thực hiện với công cụ OCR PDF của AmiPDF, công cụ chạy toàn bộ quá trình nhận dạng trong trình duyệt của bạn: tệp không bao giờ rời khỏi thiết bị, điều này quan trọng với hợp đồng, hồ sơ y tế và giấy tờ tùy thân. Bạn chọn một hoặc nhiều ngôn ngữ tài liệu, công cụ nhận dạng từng trang, và kết quả là chính PDF đó, giờ có thể tìm kiếm và sao chép.
Chạy OCR từng bước
Mở công cụ OCR và thêm bản quét của bạn
Truy cập công cụ OCR PDF của AmiPDF và thả tệp PDF quét của bạn vào khu vực tải lên. Tài liệu quét trong giới hạn số trang của công cụ đều được chấp nhận; nếu bản quét là một cuốn sách dài, hãy cắt thành nhiều phần trước bằng tách PDF rồi xử lý từng phần.

Chọn ngôn ngữ tài liệu
Chọn mọi ngôn ngữ xuất hiện trong tài liệu, trong giới hạn mỗi lần chạy. Chọn hai hoặc ba ngôn ngữ khi văn bản thực sự pha trộn chúng sẽ cải thiện nhận dạng; thêm những ngôn ngữ không có trong tài liệu chỉ làm chậm quá trình chạy. Bộ máy nhận dạng và gói ngôn ngữ chỉ tải một lần trong lần sử dụng đầu tiên và được lưu vào bộ nhớ đệm sau đó.

Chạy nhận dạng
Nhấn bắt đầu và theo dõi tiến độ từng trang. Quá trình nhận dạng diễn ra trên thiết bị của bạn với WebAssembly; bản quét 10 trang thường mất vài phút tùy thuộc vào máy của bạn. Giữ tab mở cho đến khi quá trình chạy hoàn tất; công cụ sẽ tự động ghép kết quả đầu ra.

Tải xuống PDF có thể tìm kiếm
Lưu kết quả; đây vẫn là tài liệu hiển thị như cũ, giờ có thêm lớp văn bản vô hình bên dưới. Tìm kiếm hoạt động trong mọi trình đọc PDF, sao chép dán trả về văn bản thật, và bạn có thể trích xuất nội dung sau đó bằng PDF sang Markdown. Một nút cũng cung cấp văn bản nhận dạng thô dưới dạng tệp .txt để kiểm tra nhanh.

Để có kết quả tốt nhất
Bản quét sạch nhận dạng tốt hơn
Trang thẳng, được chiếu sáng đều, 300 DPI là điều kiện lý tưởng. Ảnh chụp bằng điện thoại bị nghiêng sẽ mất độ chính xác ở các cạnh; nếu nguồn là ảnh chụp từ điện thoại, hãy làm thẳng và cắt trước; công cụ cắt PDF có thể loại bỏ các viền tối gây nhầm lẫn cho nhận dạng.
Kiểm tra bản xem trước văn bản
OCR mang tính thống kê: độ chính xác 100% không được đảm bảo, đặc biệt với phông chữ lạ hoặc độ tương phản thấp. Dùng chế độ xem văn bản trích xuất để kiểm tra nhanh vài đoạn trước khi tin vào tìm kiếm, và chạy lại với ngôn ngữ điều chỉnh nếu kết quả trông bị lỗi.
Bỏ qua OCR với PDF dạng văn bản
Nếu công cụ báo rằng tài liệu đã có lớp văn bản, bạn không cần OCR; các công cụ trích xuất như PDF sang Word hoạt động trực tiếp và hoàn tất trong vài giây.
Câu hỏi thường gặp
Tệp của tôi thật sự không được tải lên đâu cả?
Đúng vậy: nhận dạng chạy trong trình duyệt của bạn qua WebAssembly. Lưu lượng mạng duy nhất là tải một lần bộ máy OCR và các gói ngôn ngữ, được lưu vào bộ nhớ đệm cho những lần chạy sau.
Tôi có thể chọn bao nhiêu ngôn ngữ?
Tối đa theo giới hạn mỗi lần chạy hiển thị trên trang. Bạn có thể trộn ngôn ngữ thoải mái, ví dụ tiếng Anh và tiếng Trung trong một hợp đồng song ngữ, nhưng bỏ qua những ngôn ngữ không có trong tài liệu; chúng chỉ làm chậm quá trình chạy.
OCR có làm thay đổi diện mạo bản quét của tôi không?
Không. Các trang giữ nguyên diện mạo gốc; văn bản nhận dạng được thêm dưới dạng lớp vô hình nằm bên dưới bản quét. Bạn thấy cùng một tài liệu, nhưng tìm kiếm và sao chép giờ đã hoạt động.