Số hóa tài liệu và nhận dạng ký tự (OCR)
Kho hồ sơ giấy đang nằm im trong tủ trở thành dữ liệu tra cứu được trong vài giây.
Tìm được thứ trước đây không tìm nổi
Kho hồ sơ giấy trở thành dữ liệu tra cứu toàn văn theo từ khóa, số văn bản, cơ quan ban hành.
Bảo toàn tài liệu trước khi hỏng
Nội dung được lưu ở dạng số, không mất đi khi bản giấy xuống cấp.
Nạp dữ liệu cho các phần mềm khác
Tài liệu đã số hóa trở thành nguồn cho phần mềm tra cứu, tổng hợp báo cáo và đối soát.
Hồ sơ giấy là tài sản nhưng cũng là gánh nặng
Nhiều cơ quan còn hàng nghìn hộp hồ sơ giấy: công văn, quyết định, biểu mẫu tích lũy qua nhiều năm. Chúng chứa thông tin quan trọng nhưng gần như không khai thác được.
- Muốn tìm một hồ sơ cũ phải lục thủ công, có khi mất cả buổi
- Giấy xuống cấp, mờ chữ, có nguy cơ mất vĩnh viễn
- Bản scan thành file ảnh thì vẫn không tìm kiếm được nội dung
- Chữ tiếng Việt có dấu khiến nhiều công cụ nhận dạng sai
Sau khi triển khai thì khác thế nào
Tài liệu được scan hoặc chụp rồi đưa lên hệ thống. Phần mềm tự xoay, cắt lề, làm sạch ảnh trước khi nhận dạng, đọc được chữ tiếng Việt có dấu kể cả trên bản scan chất lượng trung bình, rồi tự phân loại theo loại văn bản, lĩnh vực, đơn vị và ngày tháng. Kết quả là file PDF vẫn giữ nguyên hình ảnh gốc nhưng có thêm lớp văn bản, nên tìm kiếm toàn văn được.
Giá trị mang lại
Chuyển tài liệu giấy thành dữ liệu số, tự động nhận dạng, phân loại và lưu trữ tập trung để dễ dàng tìm kiếm khi cần.
Dữ liệu đầu vào
- Hồ sơ, văn bản, công văn, quyết định, biểu mẫu
- Bản scan từ máy quét
- Ảnh chụp tài liệu
- File PDF dạng ảnh chưa có lớp văn bản
- Tài liệu lưu trữ cũ, chất lượng in không đồng đều
Chức năng chính
- Nhận dạng chữ tiếng Việt có dấu, kể cả bản scan chất lượng trung bình
- Nhận dạng bảng biểu và số liệu trong tài liệu
- Tự động xoay, cắt lề và làm sạch ảnh trước khi nhận dạng
- Tự động phân loại theo loại văn bản, lĩnh vực, đơn vị, ngày tháng
- Tạo lớp văn bản tìm kiếm được cho file PDF
- Quản lý phiên bản và lịch sử tài liệu
- Tìm kiếm toàn văn theo từ khóa, số văn bản, cơ quan ban hành
Quy trình xử lý
- 1Tài liệu giấy
- 2Scan hoặc tải ảnh, PDF lên hệ thống
- 3Nhận dạng ký tự (OCR)
- 4Phân loại và gắn siêu dữ liệu
- 5Lưu trữ tập trung
- 6Tìm kiếm và khai thác
Kết quả đầu ra
- File PDF có lớp văn bản tìm kiếm được
- Nội dung văn bản dạng số để đưa vào kho dữ liệu
- Siêu dữ liệu: loại văn bản, số ký hiệu, cơ quan ban hành, ngày tháng
- Kho tài liệu số có thể tra cứu toàn văn
- Danh sách trang cần kiểm tra lại do chất lượng ảnh thấp
Nguyên tắc kiểm soát
Độ chính xác của việc nhận dạng phụ thuộc vào chất lượng bản scan. Hệ thống đánh dấu các trang có độ tin cậy thấp để cán bộ kiểm tra lại, thay vì lặng lẽ chấp nhận kết quả sai.
Câu hỏi thường gặp
- Độ chính xác nhận dạng là bao nhiêu phần trăm?
- Chúng tôi không đưa ra một con số chung, vì nó phụ thuộc rất nhiều vào chất lượng bản scan, phông chữ và tình trạng giấy. Cách làm của chúng tôi là chạy thử trên chính tài liệu của đơn vị rồi báo con số đo được trên tập đó.
- Tài liệu viết tay có nhận dạng được không?
- Chữ viết tay khó hơn chữ in đáng kể và kết quả không ổn định. Với hồ sơ có phần viết tay, chúng tôi khuyến nghị đánh giá riêng trên mẫu thật trước khi cam kết phạm vi.
- Có cần mua máy scan mới không?
- Không nhất thiết. Phần mềm nhận cả file từ máy scan sẵn có và ảnh chụp. Nếu khối lượng lớn thì máy scan tốc độ cao sẽ tiết kiệm thời gian đáng kể.
Thuộc nền tảng Trợ lý AI cho cơ quan nhà nước
Xem thử trên chính tài liệu của đơn vị bạn
Nghe mô tả thì giải pháp nào cũng hay. Cách duy nhất để biết có dùng được không là chạy thử trên văn bản, biểu mẫu và quy trình thật của đơn vị. Chúng tôi nhận làm buổi demo như vậy.
Buổi demo không mất phí và không ràng buộc. Nếu sau buổi demo bạn thấy chưa phù hợp, chúng tôi nói thẳng.
