AI giấy tờ hỏng ở khúc bàn giao

AI giấy tờ hỏng ở khúc bàn giao

Tự động hóa tài liệu không chết vì OCR đọc sai, mà vì dữ liệu không chứng minh được mình đến từ đâu. Đây là framework cho team đang đưa AI vào workflow thật.

9 giờ sáng, chị Mai bên vận hành tín dụng mở Slack và thả một câu nghe rất quen: “AI đọc được hết rồi, sao hồ sơ vẫn bị trả về?”

Ở quầy pha của team chị, máy xay đã chạy: OCR đọc được chữ, parser tách được bảng, model trả về JSON nhìn sạch sẽ. Nhưng ly cà phê đưa tới khách lại thiếu nhãn: hạt nào, mẻ nào, ai pha, lấy từ dòng nào trên hóa đơn hay giấy xác nhận thu nhập. Đến lúc kiểm tra sau cùng, không ai nói chắc được con số kia đến từ tài liệu nào.

Đây là chỗ nhiều team Việt Nam đang hiểu sai khi áp dụng AI cho công việc giấy tờ: vấn đề không chỉ là “AI đọc đúng không”, mà là “dữ liệu đó có tự bảo vệ được khi bị hỏi lại không”.

Sơ đồ minh họa cho bài AI giấy tờ hỏng ở khúc bàn giao

Sơ đồ tóm tắt ý chính của bài viết.

Câu chuyện của Mai: OCR tốt vẫn chưa đủ

Mai phụ trách một workflow giả định trong một công ty tài chính: hồ sơ vay có chứng minh thu nhập, sao kê, hợp đồng, giấy tờ cá nhân, biểu mẫu nội bộ. Team đã dùng OCR — công nghệ nhận dạng chữ từ ảnh hoặc PDF — để giảm nhập liệu tay.

Kết quả ban đầu khá vui: tài liệu được đọc nhanh hơn, nhân viên đỡ phải gõ từng dòng. Nhưng sau vài tuần, rắc rối lòi ra ở đoạn đối soát:

Nói thẳng ra thì, tự động hóa giấy tờ không hỏng trong từng bước riêng lẻ. Nó thường hỏng ở handoff — điểm bàn giao giữa đọc tài liệu, trích xuất dữ liệu, kiểm tra nghiệp vụ, và lưu vào hệ thống.

Giống bartender pha đúng espresso nhưng đưa nhầm ly cho bàn bên cạnh. Vị có thể ngon, nhưng đơn hàng vẫn sai.

Khái niệm cần đổi: từ “đọc tài liệu” sang “dữ liệu có nguồn gốc”

Nếu bạn đang làm với hợp đồng, hóa đơn, hồ sơ bảo hiểm, hồ sơ vay, chứng từ kế toán hoặc tài liệu pháp lý, hãy để ý một từ: provenance — nguồn gốc chứng minh dữ liệu lấy từ đâu.

Trong workflow AI, provenance trả lời ba câu hỏi:

  1. Trường dữ liệu này được lấy từ tài liệu nào?
  2. Nằm ở trang nào, dòng nào, bảng nào?
  3. Vì sao hệ thống tin nó đủ đáng dùng, hay cần người kiểm tra?

Nguồn từ LlamaIndex nhấn mạnh một điểm rất thực tế trong tự động hóa tài liệu cho mortgage banking: lỗi không nhất thiết nằm ở chuyện tài liệu mờ hay OCR đọc kém. Có khi tài liệu rất rõ, nhưng khi dữ liệu đi qua nhiều bước, dấu vết bị rơi mất. Đến lúc bị audit hoặc hậu kiểm, team không chứng minh được con số trong hệ thống liên kết với tài liệu gốc như thế nào.

Dịch sang công việc hằng ngày: nếu AI điền giúp bạn một bảng Excel từ 30 file PDF, bảng đó chưa thật sự hữu ích cho production nếu mỗi ô không có “vé gửi xe” quay lại file gốc.

Framework 4C cho team đang tự động hóa tài liệu

Mai sau đó không hỏi “model nào mới nhất?” nữa. Team chị đổi câu hỏi thành: workflow này có đủ 4C chưa?

1. Capture — lấy đúng tài liệu và phiên bản

Trước khi AI đọc, hệ thống phải biết đang đọc tài liệu nào. Tên file kiểu scan_final_v2_new.pdf là công thức pha nhầm topping.

Checklist tối thiểu:

2. Cite — mọi dữ liệu trích xuất phải có dẫn chứng

Page-level citation — trích dẫn tới cấp trang — là cách lưu lại dữ liệu nằm ở trang nào trong tài liệu. Với bảng phức tạp, nên tiến thêm một bước: vùng tọa độ hoặc đoạn text gốc.

Ví dụ cụ thể:

{
  "field": "monthly_income",
  "value": "32000000",
  "document_id": "income-proof-2025-04",
  "page": 2,
  "source_text": "Thu nhập bình quân tháng: 32.000.000 VND"
}

Điểm quan trọng không phải JSON đẹp. Điểm quan trọng là khi người kiểm tra hỏi “số này ở đâu ra?”, bạn không phải mở 18 file PDF và cầu may.

3. Confidence — biết lúc nào nên nhờ người

Confidence scoring — điểm tin cậy — không nên chỉ là một con số trang trí. Nó phải quyết định hành động tiếp theo.

Ví dụ:

Đây là chỗ human-in-the-loop — người tham gia kiểm tra ở điểm rủi ro — có giá trị. Không phải bắt người duyệt mọi thứ, mà chỉ kéo người vào đúng đoạn AI không nên tự quyết.

4. Commit — ghi vào hệ thống kèm audit trail

Audit trail — dấu vết kiểm tra — là lịch sử cho biết ai hoặc hệ thống nào đã sửa gì, lúc nào, dựa trên chứng cứ nào.

Nhiều team dừng ở bước “AI xuất CSV”. Nhưng CSV không nói được dữ liệu đã qua kiểm tra chưa, ai xác nhận, và có thay đổi sau đó không. Nếu bạn làm trong tài chính, bảo hiểm, pháp lý, kế toán, hoặc vận hành nội bộ có kiểm soát, đây là khoảng trống nguy hiểm.

Commit đúng nghĩa là:

Hình dung thế này: một hồ sơ, ba con số thu nhập

Hình dung thế này: một hồ sơ có sao kê ngân hàng, hợp đồng lao động và giấy xác nhận lương. Cả ba đều có thông tin thu nhập, nhưng không cùng định dạng.

Nếu workflow chỉ hỏi AI: “thu nhập tháng là bao nhiêu?”, model có thể chọn một con số hợp lý nhất. Nghe có vẻ tiện, nhưng trong nghiệp vụ thật, “hợp lý” chưa đủ. Bạn cần biết quy tắc ưu tiên:

Đây là nơi agentic extraction — lớp trích xuất có khả năng làm nhiều bước theo quy tắc — bắt đầu đáng quan tâm. Không phải vì nó “thông minh” hơn parser thường, mà vì nó có thể được thiết kế để: đọc nhiều tài liệu, so khớp trường, phát hiện mâu thuẫn, gắn citation, rồi route sang người kiểm tra khi cần.

Nhưng nhớ: agent không thay thế quy trình nghiệp vụ. Nó chỉ làm rõ quy trình đó bằng máy.

Một buổi chiều để soi lại workflow của bạn

Nếu team bạn đang dùng AI để xử lý tài liệu, đừng bắt đầu bằng việc đổi model. Hãy dành một buổi chiều kiểm tra 5 câu dưới đây.

1. Chọn một field quan trọng nhất
Ví dụ: tổng tiền hóa đơn, mã số thuế, ngày hiệu lực hợp đồng, thu nhập tháng, số ngày nằm viện, điều khoản phạt.

2. Lần ngược field đó về file gốc
Bạn có biết nó đến từ tài liệu nào không? Trang nào? Đoạn nào? Nếu mất quá 2 phút để tìm lại, workflow đang thiếu provenance.

3. Tạo ba trạng thái xử lý

AUTO_ACCEPT: đủ rõ, đủ citation, đúng rule
NEEDS_REVIEW: có mâu thuẫn hoặc thiếu chắc chắn
REJECT_FOR_AUTOMATION: thiếu tài liệu, thiếu nguồn, không đủ điều kiện tự động

4. Bắt AI trả về cả dữ liệu lẫn chứng cứ

Prompt hoặc schema nên yêu cầu rõ:

{
  "field_name": "",
  "extracted_value": "",
  "source_document": "",
  "page_number": "",
  "evidence_text": "",
  "confidence_reason": "",
  "review_required": true
}

5. Đo bằng lỗi bàn giao, không chỉ lỗi đọc chữ
Đừng chỉ hỏi “OCR sai bao nhiêu?”. Hãy hỏi thêm:

Sau bước này, bạn sẽ nhìn AI document automation khác đi: không phải cuộc thi ai đọc PDF giỏi hơn, mà là thiết kế một luồng dữ liệu biết tự khai lý lịch.

Bẫy lớn: demo sạch quá làm team chủ quan

Demo thường dùng file đẹp, một phiên bản, ít ngoại lệ. Production thì khác: scan nghiêng, tài liệu cũ, biểu mẫu thay đổi, người dùng upload thiếu trang, hai phòng ban đặt tên field khác nhau.

Vì vậy, nếu vendor hoặc team nội bộ đưa demo “upload PDF rồi ra bảng”, bạn nên hỏi ngay:

Ly cà phê demo uống tại quầy lúc vắng khách có thể rất ổn. Nhưng giờ cao điểm mới biết quầy pha có quy trình hay chỉ đang nhờ một bạn pha giỏi gánh cả hệ thống.

Điều nên đổi trong đầu sau bài này

Đừng chọn AI cho công việc giấy tờ bằng câu hỏi “model nào đọc tốt nhất?”. Hãy chọn bằng câu hỏi: khi dữ liệu bị chất vấn, hệ thống có chỉ được nó đến từ đâu, vì sao được tin, và ai đã duyệt chưa?

Nếu trả lời được, automation mới có cơ hội đi qua khỏi demo. Nếu không, bạn chỉ đang pha một ly nhìn đẹp rồi quên ghi tên khách trên cốc.

---
Bụi Wire — nghiện đọc release notes lúc 2 giờ sáng

Nguồn tham khảo