AI giấy tờ hỏng ở khúc bàn giao
Tự động hóa tài liệu không chết vì OCR đọc sai, mà vì dữ liệu không chứng minh được mình đến từ đâu. Đây là framework cho team đang đưa AI vào workflow thật.
Bụi Wire9 giờ sáng, chị Mai bên vận hành tín dụng mở Slack và thả một câu nghe rất quen: “AI đọc được hết rồi, sao hồ sơ vẫn bị trả về?”
Ở quầy pha của team chị, máy xay đã chạy: OCR đọc được chữ, parser tách được bảng, model trả về JSON nhìn sạch sẽ. Nhưng ly cà phê đưa tới khách lại thiếu nhãn: hạt nào, mẻ nào, ai pha, lấy từ dòng nào trên hóa đơn hay giấy xác nhận thu nhập. Đến lúc kiểm tra sau cùng, không ai nói chắc được con số kia đến từ tài liệu nào.
Đây là chỗ nhiều team Việt Nam đang hiểu sai khi áp dụng AI cho công việc giấy tờ: vấn đề không chỉ là “AI đọc đúng không”, mà là “dữ liệu đó có tự bảo vệ được khi bị hỏi lại không”.

Sơ đồ tóm tắt ý chính của bài viết.
Câu chuyện của Mai: OCR tốt vẫn chưa đủ
Mai phụ trách một workflow giả định trong một công ty tài chính: hồ sơ vay có chứng minh thu nhập, sao kê, hợp đồng, giấy tờ cá nhân, biểu mẫu nội bộ. Team đã dùng OCR — công nghệ nhận dạng chữ từ ảnh hoặc PDF — để giảm nhập liệu tay.
Kết quả ban đầu khá vui: tài liệu được đọc nhanh hơn, nhân viên đỡ phải gõ từng dòng. Nhưng sau vài tuần, rắc rối lòi ra ở đoạn đối soát:
- Một trường
monthly_incometrong hệ thống không khớp với file gốc. - Nhân viên kiểm tra không biết nó đến từ sao kê hay giấy xác nhận lương.
- Có hai phiên bản tài liệu cùng tên, nhưng khác ngày ký.
- AI trích xuất đúng chữ, nhưng mapping sai vào trường nghiệp vụ.
Nói thẳng ra thì, tự động hóa giấy tờ không hỏng trong từng bước riêng lẻ. Nó thường hỏng ở handoff — điểm bàn giao giữa đọc tài liệu, trích xuất dữ liệu, kiểm tra nghiệp vụ, và lưu vào hệ thống.
Giống bartender pha đúng espresso nhưng đưa nhầm ly cho bàn bên cạnh. Vị có thể ngon, nhưng đơn hàng vẫn sai.
Khái niệm cần đổi: từ “đọc tài liệu” sang “dữ liệu có nguồn gốc”
Nếu bạn đang làm với hợp đồng, hóa đơn, hồ sơ bảo hiểm, hồ sơ vay, chứng từ kế toán hoặc tài liệu pháp lý, hãy để ý một từ: provenance — nguồn gốc chứng minh dữ liệu lấy từ đâu.
Trong workflow AI, provenance trả lời ba câu hỏi:
- Trường dữ liệu này được lấy từ tài liệu nào?
- Nằm ở trang nào, dòng nào, bảng nào?
- Vì sao hệ thống tin nó đủ đáng dùng, hay cần người kiểm tra?
Nguồn từ LlamaIndex nhấn mạnh một điểm rất thực tế trong tự động hóa tài liệu cho mortgage banking: lỗi không nhất thiết nằm ở chuyện tài liệu mờ hay OCR đọc kém. Có khi tài liệu rất rõ, nhưng khi dữ liệu đi qua nhiều bước, dấu vết bị rơi mất. Đến lúc bị audit hoặc hậu kiểm, team không chứng minh được con số trong hệ thống liên kết với tài liệu gốc như thế nào.
Dịch sang công việc hằng ngày: nếu AI điền giúp bạn một bảng Excel từ 30 file PDF, bảng đó chưa thật sự hữu ích cho production nếu mỗi ô không có “vé gửi xe” quay lại file gốc.
Framework 4C cho team đang tự động hóa tài liệu
Mai sau đó không hỏi “model nào mới nhất?” nữa. Team chị đổi câu hỏi thành: workflow này có đủ 4C chưa?
1. Capture — lấy đúng tài liệu và phiên bản
Trước khi AI đọc, hệ thống phải biết đang đọc tài liệu nào. Tên file kiểu scan_final_v2_new.pdf là công thức pha nhầm topping.
Checklist tối thiểu:
- Gán
document_idduy nhất cho mỗi file. - Lưu
uploaded_at,source_system,owner. - Nếu có nhiều phiên bản, đánh dấu bản đang hiệu lực.
- Không cho file trôi nổi ngoài workflow, ví dụ gửi riêng qua Zalo rồi nhập tay.
2. Cite — mọi dữ liệu trích xuất phải có dẫn chứng
Page-level citation — trích dẫn tới cấp trang — là cách lưu lại dữ liệu nằm ở trang nào trong tài liệu. Với bảng phức tạp, nên tiến thêm một bước: vùng tọa độ hoặc đoạn text gốc.
Ví dụ cụ thể:
{
"field": "monthly_income",
"value": "32000000",
"document_id": "income-proof-2025-04",
"page": 2,
"source_text": "Thu nhập bình quân tháng: 32.000.000 VND"
}
Điểm quan trọng không phải JSON đẹp. Điểm quan trọng là khi người kiểm tra hỏi “số này ở đâu ra?”, bạn không phải mở 18 file PDF và cầu may.
3. Confidence — biết lúc nào nên nhờ người
Confidence scoring — điểm tin cậy — không nên chỉ là một con số trang trí. Nó phải quyết định hành động tiếp theo.
Ví dụ:
- Trường rõ, khớp định dạng, có dẫn chứng: cho đi tiếp.
- Trường đọc được nhưng có hai nguồn mâu thuẫn: đưa vào hàng chờ kiểm tra.
- Trường thiếu citation: không được tự động ghi vào core system.
Đây là chỗ human-in-the-loop — người tham gia kiểm tra ở điểm rủi ro — có giá trị. Không phải bắt người duyệt mọi thứ, mà chỉ kéo người vào đúng đoạn AI không nên tự quyết.
4. Commit — ghi vào hệ thống kèm audit trail
Audit trail — dấu vết kiểm tra — là lịch sử cho biết ai hoặc hệ thống nào đã sửa gì, lúc nào, dựa trên chứng cứ nào.
Nhiều team dừng ở bước “AI xuất CSV”. Nhưng CSV không nói được dữ liệu đã qua kiểm tra chưa, ai xác nhận, và có thay đổi sau đó không. Nếu bạn làm trong tài chính, bảo hiểm, pháp lý, kế toán, hoặc vận hành nội bộ có kiểm soát, đây là khoảng trống nguy hiểm.
Commit đúng nghĩa là:
- Ghi dữ liệu vào hệ thống đích.
- Ghi kèm citation.
- Ghi trạng thái kiểm tra.
- Ghi log thay đổi.
- Cho phép truy ngược từ field về file gốc.
Hình dung thế này: một hồ sơ, ba con số thu nhập
Hình dung thế này: một hồ sơ có sao kê ngân hàng, hợp đồng lao động và giấy xác nhận lương. Cả ba đều có thông tin thu nhập, nhưng không cùng định dạng.
Nếu workflow chỉ hỏi AI: “thu nhập tháng là bao nhiêu?”, model có thể chọn một con số hợp lý nhất. Nghe có vẻ tiện, nhưng trong nghiệp vụ thật, “hợp lý” chưa đủ. Bạn cần biết quy tắc ưu tiên:
- Lấy thu nhập từ giấy xác nhận lương hay sao kê?
- Nếu hai nguồn lệch nhau thì chọn nguồn nào?
- Nếu tài liệu quá cũ thì có được dùng không?
- Nếu người duyệt sửa số, có lưu lý do không?
Đây là nơi agentic extraction — lớp trích xuất có khả năng làm nhiều bước theo quy tắc — bắt đầu đáng quan tâm. Không phải vì nó “thông minh” hơn parser thường, mà vì nó có thể được thiết kế để: đọc nhiều tài liệu, so khớp trường, phát hiện mâu thuẫn, gắn citation, rồi route sang người kiểm tra khi cần.
Nhưng nhớ: agent không thay thế quy trình nghiệp vụ. Nó chỉ làm rõ quy trình đó bằng máy.
Một buổi chiều để soi lại workflow của bạn
Nếu team bạn đang dùng AI để xử lý tài liệu, đừng bắt đầu bằng việc đổi model. Hãy dành một buổi chiều kiểm tra 5 câu dưới đây.
1. Chọn một field quan trọng nhất
Ví dụ: tổng tiền hóa đơn, mã số thuế, ngày hiệu lực hợp đồng, thu nhập tháng, số ngày nằm viện, điều khoản phạt.
2. Lần ngược field đó về file gốc
Bạn có biết nó đến từ tài liệu nào không? Trang nào? Đoạn nào? Nếu mất quá 2 phút để tìm lại, workflow đang thiếu provenance.
3. Tạo ba trạng thái xử lý
AUTO_ACCEPT: đủ rõ, đủ citation, đúng rule
NEEDS_REVIEW: có mâu thuẫn hoặc thiếu chắc chắn
REJECT_FOR_AUTOMATION: thiếu tài liệu, thiếu nguồn, không đủ điều kiện tự động
4. Bắt AI trả về cả dữ liệu lẫn chứng cứ
Prompt hoặc schema nên yêu cầu rõ:
{
"field_name": "",
"extracted_value": "",
"source_document": "",
"page_number": "",
"evidence_text": "",
"confidence_reason": "",
"review_required": true
}
5. Đo bằng lỗi bàn giao, không chỉ lỗi đọc chữ
Đừng chỉ hỏi “OCR sai bao nhiêu?”. Hãy hỏi thêm:
- Bao nhiêu field thiếu citation?
- Bao nhiêu hồ sơ bị người duyệt trả lại vì không truy được nguồn?
- Bao nhiêu lần dữ liệu bị sửa sau khi AI đã ghi?
- Bao nhiêu trường hợp có hai tài liệu mâu thuẫn?
Sau bước này, bạn sẽ nhìn AI document automation khác đi: không phải cuộc thi ai đọc PDF giỏi hơn, mà là thiết kế một luồng dữ liệu biết tự khai lý lịch.
Bẫy lớn: demo sạch quá làm team chủ quan
Demo thường dùng file đẹp, một phiên bản, ít ngoại lệ. Production thì khác: scan nghiêng, tài liệu cũ, biểu mẫu thay đổi, người dùng upload thiếu trang, hai phòng ban đặt tên field khác nhau.
Vì vậy, nếu vendor hoặc team nội bộ đưa demo “upload PDF rồi ra bảng”, bạn nên hỏi ngay:
- Có citation tới trang không?
- Có lưu text gốc không?
- Có trạng thái cần review không?
- Có xử lý tài liệu mâu thuẫn không?
- Có audit trail sau khi người sửa không?
Ly cà phê demo uống tại quầy lúc vắng khách có thể rất ổn. Nhưng giờ cao điểm mới biết quầy pha có quy trình hay chỉ đang nhờ một bạn pha giỏi gánh cả hệ thống.
Điều nên đổi trong đầu sau bài này
Đừng chọn AI cho công việc giấy tờ bằng câu hỏi “model nào đọc tốt nhất?”. Hãy chọn bằng câu hỏi: khi dữ liệu bị chất vấn, hệ thống có chỉ được nó đến từ đâu, vì sao được tin, và ai đã duyệt chưa?
Nếu trả lời được, automation mới có cơ hội đi qua khỏi demo. Nếu không, bạn chỉ đang pha một ly nhìn đẹp rồi quên ghi tên khách trên cốc.
---
Bụi Wire — nghiện đọc release notes lúc 2 giờ sáng