Document Retrieval-Aware Chunking (D-RAC): Universal Retrieval-Aware Ingestion of Enterprise Documents via PDF Normalization and Multimodal Markdown Conversion
Các tác giả trình bày Document Retrieval-Aware Chunking (D-RAC), một framework mở rộng quy trình ingestion tài liệu doanh nghiệp bằng cách chuẩn hóa mọi định dạng đầu vào thành PDF để khai thác khả năng render đáng tin cậy. Một lần chạy duy nhất qua multimodal LLM sẽ chuyển đổi các trang được render thành Markdown tối ưu cho retrieval, viết lại các bảng thành câu văn tự chủ và giữ nguyên hệ thống tiêu đề. Tiếp theo, hệ thống phân tích cú pháp xác định thành các đơn vị có ID và lập kế hoạch chia nhỏ bằng LLM trọng lượng nhẹ dựa trên định danh thay vì văn bản thuần túy. Trên tập dữ liệu mẫu gồm 236 tài liệu và 795 trang PDF, D-RAC xử lý toàn bộ corpus mà không có lỗi nào, giảm lượng token đầu ra giai đoạn chunking đi 95.7% và cắt giảm chi phí chunking từ 77.8% đến 85.6% so với agentic chunking tiêu chuẩn.
Trên tập benchmark gồm 236 tài liệu và 795 trang PDF, D-RAC chuyển đổi và chia nhỏ toàn bộ corpus trong 72 phút với 0 lỗi, tạo ra 1,748 chunk sẵn sàng cho retrieval.
D-RAC giảm 95.7% số token đầu ra ở giai đoạn chunking so với agentic chunking bằng frontier LLM.
Phương pháp này cắt giảm chi phí chunking từ 77.8% (theo giá GPT-4.1) xuống 85.6% (theo giá Gemini 2.5 Pro) và giảm 75% thời gian chunking.