Document Retrieval-Aware Chunking (D-RAC): Universal Retrieval-Aware Ingestion of Enterprise Documents via PDF Normalization and Multimodal Markdown Conversion
Les auteurs présentent Document Retrieval-Aware Chunking (D-RAC), un framework d'ingestion de documents d'entreprise qui normalise tout document d'entrée en PDF pour exploiter un rendu déterministe. Une seule passe de LLM multimodal convertit les pages rendues en Markdown optimisé pour la recherche, réécrivant les tableaux en prose autonome tout en préservant la hiérarchie des titres. Le découpage s'effectue ensuite de manière déterministe en unités adressables par ID, suivies d'une planification légère par LLM basée sur les identifiants. Sur un sous-ensemble de test de 236 documents et 795 pages PDF, D-RAC traite le corpus sans erreur, réduit les tokens de sortie de 95,7% et diminue les coûts de 77,8% à 85,6% par rapport au découpage agentique.
Sur le sous-ensemble de test de 236 documents et 795 pages PDF, D-RAC convertit et découpe l'ensemble du corpus en 72 minutes sans aucune erreur, produisant 1 748 blocs prêts pour la recherche.
D-RAC réduit les tokens de sortie de l'étape de découpage de 95,7% par rapport au découpage agentique avec des LLM de pointe.
Il réduit le coût du découpage de 77,8% (tarifs GPT-4.1) à 85,6% (tarifs Gemini 2.5 Pro) et le temps de découpage de 75%.