Análise de comparação entre modelos compreensão visual de documentos usando LoRA
Data
2026
Lattes da Autoria
Orientação Docente
Lattes da Orientação Docente
Título da Revista
ISSN da Revista
Título de Volume
Editor
Resumo
O crescimento do volume de documentos digitais tem impulsionado o desenvolvimento de soluções baseadas em Inteligência Artificial para automatizar tarefas de extração e processamento de informações. Nesse contexto, este trabalho realiza uma análise comparativa dos modelos LayoutLMv3, DocFormer e Donut aplicados à tarefa de compreensão de documentos, investigando o impacto da técnica Low-Rank Adaptation (LoRA) no processo de ajuste fino dos modelos. A metodologia adotada consistiu na aplicação de diferentes configurações de LoRA, variando os módulos-alvo, o rank, o alpha, o dropout e a taxa de aprendizado, com o objetivo de reduzir o número de parâmetros treináveis sem comprometer o desempenho preditivo. Os experimentos foram conduzidos utilizando métricas de Precisão, Revocação e F1-Score para avaliar os resultados. Entre os modelos analisados, o LayoutLMv3 apresentou o melhor desempenho geral, alcançando Precisão de 92,02 %, Revocação de 90,01 % e F1-Score de 91,00% utilizando adaptação nos módulos Query e Value, com aproximadamente 1,19 milhão de parâmetros treináveis. O Donut também apresentou resultados competitivos, obtendo Precisão de 89,75%, Revocação de 92,13% e F1-Score de 90,92% com adaptação nos módulos queryj, value, key e output, empregando resolução de entrada de 960 × 720 pixels e aproximadamente 544 mil parâmetros treináveis. Os resultados demonstram que o uso de LoRA permite reduzir significativamente o número de parâmetros atualizados durante o treinamento, preservando elevados índices de desempenho. Além disso, observou-se que diferentes estratégias de adaptação influenciam diretamente o equilíbrio entre o custo computacional e a qualidade preditiva. Conclui-se que a combinação de modelos multimodais para a compreensão de documentos e de técnicas de ajuste fino eficientes representa uma alternativa viável para aplicações de Processamento Inteligente de Documentos, permitindo a obtenção de resultados competitivos com menor demanda computacional.
Resumo em outro idioma
The growth in the volume of digital documents has driven the development of Artificial Intelligence-based solutions to automate information extraction and processing tasks. In this context, this work compares LayoutLMv3, DocFormer, and Donut models for document comprehension, investigating the impact of the Low-Rank Adaptation (LoRA) technique on model fine-tuning. The methodology adopted consisted of applying different LoRA configurations, varying target modules, rank, alpha, dropout, and learning rate, to reduce the number of trainable parameters without compromising predictive performance. The experiments were conducted using Precision, Recall, and F1-Score metrics to evaluate the results. Among the models analyzed, LayoutLMv3 showed the best overall performance, achieving Precision of 92.02%, Recall of 90.01%, and an F1-score of 91.00% with adaptation in the Query and Value modules, using approximately 1.19 million trainable parameters. The Donut model also presented competitive results, achieving an accuracy of 89.75%, Recall of 92.13%, and an F1-score of 90.92% with adaptation in the query, value, key, and output modules, employing an input resolution of 960 × 720 pixels and approximately 544,000 trainable parameters. The results demonstrate that LoRA enables significant parameter reduction during training while preserving high performance. Furthermore, it was observed that different adaptation strategies directly influence the balance between computational cost and predictive quality. It is concluded that the combination of multimodal models for document comprehension and efficient fine-tuning techniques represents a viable alternative for Intelligent Document Processing applications, allowing for competitive results with lower computational demand.
Descrição
Referência
ALBUQUERQUE NETO, Edivaldo Leitão de. Análise de comparação entre modelos compreensão visual de documentos usando LoRA. 2026. 44 f. Trabalho de Conclusão de Curso (Bacharelado em Ciência da Computação) – Departamento de Computação, Universidade Federal Rural de Pernambuco, Recife, 2026.
Identificador dARK
Avaliação
Revisão
Suplementado Por
Referenciado Por
Licença Creative Commons
Exceto quando indicado de outra forma, a licença deste item é descrita como openAccess

