Macario Filho, ValmirAlbuquerque Neto, Edivaldo Leitão de2026-08-062026ALBUQUERQUE NETO, Edivaldo Leitão de. Análise de comparação entre modelos compreensão visual de documentos usando LoRA. 2026. 44 f. Trabalho de Conclusão de Curso (Bacharelado em Ciência da Computação) – Departamento de Computação, Universidade Federal Rural de Pernambuco, Recife, 2026.https://arandu.ufrpe.br/handle/123456789/9008O crescimento do volume de documentos digitais tem impulsionado o desenvolvimento de soluções baseadas em Inteligência Artificial para automatizar tarefas de extração e processamento de informações. Nesse contexto, este trabalho realiza uma análise comparativa dos modelos LayoutLMv3, DocFormer e Donut aplicados à tarefa de compreensão de documentos, investigando o impacto da técnica Low-Rank Adaptation (LoRA) no processo de ajuste fino dos modelos. A metodologia adotada consistiu na aplicação de diferentes configurações de LoRA, variando os módulos-alvo, o rank, o alpha, o dropout e a taxa de aprendizado, com o objetivo de reduzir o número de parâmetros treináveis sem comprometer o desempenho preditivo. Os experimentos foram conduzidos utilizando métricas de Precisão, Revocação e F1-Score para avaliar os resultados. Entre os modelos analisados, o LayoutLMv3 apresentou o melhor desempenho geral, alcançando Precisão de 92,02 %, Revocação de 90,01 % e F1-Score de 91,00% utilizando adaptação nos módulos Query e Value, com aproximadamente 1,19 milhão de parâmetros treináveis. O Donut também apresentou resultados competitivos, obtendo Precisão de 89,75%, Revocação de 92,13% e F1-Score de 90,92% com adaptação nos módulos queryj, value, key e output, empregando resolução de entrada de 960 × 720 pixels e aproximadamente 544 mil parâmetros treináveis. Os resultados demonstram que o uso de LoRA permite reduzir significativamente o número de parâmetros atualizados durante o treinamento, preservando elevados índices de desempenho. Além disso, observou-se que diferentes estratégias de adaptação influenciam diretamente o equilíbrio entre o custo computacional e a qualidade preditiva. Conclui-se que a combinação de modelos multimodais para a compreensão de documentos e de técnicas de ajuste fino eficientes representa uma alternativa viável para aplicações de Processamento Inteligente de Documentos, permitindo a obtenção de resultados competitivos com menor demanda computacional.44 f.pt-BRopenAccesshttp://creativecommons.org/licenses/by/4.0/Inteligência artificialVisão computacionalDocumentos eletrônicosProcessamento de arquivo (Computação)Processamento de imagensAprendizado do computadorAnálise de comparação entre modelos compreensão visual de documentos usando LoRAbachelorThesisAttribution 4.0 International