Aplicação de LLMs open-weight na automação de testes web: estudo comparativo utilizando Python e Selenium
Data
2026-07-21
Autores
Lattes da Autoria
Orientação Docente
Lattes da Orientação Docente
Título da Revista
ISSN da Revista
Título de Volume
Editor
Resumo
A automação de testes de software contribui para reduzir custos, ampliar a cobertura dos testes e aumentar a confiabilidade no desenvolvimento de sistemas. Nesse contexto, modelos de linguagem de grande porte (Large Language Models - LLMs) têm sido explorados como apoio à geração de scripts de testes automatizados. Entretanto, o custo de modelos comerciais pode limitar sua adoção, especialmente por equipes e organizações com recursos restritos, tornando os modelos open-weight uma alternativa relevante. Este trabalho teve como objetivo comparar a eficácia de quatro modelos LLM open-weight na geração de testes automatizados para um ambiente e-commerce, utilizando Python, Selenium e Pytest. Foram avaliados os modelos GPT-OSS 120B, Gemma 4 26B, Llama 3.3 70B e Qwen3 Coder 480B. A análise considerou métricas de taxa de sucesso de execução (PASSRATE), cobertura dos requisitos, qualidade estática do código por meio do Score Pylint, complexidade ciclomática e categorias de defeitos identificadas. Os resultados permitiram observar diferenças entre os modelos quanto à capacidade de gerar scripts executáveis, aderentes aos requisitos e com qualidade estrutural adequada. A pesquisa contribui ao apresentar uma avaliação comparativa de modelos LLM open-weight aplicados à automação de testes, fornecendo subsídios para sua adoção em contextos de qualidade de software com recursos limitados.
Resumo em outro idioma
Software test automation contributes to reducing costs, increasing test coverage, and improving reliability in software development. In this context, Large Language Models (LLMs) have been explored as a supporting tool for generating automated test scripts. However, the cost of commercial models may limit their adoption, especially by teams and organizations with restricted resources, making open-weight models a relevant alternative. This study aimed to compare the effectiveness of four open-weight LLMs in generating automated tests for an e-commerce environment using Python, Selenium, and Pytest. The evaluated models were GPT-OSS 120B, Gemma 4 26B, Llama 3.3 70B, and Qwen3 Coder 480B. The analysis considered execution success rate (PASSRATE), requirements coverage, static code quality measured by the Pylint Score, cyclomatic complexity, and categories of defects identified in the generated scripts. The results showed differences among the models regarding their ability to generate executable scripts, meet the specified requirements, and produce structurally adequate code. This research contributes by presenting a comparative evaluation of open-weight LLMs applied to test automation, providing insights to support their adoption in software quality contexts with limited resources.
Descrição
Referência
LEAL, Jéssica Moreira. Aplicação de LLMs open-weight na automação de testes web: estudo comparativo utilizando Python e Selenium. 2026. 109 f. Trabalho de Conclusão de Curso (Bacharelado em Sistemas de Informação) – Departamento de Estatística e Informática, Universidade Federal Rural de Pernambuco, Recife, 2026.
Identificador dARK
Avaliação
Revisão
Suplementado Por
Referenciado Por
Licença Creative Commons
Exceto quando indicado de outra forma, a licença deste item é descrita como openAccess

