Análise comparativa de LLMs no desenho de arquiteturas de software: modelagem de diagramas e estruturas de diretórios para Spring Boot
Data
2026-07-22
Autores
Lattes da Autoria
Orientação Docente
Lattes da Orientação Docente
Título da Revista
ISSN da Revista
Título de Volume
Editor
Resumo
A adoção de Grandes Modelos de Linguagem (LLMs) na engenharia de software tem avançado rapidamente em tarefas de baixo nível, como a geração de código, mas seu uso em fases de alta abstração, como o design arquitetural, permanece pouco investigado empiricamente. Este trabalho apresenta um estudo empírico comparativo que avalia a capacidade de quatro modelos disponibilizados por diferentes provedores (GPT-5.5, Claude 4.8 Opus, Gemini 3.1 Pro e DeepSeek V4) na geração de artefatos arquiteturais tangíveis para o ecossistema Spring Boot. Adotando um paradigma de modelagem declarativa (PlantUML com notação C4 Model) e uma estratégia de Engenharia de Prompt baseada em definição de Persona, listas de restrições (Allowlist/Blocklist) e Chain-of-Thought, submeteu-se aos modelos o design de um sistema Encurtador de URLs com perfil read-heavy, em três execuções independentes por modelo. Os resultados indicam que Claude e Gemini produziram artefatos compiláveis nas três execuções, enquanto GPT-5.5 e DeepSeek apresentaram falhas sintáticas, com a principal fonte de variabilidade residindo na fidelidade sintática de baixo nível e na consistência arquitetural entre replicações, e não na compreensão do domínio. Conclui-se que, sob engenharia de prompt rigorosa, LLMs podem atuar como assistentes arquiteturais ("mesas de ressonância") úteis, embora ainda inaptos como decisores autônomos.
Resumo em outro idioma
The adoption of Large Language Models (LLMs) in software engineering has advanced rapidly in low-level tasks such as code generation, yet their use in high-abstraction phases such as architectural design remains empirically underexplored. This paper presents a comparative empirical study evaluating the ability of four LLMs made available by different providers (GPT-5.5, Claude 4.8 Opus, Gemini 3.1 Pro, and DeepSeek V4) to generate tangible architectural artifacts for the Spring Boot ecosystem. Adopting a declarative modeling paradigm (PlantUML with C4 Model notation) and a prompt-engineering strategy based on persona definition, constraint lists (allowlist/blocklist), and Chain-of-Thought reasoning, the models were tasked with designing a read-heavy URL shortener system, across three independent executions per model. Results indicate that Claude and Gemini produced compilable artifacts in all three executions, while GPT-5.5 and DeepSeek presented syntactic failures – with the main source of variability lying in low-level syntactic fidelity and in architectural consistency across replications, rather than in domain comprehension. We conclude that, under rigorous prompt engineering, LLMs can act as useful architectural assistants (”sounding boards”), while remaining unfit as autonomous decision-makers.
Descrição
Referência
SILVA JUNIOR, Estom Paulino da. Análise comparativa de LLMs no desenho de arquiteturas de software: modelagem de diagramas e estruturas de diretórios para Spring Boot. 2026. 35 f. Trabalho de Conclusão de Curso (Bacharelado em Sistemas de Informação) – Departamento de Estatística e Informática, Universidade Federal Rural de Pernambuco, Recife, 2026.
Identificador dARK
Avaliação
Revisão
Suplementado Por
Referenciado Por
Licença Creative Commons
Exceto quando indicado de outra forma, a licença deste item é descrita como openAccess

