Análise comparativa de LLMs no desenho de arquiteturas de software: modelagem de diagramas e estruturas de diretórios para Spring Boot

Imagem de Miniatura

Data

2026-07-22

Lattes da Autoria

Lattes da Orientação Docente

Título da Revista

ISSN da Revista

Título de Volume

Editor

Resumo

A adoção de Grandes Modelos de Linguagem (LLMs) na engenharia de software tem avançado rapidamente em tarefas de baixo nível, como a geração de código, mas seu uso em fases de alta abstração, como o design arquitetural, permanece pouco investigado empiricamente. Este trabalho apresenta um estudo empírico comparativo que avalia a capacidade de quatro modelos disponibilizados por diferentes provedores (GPT-5.5, Claude 4.8 Opus, Gemini 3.1 Pro e DeepSeek V4) na geração de artefatos arquiteturais tangíveis para o ecossistema Spring Boot. Adotando um paradigma de modelagem declarativa (PlantUML com notação C4 Model) e uma estratégia de Engenharia de Prompt baseada em definição de Persona, listas de restrições (Allowlist/Blocklist) e Chain-of-Thought, submeteu-se aos modelos o design de um sistema Encurtador de URLs com perfil read-heavy, em três execuções independentes por modelo. Os resultados indicam que Claude e Gemini produziram artefatos compiláveis nas três execuções, enquanto GPT-5.5 e DeepSeek apresentaram falhas sintáticas, com a principal fonte de variabilidade residindo na fidelidade sintática de baixo nível e na consistência arquitetural entre replicações, e não na compreensão do domínio. Conclui-se que, sob engenharia de prompt rigorosa, LLMs podem atuar como assistentes arquiteturais ("mesas de ressonância") úteis, embora ainda inaptos como decisores autônomos.

Resumo em outro idioma

The adoption of Large Language Models (LLMs) in software engineering has advanced rapidly in low-level tasks such as code generation, yet their use in high-abstraction phases such as architectural design remains empirically underexplored. This paper presents a comparative empirical study evaluating the ability of four LLMs made available by different providers (GPT-5.5, Claude 4.8 Opus, Gemini 3.1 Pro, and DeepSeek V4) to generate tangible architectural artifacts for the Spring Boot ecosystem. Adopting a declarative modeling paradigm (PlantUML with C4 Model notation) and a prompt-engineering strategy based on persona definition, constraint lists (allowlist/blocklist), and Chain-of-Thought reasoning, the models were tasked with designing a read-heavy URL shortener system, across three independent executions per model. Results indicate that Claude and Gemini produced compilable artifacts in all three executions, while GPT-5.5 and DeepSeek presented syntactic failures – with the main source of variability lying in low-level syntactic fidelity and in architectural consistency across replications, rather than in domain comprehension. We conclude that, under rigorous prompt engineering, LLMs can act as useful architectural assistants (”sounding boards”), while remaining unfit as autonomous decision-makers.

Descrição

Referência

SILVA JUNIOR, Estom Paulino da. Análise comparativa de LLMs no desenho de arquiteturas de software: modelagem de diagramas e estruturas de diretórios para Spring Boot. 2026. 35 f. Trabalho de Conclusão de Curso (Bacharelado em Sistemas de Informação) – Departamento de Estatística e Informática, Universidade Federal Rural de Pernambuco, Recife, 2026.

Identificador dARK

Avaliação

Revisão

Suplementado Por

Referenciado Por

Licença Creative Commons

Exceto quando indicado de outra forma, a licença deste item é descrita como openAccess