Ancoragem curricular via RAG: um middleware para mitigação de alucinações na geração de questões alinhadas à BNCC

dc.contributor.advisorGarrozi, Cícero
dc.contributor.advisorLatteshttp://lattes.cnpq.br/0488054917286587
dc.contributor.authorCavalcante, Eduardo Estevão Nunes
dc.contributor.authorLatteshttp://lattes.cnpq.br/8347468440096771
dc.date.accessioned2026-07-14T12:33:21Z
dc.date.issued2026-07-06
dc.degree.departamentEstatística e Informática
dc.degree.graduationBacharelado em Sistemas da Informação
dc.degree.levelbachelor's degree
dc.degree.localRecife
dc.description.abstractA elaboração de avaliações alinhadas à Base Nacional Comum Curricular (BNCC) é um processo complexo e custoso para educadores e empresas de tecnologia educacional (EdTechs). Embora os Grandes Modelos de Linguagem (LLMs) apresentem potencial para a Geração Automática de Questões (AQG), sua aplicação direta no domínio normativo brasileiro esbarra em dois obstáculos, a alucinação de dados estruturados, em que o modelo inventa ou associa de forma incorreta códigos curriculares, e a transferência da complexidade da Engenharia de Prompt para o usuário final. Este trabalho apresenta a concepção e a implementação de um middleware de ancoragem curricular baseado no paradigma Retrieval-Augmented Generation (RAG) para o ecossistema educacional Gradepen, da Machlev Smart Applications. A solução atua como uma camada de abstração no backend, que infere a intenção do usuário, realiza uma recuperação determinística sobre a hierarquia curricular oficial modelada em JSON e orquestra a construção de um prompt enriquecido em XML. Esse prompt incorpora exemplos Few-Shot, o nível cognitivo da Taxonomia de Bloom Revisada e regras psicométricas para a formulação de distratores, antes de consultar uma API de LLM de propósito geral. Diferentemente da formulação mais difundida de RAG, a recuperação é determinística, baseada em correspondência exata sobre o vocabulário fechado e padronizado da BNCC. Implantada em ambiente de homologação, a solução opera de forma nativa no backend, o que dispensa serviços externos e reduz a complexidade e o custo computacional da operação. A abordagem busca assegurar que os códigos e os conteúdos curriculares das questões geradas existam, de fato, na base oficial, reduzindo a incidência de alucinações normativas e tornando os recursos de IA acessíveis a docentes sem exigir conhecimento técnico especializado, ainda que a revisão docente permaneça como etapa do fluxo.
dc.description.abstractxThe design of assessments aligned with the Brazilian National Common Curricular Base (BNCC) is a complex and costly process for educators and educational technology companies (EdTechs). Although Large Language Models (LLMs) show potential for Automatic Question Generation (AQG), their direct application to the Brazilian normative domain faces two obstacles: the hallucination of structured data, in which the model fabricates or incorrectly associates curricular codes, and the transfer of the complexity of Prompt Engineering to the end user. This work presents the design and implementation of a curricular grounding middleware based on the Retrieval-Augmented Generation (RAG) paradigm for the Gradepen educational ecosystem, developed by Machlev Smart Applications. The solution acts as an abstraction layer in the backend that infers the user’s intent, performs a deterministic retrieval over the official curricular hierarchy modeled in JSON, and orchestrates the construction of an enriched prompt in XML. This prompt incorporates Few-Shot examples, the cognitive level of the Revised Bloom’s Taxonomy, and psychometric rules for the formulation of distractors, before querying a general-purpose LLM API. Unlike the more widespread formulation of RAG, the retrieval is deterministic, based on exact matching over the closed and standardized vocabulary of the BNCC. Deployed in a staging environment, the solution runs natively in the backend, dispensing with external services and reducing the computational complexity and cost of the operation. The approach seeks to ensure that the curricular codes and contents of the generated questions actually exist in the official base, reducing the incidence of normative hallucinations and making AI resources accessible to teachers without requiring specialized technical knowledge, while teacher review remains a step in the workflow.
dc.format.extent26 f.
dc.identifier.citationCAVALCANTE, Eduardo Estevão Nunes. Ancoragem curricular via RAG: um middleware para mitigação de alucinações na geração de questões alinhadas à BNCC. 2026. 26 f. Trabalho de Conclusão de Curso (Bacharelado em Sistemas de Informação) – Departamento de Estatística e Informática, Universidade Federal Rural de Pernambuco, Recife, 2026.
dc.identifier.urihttps://arandu.ufrpe.br/handle/123456789/8892
dc.language.isopt_BR
dc.publisher.countryBrazil
dc.publisher.initialsUFRPE
dc.rightsopenAccess
dc.rights.licenseAttribution-NonCommercial-NoDerivatives 4.0 Internationalen
dc.rights.urihttp://creativecommons.org/licenses/by-nc-nd/4.0/
dc.subjectInteligência artificial
dc.subjectEngenharia de Prompt
dc.subjectMiddleware
dc.subjectProcessamento de linguagem natural (Computação)
dc.subjectRecuperação da informação
dc.subjectBase Nacional Comum Curricular
dc.titleAncoragem curricular via RAG: um middleware para mitigação de alucinações na geração de questões alinhadas à BNCC
dc.typebachelorThesis

Arquivos

Pacote original

Agora exibindo 1 - 1 de 1
Imagem de Miniatura
Nome:
tcc_reltec_eduardoestevaonunescavalcante.pdf
Tamanho:
1.15 MB
Formato:
Adobe Portable Document Format

Licença do pacote

Agora exibindo 1 - 1 de 1
Nenhuma Miniatura Disponível
Nome:
license.txt
Tamanho:
1.87 KB
Formato:
Item-specific license agreed upon to submission
Descrição: