Por favor, use este identificador para citar o enlazar este ítem: https://repositorio.ufu.br/handle/123456789/49397
Registro completo de metadatos
Campo DCValorLengua/Idioma
dc.creatorQueiroz, Caio Cezar-
dc.date.accessioned2026-08-10T17:58:40Z-
dc.date.available2026-08-10T17:58:40Z-
dc.date.issued2026-07-07-
dc.identifier.citationQUEIROZ, Caio Cezar. Desenvolvimento de um framework de benchmarking para avaliação de modelos de linguagem proprietários e open source. 2026. 67 f. Trabalho de Conclusão de Curso (Graduação em Engenharia de Computação) – Universidade Federal de Uberlândia, Uberlândia, 2026.pt_BR
dc.identifier.urihttps://repositorio.ufu.br/handle/123456789/49397-
dc.description.abstractGenerative artificial intelligence technologies, especially Large Language Models (LLMs), have emerged as central tools in computational applications. However, the predominance of proprietary solutions raises questions about transparency, flexibility, and technological dependency. Therefore, the objective of this work is to present and evaluate an experimental framework for comparing proprietary and open-source language models, using quantitative metrics and standardized benchmarks. Models from the Gemini family (Google) and opensource alternatives such as LLaMA, GPT-OSS and Qwen were employed, evaluated through the Google Generative AI API and Groq API, respectively. The study adopts a quantitative and experimental approach, using the ROUGE, BLEU, and BERTScore metrics, as well as the MMLU and HellaSwag benchmarks, complemented by analyses with the EvidentlyAI tool. The results demonstrate the feasibility of the system as a benchmarking tool, highlighting the potential of open solutions and the importance of transparent methodologies for LLM evaluation.pt_BR
dc.languageporpt_BR
dc.publisherUniversidade Federal de Uberlândiapt_BR
dc.rightsAcesso Abertopt_BR
dc.rights.urihttp://creativecommons.org/licenses/by-nc-nd/3.0/us/*
dc.subjectInteligência Artificial Generativapt_BR
dc.subjectLLMpt_BR
dc.subjectOpen Sourcept_BR
dc.subjectGrandes Modelos de Linguagempt_BR
dc.subjectBenchmarkingpt_BR
dc.subjectGenerative Artificial Intelligencept_BR
dc.subjectLarge Language Modelspt_BR
dc.titleDesenvolvimento de um framework de benchmarking para avaliação de modelos de linguagem proprietários e open sourcept_BR
dc.title.alternativeDevelopment of a benchmarking framework for the evaluation of proprietary and open-source language modelspt_BR
dc.typeTrabalho de Conclusão de Cursopt_BR
dc.contributor.advisor1Park, Kil Jin Brandini-
dc.contributor.advisor1Latteshttp://lattes.cnpq.br/2730204955649484pt_BR
dc.contributor.referee1Cardoso, Alexandre-
dc.contributor.referee1Latteshttp://lattes.cnpq.br/3767009717402045pt_BR
dc.contributor.referee2Cunha, Lucas Gonçalves-
dc.contributor.referee2Latteshttp://lattes.cnpq.br/3630562638569923pt_BR
dc.description.degreenameTrabalho de Conclusão de Curso (Graduação)pt_BR
dc.description.resumoAs tecnologias de inteligência artificial generativa, em especial os grandes modelos de linguagem (Large Language Models – LLMs), têm se destacado como ferramentas centrais em diversas aplicações computacionais. Entretanto, a predominância de soluções proprietárias levanta questões relacionadas à transparência, flexibilidade e dependência tecnológica. Assim, o objetivo deste trabalho é apresentar e avaliar um framework experimental de comparação entre modelos de linguagem proprietários e open source, utilizando métricas quantitativas e benchmarks padronizados. Foram empregados modelos da família Gemini (Google) e alternativas open source, como LLaMA, GPT-OSS e Qwen, avaliados por meio da Google Generative AI API e da Groq API, respectivamente. O estudo adota uma abordagem quantitativa e experimental, utilizando as métricas ROUGE, BLEU, BERTScore e os benchmarks MMLU e HellaSwag, complementados por análises com a ferramenta EvidentlyAI. Os resultados demonstram a viabilidade do sistema como ferramenta de benchmarking, ressaltando o potencial das soluções abertas e a importância de metodologias transparentes para a avaliação de LLMs.pt_BR
dc.publisher.countryBrasilpt_BR
dc.publisher.courseEngenharia da Computaçãopt_BR
dc.sizeorduration67pt_BR
dc.subject.cnpqCNPQ::CIENCIAS EXATAS E DA TERRA::CIENCIA DA COMPUTACAOpt_BR
dc.subject.cnpqCNPQ::ENGENHARIASpt_BR
dc.orcid.putcode223288218-
Aparece en las colecciones:TCC - Engenharia de Computação

Ficheros en este ítem:
Fichero Descripción TamañoFormato 
DesenvolvimentoFrameworkBenchmarking.pdfTCC5.72 MBAdobe PDFVista previa
Visualizar/Abrir


Este ítem está sujeto a una licencia Creative Commons Licencia Creative Commons Creative Commons