Por favor, use este identificador para citar o enlazar este ítem:
https://repositorio.ufu.br/handle/123456789/49397Registro completo de metadatos
| Campo DC | Valor | Lengua/Idioma |
|---|---|---|
| dc.creator | Queiroz, Caio Cezar | - |
| dc.date.accessioned | 2026-08-10T17:58:40Z | - |
| dc.date.available | 2026-08-10T17:58:40Z | - |
| dc.date.issued | 2026-07-07 | - |
| dc.identifier.citation | QUEIROZ, Caio Cezar. Desenvolvimento de um framework de benchmarking para avaliação de modelos de linguagem proprietários e open source. 2026. 67 f. Trabalho de Conclusão de Curso (Graduação em Engenharia de Computação) – Universidade Federal de Uberlândia, Uberlândia, 2026. | pt_BR |
| dc.identifier.uri | https://repositorio.ufu.br/handle/123456789/49397 | - |
| dc.description.abstract | Generative artificial intelligence technologies, especially Large Language Models (LLMs), have emerged as central tools in computational applications. However, the predominance of proprietary solutions raises questions about transparency, flexibility, and technological dependency. Therefore, the objective of this work is to present and evaluate an experimental framework for comparing proprietary and open-source language models, using quantitative metrics and standardized benchmarks. Models from the Gemini family (Google) and opensource alternatives such as LLaMA, GPT-OSS and Qwen were employed, evaluated through the Google Generative AI API and Groq API, respectively. The study adopts a quantitative and experimental approach, using the ROUGE, BLEU, and BERTScore metrics, as well as the MMLU and HellaSwag benchmarks, complemented by analyses with the EvidentlyAI tool. The results demonstrate the feasibility of the system as a benchmarking tool, highlighting the potential of open solutions and the importance of transparent methodologies for LLM evaluation. | pt_BR |
| dc.language | por | pt_BR |
| dc.publisher | Universidade Federal de Uberlândia | pt_BR |
| dc.rights | Acesso Aberto | pt_BR |
| dc.rights.uri | http://creativecommons.org/licenses/by-nc-nd/3.0/us/ | * |
| dc.subject | Inteligência Artificial Generativa | pt_BR |
| dc.subject | LLM | pt_BR |
| dc.subject | Open Source | pt_BR |
| dc.subject | Grandes Modelos de Linguagem | pt_BR |
| dc.subject | Benchmarking | pt_BR |
| dc.subject | Generative Artificial Intelligence | pt_BR |
| dc.subject | Large Language Models | pt_BR |
| dc.title | Desenvolvimento de um framework de benchmarking para avaliação de modelos de linguagem proprietários e open source | pt_BR |
| dc.title.alternative | Development of a benchmarking framework for the evaluation of proprietary and open-source language models | pt_BR |
| dc.type | Trabalho de Conclusão de Curso | pt_BR |
| dc.contributor.advisor1 | Park, Kil Jin Brandini | - |
| dc.contributor.advisor1Lattes | http://lattes.cnpq.br/2730204955649484 | pt_BR |
| dc.contributor.referee1 | Cardoso, Alexandre | - |
| dc.contributor.referee1Lattes | http://lattes.cnpq.br/3767009717402045 | pt_BR |
| dc.contributor.referee2 | Cunha, Lucas Gonçalves | - |
| dc.contributor.referee2Lattes | http://lattes.cnpq.br/3630562638569923 | pt_BR |
| dc.description.degreename | Trabalho de Conclusão de Curso (Graduação) | pt_BR |
| dc.description.resumo | As tecnologias de inteligência artificial generativa, em especial os grandes modelos de linguagem (Large Language Models – LLMs), têm se destacado como ferramentas centrais em diversas aplicações computacionais. Entretanto, a predominância de soluções proprietárias levanta questões relacionadas à transparência, flexibilidade e dependência tecnológica. Assim, o objetivo deste trabalho é apresentar e avaliar um framework experimental de comparação entre modelos de linguagem proprietários e open source, utilizando métricas quantitativas e benchmarks padronizados. Foram empregados modelos da família Gemini (Google) e alternativas open source, como LLaMA, GPT-OSS e Qwen, avaliados por meio da Google Generative AI API e da Groq API, respectivamente. O estudo adota uma abordagem quantitativa e experimental, utilizando as métricas ROUGE, BLEU, BERTScore e os benchmarks MMLU e HellaSwag, complementados por análises com a ferramenta EvidentlyAI. Os resultados demonstram a viabilidade do sistema como ferramenta de benchmarking, ressaltando o potencial das soluções abertas e a importância de metodologias transparentes para a avaliação de LLMs. | pt_BR |
| dc.publisher.country | Brasil | pt_BR |
| dc.publisher.course | Engenharia da Computação | pt_BR |
| dc.sizeorduration | 67 | pt_BR |
| dc.subject.cnpq | CNPQ::CIENCIAS EXATAS E DA TERRA::CIENCIA DA COMPUTACAO | pt_BR |
| dc.subject.cnpq | CNPQ::ENGENHARIAS | pt_BR |
| dc.orcid.putcode | 223288218 | - |
| Aparece en las colecciones: | TCC - Engenharia de Computação | |
Ficheros en este ítem:
| Fichero | Descripción | Tamaño | Formato | |
|---|---|---|---|---|
| DesenvolvimentoFrameworkBenchmarking.pdf | TCC | 5.72 MB | Adobe PDF | ![]() Visualizar/Abrir |
Este ítem está sujeto a una licencia Creative Commons Licencia Creative Commons
