Please use this identifier to cite or link to this item:
https://repositorio.ufu.br/handle/123456789/48841| ORCID: | http://orcid.org/0009-0007-9815-1083 |
| Document type: | Trabalho de Conclusão de Curso |
| Access type: | Acesso Aberto |
| Title: | Extração de tópicos de transcrições de vídeos do YouTube sobre desenvolvimento de software com LLMs |
| Alternate title (s): | Topic extraction from YouTube video transcripts on software development with LLMs |
| Author: | Seki, Ian de Barros |
| First Advisor: | Rocha, Adriano |
| First member of the Committee: | Tuma, Carlos Cesar Mansur |
| Second member of the Committee: | Natal, Igor da Penha |
| Summary: | Este trabalho investiga o uso de Large Language Models (LLMs) para a extração de tópicos a partir de transcrições educacionais de vídeos do YouTube na área de desenvolvimento de software. Foi projetado um pipeline completo composto por seleção de vídeos, coleta de transcrições e geração automática de tópicos com três modelos distintos de LLMs, variando a quantidade de tópicos solicitados (5/7/10) e considerando dois idiomas (português/inglês). A avaliação compara os tópicos gerados pelos modelos com uma lista de referência humana por meio de categorias de correspondência (Muito Alta, Alta, Baixa, Muito Baixa), de modo a capturar alinhamento e granularidade. Também foi incluída uma base de comparação com Latent Dirichlet Allocation (LDA). Os resultados indicam que, no escopo analisado, os LLMs apresentam desempenho superior ao LDA em termos de clareza, coesão e alinhamento semântico, e que solicitar 10 tópicos tende a aumentar as correspondências Muito Alta/Alta ao reduzir omissões. Em português, o GPT-4 apresentou os resultados mais consistentes; em inglês, Gemini e GPT-4 também apresentaram resultados competitivos na configuração com 10 tópicos. Também são discutidas ameaças à validade (viés de avaliador humano único, ruído nas transcrições e sensibilidade ao prompt) e apresentados trabalhos futuros, incluindo ajuste fino específico de domínio, análise de tópicos progressiva e expansão nos modelos avaliados. |
| Keywords: | Extração de tópicos Transcrições de vídeos do YouTube Educação em desenvolvimento de software Latent Dirichlet Allocation (LDA) Large Language Models (LLMs) |
| Area (s) of CNPq: | CNPQ::CIENCIAS EXATAS E DA TERRA::CIENCIA DA COMPUTACAO::METODOLOGIA E TECNICAS DA COMPUTACAO::SISTEMAS DE INFORMACAO |
| Language: | por |
| Country: | Brasil |
| Publisher: | Universidade Federal de Uberlândia |
| Quote: | Seki, Ian. Extração de tópicos de transcrições de vídeos do YouTube sobre desenvolvimento de software com LLMs. 2025. 57 f. Trabalho de Conclusão de Curso (Graduação em Sistemas de Informação) – Universidade Federal de Uberlândia, Monte Carmelo, 2026. |
| URI: | https://repositorio.ufu.br/handle/123456789/48841 |
| Date of defense: | 9-Mar-2026 |
| Appears in Collections: | TCC - Sistemas de Informação (Monte Carmelo) |
Files in This Item:
| File | Description | Size | Format | |
|---|---|---|---|---|
| ExtracaoTopicosTranscricoes.pdf | Trabalho de Conclusão de Curso | 1.24 MB | Adobe PDF | ![]() View/Open |
Items in DSpace are protected by copyright, with all rights reserved, unless otherwise indicated.
