Please use this identifier to cite or link to this item: https://repositorio.ufu.br/handle/123456789/48841
ORCID:  http://orcid.org/0009-0007-9815-1083
Document type: Trabalho de Conclusão de Curso
Access type: Acesso Aberto
Title: Extração de tópicos de transcrições de vídeos do YouTube sobre desenvolvimento de software com LLMs
Alternate title (s): Topic extraction from YouTube video transcripts on software development with LLMs
Author: Seki, Ian de Barros
First Advisor: Rocha, Adriano
First member of the Committee: Tuma, Carlos Cesar Mansur
Second member of the Committee: Natal, Igor da Penha
Summary: Este trabalho investiga o uso de Large Language Models (LLMs) para a extração de tópicos a partir de transcrições educacionais de vídeos do YouTube na área de desenvolvimento de software. Foi projetado um pipeline completo composto por seleção de vídeos, coleta de transcrições e geração automática de tópicos com três modelos distintos de LLMs, variando a quantidade de tópicos solicitados (5/7/10) e considerando dois idiomas (português/inglês). A avaliação compara os tópicos gerados pelos modelos com uma lista de referência humana por meio de categorias de correspondência (Muito Alta, Alta, Baixa, Muito Baixa), de modo a capturar alinhamento e granularidade. Também foi incluída uma base de comparação com Latent Dirichlet Allocation (LDA). Os resultados indicam que, no escopo analisado, os LLMs apresentam desempenho superior ao LDA em termos de clareza, coesão e alinhamento semântico, e que solicitar 10 tópicos tende a aumentar as correspondências Muito Alta/Alta ao reduzir omissões. Em português, o GPT-4 apresentou os resultados mais consistentes; em inglês, Gemini e GPT-4 também apresentaram resultados competitivos na configuração com 10 tópicos. Também são discutidas ameaças à validade (viés de avaliador humano único, ruído nas transcrições e sensibilidade ao prompt) e apresentados trabalhos futuros, incluindo ajuste fino específico de domínio, análise de tópicos progressiva e expansão nos modelos avaliados.
Keywords: Extração de tópicos
Transcrições de vídeos do YouTube
Educação em desenvolvimento de software
Latent Dirichlet Allocation (LDA)
Large Language Models (LLMs)
Area (s) of CNPq: CNPQ::CIENCIAS EXATAS E DA TERRA::CIENCIA DA COMPUTACAO::METODOLOGIA E TECNICAS DA COMPUTACAO::SISTEMAS DE INFORMACAO
Language: por
Country: Brasil
Publisher: Universidade Federal de Uberlândia
Quote: Seki, Ian. Extração de tópicos de transcrições de vídeos do YouTube sobre desenvolvimento de software com LLMs. 2025. 57 f. Trabalho de Conclusão de Curso (Graduação em Sistemas de Informação) – Universidade Federal de Uberlândia, Monte Carmelo, 2026.
URI: https://repositorio.ufu.br/handle/123456789/48841
Date of defense: 9-Mar-2026
Appears in Collections:TCC - Sistemas de Informação (Monte Carmelo)

Files in This Item:
File Description SizeFormat 
ExtracaoTopicosTranscricoes.pdfTrabalho de Conclusão de Curso1.24 MBAdobe PDFThumbnail
View/Open


Items in DSpace are protected by copyright, with all rights reserved, unless otherwise indicated.