Por favor, use este identificador para citar o enlazar este ítem: https://repositorio.ufu.br/handle/123456789/48841
ORCID:  http://orcid.org/0009-0007-9815-1083
Tipo de documento: Trabalho de Conclusão de Curso
Tipo de acceso: Acesso Aberto
Título: Extração de tópicos de transcrições de vídeos do YouTube sobre desenvolvimento de software com LLMs
Título (s) alternativo (s): Topic extraction from YouTube video transcripts on software development with LLMs
Autor: Seki, Ian de Barros
Primer orientador: Rocha, Adriano
Primer miembro de la banca: Tuma, Carlos Cesar Mansur
Segundo miembro de la banca: Natal, Igor da Penha
Resumen: Este trabalho investiga o uso de Large Language Models (LLMs) para a extração de tópicos a partir de transcrições educacionais de vídeos do YouTube na área de desenvolvimento de software. Foi projetado um pipeline completo composto por seleção de vídeos, coleta de transcrições e geração automática de tópicos com três modelos distintos de LLMs, variando a quantidade de tópicos solicitados (5/7/10) e considerando dois idiomas (português/inglês). A avaliação compara os tópicos gerados pelos modelos com uma lista de referência humana por meio de categorias de correspondência (Muito Alta, Alta, Baixa, Muito Baixa), de modo a capturar alinhamento e granularidade. Também foi incluída uma base de comparação com Latent Dirichlet Allocation (LDA). Os resultados indicam que, no escopo analisado, os LLMs apresentam desempenho superior ao LDA em termos de clareza, coesão e alinhamento semântico, e que solicitar 10 tópicos tende a aumentar as correspondências Muito Alta/Alta ao reduzir omissões. Em português, o GPT-4 apresentou os resultados mais consistentes; em inglês, Gemini e GPT-4 também apresentaram resultados competitivos na configuração com 10 tópicos. Também são discutidas ameaças à validade (viés de avaliador humano único, ruído nas transcrições e sensibilidade ao prompt) e apresentados trabalhos futuros, incluindo ajuste fino específico de domínio, análise de tópicos progressiva e expansão nos modelos avaliados.
Palabras clave: Extração de tópicos
Transcrições de vídeos do YouTube
Educação em desenvolvimento de software
Latent Dirichlet Allocation (LDA)
Large Language Models (LLMs)
Área (s) del CNPq: CNPQ::CIENCIAS EXATAS E DA TERRA::CIENCIA DA COMPUTACAO::METODOLOGIA E TECNICAS DA COMPUTACAO::SISTEMAS DE INFORMACAO
Idioma: por
País: Brasil
Editora: Universidade Federal de Uberlândia
Cita: Seki, Ian. Extração de tópicos de transcrições de vídeos do YouTube sobre desenvolvimento de software com LLMs. 2025. 57 f. Trabalho de Conclusão de Curso (Graduação em Sistemas de Informação) – Universidade Federal de Uberlândia, Monte Carmelo, 2026.
URI: https://repositorio.ufu.br/handle/123456789/48841
Fecha de defensa: 9-mar-2026
Aparece en las colecciones:TCC - Sistemas de Informação (Monte Carmelo)

Ficheros en este ítem:
Fichero Descripción TamañoFormato 
ExtracaoTopicosTranscricoes.pdfTrabalho de Conclusão de Curso1.24 MBAdobe PDFVista previa
Visualizar/Abrir


Los ítems de DSpace están protegidos por copyright, con todos los derechos reservados, a menos que se indique lo contrario.