Please use this identifier to cite or link to this item: https://repositorio.ufu.br/handle/123456789/48841
Full metadata record
DC FieldValueLanguage
dc.creatorSeki, Ian de Barros-
dc.date.accessioned2026-07-14T17:38:07Z-
dc.date.available2026-07-14T17:38:07Z-
dc.date.issued2026-03-09-
dc.identifier.citationSeki, Ian. Extração de tópicos de transcrições de vídeos do YouTube sobre desenvolvimento de software com LLMs. 2025. 57 f. Trabalho de Conclusão de Curso (Graduação em Sistemas de Informação) – Universidade Federal de Uberlândia, Monte Carmelo, 2026.pt_BR
dc.identifier.urihttps://repositorio.ufu.br/handle/123456789/48841-
dc.languageporpt_BR
dc.publisherUniversidade Federal de Uberlândiapt_BR
dc.rightsAcesso Abertopt_BR
dc.subjectExtração de tópicospt_BR
dc.subjectTranscrições de vídeos do YouTubept_BR
dc.subjectEducação em desenvolvimento de softwarept_BR
dc.subjectLatent Dirichlet Allocation (LDA)pt_BR
dc.subjectLarge Language Models (LLMs)pt_BR
dc.titleExtração de tópicos de transcrições de vídeos do YouTube sobre desenvolvimento de software com LLMspt_BR
dc.title.alternativeTopic extraction from YouTube video transcripts on software development with LLMspt_BR
dc.typeTrabalho de Conclusão de Cursopt_BR
dc.contributor.advisor1Rocha, Adriano-
dc.contributor.advisor1Latteshttp://lattes.cnpq.br/9672436935373713pt_BR
dc.contributor.referee1Tuma, Carlos Cesar Mansur-
dc.contributor.referee1Latteshttp://lattes.cnpq.br/0916152883066962pt_BR
dc.contributor.referee2Natal, Igor da Penha-
dc.contributor.referee2Latteshttp://lattes.cnpq.br/4275771362524151pt_BR
dc.description.degreenameTrabalho de Conclusão de Curso (Graduação)pt_BR
dc.description.resumoEste trabalho investiga o uso de Large Language Models (LLMs) para a extração de tópicos a partir de transcrições educacionais de vídeos do YouTube na área de desenvolvimento de software. Foi projetado um pipeline completo composto por seleção de vídeos, coleta de transcrições e geração automática de tópicos com três modelos distintos de LLMs, variando a quantidade de tópicos solicitados (5/7/10) e considerando dois idiomas (português/inglês). A avaliação compara os tópicos gerados pelos modelos com uma lista de referência humana por meio de categorias de correspondência (Muito Alta, Alta, Baixa, Muito Baixa), de modo a capturar alinhamento e granularidade. Também foi incluída uma base de comparação com Latent Dirichlet Allocation (LDA). Os resultados indicam que, no escopo analisado, os LLMs apresentam desempenho superior ao LDA em termos de clareza, coesão e alinhamento semântico, e que solicitar 10 tópicos tende a aumentar as correspondências Muito Alta/Alta ao reduzir omissões. Em português, o GPT-4 apresentou os resultados mais consistentes; em inglês, Gemini e GPT-4 também apresentaram resultados competitivos na configuração com 10 tópicos. Também são discutidas ameaças à validade (viés de avaliador humano único, ruído nas transcrições e sensibilidade ao prompt) e apresentados trabalhos futuros, incluindo ajuste fino específico de domínio, análise de tópicos progressiva e expansão nos modelos avaliados.pt_BR
dc.publisher.countryBrasilpt_BR
dc.publisher.courseSistemas de Informaçãopt_BR
dc.sizeorduration57pt_BR
dc.subject.cnpqCNPQ::CIENCIAS EXATAS E DA TERRA::CIENCIA DA COMPUTACAO::METODOLOGIA E TECNICAS DA COMPUTACAO::SISTEMAS DE INFORMACAOpt_BR
dc.orcid.putcode220732527-
Appears in Collections:TCC - Sistemas de Informação (Monte Carmelo)

Files in This Item:
File Description SizeFormat 
ExtracaoTopicosTranscricoes.pdfTrabalho de Conclusão de Curso1.24 MBAdobe PDFThumbnail
View/Open


Items in DSpace are protected by copyright, with all rights reserved, unless otherwise indicated.