Use este identificador para citar ou linkar para este item:
https://repositorio.ufu.br/handle/123456789/48841| ORCID: | http://orcid.org/0009-0007-9815-1083 |
| Tipo do documento: | Trabalho de Conclusão de Curso |
| Tipo de acesso: | Acesso Aberto |
| Título: | Extração de tópicos de transcrições de vídeos do YouTube sobre desenvolvimento de software com LLMs |
| Título(s) alternativo(s): | Topic extraction from YouTube video transcripts on software development with LLMs |
| Autor(es): | Seki, Ian de Barros |
| Primeiro orientador: | Rocha, Adriano |
| Primeiro membro da banca: | Tuma, Carlos Cesar Mansur |
| Segundo membro da banca: | Natal, Igor da Penha |
| Resumo: | Este trabalho investiga o uso de Large Language Models (LLMs) para a extração de tópicos a partir de transcrições educacionais de vídeos do YouTube na área de desenvolvimento de software. Foi projetado um pipeline completo composto por seleção de vídeos, coleta de transcrições e geração automática de tópicos com três modelos distintos de LLMs, variando a quantidade de tópicos solicitados (5/7/10) e considerando dois idiomas (português/inglês). A avaliação compara os tópicos gerados pelos modelos com uma lista de referência humana por meio de categorias de correspondência (Muito Alta, Alta, Baixa, Muito Baixa), de modo a capturar alinhamento e granularidade. Também foi incluída uma base de comparação com Latent Dirichlet Allocation (LDA). Os resultados indicam que, no escopo analisado, os LLMs apresentam desempenho superior ao LDA em termos de clareza, coesão e alinhamento semântico, e que solicitar 10 tópicos tende a aumentar as correspondências Muito Alta/Alta ao reduzir omissões. Em português, o GPT-4 apresentou os resultados mais consistentes; em inglês, Gemini e GPT-4 também apresentaram resultados competitivos na configuração com 10 tópicos. Também são discutidas ameaças à validade (viés de avaliador humano único, ruído nas transcrições e sensibilidade ao prompt) e apresentados trabalhos futuros, incluindo ajuste fino específico de domínio, análise de tópicos progressiva e expansão nos modelos avaliados. |
| Palavras-chave: | Extração de tópicos Transcrições de vídeos do YouTube Educação em desenvolvimento de software Latent Dirichlet Allocation (LDA) Large Language Models (LLMs) |
| Área(s) do CNPq: | CNPQ::CIENCIAS EXATAS E DA TERRA::CIENCIA DA COMPUTACAO::METODOLOGIA E TECNICAS DA COMPUTACAO::SISTEMAS DE INFORMACAO |
| Idioma: | por |
| País: | Brasil |
| Editora: | Universidade Federal de Uberlândia |
| Referência: | Seki, Ian. Extração de tópicos de transcrições de vídeos do YouTube sobre desenvolvimento de software com LLMs. 2025. 57 f. Trabalho de Conclusão de Curso (Graduação em Sistemas de Informação) – Universidade Federal de Uberlândia, Monte Carmelo, 2026. |
| URI: | https://repositorio.ufu.br/handle/123456789/48841 |
| Data de defesa: | 9-Mar-2026 |
| Aparece nas coleções: | TCC - Sistemas de Informação (Monte Carmelo) |
Arquivos associados a este item:
| Arquivo | Descrição | Tamanho | Formato | |
|---|---|---|---|---|
| ExtracaoTopicosTranscricoes.pdf | Trabalho de Conclusão de Curso | 1.24 MB | Adobe PDF | ![]() Visualizar/Abrir |
Os itens no repositório estão protegidos por copyright, com todos os direitos reservados, salvo quando é indicado o contrário.
