Please use this identifier to cite or link to this item: https://repositorio.ufu.br/handle/123456789/50470
Full metadata record
DC FieldValueLanguage
dc.creatorSouza Junior, Fabio Romero de-
dc.date.accessioned2026-09-28T16:42:23Z-
dc.date.available2026-09-28T16:42:23Z-
dc.date.issued2026-08-31-
dc.identifier.citationSOUZA JÚNIOR, Fabio Romero de. Comparação entre algoritmos de aprendizado por reforço profundo e controlador PID aplicados ao seguimento de linha. 2026. Dissertação (Mestrado em Engenharia Elétrica) – Universidade Federal de Uberlândia, Uberlândia, 2026. DOI: http://doi.org/10.14393/ufu.di.2026.694pt_BR
dc.identifier.urihttps://repositorio.ufu.br/handle/123456789/50470-
dc.description.abstractThis work presents an experimental comparative evaluation of six deep reinforcement learning algorithms Deep Deterministic Policy Gradient (DDPG), Twin Delayed DDPG (TD3), Soft Actor-Critic (SAC), Proximal Policy Optimization (PPO), Advantage Actor-Critic (A2C), and Model-Based Reinforcement Learning (MBRL) and a Proportional-Integral-Derivative (PID) controller, applied to the line-following task using computer vision on a differential mobile robot. The experiments were conducted in a simulated environment, considering three scenarios of increasing geometric complexity and two operating speeds, corresponding to 50% and 75% of the robot's maximum stable velocity. The evaluation considered metrics of precision, stability, control effort, completion rate, and robustness. The results indicate that DDPG achieved the best balance between accuracy and completion rate across all evaluated scenarios, maintaining consistent performance even as speed increased. The PID controller demonstrated competitive results under stable conditions, with lower control effort, but showed sensitivity to speed increases. The remaining reinforcement learning algorithms presented significantly higher tracking errors. Overall, the results reinforce the potential of deep reinforcement learning for continuous control tasks in mobile robotics, highlighting that the most suitable method depends on the specific requirements of the application.pt_BR
dc.description.sponsorshipCAPES - Coordenação de Aperfeiçoamento de Pessoal de Nível Superiorpt_BR
dc.language.isopt_BRpt_BR
dc.publisherUniversidade Federal de Uberlândiapt_BR
dc.rightsAcesso Abertopt_BR
dc.subjectAprendizado por Reforço Profundopt_BR
dc.subjectSeguimento de linhapt_BR
dc.subjectVisão Computacionalpt_BR
dc.subjectRobótica Móvelpt_BR
dc.subjectDeep Reinforcement Learningpt_BR
dc.subjectTrajectory Followingpt_BR
dc.subjectComputer Visionpt_BR
dc.subjectMobile Roboticspt_BR
dc.subjectPID Controllerpt_BR
dc.titleComparação entre algoritmos de aprendizado por reforço profundo e controlador PID aplicados ao seguimento de linhapt_BR
dc.title.alternativeComparison of deep reinforcement learning algorithms and PID controller applied to line followingpt_BR
dc.typeDissertaçãopt_BR
dc.contributor.advisor1Ramos, Daniel Costa-
dc.contributor.advisor1Latteshttp://lattes.cnpq.br/5562358915665822pt_BR
dc.contributor.referee1Carvalho, Sidney Roberto Dias De-
dc.contributor.referee1Latteshttp://lattes.cnpq.br/7075216254381144pt_BR
dc.contributor.referee2Lima, Gabriela Vieira-
dc.contributor.referee2Latteshttp://lattes.cnpq.br/6367204273336062pt_BR
dc.creator.Latteshttp://lattes.cnpq.br/3976533093866468pt_BR
dc.description.degreenameDissertação (Mestrado)pt_BR
dc.description.resumoEste trabalho apresenta uma avaliação experimental comparativa entre seis algoritmos de aprendizado por reforço profundo Deep Deterministic Policy Gradient (DDPG), Twin Delayed DDPG (TD3), Soft Actor-Critic (SAC), Proximal Policy Optimization (PPO), Advantage Actor-Critic (A2C) e Model-Based Reinforcement Learning (MBRL) e o controlador Proporcional-Integral-Derivativo (PID), aplicados ao problema de seguimento de linha por visão computacional em um robô móvel diferencial. Os experimentos foram conduzidos em ambiente simulado, considerando três cenários de complexidade geométrica crescente e duas velocidades de operação, correspondentes a 50% e 75% da velocidade máxima estável do robô. A avaliação considerou métricas de precisão, estabilidade, esforço de controle, taxa de conclusão e robustez. Os resultados indicam que o DDPG apresentou o melhor equilíbrio entre precisão e taxa de conclusão nos cenários avaliados, mantendo desempenho consistente mesmo com o aumento da velocidade. O PID demonstrou resultados competitivos em condições estáveis, com menor esforço de controle, mas apresentou sensibilidade ao aumento de velocidade. Os demais algoritmos de aprendizado por reforço apresentaram erros de rastreamento significativamente maiores. Os resultados reforçam o potencial do aprendizado por reforço profundo para tarefas de controle contínuo em robótica móvel, evidenciando que a escolha do método mais adequado depende dos requisitos específicos da aplicação.pt_BR
dc.publisher.countryBrasilpt_BR
dc.publisher.programPrograma de Pós-graduação em Engenharia Elétricapt_BR
dc.sizeorduration74pt_BR
dc.subject.cnpqCNPQ::ENGENHARIAS::ENGENHARIA ELETRICApt_BR
dc.identifier.doihttp://doi.org/10.14393/ufu.di.2026.694pt_BR
dc.subject.autorizadoEngenharia elétricapt_BR
dc.subject.autorizadoAlgorítmos computacionaispt_BR
dc.subject.autorizadoRobóticapt_BR
dc.subject.odsODS::ODS 9. Indústria, Inovação e infraestrutura - Construir infraestrutura resiliente, promover a industrialização inclusiva e sustentável, e fomentar a inovação.pt_BR
dc.identifier.capesdegreeprogramcode32006012001P9 -
dc.degree.levelMestrado Acadêmicopt_BR
dc.degree.departmentFaculdade de Engenharia Elétricapt_BR
Appears in Collections:DISSERTAÇÃO - Engenharia Elétrica

Files in This Item:
File SizeFormat 
Comparação entre algoritmos de aprendizado .pdf2.8 MBAdobe PDFView/Open


Items in DSpace are protected by copyright, with all rights reserved, unless otherwise indicated.