Use este identificador para citar ou linkar para este item:
https://repositorio.ufu.br/handle/123456789/50049| ORCID: | http://orcid.org/0009-0002-0194-3660 |
| Tipo do documento: | Trabalho de Conclusão de Curso |
| Tipo de acesso: | Acesso Aberto |
| Título: | Emprego de visão computacional para identificação de comportamento suspeito no varejo |
| Autor(es): | Menezes, Luis Felipe Costa Fernandes de |
| Primeiro orientador: | Assis, Pedro Augusto Queiroz de |
| Primeiro membro da banca: | Souza, Fernando Lourenço de |
| Segundo membro da banca: | Borges, Arthur Pereira |
| Resumo: | O presente trabalho aborda o problema crônico das perdas de inventário por furtos no setor varejista, com o objetivo de comparar empiricamente o desempenho de duas conhecidas arquiteturas de aprendizado profundo na identificação automatizada de comportamentos suspeitos em vídeos: uma Rede Neural Convolucional Tridimensional (I3D) e um Trans- formador de Visão (TimeSFormer). Para a condução do estudo, a metodologia englobou a construção de um banco de dados próprio através da agregação, filtragem e segmentação de amostras de bases públicas, submetendo os modelos a dezesseis configurações experi- mentais. Tais experimentos variaram a estratégia de ajuste de pesos, a resolução temporal e o uso de imagens de fluxo óptico combinadas ao padrão de cores convencional. A avalia- ção incluiu ainda uma simulação de monitoramento contínuo em vídeos reais não editados, utilizando uma abordagem de inferência por janela deslizante. Os resultados demonstram que o ajuste profundo de todos os parâmetros da rede configura uma etapa estritamente essencial para a convergência e o aprendizado em ambas as arquiteturas. O Transfor- mador de Visão alcançou a melhor capacidade de generalização e controle de alarmes falsos no conjunto de teste, mas exige um investimento computacional substancialmente maior com elevado tempo de inferência. Em contrapartida, a Rede Neural Convolucional apresentou um comportamento preditivo conservador e com maior tendência a falsos po- sitivos, destacando-se, no entanto, pela alta eficiência e baixa latência em sua execução. Conclui-se que a aplicação mercadológica exige um compromisso técnico direto entre a alta seletividade de modelos baseados em atenção e a escalabilidade e rapidez das redes convolucionais, além de constatar que ambos os sistemas compartilham vulnerabilidades críticas e falhas de detecção frente a oclusões severas e movimentos sutis no ambiente comercial. |
| Abstract: | This work addresses the chronic problem of inventory losses due to theft in the retail sector, aiming to empirically compare the performance of two known deep learning architectures for the automated detection of suspicious behavior in videos: a Three-Dimensional Con- volutional Neural Network (I3D) and a Vision Transformer (TimeSFormer). To conduct the study, the methodology involved building a proprietary dataset through the aggrega- tion, filtering, and segmentation of samples from public datasets, subjecting the models to sixteen experimental configurations. These experiments varied the weight fine-tuning strategy, temporal resolution, and the use of optical flow images combined with standard RGB inputs. The evaluation also included a simulation of continuous monitoring on real, unedited videos using a sliding window inference approach. The results demonstrate that full fine-tuning of all network parameters is a strictly essential step for convergence and learning in both architectures. The Vision Transformer achieved the best generalization capability and false alarm control on the test set, attaining perfect precision; however, it requires substantially higher computational investment and exhibits high inference time. In contrast, the Convolutional Neural Network showed a more conservative predictive behavior with a greater tendency toward false positives, while standing out for its high efficiency and low latency. It is concluded that practical deployment requires a direct tech- nical trade-off between the high selectivity of attention-based models and the scalability and speed of convolutional networks. Additionally, both systems share critical vulnera- bilities and detection failures when faced with severe occlusions and subtle movements in retail environments. |
| Palavras-chave: | Inteligência Artificial Comportamento Suspeito Varejo Visão Computacional TimeSFormer I3D Redes Convolucionais 3D Transformers |
| Área(s) do CNPq: | CNPQ::OUTROS::ENGENHARIA MECATRONICA |
| Idioma: | por |
| País: | Brasil |
| Editora: | Universidade Federal de Uberlândia |
| Referência: | MENEZES, Luis Felipe Costa Fernandes de. Emprego de visão computacional para identificação de comportamento suspeito no varejo. 2026. 72 f. Trabalho de Conclusão de Curso (Graduação em Engenharia Mecatrônica) – Universidade Federal de Uberlândia, Uberlândia, 2026. |
| URI: | https://repositorio.ufu.br/handle/123456789/50049 |
| Data de defesa: | 21-Mai-2026 |
| Aparece nas coleções: | TCC - Engenharia Mecatrônica |
Arquivos associados a este item:
| Arquivo | Descrição | Tamanho | Formato | |
|---|---|---|---|---|
| Emprego de visão computacional para identificação de comportamento suspeito no varejo.pdf | 7.98 MB | Adobe PDF | ![]() Visualizar/Abrir |
Os itens no repositório estão protegidos por copyright, com todos os direitos reservados, salvo quando é indicado o contrário.
