Use este identificador para citar ou linkar para este item:
https://repositorio.ufu.br/handle/123456789/49646| ORCID: | http://orcid.org/0009-0007-2315-8440 |
| Tipo do documento: | Trabalho de Conclusão de Curso |
| Tipo de acesso: | Acesso Aberto |
| Título: | SQL para ciência de dados aplicada em dados de saúde pública no Brasil |
| Título(s) alternativo(s): | SQL for data science applied to public health data in Brazil |
| Autor(es): | Cruz, Filipe Gabriel Oliveira da |
| Primeiro orientador: | Barioni, Maria Camila Nardini |
| Primeiro membro da banca: | Brasil, Christiane Regina Soares |
| Segundo membro da banca: | Paulino, Alessandra Aparecida |
| Resumo: | Embora pipelines tradicionais de Ciência de Dados dependam da exportação de grandes volumes de informação para ambientes imperativos externos, os Sistemas de Gerenciamento de Bancos de Dados (SGBDs) relacionais evoluíram para suportar lógicas analíticas complexas. O paradigma de análise In-database surge como uma solução para eliminar os custos de movimentação e serialização de dados através da rede, aproveitando otimizadores lógicos nativos. Este trabalho tem como objetivo demonstrar a viabilidade de se executar um ciclo de vida analítico unificado utilizando exclusivamente comandos SQL nativos e recursos analíticos do PostgreSQL. Para validar empiricamente a robustez e a expressividade da linguagem, implementou-se um estudo de caso aplicado sobre as notificações de dengue no Brasil em 2025 (SINAN), integrando-as a indicadores demográficos (IBGE) e de classificação ocupacional (CBO). O método de trabalho compreendeu o desenho de uma arquitetura resiliente dividida em uma Staging Area tolerante a falhas, saneamento de chaves, normalização na Terceira Forma Normal (3FN) e transposição de matrizes esparsas utilizando o operador CROSS JOIN LATERAL. A infraestrutura de dados foi acelerada por meio de indexação física (B-Tree) e consolidada em uma Materialized View. Os resultados comprovam a eficiência prática do ecossistema relacional, que processou um volume superior a 1,65 milhão de registros com tempos de resposta na ordem de um segundo, computando taxas de incidência, séries temporais cumulativas via Window Functions, engenharia de atributos etários e correlações estatísticas de Pearson. O trabalho contribui ao desmistificar o uso do SGBD relacional como repositório passivo, apresentando um roteiro reprodutível e performático voltado à Ciência de Dados puramente estruturada em SQL. |
| Abstract: | Although traditional Data Science pipelines rely on exporting large volumes of information to external imperative environments, relational Database Management Systems (DBMSs) have evolved to support complex analytical logic. The In-database analytics paradigm emerges as a solution to eliminate data movement and serialization costs across the network by leveraging native logical optimizers. This work aims to demonstrate the viability of executing a unified analytical lifecycle using exclusively native SQL commands and analytical resources of PostgreSQL. To empirically validate the language’s robustness and expressiveness, a case study was implemented on dengue notifications in Brazil in 2025 (SINAN), integrating them with demographic indicators (IBGE) and occupational classification (CBO). The work methodology comprised designing a resilient architecture divided into a fault-tolerant Staging Area, key cleansing, Third Normal Form (3FN) normalization, and the transposition of sparse matrices using the CROSS JOIN LATERAL operator. The data infrastructure was accelerated through physical indexing (B-Tree) and consolidated into a Materialized View. The results prove the practical efficiency of the relational ecosystem, which processed a volume exceeding 1.65 million records with response times on the order of one second, computing incidence rates, cumulative time series via Window Functions, age attribute engineering, and Pearson statistical correlations. The work contributes to demystifying the use of the relational DBMS as a passive repository, presenting a reproducible and performant roadmap focused on Data Science purely structured in SQL. |
| Palavras-chave: | Ciência de Dados Linguagem SQL Análise In-database PostgreSQL Saúde Pública Data Science SQL Language In-database Analytics PostgreSQL Public Health |
| Área(s) do CNPq: | CNPQ::CIENCIAS EXATAS E DA TERRA::CIENCIA DA COMPUTACAO::METODOLOGIA E TECNICAS DA COMPUTACAO::BANCO DE DADOS |
| Idioma: | por |
| País: | Brasil |
| Editora: | Universidade Federal de Uberlândia |
| Referência: | CRUZ, Filipe Gabriel Oliveira da. SQL para ciência de dados aplicada em dados de saúde pública no Brasil. 2026. 78 f. Trabalho de Conclusão de Curso (Graduação em Ciência da Computação) – Universidade Federal de Uberlândia, Uberlândia, 2026. |
| URI: | https://repositorio.ufu.br/handle/123456789/49646 |
| Data de defesa: | 21-Jul-2026 |
| Aparece nas coleções: | TCC - Ciência da Computação |
Arquivos associados a este item:
| Arquivo | Descrição | Tamanho | Formato | |
|---|---|---|---|---|
| SQLCiênciaDados.pdf | TCC | 6.83 MB | Adobe PDF | ![]() Visualizar/Abrir |
Os itens no repositório estão protegidos por copyright, com todos os direitos reservados, salvo quando é indicado o contrário.
