Aula 04: Análise Exploratória de Dados
Estrutura, granularidade, escopo, temporalidade e corretude
Pergunta da aula
Como transformar tabelas de pedidos, itens, clientes e avaliações em uma análise que preserve o significado de cada linha?
Materiais
Slides
Deck com 45 slides, códigos abertos, resultados e gráficos construídos com a base Olist.
Material de apoio
Notebook executado com auditoria, merges, exercícios e respostas comentadas.
Base de dados de apoio
E-commerce brasileiro com pedidos, clientes, itens, pagamentos e avaliações.
A base
Usamos o Brazilian E-Commerce Public Dataset by Olist, disponível no Kaggle. O conjunto original contém aproximadamente 100 mil pedidos brasileiros realizados entre 2016 e 2018 e permite observar pedidos por múltiplas dimensões: clientes, itens, pagamentos, entregas e avaliações.
Para o material didático, foi criada uma amostra reprodutível de 20 mil pedidos, mantendo todas as linhas relacionadas nas demais tabelas.
Unidade de observação
Cada arquivo possui uma granularidade diferente:
orders: um pedido;customers: um identificador de cliente associado ao pedido;order_items: um item dentro do pedido;order_payments: uma parcela ou forma de pagamento;order_reviews: uma avaliação registrada.
Objetivos de aprendizagem
Ao final da aula, você deverá conseguir:
- reconhecer estrutura e granularidade de tabelas relacionadas;
- testar chaves e cardinalidades antes de um
merge; - preservar a unidade de observação durante a preparação dos dados;
- interpretar ausências pelo processo de geração dos registros;
- avaliar escopo, cobertura temporal e regras de validade;
- distinguir padrões exploratórios de conclusões causais.
Fio condutor
A aula começa observando que pedidos atrasados possuem notas médias menores. Em seguida, voltamos ao processo necessário para confiar nessa comparação:
- identificar a granularidade de cada tabela;
- agregar itens, pagamentos e avaliações por pedido;
- validar os merges;
- interpretar datas e ausências;
- examinar distribuições e valores extremos;
- retornar à associação entre atraso e avaliação, agora com limites explícitos.
Material de estudos
O notebook inclui:
- função reutilizável de auditoria de tabelas;
- testes de chaves simples e compostas;
- demonstração do erro de contagem após merge ingênuo;
- agregações seguras por pedido;
- validação
many_to_oneeone_to_one; - reconciliação de valores financeiros;
- análise de ausências condicionada ao status;
- auditoria temporal e identificação de meses incompletos;
- distribuições de valor, frete, prazo e avaliações;
- exercícios, respostas sugeridas e desafios adicionais.
Leitura adicional
Bibliografia da aula
Bibliografia principal
- Lau, Gonzalez e Nolan, Learning Data Science, Capítulo 9 — Wrangling Dataframes: qualidade, ausências, estrutura, granularidade e preparação dos dados.
- Lau, Gonzalez e Nolan, Learning Data Science, Capítulo 10 — Exploratory Data Analysis: distribuições, relações, observações incomuns e investigação iterativa.
- Adhikari, DeNero e Wagner, Computational and Inferential Thinking, Capítulo 7 — Visualization: tabelas, distribuições e comparações exploratórias.
Bibliografia complementar
- Documentação do pandas, Merge, join, concatenate and compare: chaves, junções e validação de cardinalidade.