Aula 03: Tabelas e Tipos de Dados
Módulo 1 — Análise Exploratória
Materiais da aula
Slides
Tabelas, tipos semânticos, pandas, validação e operações agrupadas.
Material de apoio
Estudo completo e reproduzível da base Airbnb NYC 2019.
Base de dados de apoio
Anúncios do Airbnb em Nova York, com localização, preço, avaliações e disponibilidade.
Base de dados
Usaremos New York City Airbnb Open Data (2019), disponível no Kaggle. Cada linha representa um anúncio e as 16 colunas descrevem identificadores, localização, tipo de acomodação, preço, avaliações e disponibilidade.
- 48.895 anúncios;
- cinco distritos de Nova York;
- três tipos de acomodação;
- datas, texto, categorias, coordenadas, contagens e valores ausentes;
- fonte: Kaggle — Airbnb in NYC.
Objetivos
- Reconhecer linha, coluna, célula e unidade observacional.
- Diferenciar população, amostra e processo de coleta.
- Distinguir tipo computacional e tipo semântico.
- Trabalhar com identificadores, categorias, quantidades, datas, texto e coordenadas.
- Diagnosticar ausências, duplicatas e valores inválidos.
- Selecionar, filtrar e transformar dados com pandas.
- Resumir grupos com
groupby,agge encadeamento de métodos.
Narrativa da aula
A aula começa com a pergunta “quanto custa ficar em Nova York?”. Antes de calcular uma média, a turma precisa descobrir o que a tabela realmente mede. O dataset permite mostrar que um número pode ser identificador, contagem, coordenada ou quantidade; e que uma data pode chegar do CSV como texto.
Depois da descrição da base, a aula acompanha um pipeline mínimo de qualidade: ler, inspecionar, converter tipos, compreender ausências, validar intervalos, selecionar linhas e colunas, criar variáveis e agrupar. A comparação final de preços por distrito e tipo de acomodação mostra como uma pergunta se transforma em operações tabulares verificáveis.
Material de estudo
O notebook vai além dos slides e inclui:
- dicionário de dados e diagnóstico reproduzível;
- conversão de categorias e datas;
- investigação do padrão de valores ausentes;
- validações de domínio e indicadores de qualidade;
- seleção com
loc,ilocequery; - tabelas cruzadas e proporções condicionais;
- índices hierárquicos,
stack,unstacke formato longo; - função reutilizável de auditoria;
- depuração de erros frequentes;
- miniestudo guiado e exercícios com respostas sugeridas.
Preparação
O arquivo da base está incluído no material. Para executar o notebook, são necessários Python, pandas, NumPy, Matplotlib e Seaborn.
Recomendação: execute as células em ordem uma primeira vez; depois reinicie o kernel e tente responder aos exercícios sem consultar as soluções.
Bibliografia da aula
Bibliografia principal
- Lau, Gonzalez e Nolan, Learning Data Science, Capítulo 2 — Data Scope: população, amostra e processo de coleta.
- Lau, Gonzalez e Nolan, Learning Data Science, Capítulo 9 — Wrangling Dataframes: granularidade, qualidade, ausências, transformações e reorganização de tabelas.
- Joel Grus, Data Science from Scratch, capítulos sobre Python, estatística e trabalho com dados: tipos computacionais, coleções, tabelas e operações básicas.
Bibliografia complementar
- Documentação do pandas, Group by: split-apply-combine: referência prática para
groupby, agregação e transformação.