Introdução à Ciência de Dados
Fundamentos estatísticos, análise reprodutível e decisões orientadas por dados
Ciência de dados começa com uma boa pergunta — e termina com uma resposta que possa ser compreendida, verificada e usada com responsabilidade.
Nesta disciplina, conceitos estatísticos são desenvolvidos por meio de bases reais, simulações, visualizações e notebooks reproduzíveis.
Informações rápidas
Professor
Heitor Ramos
Departamento de Ciência da Computação — UFMG
heitor@dcc.ufmg.br
Horário e sala
Terças e quintas, 17h00–18h40
Sala 406 — CAD3
Atendimento
Ver horários de monitoria.
Sobre a disciplina
Introdução à Ciência de Dados apresenta ideias e ferramentas para transformar dados em evidência. O curso percorre o ciclo completo de uma investigação: formular perguntas, compreender e preparar bases, visualizar padrões, quantificar incerteza, testar hipóteses e comunicar conclusões.
O foco não é apenas executar métodos. Ao longo das aulas, discutimos por que um método funciona, quais suposições ele exige e quando uma conclusão não é sustentada pelos dados.
Dados reais
Cada sequência conceitual é guiada por uma base pública, com contexto, descrição das variáveis e análise exploratória.
Código reprodutível
Os gráficos apresentam seu código, e os notebooks ampliam a aula com explicações, simulações e exercícios.
Leitura crítica
Resultados são acompanhados por suposições, limitações e uma tradução para a decisão que motivou a análise.
Ementa
Dados e unidades observacionais. Estudos experimentais e observacionais. Organização, transformação e visualização de dados. Medidas de posição e dispersão. Amostragem e distribuições amostrais. Estimadores, viés, variância e funções de perda. Teorema Central do Limite. Intervalos de confiança. Testes de hipóteses, bootstrap e testes de permutação. Introdução à modelagem e comunicação reprodutível de resultados.
Objetivos de aprendizagem
Ao final da disciplina, espera-se que estudantes consigam:
Investigar
- formular perguntas que possam ser respondidas com dados;
- reconhecer unidade observacional, variáveis e população-alvo;
- descrever uma base antes de iniciar a modelagem;
- identificar problemas de qualidade e limites de mensuração.
Analisar e comunicar
- produzir resumos e visualizações adequados;
- quantificar variabilidade e incerteza;
- interpretar intervalos, testes e tamanhos de efeito;
- comunicar resultados de forma reprodutível e responsável.
Módulos do curso
O conteúdo segue a organização modular da disciplina. O Módulo 2 reúne as Aulas 08–15; o Módulo 3 começa na Aula 16 com correlação e avança para regressão e aprendizado de máquina.
Módulo 0 · Motivação
Ciência de dados, perguntas, responsabilidade, correlações espúrias e causalidade.
Módulo 1 · Análise Exploratória
Aulas 03–07: tabelas, tipos de dados, EDA, visualização, tendências centrais e dispersão. O módulo se encerra na Aula 07.
Módulo 2 · Inferência Estatística
Aulas 08–15: estimadores, intervalos, testes, bootstrap, permutação, poder e múltiplos testes.
Módulo 3 · Aulas 16–26
Correlação, regressão e aprendizado de máquina. Aulas 16–26 disponíveis.
Cronograma
Consulte a sequência das aulas, a divisão por módulos e os links para os materiais publicados.
Dinâmica das aulas
Antes da aula
Consulte a pergunta motivadora e, quando indicado, faça uma leitura ou exploração curta da base.
Durante a aula
Conceitos, derivações e simulações são conectados a um estudo de caso que guia o deck inteiro.
Depois da aula
Use o notebook como material de estudo: reproduza os resultados, altere parâmetros e responda às questões propostas.
Avaliação da aprendizagem
| Componente | Pontos |
|---|---|
| Prova 1 | 30 |
| Prova 2 | 30 |
| Listas (Moodle/VPL) | 10 |
| Projeto final (TP) | 30 |
| Total | 100 |
As datas, a política de recuperação e as regras de entrega serão publicadas no Moodle e no cronograma da disciplina.
Projeto final
O projeto vale 30 pontos e desenvolve uma investigação completa de ciência de dados, acompanhada em etapas ao longo do semestre.
Material de apoio e ferramentas
Aulas
Roteiro central com acesso aos slides e notebooks de cada encontro.
Ambiente computacional
Python, Jupyter e bibliotecas de análise e visualização. As instruções de instalação serão adicionadas conforme a necessidade.
Ambiente institucional
Avisos, atividades, entregas e notas são publicados no Moodle da disciplina.
Bibliografia
- Sam Lau, Joey Gonzalez e Deb Nolan. Learning Data Science — inglês, acesso aberto.
- Mine Çetinkaya-Rundel e Johanna Hardin. Introduction to Modern Statistics — inglês, acesso aberto.
- Ani Adhikari, John DeNero e David Wagner. Computational and Inferential Thinking — inglês, acesso aberto.
- Joel Grus. Data Science from Scratch — disponível também em português.
- Renato Assunção. Fundamentos Estatísticos para Ciência da Computação — português.
- Gareth James, Daniela Witten, Trevor Hastie, Robert Tibshirani e Jonathan Taylor. An Introduction to Statistical Learning — inglês, acesso aberto.
- Hotsite desta disciplina — slides, notebooks e materiais de apoio.
- Prof. Flávio Vinícius. Introdução à Ciência de Dados — material anterior da disciplina, utilizado como uma das bases para a elaboração deste site.
Por onde começar
Se esta é sua primeira visita, comece pela página de aulas e siga a sequência da disciplina. Cada página reúne o que deve ser lido, projetado e executado.