Python Data Science Numpy
Este repositório apresenta um portfólio de Python aplicados à Ciência de Dados, com ênfase especial na biblioteca NumPy (Numerical Python). O material guia o usuário desde os conceitos básicos da linguagem até a manipulação avançada de arrays multidimensionais, que são a base para computação científica e análise de dados em Python.
📖 Tabela de Conteúdos
- Introdução ao Python
- Configuração do ambiente (Anaconda, Google Colab)
- Primeiro contato com dados usando NumPy (
np.loadtxt) - Realizando a primeira operação vetorizada
- Características Básicas da Linguagem
- Operações matemáticas e expressões
- Variáveis, tipos de dados (
int,float,bool,str,None) - Conversão de tipos e formatação de strings (
f-strings)
- Trabalhando com Listas
- Criação, seleção, fatiamento e concatenação
- Principais métodos (
.sort(),.append(),.pop(),.copy())
- Estruturas de Repetição e Condicionais
- Laços
fore loops aninhados - List Comprehensions
- Estruturas
if,elif,else
- Laços
- NumPy
- Criação de Arrays:
- A partir de listas Python (
np.array) - A partir de arquivos externos (
np.loadtxt) - Comparativo de desempenho: NumPy vs. Listas
- A partir de listas Python (
- Operações com Arrays:
- Operações vetorizadas (array com escalar, array com array)
- Operações em arrays de duas dimensões
- Seleção em Arrays:
- Indexação e fatiamento (
slicing) - Indexação com arrays booleanos (filtros)
- Indexação e fatiamento (
- Atributos e Métodos:
- Atributos:
.shape,.ndim,.size,.dtype,.T - Métodos:
.tolist(),.reshape(),.resize()
- Atributos:
- Estatísticas com Arrays:
- Cálculo de média (
np.mean), desvio padrão (np.std) e soma (np.sum) - Uso do parâmetro
axispara operações em eixos específicos
- Cálculo de média (
- Criação de Arrays:
4. Fundamentos do Python
As seções iniciais constroem uma base sólida em Python, cobrindo desde a sintaxe e tipos de dados até estruturas de controle como laços e condicionais. Estes são pré-requisitos essenciais para qualquer pessoa que queira trabalhar com Data Science.
5. NumPy
Esta é a seção principal do notebook, onde você mergulhará no poder da computação numérica com NumPy. Os principais aprendizados incluem:
- Performance Superior: Uma demonstração prática (
%timeit) que prova por que os arrays NumPy são ordens de magnitude mais rápidos que as listas Python para operações numéricas. - Criação e Manipulação de Arrays: Aprenda a criar arrays multidimensionais a partir de diversas fontes e a inspecionar suas propriedades com atributos como
.shape,.ndime.dtype. - Poder da Vetorização: Entenda como realizar operações matemáticas complexas em arrays inteiros sem a necessidade de escrever laços
forexplícitos, resultando em um código mais limpo, legível e performático. - Seleção de Dados Avançada: Domine técnicas de fatiamento e indexação booleana para filtrar e selecionar dados de forma eficiente e intuitiva.
- Transformação de Dados: Utilize métodos como
.reshape()e.T(transposição) para moldar seus dados no formato necessário para análises e algoritmos de machine learning. - Análise Estatística: Calcule estatísticas descritivas fundamentais (média, desvio padrão, soma) de forma simples e eficiente, controlando o eixo da operação.
🚀 Como Executar
Para executar este notebook em sua máquina local, siga os passos abaixo.
Pré-requisitos
- Python 3.7 ou superior
- Jupyter Notebook ou JupyterLab (geralmente incluído em distribuições como Anaconda)
Passos
-
Clone o repositório:
git clone https://github.com/sergiocalazans/python-data-science-numpy.git -
Navegue até o diretório clonado:
cd python-data-science-numpy -
Instale a biblioteca NumPy (se ainda não tiver):
pip install numpy -
Inicie o Jupyter Notebook ou JupyterLab:
jupyter notebook # ou jupyter lab
Alternativamente, você pode abrir os notebooks diretamente no Google Colab clicando no badge abaixo, sem necessidade de instalação local.