Quem nunca precisou lidar com dados bagunçados, sem padrão e/ou incompletos, e quis simplesmente deixar pra lá e observar pássaros? O que podemos descartar? Como podemos corrigi-los e estruturá-los? Como garantir que as alterações feitas ainda mantém fidelidade aos dados originais? Usando um dataset disponível no Kaggle, aqui vai a primeira de uma série de 4 partes sobre limpeza e tratamento de dados, que fiz utilizando Python:
FERRAMENTAS

Google Colab

ataques.csv

FEATURES

Análise exploratória

Big Data

ETL

Spark DataFrames

SQL