Saltar al contenidoIr al contenido
Cómo usar Python para análisis de datos desde cero
Python

Cómo usar Python para análisis de datos desde cero

Python es una de las herramientas más utilizadas en análisis de datos. Permite importar archivos, limpiar información, analizar datos, crear gráficos y ejecutar consultas SQL dentro del mismo entorno de trabajo.

En este artículo veremos cómo empezar a utilizar Python para análisis de datos desde cero, instalando las herramientas necesarias y trabajando con un archivo CSV de ejemplo.

Qué vamos a hacer

El proceso se divide en tres partes principales:

  • Instalar Python y el entorno de trabajo.
  • Realizar un análisis exploratorio de datos.
  • Entender el potencial de Python para análisis, automatización y modelos más avanzados.

La idea es trabajar con un archivo de datos, importarlo en Python, limpiarlo, analizarlo, crear gráficos y ejecutar consultas SQL.

Instalar Visual Studio Code

Para trabajar con Python localmente se puede utilizar Visual Studio Code.

Visual Studio Code es un editor de código que permite escribir, organizar y ejecutar proyectos de programación. Además, ofrece extensiones para trabajar cómodamente con Python y Jupyter Notebook.

Para instalarlo, se puede entrar a la página oficial de Visual Studio Code y descargar la versión correspondiente al sistema operativo.

Instalar Python

Después de instalar Visual Studio Code, el siguiente paso es instalar Python.

Python se puede descargar desde su sitio oficial. Una vez instalado, podremos ejecutar código Python en nuestra computadora.

Si trabajas en Windows, es importante marcar la opción para agregar Python al PATH durante la instalación, porque esto facilita ejecutar Python desde la terminal.

Instalar extensiones de Python y Jupyter

Dentro de Visual Studio Code se pueden instalar extensiones para trabajar con Python y Jupyter Notebook.

Para hacerlo, se abre la sección de extensiones y se busca la extensión de Python. También se puede instalar la extensión de Jupyter para trabajar con notebooks directamente desde el editor.

En algunos sistemas, Visual Studio Code puede pedir instalar herramientas adicionales. Si aparece un aviso solicitando componentes necesarios, se puede revisar e instalar lo que haga falta.

Instalar pip

pip es el gestor de paquetes de Python. Sirve para instalar librerías que luego podremos usar en nuestros proyectos.

Una vez instalado y configurado, podremos instalar paquetes desde la terminal usando comandos como:

pip install nombre_del_paquete

Instalar librerías para análisis de datos

Para este ejercicio se utilizan varias librerías importantes:

  • pandas: para trabajar con datos en tablas.
  • seaborn: para crear gráficos estadísticos.
  • sqlalchemy: para trabajar con SQL desde Python.
  • pandasql: para ejecutar consultas SQL sobre DataFrames.

Se pueden instalar desde la terminal con los siguientes comandos:

pip install pandas pip install seaborn pip install sqlalchemy pip install pandasql

Crear un archivo Jupyter Notebook

Después de instalar las librerías, se puede abrir Visual Studio Code y crear un nuevo archivo de Jupyter Notebook.

Un notebook permite ejecutar código por partes en bloques o celdas. Esto es muy útil para análisis de datos, porque podemos probar comandos, visualizar resultados y documentar el proceso paso a paso.

En una celda podemos importar las librerías necesarias.

import pandas as pd import seaborn as sns

Para ejecutar una celda en Jupyter Notebook se puede usar Shift + Enter.

Si todo funciona correctamente, el código se ejecutará sin errores.

Probar Python con una operación simple

Antes de trabajar con datos, podemos hacer una prueba sencilla.

2 + 2

Al ejecutar la celda, Jupyter Notebook mostrará el resultado.

Con esto confirmamos que Python está corriendo correctamente.

Qué es el análisis exploratorio de datos

El análisis exploratorio de datos, conocido como EDA por Exploratory Data Analysis, consiste en revisar un conjunto de datos para entender su estructura y comportamiento.

Durante esta etapa se busca responder preguntas como:

  • Cuántas filas tiene el dataset.
  • Cuántas columnas contiene.
  • Qué tipo de variables incluye.
  • Cuáles son los valores mínimos y máximos.
  • Cuáles son los promedios.
  • Si existen datos duplicados.
  • Si hay valores nulos.
  • Cómo se distribuyen los datos.

Esta etapa suele ocupar gran parte del trabajo diario de un analista de datos.

Obtener datos desde Google Ads

Para trabajar con un ejemplo real, se puede descargar un archivo de datos desde Google Ads.

Una opción es utilizar Keyword Planner para obtener ideas de palabras clave y sus estadísticas.

El proceso general consiste en buscar palabras clave relacionadas con un tema, descargar las ideas generadas y exportarlas en formato CSV.

Después de descargar el archivo, se puede guardar con un nombre claro, por ejemplo:

datos_google_ads.csv

Importar un archivo CSV con pandas

Para cargar el archivo CSV en Python, usamos la librería pandas.

df = pd.read_csv("datos_google_ads.csv")

En este ejemplo, df es el nombre de la variable donde se guarda el DataFrame.

Un DataFrame es una tabla de datos con filas y columnas.

Si el archivo no carga correctamente, puede ser porque el notebook y el archivo CSV no están en la misma carpeta. En ese caso, se puede mover el archivo a la misma carpeta o escribir la ruta completa del archivo.

Visualizar el DataFrame

Para ver los datos cargados, basta con escribir el nombre de la variable.

df

Jupyter Notebook mostrará una tabla con el contenido del archivo.

Conocer el tamaño del dataset

Una forma rápida de saber cuántas filas y columnas tiene el dataset es usar shape.

df.shape

El resultado muestra primero la cantidad de filas y luego la cantidad de columnas.

Obtener estadísticas descriptivas

La función describe() permite obtener estadísticas descriptivas de las columnas numéricas.

df.describe()

Con esta función se pueden ver datos como:

  • Cantidad de registros.
  • Promedio.
  • Desviación estándar.
  • Valor mínimo.
  • Percentiles.
  • Valor máximo.

Buscar duplicados

En análisis de datos es común revisar si existen valores duplicados.

Por ejemplo, si tenemos una columna llamada keyword, podemos comprobar duplicados de esta forma:

df["keyword"].duplicated().sum()

Esto devuelve la cantidad de duplicados encontrados en esa columna.

Eliminar valores nulos

También es frecuente encontrar filas con valores vacíos o nulos.

Para eliminar filas que tengan valores nulos en una columna específica, podemos usar dropna().

df = df.dropna(subset=["Competition Index"])

Esto elimina las filas donde la columna indicada tenga valores nulos.

También se puede aplicar el mismo proceso a otras columnas que sean importantes para el análisis.

Crear gráficos con Python

Los gráficos ayudan a entender mejor la distribución de los datos.

Por ejemplo, podemos crear un histograma para analizar cómo se distribuyen los índices de competencia.

df["Competition Index"].plot.hist()

Un histograma permite ver la frecuencia de los valores dentro de una variable.

Graficar búsquedas promedio por nivel de competencia

También podemos usar Seaborn para crear gráficos más visuales.

Por ejemplo, si queremos analizar la suma de búsquedas promedio por nivel de competencia, podemos agrupar los datos y graficarlos.

sns.barplot( data=df, x="Competition", y="Avg. monthly searches" )

Este tipo de gráfico ayuda a comparar categorías y entender mejor el comportamiento de los datos.

Ejecutar SQL dentro de Python

Una ventaja interesante de Python es que también podemos ejecutar consultas SQL sobre DataFrames.

Esto puede ser útil cuando necesitamos filtrar, seleccionar columnas o hacer agregaciones de una forma más cómoda usando sintaxis SQL.

Primero se importan las herramientas necesarias.

from sqlalchemy import create_engine from pandasql import sqldf

También se puede crear una función auxiliar para ejecutar consultas.

pysqldf = lambda q: sqldf(q, globals())

Preparar columnas para SQL

Antes de correr SQL, conviene evitar nombres de columnas con espacios, porque pueden causar problemas al escribir consultas.

Podemos renombrar columnas usando rename().

df = df.rename(columns={ "Avg. monthly searches": "average_searches", "Competition Index": "competition_index" })

Usar nombres descriptivos y con guiones bajos hace que las consultas sean más cómodas.

Crear una consulta SQL

Podemos escribir una consulta para seleccionar solo algunas columnas y filtrar palabras clave con cierto volumen de búsqueda.

q = """ SELECT keyword, average_searches, Competition, competition_index FROM df WHERE average_searches >= 500 """

Luego ejecutamos la consulta sobre el DataFrame.

top_export = pysqldf(q)

Para ver el resultado en el notebook:

top_export

Exportar el resultado a CSV

Después de procesar los datos, podemos exportar el resultado a un nuevo archivo CSV.

top_export.to_csv("datos_google_ads_procesados.csv", index=False)

Esto crea un archivo con los datos filtrados y procesados.

Qué se puede hacer con Python en análisis de datos

Python no solo sirve para cargar un archivo y hacer una limpieza básica.

Su verdadero potencial está en que permite trabajar con grandes volúmenes de datos y automatizar procesos que en herramientas como Excel serían más difíciles de manejar.

Con Python se pueden realizar tareas como:

  • Limpiar y transformar datos.
  • Crear reportes automáticos.
  • Conectar con APIs.
  • Hacer web scraping.
  • Analizar campañas de marketing.
  • Crear visualizaciones.
  • Ejecutar SQL sobre datos locales.
  • Preparar datos para modelos predictivos.

Librerías avanzadas para ciencia de datos

Además de pandas y Seaborn, Python cuenta con librerías más avanzadas para machine learning y deep learning.

Algunas de las más conocidas son:

  • scikit-learn: para machine learning clásico.
  • TensorFlow: para deep learning.
  • PyTorch: para modelos de aprendizaje profundo.

Estas librerías permiten ejecutar algoritmos complejos con pocas líneas de código, siempre que los datos estén preparados correctamente.

Python en el trabajo diario de un analista de datos

En el trabajo diario de un analista, muchas tareas no requieren modelos extremadamente complejos.

Con frecuencia, lo más importante es importar datos, limpiarlos, transformarlos, analizarlos y entregar resultados claros.

Python ayuda mucho en ese proceso porque permite automatizar tareas repetitivas y trabajar con datasets más grandes de forma ordenada.

Resumen del proceso

  • Instalar Visual Studio Code.
  • Instalar Python.
  • Instalar extensiones de Python y Jupyter.
  • Instalar librerías con pip.
  • Crear un Jupyter Notebook.
  • Importar un archivo CSV con pandas.
  • Explorar el dataset con shape y describe().
  • Buscar duplicados y valores nulos.
  • Crear gráficos.
  • Ejecutar SQL dentro de Python.
  • Exportar el resultado procesado a CSV.

Conclusión

Python es una herramienta muy potente para análisis de datos. Permite trabajar con archivos CSV, explorar datasets, limpiar información, crear gráficos y ejecutar consultas SQL dentro del mismo flujo de trabajo.

Aunque este ejemplo muestra una introducción sencilla, estos conceptos son muy útiles para tareas reales de análisis de datos.

Dominar herramientas como pandas, Jupyter Notebook, Seaborn y SQL dentro de Python puede ser un gran primer paso para entrar al mundo del análisis de datos y trabajar con información de forma más profesional.

Compartir
Escrito por
deybi
Soy un joven dominicano dedicado a la creación de páginas web, con un proyecto de vida claro y una visión enfocada en el crecimiento, la disciplina y el trabajo constante. Me esfuerzo cada día...

Deja un comentario