Introducción a Pandas para análisis de datos
Pandas es la librería más usada en Python para análisis de datos. Con ella puedes cargar, limpiar, transformar y explorar datos de manera rápida y expresiva, sin salir de tu entorno Python. Si estás dando tus primeros pasos en ciencia de datos, aprender Pandas es tan importante como aprender Python mismo.
¿Qué es Pandas?
Pandas es una librería de código abierto construida sobre NumPy que introduce dos estructuras de datos fundamentales: el Series (una columna con índice) y el DataFrame (una tabla bidimensional con filas y columnas etiquetadas). Fue creada por Wes McKinney en 2008 mientras trabajaba en gestión de datos financieros, y hoy es parte esencial del stack de cualquier analista o científico de datos.
Lo que hace especial a Pandas es su capacidad para manejar datos heterogéneos (texto, números, fechas) en una sola estructura, combinada con una API muy legible. Operaciones que en SQL requerirían varias líneas o subqueries, en Pandas se expresan en una sola línea de código.
Instalación
Si ya tienes Python instalado, añadir Pandas a tu entorno es inmediato. Se recomienda trabajar dentro de un entorno virtual para mantener las dependencias de cada proyecto aisladas:
pip install pandas
Si usas Anaconda o Miniconda, Pandas ya viene incluido. También puedes instalarlo con
conda install pandas si prefieres el gestor de Conda.
Creando tu primer DataFrame
La forma más directa de crear un DataFrame es a partir de un diccionario de Python, donde cada clave es el nombre de una columna y cada valor es una lista con los datos de esa columna:
import pandas as pd
datos = {
'nombre': ['Ana', 'Carlos', 'María'],
'edad': [28, 35, 24],
'ciudad': ['Bogotá', 'Medellín', 'Cali']
}
df = pd.DataFrame(datos)
print(df)
Al ejecutar ese código verás una tabla perfectamente alineada en la consola, con índice
automático (0, 1, 2) y los nombres de columna como encabezados. A partir de ahí puedes
acceder a cualquier columna con df['nombre'] o a una fila con
df.iloc[0].
Operaciones básicas
Una vez que tienes un DataFrame, Pandas te da un arsenal de métodos para explorarlo y transformarlo. Estos son los que usarás en casi todos tus proyectos:
# Ver las primeras filas
df.head()
# Resumen estadístico de columnas numéricas
df.describe()
# Filtrar filas donde la edad es mayor a 25
mayores = df[df['edad'] > 25]
# Ordenar por edad de menor a mayor
df.sort_values('edad')
# Agrupar por ciudad y calcular la edad promedio
df.groupby('ciudad')['edad'].mean()
- df.head(n) — muestra las primeras n filas (por defecto 5)
- df.info() — tipos de datos y valores nulos por columna
- df.describe() — estadísticas descriptivas (media, desviación, cuartiles)
- df.dropna() — elimina filas con valores nulos
- df.groupby() — agrupa datos para calcular agregaciones por categoría
"En ciencia de datos, el 80% del tiempo lo gastas limpiando datos y el 20% analizándolos. Pandas hace que ese 80% sea mucho menos doloroso."
Esta guía es solo el punto de partida. Pandas tiene cientos de métodos para fusionar tablas, trabajar con fechas, pivotar datos y mucho más. La mejor forma de aprenderlos es aplicarlos en proyectos reales con datos que te interesen. Si quieres ir más rápido y con acompañamiento, nuestro curso de Python para Análisis de Datos te guía paso a paso desde los fundamentos hasta proyectos con datos reales.