🗺️ Capítulo 17 · Carrera

Roadmap de Aprendizaje 2026

Un camino estructurado de 10 meses para pasar de no saber nada a tener el nivel necesario para conseguir tu primer rol como Data Engineer, o para consolidarte como Senior si ya estás en la industria.

⏱️ Lectura: ~15 min
🎯 Nivel: Todos
Mes 1 - 2: Fundamentos e Infraestructura

Bases del Software y Datos

Antes de mover terabytes de datos, debes entender cómo funciona una computadora, la red y las bases de datos transaccionales.

  • Linux & Terminal: Navegación de directorios, grep, sed, permisos de archivos, SSH.
  • Git: Commits, branches, Pull Requests, merge conflicts.
  • Bases de Datos Relacionales: Qué es PostgreSQL, cómo levantar uno con Docker, diferencias entre OLTP y OLAP.
  • Data Warehouse Basics: Modelado Dimensional (Kimball), Star Schema.
Mes 3 - 4: El Lenguaje de los Datos

SQL Avanzado y Python

El 90% de tu tiempo lo pasarás escribiendo código en estos dos lenguajes.

  • SQL Nivel DE: Window Functions (ROW_NUMBER(), RANK(), LEAD/LAG), CTEs, agregaciones avanzadas, optimización de queries (EXPLAIN).
  • Python para Datos: Estructuras de datos, OOP básico, APIs REST (requests), manejo de JSON, Pandas y Polars.
  • Buenas Prácticas Python: Entornos virtuales (venv, uv), type hinting, PEP8.
Mes 5 - 6: Modern Data Stack

Herramientas Core

Aquí es donde construyes tus primeros pipelines ETL/ELT reales.

  • Orquestación: Apache Airflow. Escribir DAGs, Operators y TaskGroups.
  • Transformación: dbt (data build tool). Modelos, macros, tests.
  • Almacenamiento: Amazon S3 o Google Cloud Storage. Parquet vs CSV.
  • Data Warehouse Cloud: Snowflake o BigQuery. Levantar instancias de prueba y cargar datos.
Mes 7 - 8: Big Data & Streaming

Escalando el Procesamiento

Cuando Pandas ya no alcanza y los datos no caben en memoria, necesitas sistemas distribuidos.

  • Apache Spark: Arquitectura (Driver/Worker), PySpark, DataFrames, Particionamiento, Lazy Evaluation.
  • Lakehouse Architecture: Delta Lake, Apache Iceberg, Apache Hudi. Time travel y ACID en el Data Lake.
  • Streaming (Opcional pero recomendado): Apache Kafka básico (Topics, Producers, Consumers).
Mes 9 - 10: Nivel Senior

DevOps, Calidad y Arquitectura

Lo que diferencia a un Junior de un Senior no es qué herramientas conoce, sino cómo diseña, despliega y mantiene sistemas robustos.

  • Infrastructure as Code: Terraform básico.
  • CI/CD: GitHub Actions para testear código dbt y DAGs de Airflow.
  • Data Quality & Observability: Great Expectations, alertas en Slack, SLAs.
  • System Design: Lambda, Kappa y Data Mesh. Diseño de arquitecturas tolerantes a fallos.
💡 Consejo de Carrera

No intentes aprender todo a la vez (tutorial hell). Por cada mes de aprendizaje teórico, dedica dos semanas a construir un proyecto que integre lo aprendido. (Ver Capítulo 18: Portfolio de Proyectos).

Capítulo 16
Setup Local