MLOps & Edge Deployment

Kubeflow · BalenaCloud · TensorRT · GitHub Actions CI/CD · Edge Computing

MLOps & Edge Deployment Cover
Level 3 · Master Architect

Capítulo 1 · Introducción a MLOps & Desafíos en el Edge

Llevar modelos de Machine Learning desde un cuaderno Jupyter hasta un entorno de producción masivo y dispositivos remotos (Robots, Drones, Sensores Industriales) requiere una arquitectura automatizada, confiable y auditable. Esto es MLOps (Machine Learning Operations).

¿Qué es MLOps?
MLOps es la unión de Machine Learning, DevOps y Data Engineering. Su objetivo es automatizar todo el ciclo de vida de los modelos: ingesta de datos, entrenamiento continuo, validación, empaquetado, despliegue y monitoreo de la deriva de datos (Data Drift).
┌─────────────────────────────────────────────────────────────────────────────┐ │ CICLO DE VIDA MLOPS & EDGE │ │ │ │ [ Datos ] ──► [ Kubeflow Pipeline ] ──► [ Model Registry / MLflow ] │ │ │ │ │ │ ▼ ▼ │ │ [ Optimización TensorRT ] [ GitHub Actions CI/CD ] │ │ │ │ │ │ └────────────┬───────────────┘ │ │ ▼ │ │ [ BalenaCloud OTA Update ] │ │ │ │ │ ┌────────────┴────────────┐ │ │ ▼ ▼ │ │ [ Drone Edge Node ] [ Jetson Robot Node ] │ └─────────────────────────────────────────────────────────────────────────────┘

Por qué Edge Computing cambia las reglas del juego

A diferencia del despliegue Nube tradicional donde dispones de recursos ilimitados, los nodos Edge (NVIDIA Jetson Orin, Raspberry Pi 5, ESP32) enfrentan limitaciones extremas de latencia, conectividad y energía.

CriterioCloud InferenceEdge AI Deployment
Latencia50ms - 500ms (red)< 5ms (Local)
ConectividadRequiere 100% OnlineOpera Offline
Privacidad de datosTráfico por InternetProcesado On-Device
Ancho de BandaAlto consumo de redMínimo (solo telemetría)
Cuestionario — Capítulo 1
1. ¿Cuál es el principal beneficio de desplegar modelos de IA en dispositivos Edge en lugar de la Nube?
El procesamiento Edge elimina la latencia de red y permite que drones y robots tomen decisiones en milisegundos de forma autónoma.

Capítulo 2 · Kubeflow Pipelines & Experiment Tracking

Kubeflow es la plataforma estándar de la industria sobre Kubernetes para construir y desplegar pipelines de ML escalables y reproducibles.

python (Kubeflow SDK)
from kfp import dsl
from kfp.dsl import component, Output, Dataset, Model

@component(base_image='python:3.11-slim')
def train_edge_model(dataset: Input[Dataset], model: Output[Model]):
    import torch
    # Entrenamiento optimizado
    print("Entrenando red neuronal para Edge inference...")

@dsl.pipeline(
    name='Edge Vision Pipeline',
    description='Pipeline automatizado de vision industrial'
)
def vision_pipeline():
    train_task = train_edge_model()
Cuestionario — Capítulo 2
1. ¿Sobre qué infraestructura se ejecuta nativamente Kubeflow Pipelines?
Kubeflow se orquesta sobre Kubernetes, convirtiendo cada paso del pipeline en un Pod o contenedor aislado.

Capítulo 3 · Optimización de Modelos: ONNX, TensorRT & Quantization

Un modelo de PyTorch/TensorFlow crudo es demasiado pesado para un dispositivo embebido. En este módulo aprendemos a acelerar la inferencia hasta **10x** usando **TensorRT** y **Cuantización INT8**.

bash (TensorRT CLI)
# Exportar modelo PyTorch a ONNX format
python -m torch.onnx.export --model model.pt --output model.onnx

# Compilar motor de alta velocidad TensorRT en NVIDIA Jetson
trtexec --onnx=model.onnx --saveEngine=model_int8.engine --int8 --fp16
Cuestionario — Capítulo 3
1. ¿Qué beneficio aporta la cuantización FP32 a INT8 en modelos de IA?
La cuantización representa los pesos de 32 bits en enteros de 8 bits, reduciendo el consumo de memoria en un 75% y acelerando la velocidad de computación en hardware Edge.

Capítulo 4 · Despliegue de Flotas con BalenaCloud & Updates OTA

Gestionar miles de robots o cámaras de seguridad distribuidas por todo el mundo requiere actualizaciones Over-The-Air (OTA) seguras y a prueba de fallas con **BalenaCloud**.

dockerfile (balena-yml)
version: '2.1'
services:
  ai-inference-engine:
    build: ./engine
    privileged: true
    devices:
      - "/dev/nvhost-ctrl:/dev/nvhost-ctrl"
    restart: always
Cuestionario — Capítulo 4
1. ¿Qué significa una actualización OTA (Over-The-Air) en flotas de IoT/Edge?
BalenaCloud permite enviar nuevos contenedores de IA a miles de dispositivos en cualquier lugar del mundo de forma remota y segura.

Capítulo 5 · Cloud CI/CD Automático & GitOps

Integramos GitHub Actions y ArgoCD para que cada vez que subas código o nuevos datos a tu repositorio, el pipeline compile automáticamente las imágenes Docker multi-arquitectura (`arm64`/`amd64`).

yaml (GitHub Actions Workflow)
name: Build & Deploy Edge Container
on:
  push:
    branches: [ main ]
jobs:
  build-edge:
    runs-on: ubuntu-latest
    steps:
      - uses: actions/checkout@v4
      - name: BuildX ARM64 Container
        run: docker buildx build --platform linux/arm64 -t autonovations/edge-ai:latest --push .
Cuestionario — Capítulo 5
1. ¿Por qué es vital usar Docker Buildx con plataformas multi-arch (ej: linux/arm64)?
Buildx permite emular y construir contenedores ARM64 (Jetson, Raspberry Pi) directamente en servidores CI/CD basados en x86.

Capítulo 6 · Monitoreo de Data Drift & Proyecto Capstone E2E

Los modelos pierden precisión con el tiempo debido al cambio en las condiciones del mundo real (Concept & Data Drift). Aprendemos a detectarlo con Prometheus + Evidently AI y disparar re-entrenamientos automáticos.

┌─────────────────────────────────────────────────────────────────────────────┐ │ PROYECTO INTEGRADOR FINAL (CAPSTONE) │ │ │ │ [ Cámara Nube/Edge ] ──► [ Inferencia TensorRT ] ──► [ Telemetría MQTT ] │ │ │ │ │ ▼ │ │ [ Re-entrenamiento Auto ] ◄── [ Alerta Drift ] ◄── [ Evidently AI Dashboard]│ └─────────────────────────────────────────────────────────────────────────────┘
Cuestionario Final — Capítulo 6
1. ¿Qué se entiende por Data Drift en producción?
El Data Drift ocurre cuando la distribución de los datos reales del entorno cambia, requiriendo re-entrenar el modelo con nuevos ejemplos.
¡Curso Finalizado! Volver al Inicio