Skip to content
View Seba-LupeLab's full-sized avatar

Block or report Seba-LupeLab

Block user

Prevent this user from interacting with your repositories and sending you notifications. Learn more about blocking users.

You must be logged in to block users.

Content in all repositories owned by your account will be closed.
Maximum 250 characters. Please don’t include any personal information such as legal names or email addresses. Markdown is supported. This note will only be visible to you.
Report abuse

Contact GitHub support about this user’s behavior. Learn more about reporting abuse.

Report abuse
Seba-LupeLab/README.md

Sebastián Astudillo

Senior Data Engineer | DataOps & Cloud Architect | LLMOps & AI Platform Engineer

LinkedIn GitHub CV Location Status

English Version | Versión en Español | Versão em Português


English

Executive Summary

Senior Data Engineer and Cloud Architect specializing in designing, scaling, and maintaining mission-critical data pipelines, DataOps frameworks, and enterprise AI ecosystems. Nearly 4 years of experience building resilient cloud-native data architectures on Google Cloud Platform (GCP) and Snowflake, transforming complex manual workflows into 100% automated, zero-error production pipelines.

  • 30+ Enterprise Systems Delivered: Proven track record delivering production-grade data pipelines, LLMOps gateways, and infrastructure automation across Advertising & Media, Retail, Banking, Agrochem, and FinTech.
  • 100% End-to-End Automation: Replaced manual data workflows across multiple business verticals, reducing human intervention to zero.
  • 85% Processing Latency Reduction: Accelerated data ingestion and reporting cycles from 2 weeks to 2 days using event-driven BigQuery architectures and Google Cloud Pub/Sub.
  • FinOps & Cloud Governance: Architected multi-project GCP environments with automated billing exports, real-time cost guardrails, and serverless scale-to-zero microservices.

Key Impact Metrics

Metric Business & Technical Impact
Data Processing Latency 85% reduction in cycle times (from 14 days down to 2 days)
Manual Operations 0% human intervention in production pipelines (100% automated end-to-end)
Production Architectures 30+ enterprise systems architected and deployed on GCP and Snowflake
Cloud Governance & FinOps 10+ GCP projects actively managed with Terraform (IaC) and automated billing guardrails
Market Intelligence Scale 40+ competing brands ingested and categorized daily via multimodal vision pipelines
Query Latency (Self-Service) Under 4 seconds for conversational Natural Language to SQL analytics
Event Routing & Messaging Sub-second asynchronous dispatch via Google Cloud Pub/Sub and Cloud Eventarc

Engineering Principles & DataOps Standards

  • Zero-Touch Automation: If a data workflow requires manual human intervention more than once, it is engineered into a fully autonomous, self-healing pipeline.
  • Idempotency & Determinism: Every ingestion and transformation job is designed to be safely re-runnable across any date range without generating duplicate records or requiring manual rollbacks.
  • Data Contracts & Strict Typing: Upstream data streams must satisfy strict contract assertions (Pydantic v2 / JSON Schema) before promoting records to raw and curated warehouse tables.
  • FinOps by Design: Schema partitioning, clustering, scan byte limits, and BI Engine caches are mandatory across BigQuery datasets; serverless compute scales to zero when idle.
  • Proactive Observability: Automated smoke tests, data drift validations, and instant alerting mechanisms protect downstream BI consumers from silent failures.

Production Architectural Patterns & Guardrails

  • Idempotent Data Ingestion (MERGE + Partition Pruning): High-volume pipelines execute atomic MERGE statements scoped to specific date partitions, allowing retroactive backfills without locking tables or creating duplicate records.
  • Event-Driven & Streaming Ingestion (Pub/Sub + Eventarc): Decoupled data ingestion pipelines ingest events asynchronously, triggering lightweight Cloud Run microservices with dead-letter queues (DLQ) for automatic error isolation.
  • Serverless Scale-to-Zero Pipelines: Batch and scheduled scraping workloads are packaged into Cloud Run Jobs triggered via Cloud Storage events and Cloud Scheduler, incurring zero compute cost outside execution windows.
  • NL-to-SQL Semantic Guardrails: Conversational query engines use INFORMATION_SCHEMA metadata grounding, table allowlists, and BigQuery Dry Run execution (validating byte scan limits before query execution) to prevent runaway cloud costs and SQL injection.

Data Quality & Reliability Stack

  • Strict Schema Enforcement & Data Contracts: Pydantic v2 and JSON Schema validation on all API payloads, raw extraction streams, and warehouse promotion layers.
  • Automated CI/CD Testing: GitHub Actions and Azure Pipelines executing automated smoke tests, syntax linters, and integration tests before deployment.
  • Telemetry & Proactive Alerting: Centralized logging to BigQuery with automated webhook alerts to Slack and Microsoft Teams on task failure or data drift.

Architecture Blueprint (Standard Cloud Data Platform)

graph LR
    subgraph Ingestion [Ingestion & Event Streaming Layer]
        A[Playwright / Selenium Scrapers] --> B[Google Cloud Storage]
        C[REST APIs / Ad Networks] --> D[Google Cloud Pub/Sub]
        E[Scanned PDF Invoices / Files] --> B
        D --> F[Cloud Eventarc]
    end

    subgraph Processing [Processing & DataOps Layer]
        B --> G[Cloud Run Jobs / Functions]
        F --> G
        G --> H[Gemini 1.5 Multimodal / Pydantic Contracts]
    end

    subgraph Storage [Data Lakehouse & Warehouse]
        H --> I[(BigQuery Partitioned & Clustered Tables)]
        I --> J[(Snowflake Data Warehouse)]
    end

    subgraph Serving [Analytics & AI Serving Layer]
        I --> K[Vertex AI / NL-to-SQL Gateway]
        I --> L[Connected Sheets / Executive Dashboards]
        K --> M[MS Teams Bot / Web Chat Portal]
    end
Loading

Domain Expertise Matrix

Industry Domain Key Problems Solved Architectural Patterns
Advertising, Media & AdTech Multi-channel attribution, Share of Voice (SOV), Share of Investment (SOI), competitor creative monitoring Headless browser scrapers (Playwright), multimodal AI classifiers, automated Google Sheets sync
Corporate Finance & Accounting Manual vendor invoice processing, Chilean tax compliance (SII/DTE), multi-currency conversions Serverless PDF OCR with Gemini Vision, Pydantic schema validation, atomic database loading
Agrochemicals & Global Logistics Container shipping optimization, procurement tracking (LATAM to China), supply chain forecasting Snowflake data warehousing, mathematical optimization models (Python + Gurobi), Power BI integration
Retail, Banking & Automotive Distributed media plans, real-time order telemetry, tracking parameter validation Cloud Run microservices, WebSockets, Pub/Sub events, BigQuery partition-by-date pipelines

Languages

  • Spanish: Native
  • Portuguese: Fluent / Professional Working Proficiency
  • English: Reading & writing fluency (technical docs, async/chat) — interviews and verbal communication in Spanish or Portuguese only

Core Technical Competencies

Domain Technologies & Frameworks
Data Engineering & Warehousing Python, SQL, Google BigQuery, Snowflake, PostgreSQL, Google Cloud Pub/Sub, Partitioning & Clustering, Data Modeling, Data Contracts (Pydantic / Great Expectations), DBT, Idempotent Pipelines
Cloud & Distributed Infrastructure Google Cloud Platform (GCP), AWS, Docker, Cloud Run, Cloud Functions, Cloud SQL, Cloud Storage, Compute Engine, Eventarc, Cloud Composer (Airflow), IAP Security
DataOps, DevOps & CI/CD Terraform (IaC), GitHub Actions, Azure Pipelines, Secret Manager, Docker Compose, Automated Smoke Tests & Regression Suites
AI Systems & LLMOps Vertex AI, Gemini API, LiteLLM Proxy, LangChain, RAG Architectures, NL-to-SQL Engines, Multimodal OCR Vision, Prompt & Token Guardrails
Automation & Extraction Playwright, Selenium, Headless Browsers, WebSockets, REST APIs, FastAPI, Flask

Featured Enterprise Projects & Case Studies (White-Labeled / NDA Compliant)

Below is a curated selection of production architectures and automated data systems engineered for enterprise clients and internal operations.


1. Multimodal Financial OCR & Automated Invoice Ingestion Engine

  • Enterprise Vertical: Corporate Finance & Media Operations
  • Core Stack: Python, Gemini 1.5 Multimodal Vision, Google Cloud Storage, BigQuery, FastAPI, Next.js
  • Related Architecture Repository: data-engineering-toolkit
  • The Problem: Finance teams manually processed hundreds of multi-format, scanned PDF vendor invoices, purchase orders, and tax receipts every month, causing multi-day payment delays and error-prone data entry.
  • Engineering Solution:
    • Designed an asynchronous serverless ingestion pipeline.
    • Extracted tabular line items, tax IDs, withholding amounts, and currency conversions using Gemini 1.5 Multimodal Vision with strict JSON Schema validation (Pydantic).
    • Automated deduplication and atomic loading into BigQuery and PostgreSQL, triggering real-time validation webhooks.
  • Architecture Diagram:
graph LR
    A[Raw PDF Invoices] --> B[GCS Bucket]
    B --> C[Cloud Run Event Trigger]
    C --> D[Gemini 1.5 Vision OCR]
    D --> E[Pydantic Schema Validation]
    E --> F[(BigQuery DWH)]
    E --> G[(PostgreSQL DB)]
Loading
  • Quantifiable Impact: 100% end-to-end automation with zero manual data entry, reducing invoice processing time from 4 days to under 15 seconds per document.

2. Multi-Channel Natural Language to SQL Analytics Copilot

  • Enterprise Vertical: Multinational Consumer Electronics Enterprise
  • Core Stack: Vertex AI, Gemini API, BigQuery, FastAPI, Microsoft Bot Framework (Teams), Docker
  • Related Architecture Repository: data-engineering-toolkit
  • The Problem: Non-technical marketing and executive stakeholders submitted dozens of ad-hoc SQL report requests daily to the BI team, creating an analytics bottleneck with 48-72h turnaround times.
  • Engineering Solution:
    • Architected an enterprise-grade 3-layer conversational AI system (Frontend/Teams Bot -> FastAPI Middleware -> Vertex AI + BigQuery).
    • Implemented strict semantic schema grounding, prompt guardrails, and read-only sandboxed SQL execution with scan-cost estimation limits before query execution.
    • Delivered interactive visual responses via Microsoft Teams Adaptive Cards and a dedicated web chat portal.
  • Architecture Diagram:
graph LR
    A[User Query Teams / Web] --> B[FastAPI Middleware]
    B --> C[Vertex AI Schema Grounding]
    C --> D[SQL Sandbox & Scan Cost Limit]
    D --> E[(BigQuery Analytics Execution)]
    E --> F[Adaptive Cards / Visual Charts]
Loading
  • Quantifiable Impact: Reduced ad-hoc BI requests by 65%, providing instant, self-service data insights in less than 4 seconds.

3. High-Throughput Market Intelligence & Multimodal Ad Classifier

  • Enterprise Vertical: Cosmetics, Healthcare & Commercial Retail
  • Core Stack: Playwright, Cloud Run Jobs, BigQuery, Gemini Vision, Cloud Scheduler
  • Related Architecture Repository: data-engineering-toolkit
  • The Problem: Ingesting competitive advertising intelligence was performed through brittle manual portal exports, leaving historical data scattered across disconnected spreadsheets.
  • Engineering Solution:
    • Developed resilient headless browser scrapers (Playwright) orchestrated via Cloud Run Jobs and Cloud Scheduler.
    • Built a deterministic multimodal categorization pipeline that analyzes creative videos/images with Gemini Vision, generating automated video thumbnails and hierarchical brand taxonomies in BigQuery.
    • Implemented date-partitioned MERGE statements to guarantee complete idempotency and zero record duplication upon re-runs.
  • Architecture Diagram:
graph LR
    A[Cloud Scheduler] --> B[Cloud Run Job Playwright]
    B --> C[Raw Assets to GCS]
    C --> D[Gemini Vision Classifier]
    D --> E[Idempotent Partitioned MERGE]
    E --> F[(BigQuery Analytics Table)]
Loading
  • Quantifiable Impact: Automated daily data extraction across 40+ competing brands, eliminating 20+ hours/week of manual gathering.

4. Enterprise LLM API Gateway & Centralized FinOps Proxy

  • Enterprise Vertical: Multinational Advertising & Technology Holding
  • Core Stack: LiteLLM, FastAPI, BigQuery, Cloud Run, Docker, Terraform
  • Related Architecture Repository: gcp-infra-monitor
  • The Problem: Multiple teams were deploying unmonitored LLM API calls with fragmented keys, lacking rate limits, cost attribution, or audit logs, leading to unexpected cloud budget spikes.
  • Engineering Solution:
    • Architected a centralized AI Gateway with LiteLLM and FastAPI deployed on Cloud Run.
    • Implemented virtual API keys, team-based token quotas, model failover routing (Gemini / Claude / OpenAI), and asynchronous cost telemetry streaming to BigQuery.
  • Architecture Diagram:
graph LR
    A[Team LLM Request] --> B[LiteLLM Proxy FastAPI]
    B --> C[Virtual Keys & Quota Check]
    C --> D{Multi-Model Router}
    D --> E[Gemini 1.5 / Claude / GPT]
    B --> F[(BigQuery FinOps Telemetry)]
Loading
  • Quantifiable Impact: Centralized 100% of internal AI usage, providing real-time FinOps cost visibility and preventing budget overruns.

5. Multi-Vertical Media Planning & Budget Reconciliation Pipelines

  • Enterprise Vertical: Tier-1 Banking, Automotive & Supermarket Retail
  • Core Stack: Python, Selenium, BigQuery, Connected Sheets, Cloud Functions, Cloud SQL
  • Related Architecture Repository: data-engineering-toolkit
  • The Problem: Media planning data across diverse clients was scattered across siloed tools and spreadsheets, preventing unified executive performance tracking.
  • Engineering Solution:
    • Built specialized data ingestion pipelines tailoring parsing rules for banking, automotive, and retail data schemas into normalized BigQuery datasets.
    • Integrated bi-directional sync between BigQuery and Google Connected Sheets, allowing business users to interact with warehouse-grade data without writing SQL.
  • Architecture Diagram:
graph LR
    A[Media Plans Excel / API] --> B[Python Ingestion Engine]
    B --> C[Schema Normalization]
    C --> D[(BigQuery Enterprise Warehouse)]
    D <--> E[Connected Sheets Bi-directional Sync]
Loading
  • Quantifiable Impact: Replaced manual consolidation across 3 major client accounts, delivering daily automated budget reconciliation.

6. Real-Time TV Broadcast Telemetry & Media Reconciliation Engine

  • Enterprise Vertical: Global Cosmetics & Beauty Leader
  • Core Stack: Python, Gemini API, Pandas, Excel Automation, Cloud Storage
  • Related Architecture Repository: gcp-infra-monitor
  • The Problem: Reconciling planned TV advertising campaigns against real broadcast monitoring logs was executed quarterly via massive manual spreadsheets.
  • Engineering Solution:
    • Automated the cross-referencing of actual TV broadcast logs against planned media flight dates, stations, and budget allocations.
    • Utilized AI-assisted entity matching to map inconsistent channel and program naming conventions into a persistent historical catalog.
  • Architecture Diagram:
graph LR
    A[TV Broadcast Logs] --> B[Reconciliation Engine Python]
    B --> C[Gemini Entity Resolution]
    C --> D[Normalized Channel Mapping]
    D --> E[Audited Executive Report]
Loading
  • Quantifiable Impact: Converted a quarterly manual audit into an automated monthly delivery, achieving 100% data reconciliation.

Open Source & Production Frameworks

Repository Focus Area Technologies Link
gcp-infra-monitor Multi-Cloud FinOps & Infrastructure Observability BigQuery, Cloud Run, Terraform, Next.js View Repo
data-engineering-toolkit Production ETL Patterns, Scrapers & LLM Gateways Python, BigQuery, Vertex AI, Playwright View Repo
algo-trading-engine Modular Trading Framework with Risk Controls Python, GCP, Systemd, Technical Indicators View Repo
ai-project-manager Autonomous Agent Auditing Tasks against Git Commits Python, FastAPI, LLM Agents, GitHub API View Repo
saas-accounting-platform Chilean Tax & Invoicing SaaS (SII Integration) Node.js, TypeScript, PostgreSQL, GCP View Repo
b2b-elearning-platform B2B Corporate Training SaaS with Cloud Video Next.js, Firebase, Cloud SQL, GCS View Repo
whatsapp-chatbot-engine Enterprise WhatsApp Engine with HMAC & LLM Fallback TypeScript, Node.js, Meta Cloud API View Repo
podcast-tech-pipeline End-to-End Automated Podcast & Voice Synthesis Engine Python, Vertex AI, Cloud TTS, GCP View Repo

Career History

Senior Data Engineer & Cloud Architect — Advertising, Media & Tech Holding

Jan 2026 – Present | Santiago, Chile / Remote

  • Architected automated data pipelines connecting TikTok, Meta, Google Ads, and proprietary ad networks to BigQuery.
  • Built and deployed the enterprise LiteLLM API Gateway managing token quotas, routing, and audit logs.
  • Engineered multimodal OCR pipelines with Gemini 1.5, reducing document extraction latency by 99%.
  • Accelerated analytics delivery cycles from 2 weeks to 2 days (85% speedup).

Tech Lead & Senior Data Engineer — Global Agrochemical Enterprise

Apr 2024 – Dec 2025 | Santiago, Chile

  • Tech Lead & Corporate Head of Planning & Supply Chain (Apr 2024 – Aug 2025): led a team of 4 engineers/analysts building a transnational procurement & logistics data platform (LATAM to China); designed the Snowflake enterprise data warehouse powering executive Power BI reporting; developed container logistics optimization models with Python and Gurobi.
  • Data Engineer (Sep 2025 – Dec 2025), following an internal team reorganization: reduced data ingestion latency from 7 days to 1 day through high-throughput asynchronous scrapers; led NLP/AI-agent data indexing projects extracting market intelligence into corporate databases.

Full Stack Developer — Global Agrochemical Enterprise

Jan 2023 – Mar 2024 | Santiago, Chile

  • Full Stack Developer (Jun 2023 – Mar 2024): built the Purchasing Platform's analytical layer end-to-end (React frontend, FastAPI backend), integrating SAP MM with cloud storage.
  • Full Stack Developer, Intern (Jan – Jun 2023): designed and implemented the first version of the Corporate Purchasing Platform.

Founder & Cloud Architect — LupeLab SaaS Solutions

Apr 2026 – Present

  • Architects and manages 10+ Google Cloud Platform projects with centralized FinOps monitoring and IaC (Terraform).

Education

  • B.S. in Computer Science & Telecommunications Engineering — Universidad Diego Portales (2020 – 2025)
  • B.S. in Computer Engineering Studies — Universidad Técnica Federico Santa María (UTFSM) (2016 – 2018)

Engagement, Location & Target Roles

  • Target Roles: Senior Data Engineer, Lead Data Engineer, DataOps Architect, Cloud Solutions Architect (Data & AI), LLMOps & AI Platform Engineer, Analytics Engineer (Lead / Senior), Tech Lead (Data & AI).
  • Work Arrangement: 100% Remote (Global, US, Europe, LATAM).
  • Location & Relocation: Based in Santiago, Chile. Open to local employment, residency, and relocation to Brazil (fluent in Portuguese).
  • Contract Types: Full-Time Employee (W2 / Direct Contract / CLT / PJ), B2B Contractor (C2C / International Invoice).
  • Timezone Compatibility: Full overlap with Brazil (BRT / UTC-3), US Eastern (EST), US Central (CST), US Pacific (PST), and Chile (CLT / UTC-4).

Curriculum Vitae: Download PDF (Updated: August 2026)  |  Contact: LinkedIn  |  Email

Español

Resumen Ejecutivo

Ingeniero de Datos Senior y Arquitecto Cloud especializado en el diseño, escalabilidad y mantenimiento de pipelines de datos de misión crítica, metodologías DataOps y ecosistemas de IA empresarial. Cerca de 4 años de experiencia construyendo arquitecturas de datos en la nube sobre Google Cloud Platform (GCP) y Snowflake, transformando procesos manuales complejos en pipelines de producción 100% automatizados y resilientes.

  • Más de 30 Sistemas Empresariales Entregados: Trayectoria comprobada implementando pipelines de datos en producción, gateways de LLMOps y automatización de infraestructura en Medios, Retail, Banca, Agroquímica y FinTech.
  • 100% de Automatización End-to-End: Eliminación de flujos de trabajo manuales en múltiples verticales de negocio, reduciendo la intervención humana a cero.
  • 85% de Reducción en Latencia de Procesamiento: Aceleración de ciclos de ingesta y reportería de 2 semanas a 2 días mediante arquitecturas BigQuery orientadas a eventos y Google Cloud Pub/Sub.
  • FinOps y Gobernanza Cloud: Arquitectura de entornos multi-proyecto en GCP con exportación automatizada de facturación, límites de costo en tiempo real y microservicios serverless de escala a cero.

Métricas de Impacto Clave

Métrica Impacto Técnico y de Negocio
Latencia de Procesamiento Reducción del 85% en tiempos de ciclo (de 14 días a 2 días)
Operaciones Manuales 0% de intervención humana en pipelines de producción (100% automatizado)
Sistemas en Producción Más de 30 plataformas empresariales desplegadas en GCP y Snowflake
Gobernanza Cloud y FinOps Más de 10 proyectos GCP gestionados con Terraform (IaC) y control presupuestario
Monitoreo de Competencia Más de 40 marcas competidoras extraídas y clasificadas diariamente con visión multimodal
Latencia de Autoservicio Menos de 4 segundos en consultas de Lenguaje Natural a SQL
Enrutamiento de Eventos Despacho asíncrono sub-segundo mediante Google Cloud Pub/Sub y Eventarc

Principios de Ingeniería y Estándares DataOps

  • Automatización Cero Fricción: Si un proceso de datos requiere intervención manual más de una vez, se diseña un pipeline autónomo con autorecuperación.
  • Idempotencia y Determinismo: Toda ingesta y transformación está diseñada para ser reejecutada sobre cualquier rango de fechas sin duplicar registros ni requerir limpiezas manuales.
  • Contratos de Datos y Tipado Estricto: Los flujos de datos entrantes deben cumplir contratos estrictos de esquema (Pydantic v2 / JSON Schema) antes de ser promovidos a las capas de almacenamiento analítico.
  • FinOps por Diseño: Particionado por fecha, clustering, límites de bytes escaneados y caché de BI Engine son obligatorios en BigQuery; las cargas serverless escalan a cero cuando no se usan.
  • Observabilidad Proactiva: Pruebas automáticas, validación de desvío de datos (data drift) y alertas instantáneas por webhook ante fallos.

Patrones de Arquitectura en Producción

  • Ingesta Idempotente (MERGE + Poda de Particiones): Pipelines de alto volumen ejecutan sentencias atómicas MERGE acotadas a particiones de fecha específicas, permitiendo reprocesamientos históricos sin bloqueos ni duplicados.
  • Ingesta Dirigida por Eventos y Streaming (Pub/Sub + Eventarc): Pipelines desacoplados ingieren eventos asíncronos activando microservicios Cloud Run con colas de mensajes fallidos (Dead Letter Queue - DLQ).
  • Pipelines Serverless Escala-a-Cero: Cargas de scraping empaquetadas en Cloud Run Jobs activadas por eventos de Cloud Storage y Cloud Scheduler, con costo computacional cero fuera de las ventanas de ejecución.
  • Guardrails Semánticos en NL-to-SQL: Motores conversacionales basados en metadata de INFORMATION_SCHEMA, listas blancas de tablas y modo Dry Run en BigQuery para estimar el costo de escaneo antes de ejecutar la consulta.

Calidad y Confiabilidad de Datos

  • Validación Estricta de Esquemas y Contratos de Datos: Pydantic v2 y validación JSON Schema en todas las cargas de API, flujos de extracción y capas de promoción a data warehouse.
  • CI/CD Automatizado: GitHub Actions y Azure Pipelines ejecutando pruebas unitarias, linters y pruebas de integración antes de cada despliegue.
  • Telemetría y Alertas Proactivas: Registro centralizado en BigQuery con notificaciones automáticas a Slack y Microsoft Teams ante fallas de tareas o anomalías en datos.

Diagrama de Arquitectura de Plataforma de Datos Cloud

graph LR
    subgraph Ingesta [Capa de Ingesta y Streaming de Eventos]
        A[Scrapers Playwright / Selenium] --> B[Google Cloud Storage]
        C[APIs REST / Redes Publicitarias] --> D[Google Cloud Pub/Sub]
        E[Facturas PDF Escaneadas] --> B
        D --> F[Cloud Eventarc]
    end

    subgraph Procesamiento [Capa de Procesamiento y DataOps]
        B --> G[Cloud Run Jobs / Functions]
        F --> G
        G --> H[Gemini 1.5 Multimodal / Validación Pydantic]
    end

    subgraph Almacenamiento [Data Lakehouse y Warehouse]
        H --> I[(Tablas Particionadas BigQuery)]
        I --> J[(Data Warehouse Snowflake)]
    end

    subgraph Consumo [Capa de Analítica y Servido de IA]
        I --> K[Vertex AI / Gateway NL-to-SQL]
        I --> L[Connected Sheets / Dashboards]
        K --> M[Bot MS Teams / Portal Web]
    end
Loading

Matriz de Especialidad por Industria

Sector / Industria Problemas Resueltos Patrones de Arquitectura
Publicidad, Medios y AdTech Atribución multicanal, Share of Voice (SOV), monitoreo de piezas creativas competidoras Scrapers headless (Playwright), clasificadores con IA multimodal, sincronización con Google Sheets
Finanzas Corporativas y Contabilidad Procesamiento manual de facturas, cumplimiento tributario (SII/DTE), conversión de divisas OCR serverless con Gemini Vision, validación con Pydantic, carga atómica en bases de datos
Agroquímica y Logística Global Optimización de fletes de contenedores, compras internacionales (LATAM a China), pronóstico de suministros Data warehouse en Snowflake, modelos de optimización matemática (Python + Gurobi), Power BI
Retail, Banca y Automotriz Planes de medios distribuidos, telemetría de órdenes en tiempo real, validación de parámetros de pauta Microservicios en Cloud Run, WebSockets, Pub/Sub, pipelines BigQuery particionados por fecha

Idiomas

  • Español: Nativo
  • Portugués: Fluido / Competencia Profesional
  • Inglés: Lectura y escritura fluida (documentación técnica, chat asíncrono) — entrevistas y comunicación verbal solo en español o portugués

Competencias Técnicas Principales

Dominio Tecnologías y Herramientas
Ingeniería de Datos y Almacenamiento Python, SQL, Google BigQuery, Snowflake, PostgreSQL, Google Cloud Pub/Sub, Particionado y Clustering, Modelado de Datos, Contratos de Datos (Pydantic / Great Expectations), DBT, Pipelines Idempotentes
Infraestructura Cloud y Distribuida Google Cloud Platform (GCP), AWS, Docker, Cloud Run, Cloud Functions, Cloud SQL, Cloud Storage, Compute Engine, Eventarc, Cloud Composer (Airflow), Seguridad IAP
DataOps, DevOps y CI/CD Terraform (IaC), GitHub Actions, Azure Pipelines, Secret Manager, Docker Compose, Pruebas Automatizadas y Suites de Regresión
Ingeniería de IA y LLMOps Vertex AI, Gemini API, LiteLLM Proxy, LangChain, Arquitecturas RAG, Motores NL-to-SQL, Extracción OCR Multimodal, Control de Cuotas y Tokens
Automatización y Web Scraping Playwright, Selenium, Navegadores Headless, WebSockets, APIs REST, FastAPI, Flask

Casos de Estudio y Proyectos Empresariales (Anonimizados / NDA Compliant)

A continuación se detallan sistemas de producción y arquitecturas automatizadas desarrolladas para clientes corporativos y plataformas internas.


1. Motor OCR Financiero Multimodal y Pipeline de Facturas con IA

  • Vertical: Finanzas Corporativas y Operaciones de Medios
  • Stack: Python, Gemini 1.5 Multimodal Vision, Google Cloud Storage, BigQuery, FastAPI, Next.js
  • Repositorio de Arquitectura: data-engineering-toolkit
  • Desafío de Negocio: Cientos de facturas, órdenes de compra y documentos tributarios en PDF escaneados eran procesados a mano mensualmente, generando atrasos en pagos y errores de digitación.
  • Solución de Ingeniería:
    • Diseño de un pipeline serverless asíncrono sobre Google Cloud.
    • Extracción automática de ítems, montos, impuestos y conversiones de divisa usando Gemini 1.5 Multimodal Vision con validación estricta de esquemas JSON (Pydantic).
    • Deduplicación y carga atómica en BigQuery y PostgreSQL con webhooks de validación inmediata.
  • Diagrama de Arquitectura:
graph LR
    A[Facturas PDF Escaneadas] --> B[Bucket GCS]
    B --> C[Disparador Cloud Run]
    C --> D[Gemini 1.5 Vision OCR]
    D --> E[Validación Pydantic Schema]
    E --> F[(Data Warehouse BigQuery)]
    E --> G[(Base de Datos PostgreSQL)]
Loading
  • Impacto Cuantificable: Automatización end-to-end del 100% sin digitación manual, reduciendo el procesamiento por documento de 4 días a menos de 15 segundos.

2. Copiloto Analítico de Lenguaje Natural a SQL (NL-to-SQL)

  • Vertical: Empresa Multinacional de Electrónica de Consumo
  • Stack: Vertex AI, Gemini API, BigQuery, FastAPI, Microsoft Bot Framework (Teams), Docker
  • Repositorio de Arquitectura: data-engineering-toolkit
  • Desafío de Negocio: Múltiples equipos comerciales y ejecutivos saturaban al equipo de BI con solicitudes ad-hoc diarias de reportes en SQL, provocando cuellos de botella y demoras de 48 a 72 horas.
  • Solución de Ingeniería:
    • Arquitectura en 3 capas (Bot en Teams / Web -> Middleware en FastAPI -> Vertex AI + BigQuery).
    • Anclaje semántico de esquemas, barreras de seguridad (guardrails) y ejecución de consultas SQL en modo sandbox con estimación previa de costos de escaneo.
    • Respuestas interactivas mediante Adaptive Cards en Microsoft Teams y portal web corporativo.
  • Diagrama de Arquitectura:
graph LR
    A[Consulta Teams / Web] --> B[Middleware FastAPI]
    B --> C[Vertex AI Anclaje Semántico]
    C --> D[Sandbox SQL y Límite de Costo]
    D --> E[(Ejecución BigQuery)]
    E --> F[Adaptive Cards / Gráficos]
Loading
  • Impacto Cuantificable: Reducción del 65% en tickets ad-hoc de BI, entregando métricas de negocio precisas en menos de 4 segundos.

3. Pipeline de Inteligencia de Mercado y Clasificación Multimodal de Avisos

  • Vertical: Cosmética, Farmacéutica y Retail Comercial
  • Stack: Playwright, Cloud Run Jobs, BigQuery, Gemini Vision, Cloud Scheduler
  • Repositorio de Arquitectura: data-engineering-toolkit
  • Desafío de Negocio: La recolección de pauta publicitaria de la competencia se realizaba mediante descargas manuales dispersas e inconsistentes.
  • Solución de Ingeniería:
    • Scrapers automatizados con Playwright orquestados mediante Cloud Run Jobs y Cloud Scheduler.
    • Pipeline de clasificación determinista mediante visión multimodal (Gemini Vision) para clasificar piezas creativas, generando miniaturas y taxonomías en BigQuery.
    • Sentencias MERGE particionadas por fecha para asegurar idempotencia total y evitar duplicidad en reejecuciones.
  • Diagrama de Arquitectura:
graph LR
    A[Cloud Scheduler] --> B[Cloud Run Job Playwright]
    B --> C[Archivos en GCS]
    C --> D[Clasificador Gemini Vision]
    D --> E[MERGE Particionado Idempotente]
    E --> F[(Tabla Analítica BigQuery)]
Loading
  • Impacto Cuantificable: Extracción automática diaria sobre más de 40 marcas competidoras, ahorrando más de 20 horas semanales de trabajo manual.

4. Gateway Corporativo de APIs LLM y Proxy FinOps

  • Vertical: Holding Global de Publicidad y Tecnología
  • Stack: LiteLLM, FastAPI, BigQuery, Cloud Run, Docker, Terraform
  • Repositorio de Arquitectura: gcp-infra-monitor
  • Desafío de Negocio: Diferentes equipos consumían APIs de modelos de lenguaje sin límites de cuota, control de costos ni trazabilidad de auditoría.
  • Solución de Ingeniería:
    • Gateway centralizado con LiteLLM y FastAPI sobre Cloud Run con balanceo multi-modelo (Gemini / Claude / OpenAI).
    • Control de cuotas de tokens por equipo, autenticación con llaves virtuales y streaming de costos a BigQuery.
  • Diagrama de Arquitectura:
graph LR
    A[Petición LLM de Equipo] --> B[Proxy LiteLLM FastAPI]
    B --> C[Control de Cuotas y Llaves]
    C --> D{Enrutador Multi-Modelo}
    D --> E[Gemini 1.5 / Claude / GPT]
    B --> F[(Telemetría FinOps BigQuery)]
Loading
  • Impacto Cuantificable: Gobernanza y visibilidad FinOps en tiempo real del 100% del consumo de IA interna.

5. Pipelines de Ingesta y Conciliación Presupuestaria de Medios

  • Vertical: Banca, Automotriz y Retail de Supermercados
  • Stack: Python, Selenium, BigQuery, Connected Sheets, Cloud Functions, Cloud SQL
  • Repositorio de Arquitectura: data-engineering-toolkit
  • Desafío de Negocio: Los planes de inversión publicitaria se gestionaban en planillas aisladas, dificultando la consolidación ejecutiva.
  • Solución de Ingeniería:
    • Pipelines de ingesta con esquemas estandarizados para banca, automotriz y retail cargando hacia BigQuery.
    • Sincronización bidireccional con Google Connected Sheets para consulta directa sin requerir conocimientos de SQL.
  • Diagrama de Arquitectura:
graph LR
    A[Planes de Medios Excel / API] --> B[Motor de Ingesta Python]
    B --> C[Normalización de Esquemas]
    C --> D[(Data Warehouse BigQuery)]
    D <--> E[Connected Sheets Sincronización Bidireccional]
Loading
  • Impacto Cuantificable: Reemplazo de consolidación manual en 3 grandes cuentas, entregando conciliación presupuestaria automatizada diaria.

6. Motor de Conciliación de Transmisiones de TV en Tiempo Real

  • Vertical: Multinacional Líder de Belleza y Cosmética
  • Stack: Python, Gemini API, Pandas, Automatización Excel, Cloud Storage
  • Repositorio de Arquitectura: gcp-infra-monitor
  • Desafío de Negocio: La conciliación entre anuncios contratados y transmisiones reales se realizaba trimestralmente en planillas manuales.
  • Solución de Ingeniería:
    • Cruce automático de logs reales de transmisión contra planes de pauta contratados.
    • Catálogo persistente de homologación de canales y programas asistido por IA.
  • Diagrama de Arquitectura:
graph LR
    A[Logs de Transmisión TV] --> B[Motor de Conciliación Python]
    B --> C[Resolución de Entidades con Gemini]
    C --> D[Mapeo Homologado de Canales]
    D --> E[Reporte Ejecutivo Auditado]
Loading
  • Impacto Cuantificable: Transformación de una auditoría trimestral manual a una entrega mensual 100% automatizada.

Repositorios y Frameworks de Arquitectura en Producción

Repositorio Área de Enfoque Tecnologías Enlace
gcp-infra-monitor FinOps Multi-Cloud y Observabilidad de Infraestructura BigQuery, Cloud Run, Terraform, Next.js Ver Repositorio
data-engineering-toolkit Patrones ETL de Producción, Scrapers y Gateways LLM Python, BigQuery, Vertex AI, Playwright Ver Repositorio
algo-trading-engine Framework de Trading Modular con Control de Riesgo Python, GCP, Systemd, Indicadores Técnicos Ver Repositorio
ai-project-manager Agente Autónomo para Auditoría de Tareas contra Commits Python, FastAPI, Agentes LLM, GitHub API Ver Repositorio
saas-accounting-platform SaaS de Facturación y Cumplimiento Tributario (SII) Node.js, TypeScript, PostgreSQL, GCP Ver Repositorio
b2b-elearning-platform SaaS B2B de Capacitación con Streaming de Video Cloud Next.js, Firebase, Cloud SQL, GCS Ver Repositorio
whatsapp-chatbot-engine Motor WhatsApp Empresarial con HMAC y Fallback LLM TypeScript, Node.js, Meta Cloud API Ver Repositorio
podcast-tech-pipeline Pipeline Automatizado de Síntesis de Voz y Podcasts con IA Python, Vertex AI, Cloud TTS, GCP Ver Repositorio

Historial Profesional

Ingeniero de Datos Senior y Arquitecto Cloud — Holding de Publicidad, Medios y Tecnología

Ene 2026 – Presente | Santiago, Chile / Remoto

  • Arquitectura de pipelines en BigQuery conectando TikTok, Meta, Google Ads y redes publicitarias.
  • Desarrollo del AI Gateway corporativo con LiteLLM para gestión de cuotas y costos.
  • Pipelines de OCR con Gemini 1.5, reduciendo la latencia de extracción en 99%.
  • Aceleración de ciclos de entrega de 2 semanas a 2 días (85% de ganancia).

Tech Lead e Ingeniero de Datos Senior — Multinacional Agroquímica

Abr 2024 – Dic 2025 | Santiago, Chile

  • Tech Lead y Encargado Corporativo de Planificación y Abastecimiento (Abr 2024 – Ago 2025): liderazgo técnico de un equipo de 4 ingenieros/analistas en una plataforma transnacional de compras y logística (LATAM a China); arquitectura del data warehouse en Snowflake alimentando dashboards ejecutivos en Power BI; modelos de optimización logística de contenedores en Python + Gurobi.
  • Ingeniero de Datos (Sep 2025 – Dic 2025), tras una reorganización interna del equipo: reducción del tiempo de ingesta de 7 días a 1 día con scrapers asíncronos en Python; liderazgo de proyectos de indexación de datos con NLP y agentes de IA.

Full Stack Developer — Multinacional Agroquímica

Ene 2023 – Mar 2024 | Santiago, Chile

  • Full Stack Developer (Jun 2023 – Mar 2024): desarrollo end-to-end de la capa analítica de la Plataforma de Compras (frontend React, backend FastAPI), integrando SAP MM con almacenamiento cloud.
  • Full Stack Developer, Práctica (Ene – Jun 2023): diseño e implementación de la primera versión de la Plataforma Corporativa de Compras.

Arquitecto Cloud y Fundador — LupeLab SaaS Solutions

Abr 2026 – Presente

  • Gestión y arquitectura de 10+ proyectos GCP con monitoreo FinOps e infraestructura como código (Terraform).

Formación Académica

  • Ingeniería Civil en Informática y Telecomunicaciones — Universidad Diego Portales (2020 – 2025)
  • Estudios de Ingeniería Civil en Informática — Universidad Técnica Federico Santa María (UTFSM) (2016 – 2018)

Modalidades de Contratación, Ubicación y Roles Objetivo

  • Roles Objetivo: Senior Data Engineer, Lead Data Engineer, DataOps Architect, Cloud Solutions Architect (Data & AI), LLMOps & AI Platform Engineer, Analytics Engineer (Lead / Senior), Tech Lead (Data & AI).
  • Modalidad de Trabajo: 100% Remoto (Global, EE.UU., Europa, LATAM).
  • Ubicación y Relocación: Residencia en Santiago, Chile. Abierto a contratación local, residencia y relocación a Brasil (dominio fluido de portugués).
  • Tipos de Contrato: Full-Time (CLT / Directo), Contrato B2B (PJ / Contractor / Invoice Internacional).
  • Compatibilidad de Zona Horaria: Solapamiento completo con Brasil (BRT / UTC-3), EE.UU. (EST, CST, PST) y Chile (CLT / UTC-4).

Currículum Vitae: Descargar PDF (Actualizado: Agosto 2026)  |  Contacto: LinkedIn  |  Email

Português

Resumo Executivo

Engenheiro de Dados Sênior e Arquiteto Cloud especializado no design, escalabilidade e sustentação de pipelines de dados de missão crítica, metodologias DataOps e ecossistemas de IA corporativa. Quase 4 anos de experiência construindo arquiteturas de dados em nuvem no Google Cloud Platform (GCP) e Snowflake, transformando processos manuais complexos em pipelines de produção 100% automatizados e resilientes.

  • Mais de 30 Sistemas Corporativos Entregues: Experiência comprovada implementando pipelines de dados em produção, gateways de LLMOps e automação de infraestrutura em Mídia, Varejo, Bancos, Agroquímica e FinTech.
  • 100% de Automação Ponta a Ponta: Eliminação de fluxos manuais de trabalho em múltiplas verticais, reduzindo a intervenção humana a zero.
  • 85% de Redução na Latência de Processamento: Aceleração de ciclos de ingestão e relatórios de 2 semanas para 2 dias utilizando arquiteturas BigQuery orientadas a eventos e Google Cloud Pub/Sub.
  • FinOps e Governança Cloud: Arquitetura de ambientes multi-projeto no GCP com exportação automática de faturamento, limites de custo em tempo real e microsserviços serverless com escala a zero.

Métricas de Impacto Principais

Métrica Impacto Técnico e de Negócios
Latência de Processamento Redução de 85% nos tempos de ciclo (de 14 dias para 2 dias)
Operações Manuais 0% de intervenção humana em pipelines de produção (100% automatizado)
Sistemas em Produção Mais de 30 plataformas corporativas implantadas no GCP e Snowflake
Governança Cloud e FinOps Mais de 10 projetos GCP gerenciados com Terraform (IaC) e controle orçamentário
Monitoramento de Concorrência Mais de 40 marcas concorrentes extraídas e classificadas diariamente com visão multimodal
Latência de Autoatendimento Menos de 4 segundos em consultas de Linguagem Natural para SQL
Roteamento de Eventos Despacho assíncrono sub-segundo via Google Cloud Pub/Sub e Eventarc

Princípios de Engenharia e Padrões DataOps

  • Automação Zero Fricção: Se um fluxo de dados requer intervenção manual mais de uma vez, projeta-se um pipeline autônomo e autorrecuperável.
  • Idempotência e Determinismo: Toda ingestão e transformação é projetada para ser reexecutada em qualquer intervalo de datas sem duplicar registros.
  • Contratos de Dados e Tipagem Estrita: Os fluxos de dados de entrada devem cumprir asserções rígidas de contrato de esquema (Pydantic v2 / JSON Schema) antes da promoção para as camadas analíticas.
  • FinOps por Design: Particionamento por data, clustering, limites de bytes escaneados e cache do BI Engine são obrigatórios no BigQuery; cargas serverless escalam a zero quando ociosas.
  • Observabilidade Proativa: Testes automáticos, validação de desvio de dados (data drift) e alertas instantâneos via webhook em caso de falha.

Padrões Arquiteturais de Produção

  • Ingestão Idempotente (MERGE + Poda de Partições): Pipelines de alto volume executam comandos atômicos MERGE restritos a partições específicas de data, permitindo reprocessamentos históricos sem bloqueios nem duplicatas.
  • Ingestão Baseada em Eventos e Streaming (Pub/Sub + Eventarc): Pipelines desacoplados consom eventos assíncronos acionando microsserviços Cloud Run com filas de mensagens com falha (DLQ).
  • Pipelines Serverless Escala-a-Zero: Cargas de trabalho de raspagem empacotadas no Cloud Run Jobs disparadas por eventos do Cloud Storage e Cloud Scheduler, gerando custo computacional zero fora das janelas de execução.
  • Guardrails Semânticos em NL-to-SQL: Motores conversacionais fundamentados em metadados do INFORMATION_SCHEMA, listas de permissão de tabelas e modo Dry Run no BigQuery para validar custos antes da execução.

Qualidade e Confiabilidade de Dados

  • Validação Rígida de Esquemas e Contratos de Dados: Pydantic v2 e validação JSON Schema em todas as cargas de API, fluxos de extração e camadas de promoção para data warehouse.
  • CI/CD Automatizado: GitHub Actions e Azure Pipelines executando testes unitários, linters e testes de integração antes do deploy.
  • Telemetria e Alertas Proativos: Registro centralizado no BigQuery com notificações automáticas para Slack e Microsoft Teams em caso de falha ou desvio de dados.

Diagrama de Arquitetura de Plataforma de Dados Cloud

graph LR
    subgraph Ingestão [Camada de Ingestão e Streaming de Eventos]
        A[Scrapers Playwright / Selenium] --> B[Google Cloud Storage]
        C[APIs REST / Redes de Anúncios] --> D[Google Cloud Pub/Sub]
        E[Faturas PDF Escaneadas] --> B
        D --> F[Cloud Eventarc]
    end

    subgraph Processamento [Camada de Processamento e DataOps]
        B --> G[Cloud Run Jobs / Functions]
        F --> G
        G --> H[Gemini 1.5 Multimodal / Contratos Pydantic]
    end

    subgraph Armazenamento [Data Lakehouse e Warehouse]
        H --> I[(Tabelas Particionadas BigQuery)]
        I --> J[(Data Warehouse Snowflake)]
    end

    subgraph Consumo [Camada de Analytics e IA]
        I --> K[Vertex AI / Gateway NL-to-SQL]
        I --> L[Connected Sheets / Dashboards]
        K --> M[Bot MS Teams / Portal Web]
    end
Loading

Matriz de Especialidade por Setor

Setor / Indústria Problemas Resolvidos Padrões de Arquitetura
Publicidade, Mídia e AdTech Atribuição multicanal, Share of Voice (SOV), monitoramento de criativos da concorrência Scrapers headless (Playwright), classificadores com IA multimodal, sincronização com Google Sheets
Finanças Corporativas e Contabilidade Processamento manual de faturas, conformidade tributária chilena (SII/DTE), conversão de moedas OCR serverless com Gemini Vision, validação com Pydantic, carga atômica em bancos de dados
Agroquímica e Logística Global Otimização de fretes de contêineres, compras internacionais (LATAM para China), previsão de suprimentos Data warehouse no Snowflake, modelos de otimização matemática (Python + Gurobi), Power BI
Varejo, Bancos e Automotivo Planos de mídia distribuídos, telemetria de pedidos em tempo real, validação de parâmetros de mídia Microsserviços no Cloud Run, WebSockets, Pub/Sub, pipelines BigQuery particionados por data

Idiomas

  • Espanhol: Nativo
  • Português: Fluente / Proficiência Profissional Plena
  • Inglês: Leitura e escrita fluente (documentação técnica, chat assíncrono) — entrevistas e comunicação verbal somente em espanhol ou português

Competências Técnicas Principais

Domínio Tecnologias e Ferramentas
Engenharia de Dados e Armazenamento Python, SQL, Google BigQuery, Snowflake, PostgreSQL, Google Cloud Pub/Sub, Particionamento e Clustering, Modelagem de Dados, Contratos de Dados (Pydantic / Great Expectations), DBT, Pipelines Idempotentes
Infraestrutura Cloud e Distribuída Google Cloud Platform (GCP), AWS, Docker, Cloud Run, Cloud Functions, Cloud SQL, Cloud Storage, Compute Engine, Eventarc, Cloud Composer (Airflow), Segurança IAP
DataOps, DevOps e CI/CD Terraform (IaC), GitHub Actions, Azure Pipelines, Secret Manager, Docker Compose, Testes Automatizados e Suítes de Regressão
Engenharia de IA e LLMOps Vertex AI, Gemini API, LiteLLM Proxy, LangChain, Arquiteturas RAG, Motores NL-to-SQL, Extração OCR Multimodal, Controle de Cotas e Tokens
Automação e Web Scraping Playwright, Selenium, Navegadores Headless, WebSockets, APIs REST, FastAPI, Flask

Casos de Estudo Empresariais (Anonimizados / NDA Compliant)

Abaixo estão arquiteturas em produção e sistemas automatizados desenvolvidos para clientes corporativos.


1. Motor OCR Financeiro Multimodal e Pipeline de Faturas com IA

  • Setor: Finanças Corporativas e Operações de Mídia
  • Stack: Python, Gemini 1.5 Multimodal Vision, Google Cloud Storage, BigQuery, FastAPI, Next.js
  • Repositório de Arquitetura: data-engineering-toolkit
  • Desafio de Negócio: Centenas de faturas em PDF escaneadas eram processadas manualmente todo mês, gerando atrasos em pagamentos e erros operacionais.
  • Solução de Engenharia:
    • Pipeline serverless assíncrono no Google Cloud.
    • Extração com Gemini 1.5 Multimodal Vision e validação rígida de esquemas JSON (Pydantic).
    • Deduplicação e carga atômica no BigQuery e PostgreSQL com webhooks de validação imediata.
  • Diagrama de Arquitetura:
graph LR
    A[Faturas PDF Escaneadas] --> B[Bucket GCS]
    B --> C[Disparador Cloud Run]
    C --> D[Gemini 1.5 Vision OCR]
    D --> E[Validação Pydantic Schema]
    E --> F[(Data Warehouse BigQuery)]
    E --> G[(Banco de Dados PostgreSQL)]
Loading
  • Impacto Quantificável: 100% de automação ponta a ponta, reduzindo o tempo de processamento de 4 dias para menos de 15 segundos por documento.

2. Copiloto Analítico de Linguagem Natural para SQL (NL-to-SQL)

  • Setor: Empresa Multinacional de Eletrônicos de Consumo
  • Stack: Vertex AI, Gemini API, BigQuery, FastAPI, Microsoft Bot Framework (Teams), Docker
  • Repositório de Arquitetura: data-engineering-toolkit
  • Desafio de Negócio: Equipes comerciais sobrecarregavam a equipe de BI com solicitações pontuais de SQL, gerando prazos de espera de 48 a 72 horas.
  • Solução de Engenharia:
    • Arquitetura em 3 camadas (Teams Bot / Web -> Middleware FastAPI -> Vertex AI + BigQuery).
    • Ancoragem semântica de esquemas, guardrails e execução em sandbox com estimativa prévia de custos (Dry Run).
    • Respostas interativas via Adaptive Cards no Microsoft Teams e portal web.
  • Diagrama de Arquitetura:
graph LR
    A[Consulta Teams / Web] --> B[Middleware FastAPI]
    B --> C[Vertex AI Ancoragem Semântica]
    C --> D[Sandbox SQL e Limite de Custo]
    D --> E[(Execução BigQuery Analytics)]
    E --> F[Adaptive Cards / Gráficos]
Loading
  • Impacto Quantificável: Redução de 65% nos tickets ad-hoc de BI, entregando métricas precisas em menos de 4 segundos.

3. Pipeline de Inteligência de Mercado e Classificação Multimodal de Anúncios

  • Setor: Cosméticos, Farmacêutica e Varejo Comercial
  • Stack: Playwright, Cloud Run Jobs, BigQuery, Gemini Vision, Cloud Scheduler
  • Repositório de Arquitetura: data-engineering-toolkit
  • Desafio de Negócio: A coleta de dados da concorrência era realizada por downloads manuais lentos e desestruturados.
  • Solução de Engenharia:
    • Scrapers automatizados com Playwright orquestrados via Cloud Run Jobs e Cloud Scheduler.
    • Classificação determinística com visão multimodal (Gemini Vision) para categorizar anúncios no BigQuery com miniaturas automáticas.
    • Comandos MERGE particionados garantindo idempotência total e zero registros duplicados.
  • Diagrama de Arquitetura:
graph LR
    A[Cloud Scheduler] --> B[Cloud Run Job Playwright]
    B --> C[Arquivos no GCS]
    C --> D[Classificador Gemini Vision]
    D --> E[MERGE Particionado Idempotente]
    E --> F[(Tabela Analítica BigQuery)]
Loading
  • Impacto Quantificável: Extração diária automatizada de +40 marcas concorrentes, economizando +20 horas semanais de trabalho manual.

4. Gateway Corporativo de APIs LLM e Proxy FinOps

  • Setor: Holding Global de Publicidade e Tecnologia
  • Stack: LiteLLM, FastAPI, BigQuery, Cloud Run, Docker, Terraform
  • Repositório de Arquitetura: gcp-infra-monitor
  • Desafio de Negócio: Múltiplas equipes consumiam APIs de LLM sem controle de custos, cotas ou auditoria centralizada.
  • Solução de Engenharia:
    • Gateway centralizado com LiteLLM e FastAPI no Cloud Run com balanceamento multi-modelo (Gemini / Claude / OpenAI).
    • Controle de cotas por equipe, chaves virtuais e streaming assíncrono de custos para o BigQuery.
  • Diagrama de Arquitetura:
graph LR
    A[Requisição LLM da Equipe] --> B[Proxy LiteLLM FastAPI]
    B --> C[Validação de Cotas e Chaves]
    C --> D{Roteador Multi-Modelo}
    D --> E[Gemini 1.5 / Claude / GPT]
    B --> F[(Telemetria FinOps BigQuery)]
Loading
  • Impacto Quantificável: Governança e visibilidade FinOps em tempo real de 100% do consumo corporativo de IA.

5. Pipelines de Ingestão e Conciliação Orçamentária de Mídia

  • Setor: Bancos, Automotivo e Varejo Supermercadista
  • Stack: Python, Selenium, BigQuery, Connected Sheets, Cloud Functions, Cloud SQL
  • Repositório de Arquitetura: data-engineering-toolkit
  • Desafio de Negócio: Planos de mídia residiam em planilhas dispersas, dificultando o acompanhamento financeiro executivo.
  • Solução de Engenharia:
    • Pipelines de ingestão com esquemas padronizados carregando dados para o BigQuery.
    • Sincronização bidirecional com o Google Connected Sheets para consulta direta sem necessidade de SQL.
  • Diagrama de Arquitetura:
graph LR
    A[Planos de Mídia Excel / API] --> B[Motor de Ingestão Python]
    B --> C[Normalização de Esquemas]
    C --> D[(Data Warehouse BigQuery)]
    D <--> E[Connected Sheets Sincronização Bidirecional]
Loading
  • Impacto Quantificável: Conciliação orçamentária 100% automatizada com atualização diária.

6. Motor de Conciliação de Transmissões de TV em Tempo Real

  • Setor: Multinacional de Beleza e Cosméticos
  • Stack: Python, Gemini API, Pandas, Automação Excel, Cloud Storage
  • Repositório de Arquitetura: gcp-infra-monitor
  • Desafio de Negócio: A conciliação entre anúncios contratados e transmissões reais era feita trimestralmente em planilhas manuais.
  • Solução de Engenharia:
    • Cruzamento automático de logs reais de transmissão contra planos de veiculação.
    • Catálogo persistente de homologação de canais e programas assistido por IA.
  • Diagrama de Arquitetura:
graph LR
    A[Logs de Transmissão TV] --> B[Motor de Conciliação Python]
    B --> C[Resolução de Entidades com Gemini]
    C --> D[Mapeamento Homologado de Canais]
    D --> E[Relatório Executivo Auditado]
Loading
  • Impacto Quantificável: Migração de auditorias trimestrais manuais para um ciclo mensal 100% automatizado.

Repositórios e Frameworks de Arquitectura em Produção

Repositório Área de Foco Tecnologias Link
gcp-infra-monitor FinOps Multi-Cloud e Observabilidade de Infraestrutura BigQuery, Cloud Run, Terraform, Next.js Ver Repositório
data-engineering-toolkit Padrões ETL de Produção, Scrapers e Gateways LLM Python, BigQuery, Vertex AI, Playwright Ver Repositório
algo-trading-engine Framework de Trading Modular com Controle de Risco Python, GCP, Systemd, Indicadores Técnicos Ver Repositório
ai-project-manager Agente Autônomo para Auditoria de Tarefas contra Commits Python, FastAPI, Agentes LLM, GitHub API Ver Repositório
saas-accounting-platform SaaS de Faturamento e Conformidade Tributária (SII) Node.js, TypeScript, PostgreSQL, GCP Ver Repositório
b2b-elearning-platform SaaS B2B de Capacitação Corporativa com Vídeo em Nuvem Next.js, Firebase, Cloud SQL, GCS Ver Repositório
whatsapp-chatbot-engine Motor WhatsApp Corporativo com HMAC e Fallback LLM TypeScript, Node.js, Meta Cloud API Ver Repositório
podcast-tech-pipeline Pipeline Automatizado de Síntese de Voz e Podcasts com IA Python, Vertex AI, Cloud TTS, GCP Ver Repositório

Histórico Profissional

Engenheiro de Dados Sênior e Arquiteto Cloud — Holding de Publicidade, Mídia e Tecnologia

Jan 2026 – Presente | Santiago, Chile / Remoto

  • Arquitetura de pipelines no BigQuery conectando TikTok, Meta, Google Ads e redes de mídia.
  • Desenvolvimento do AI Gateway corporativo com LiteLLM para gestão de cotas e custos.
  • Pipelines de OCR com Gemini 1.5, reduzindo a latência de extração em 99%.
  • Aceleração de ciclos de entrega de 2 semanas para 2 dias (85% de ganho).

Tech Lead e Engenheiro de Dados Sênior — Multinacional Agroquímica

Abr 2024 – Dez 2025 | Santiago, Chile

  • Tech Lead e Responsável Corporativo de Planejamento e Suprimentos (Abr 2024 – Ago 2025): liderança técnica de uma equipe de 4 engenheiros/analistas em plataforma transnacional de compras e logística (LATAM para China); arquitetura do data warehouse no Snowflake alimentando dashboards executivos no Power BI; modelos de otimização logística de contêineres em Python + Gurobi.
  • Engenheiro de Dados (Set 2025 – Dez 2025), após uma reorganização interna da equipe: redução do tempo de ingestão de 7 dias para 1 dia com scrapers assíncronos em Python; liderança de projetos de indexação de dados com NLP e agentes de IA.

Full Stack Developer — Multinacional Agroquímica

Jan 2023 – Mar 2024 | Santiago, Chile

  • Full Stack Developer (Jun 2023 – Mar 2024): desenvolvimento ponta a ponta da camada analítica da Plataforma de Compras (frontend React, backend FastAPI), integrando SAP MM com armazenamento em nuvem.
  • Full Stack Developer, Estagiário (Jan – Jun 2023): design e implementação da primeira versão da Plataforma Corporativa de Compras.

Arquiteto Cloud e Fundador — LupeLab SaaS Solutions

Abr 2026 – Presente

  • Gestão e arquitetura de 10+ projetos GCP com monitoramento FinOps e infraestrutura como código (Terraform).

Formação Acadêmica

  • Bacharelado em Engenharia Civil em Informática e Telecomunicações — Universidad Diego Portales (2020 – 2025)
  • Estudos em Engenharia Civil em Informática — Universidad Técnica Federico Santa María (UTFSM) (2016 – 2018)

Modalidades de Contratação, Localização e Cargos de Interesse

  • Cargos de Interesse: Senior Data Engineer, Lead Data Engineer, DataOps Architect, Cloud Solutions Architect (Data & AI), LLMOps & AI Platform Engineer, Analytics Engineer (Lead / Senior), Tech Lead (Data & AI).
  • Modelo de Trabalho: 100% Remoto (Brasil, EUA, Europa, LATAM).
  • Localização e Relocação: Base em Santiago, Chile. Disponível para contratação local, residência e relocação no Brasil (português fluente).
  • Formatos de Contrato: CLT, PJ (Pessoa Jurídica / B2B), Contrato Internacional (Invoice / C2C / W2).
  • Fuso Horário: Compatibilidade total com o horário de Brasília (BRT / UTC-3), EUA (EST, CST, PST) e Chile (CLT / UTC-4).

Currículo: Baixar PDF (Atualizado em: Agosto 2026)  |  Contato: LinkedIn  |  Email

Popular repositories Loading

  1. prueba-scraper prueba-scraper Public

    TypeScript

  2. Seba-LupeLab Seba-LupeLab Public

    👨‍💻 Data Engineer · DataOps · AI Engineer — Santiago, Chile

  3. algo-trading-engine algo-trading-engine Public

    Modular algorithmic trading framework with risk management, position sizing, and automated systemd execution.

  4. gcp-infra-monitor gcp-infra-monitor Public

    Multi-cloud FinOps observability, automated billing telemetry, and infrastructure governance on Google Cloud.

  5. ai-project-manager ai-project-manager Public

    Autonomous AI engineering assistant for task tracking, Git commit audits, and project backlog validation.

  6. data-engineering-toolkit data-engineering-toolkit Public

    Enterprise DataOps patterns: idempotent BigQuery pipelines, LLM gateways, multimodal OCR, and automated scrapers.